Prédiction de l'environnement d'un quartier
Abstract
Rapport de stage de Master 2.
Full text
Prédiction de l’environnement d’un quartier Rapport de stage Nelly Barret1 Encadrée par Fabien Duchateau2et Franck Favetta2 1Université Claude Bernard Lyon 1 [email protected] 2LIRIS UMR 5205 [email protected] Résumé Arriver dans une nouvelle ville suite à une mutation est toujours un défi ! En effet, il est courant d’arriver dans une ville que l’on ne connaît pas et la recherche d’un nouveau lieu de vie devient alors complexe. Proche des transports en commun pour certains, un cadre plus rural pour d’autres, plutôt animé pour les premiers, loin de l’agitation urbaine pour les autres : les critères pour choisir son futur quartier ne manquent pas. Dans ce rapport, nous présentons Predihood, un nouvel outil qui facilite la recherche et le choix d’un quartier. Mots-clés : Apprentissage automatique, Apprentissage supervisé par classification, Nettoyage de données, Visualisation d’informations, Étude des quartiers Abstract. Getting to a new city after a job transfer is always a challenge! We often arrive in a city that we don’t know, thus finding the perfect living place becomes complex. Nearby public transport on one hand, a rural landscape on the other hand, an animated neighbourhood for some, far from urban hustle and bustle for others: there are many criteria for choosing your future neighbourhood. This report presents Predihood, a new tool which facilitates the search and the choice of a neighbourhood. Keywords: Machine learning, Supervised learning by classification, Data cleaning, Information visualization, Neighbourhood study
2 Remerciements Je souhaite ici remercier toutes les personnes qui ont contribué de près ou de loin à mon stage. Dans un premier temps, mes remerciements vont vers mes deux maîtres de stage, Messieurs Fabien Duchateau et Franck Favetta, enseignants-chercheurs au LIRIS3. Sans eux, mon stage n’aurait pas pu voir le jour et ils ont su m’accompagner tout du long malgré leurs emplois du temps et le confinement dû à la crise sanitaire du Covid 19. C’est donc avec gratitude que je les remercie. Mes remerciements se tournent également vers la start-up Home in Love avec qui le LIRIS collabore sur un projet éponyme. Pour avoir travaillé avec eux, je remercie tous les membres de ce projet : –Nelly Duong, co-fondatrice de Home in Love, –Loïc Bonneval, enseignant-chercheur en sciences sociales à Lyon 2, –Behnaz Jullien, stagiaire en psychologie à Lyon 2, –Wissame Laddada, post-doctorante en informatique à Lyon 1, –ainsi que Ludovic Moncla, maître de conférences en informatique à l’INSA. Je poursuis avec le LabEx IMU (Laboratoire d’Excellence, Intelligence des Mondes Urbains) qui a financé mon stage ainsi que Marion Nicolas, membre du LabEx, pour ses conseils en lien avec le projet et mon stage. Bien entendu, mes remerciements vont au personnel du LIRIS pour son accueil, à l’Université Claude Bernard Lyon 1 pour mes cinq années passées ici, ainsi qu’à Madame Salima Hassas sans qui ce Master 2 Intelligence Artificielle ne serait pas le même. 3Laboratoire d’InfoRmatique en Imagerie et Systèmes d’information.
3 1 Introduction Dans un monde où la quantité de données ne cesse d’augmenter, i.e. l’ère du Big Data, de nouveaux challenges apparaissent à différents niveaux [16]. En effet, les données ainsi que leurs sources sont en pleine explosion : les données sont estimées à plus de 40 zettaoctets en 2020 [10] et les sources ne cessent d’augmenter. De plus, les données produites sont de plus en plus variées : itinéraires routiers, données médicales, recommandation de produits, et tant d’autres. Plusieurs enjeux émergent de ces constats : stockage, gestion, traitement puis exploitation (e.g. la recommandation de contenu ou la génération de nouvelles connaissances). En tant que laboratoire de recherche en informatique, le LIRIS se positionne tout naturellement sur ces questions. Le LIRIS est un laboratoire d’informatique (UMR 5205). Il dépend du CNRS, de l’INSA Lyon, de l’Université Claude Bernard Lyon 1, de l’Université Lumière Lyon 2 et de l’École Centrale de Lyon. Son organigramme se compose de 14 équipes réparties sur 6 pôles. Je suis attachée à l’équipe Bases de Données (BD), inscrite dans le pôle Sciences des Données. L’objectif de cette équipe est double : la conception de nouveaux modèles pour faire face à l’augmentation de la masse de données et le développement d’outils répondant à ces nouveaux besoins, e.g. l’accès, la diffusion et l’usage de ces données. Les projets entrepris par l’équipe BD sont financés par différentes sources, dont le LabEx IMU qui soutient principalement des projets pluridisciplinaires. Ce LabEx s’intéresse aux enjeux sociétaux autour de la ville, de l’urbain et de la métropolisation. L’un des projets soutenus, qui rassemble des chercheurs en sociologie et en informatique, est le projet Home in Love, dans lequel s’inscrit mon stage. Étant en deuxième année de Master informatique en Intelligence Artificielle à l’Université Claude Bernard Lyon 1, je dois effectuer un stage de fin de cycle. Cette immersion dure 6 mois, de février à juillet, et a pour objectif de nous faire travailler sur des projets mêlant recherche et développement pour nous former à nos futurs emplois. Comme je souhaite poursuivre en thèse l’année prochaine et ayant effectué mon stage de Licence sur le projet Home in Love avec Fabien Duchateau et Franck Favetta, ces derniers m’ont proposé un sujet de stage sur ce même projet. Cette proposition regroupait toutes mes attentes : de la recherche, du développement, un sujet d’Intelligence Artificielle et un projet pluridisciplinaire. Le projet Home in Love a pour objectif de faciliter la recherche immobilière, en particulier pour les personnes en mobilité salariale, e.g. lors d’une mutation professionnelle ou lors d’une alternance. Cette aide à la recherche immobilière se caractérise par la recommandation de quartiers et de logements pertinents. Cela nécessite, entre autres, de décrire simplement un quartier et de prendre en compte le profil des utilisateurs, i.e. leurs envies, leurs besoins et le style de vie qu’ils recherchent. Dans ce cadre, mon stage a pour objectif de prédire, par apprentissage supervisé, l’environnement d’un quartier pour aider les utilisateurs qui sont à la recherche d’un nouveau lieu de vie. Les quartiers peuvent être défi-
4 nis selon des centaines d’indicateurs, par exemple l’INSEE en fournit plus de 600 pour chacun. Seulement, autant d’indicateurs ne permettent pas de recommander efficacement et de manière interprétable ni d’avoir une vision globale de l’environnement d’un quartier. Par exemple connaître le nombre de restaurants et le nombre de supermarchés n’est pas suffisant pour caractériser l’environnement d’un quartier. En revanche savoir si un quartier est commerçant est important lors de la prise de décision dans ce contexte. Il est donc nécessaire de définir un nombre restreint d’indicateurs, que nous appellerons variables d’environnement (Annexe A). Elles ont été définies par les sociologues, sont au nombre de six et possèdent un nombre limité de valeurs. Par exemple, la variable d’environnement paysage a pour valeurs urbanisé,espaces verts,arboré ou agricole tandis que celle de la classe sociale s’étend de populaire àsupérieure. L’approche Predihood proposée pendant mon stage consiste donc à collecter et intégrer des données ou indicateurs sur les quartiers, et à prédire les six variables d’environnement pour un quartier donné. Cette approche sera implémentée dans un outil avec une interface cartographique, qui permettra aux utilisateurs de comparer les quartiers entre eux grâce aux six variables d’environnement. Quatre enjeux émergent de ces objectifs. Le premier sera d’assurer une grande couverture géographique, i.e. de pouvoir prédire les variables d’environnement de n’importe quel quartier en France. Le second concerne la qualité de la prédiction, i.e. l’approche doit prédire correctement les valeurs des variables d’environnement qui serviront notamment de justification lors de l’étape de recommandation de quartiers aux clients Home in Love. Le troisième enjeu est la performance puisque l’approche Predihood doit calculer des résultats au moyen d’algorithmes efficients. Enfin, le dernier enjeu concerne la reproductibilité et la réutilisation, i.e. être capable de reproduire les résultats obtenus et de permettre à la communauté d’ajouter facilement de nouveaux algorithmes de prédiction. Ce rapport abordera en premier l’état de l’art en Section 2puis un aperçu de l’approche Predihood en Section 3. Ensuite nous détaillerons le processus de préparation des données en Section 4puis la prédiction de l’environnement en Section 5. Enfin, nous présenterons la validation expérimentale en Section 6, une discussion en Section 7avant de conclure et de proposer des perspectives en Section 8. 2 État de l’art La recommandation de contenu est un domaine très étudié depuis les années 1990. De plus, les besoins sociétaux ont évolué et une tendance se dessine : générer beaucoup de données pour en extraire de l’information intéressante à recommander aux utilisateurs en fonction de leur profil, notamment grâce aux systèmes de recommandation. Par exemple, dans une médiathèque un utilisateur aura le choix parmi une centaine de disques alors que sur Internet, le nombre de musiques proposées est si important qu’il est nécessaire de recommander à l’utilisateur celles qu’il est susceptible d’écouter (e.g. Deezer offrait plus de 53
5 millions de titres en 2018). Ainsi, les systèmes de recommandation permettent de filtrer l’information pour ne présenter aux utilisateurs que des ressources pertinentes qui pourraient les intéresser [4]. L’enjeu qui nous intéresse dans le cadre du projet Home in Love est le besoin de recommandation de contenu, et plus précisément de quartiers. Pour prédire l’environnement d’un quartier, il est nécessaire de définir la notion de quartier puis de récolter des données pour ensuite prédire les valeurs des six variables d’environnement. Dès les années 1970 [11], les notions de voisinage et de quartier ont émergé et sont devenues une problématique commune à plusieurs domaines de recherche. Toutefois, la littérature montre qu’il existe plusieurs freins à une définition complète et réaliste de la notion de voisinage. Il est tout de même possible de s’appuyer sur les définitions proposées par les deux travaux suivants. Le premier [9] montre qu’il existe plusieurs types de quartiers, i.e. ceux définis par les institutions, ceux par les relations sociales et ceux physiquement. De plus, l’article note que la dimension d’un quartier est toute aussi importante que sa définition. Un second article [5], plus récent, appuie ces propos et relève quatre enjeux pour lever les freins à une définition satisfaisante : la description, la délimitation, la comparaison et l’évaluation des différentes notions de quartier. Lorsque la notion de quartier a été définie, le défi suivant relève du cas d’application, par exemple la comparaison ou la recommandation de quartiers, qui sont les deux approches principales pour l’aide à la recherche immobilière. Dans l’approche comparative, les systèmes cartographient les différences pour que les utilisateurs puissent comparer eux-mêmes. Cette approche peut être étayée par plusieurs articles. Le premier [12] s’appuie sur les réseaux sociaux qui sont des sources riches d’informations à propos des lieux de vie d’un quartier, e.g. des tweets dans les centres commerciaux et des checks-in dans les restaurants ou les cafés. L’idée de cet article est de mesurer la similarité des quartiers en utilisant l’activité économique de chacun. Pour ce faire, Foursquare met à disposition des millions de points d’enregistrement, check-in en anglais, à travers le monde. La distance Earth-mover est ensuite utilisée pour détecter les quartiers similaires entre eux, i.e. les quartiers les plus similaires sont ceux qui subissent le plus faible effort de transformation entre eux et le quartier d’origine. Le second article [18] propose d’organiser les espaces urbains en quartiers en utilisant des données de géolocalisation fournies par les réseaux sociaux et les points d’enregistrement Foursquare. Les activités des habitants, e.g. aller au Starbucks, visiter une galerie d’art ou encore faire du sport, sont associées aux catégories Foursquare (plus de 300) pour en déduire les raisons de venir dans un quartier ainsi que les délimitations de celui-ci. De plus, la temporalité est inclue de manière à détecter les heures pleines et creuses de chaque quartier. Enfin, les activités sont catégorisées comme locales ou touristiques à l’aide d’un arbre de décision. Toujours dans une approche comparative, plusieurs interfaces ont été proposées à différentes échelles. L’interface Better Life Index, mise à disposition par l’OCDE, propose onze critères dans le but de classer et de comparer une quarantaine de pays par score. Cette plateforme se base principalement sur les statistiques de l’OCDE
6 et des Nations Unies. Ensuite, GéoPortail est une plateforme gouvernementale visant à faciliter la diffusion et la visualisation des données géographiques en France, et permettant entre autres la comparaison manuelle de villes grâce à l’affichage de données thématiques (e.g. les restaurants, les supermarchés et les écoles). GéoPortail se base sur plus de 80 sources dont OpenStreetMap et des sources ministérielles. DataFrance est une interface agrégeant des centaines d’indices en cinq catégories, dont l’éducation, les commerces et les loisirs, pour mesurer la qualité de vie d’une commune en France. Enfin, KelQuartier est un outil d’aide à la décision pour les particuliers qui souhaitent déménager. Six catégories, dont l’éducation, le logement et les habitants, sont proposées dans lesquelles il y a des indicateurs numériques plus détaillés, e.g. ville fleurie, nombre de commerces tous les 100 mètres et revenus moyens. KelQuartier propose aussi une comparaison avec les communes adjacentes. Leurs sources proviennent de plusieurs centaines d’administrations publiques françaises dont l’INSEE, les ministères et la Direction Générale des Impôts. L’approche de recommandation permet de proposer aux utilisateurs uniquement des lieux qui pourraient les intéresser. Elle peut être étayée par plusieurs articles et interfaces. Un premier article [14] utilise les réseaux sociaux géolocalisés et les points d’enregistrement Foursquare pour la recommandation de quartiers. Cette recommandation, via l’algorithme Instance-Region Neighborhood Matrix Factorization, est proposée à deux niveaux : au niveau du quartier (i.e. un utilisateur est susceptible d’apprécier les quartiers voisins car ils partagent des propriétés similaires) et au niveau de la région e.g. affaires, scolarité et loisirs. Un second article [1] propose de la recommandation de quartiers via des mesures de similarité et des algorithmes de regroupement (clustering en anglais). De plus, l’article mentionne un outil, nommé VizLiris, qui apporte une interface cartographique à la recommandation de quartiers en France. Ce prototype propose deux fonctionnalités : la détection des meilleurs quartiers similaires à un quartier d’origine ainsi que le regroupement d’une zone géographique par type de quartiers grâce à des méthodes de clustering. Comme VizLiris recommande des quartiers pertinents à partir d’un quartier d’origine, il est nécessaire que ce quartier soit en France (ce qui n’est pas toujours le cas, par exemple avec les habitants étrangers) et que celui-ci plaise à la personne, ce qui n’est pas forcément vrai pour tous les critères. Une seconde approche [17], proposée par une équipe coréenne, montre l’utilisation du raisonnement par cas dans le cadre de la recommandation de logements. Les utilisateurs peuvent émettre trois contraintes : la localisation, le prix et l’unité d’habitation (e.g. le nombre de salles de bains ou la surface de la cuisine). Enfin, le projet Livehoods [7] découpe les villes en fonction de leurs dynamiques sur la base des données générées via les médias sociaux par les habitants. Le sujet de mon stage apporte une approche différente de ces travaux existants sur deux points majeurs. Le premier concerne la description d’un quartier en termes de lieu de vie. C’est une tâche complexe car le lien entre les nombreux indicateurs disponibles (e.g. indicateurs INSEE, points d’intérêt, statistiques) et l’environnement d’un quartier (qui relève du domaine du sensible) n’est pas fais-
7 able manuellement. Cette subjectivité nécessite des compétences en sociologie, e.g. pour définir l’ambiance ou le paysage, et un cadre pluridisciplinaire. Le second point est la qualification de l’environnement d’un quartier (à travers les variables d’environnement) tandis que les travaux existants caractérisent la qualité de vie (e.g. scolarité des enfants, sécurité, proche des restaurants). La proposition d’un nombre restreint de variables d’environnement permet aussi de simplifier la justification de la recommandation. De nombreux projets, comme Livehoods et Hoodsquare, utilisent les réseaux sociaux géolocalisés pour déterminer par exemple les dynamiques des quartiers. Les données générées par ces réseaux sont complexes à exploiter, notamment car les données ne sont pas disponibles uniformément (en particulier dans les campagnes) et sont soumises à un biais de par la population qui utilise ces réseaux sociaux. C’est pourquoi nous avons choisi une approche pluridisciplinaire avec des sociologues, car c’est un gage de qualité. Enfin, l’outil Predihood sera fonctionnel au niveau national tout en respectant un partitionnement fin de la taille d’un quartier, ce qui est important dans le contexte des mutations professionnelles. 3 Présentation de l’approche Predihood L’approche Predihood consiste en la simplification de la qualification de l’environnement d’un quartier. Pour ce faire, cette approche propose la définition de six variables d’environnement, la sélection des critères importants pour la prédiction de ces six variables ainsi que le déploiement de l’approche dans un nouvel outil, nommé Predihood. La conception, le développement et le déploiement du projet Predihood suivent le modèle de développement CRISP-DM,Cross-Industry Standard Process for Data Mining [15]. C’est un modèle standard open-source qui détaille les processus pour le développement d’outils en data mining. La Figure 1illustre le déroulement du développement de Predihood (deuxième ligne) en parallèle de celui de ce modèle (première ligne). Fig. 1: Processus pour le développement de Predihood en comparaison du modèle CRISP-DM. Afin de prédire les variables d’environnement dans le but d’aider à la recherche de quartiers avec l’approche Predihood, il est nécessaire de définir les concepts utilisés, de rechercher des sources pertinentes et de les intégrer dans un outil unique.
8 Ces trois étapes4correspondent au premier processus de la seconde ligne de la Figure 1. Une fois l’intégration de données réalisée, il faut préparer les données afin de pouvoir les utiliser dans les étapes suivantes puis sélectionner les indicateurs pertinents pour la prédiction. Ensuite, les algorithmes d’apprentissage supervisés peuvent prédire les six variables à partir de la sélection des indicateurs et des données nettoyées avant d’être évalués grâce à des métriques de performance. Enfin, le dernier processus correspond au déploiement de l’approche dans une interface web nommée Predihood. La Figure 2illustre en détail les étapes de l’approche Predihood. Les trois premières étapes, i.e. la définition des concepts, la recherche de sources, l’intégration et le prétraitement de celles-ci sont présentées en Section 4. La sélection des indicateurs, réalisée à partir de la combinaison de trois techniques dédiées, est présentée en Section 5. Les trois étapes suivantes, i.e. la création des jeux de données, l’apprentissage et la prédiction, correspondent au troisième processus du cycle CRISP-DM. Une fois le processus d’apprentissage terminé, les prédictions sont évaluées, comme présenté en Section 6. L’interface Predihood propose une interface cartographique facilitant la comparaison de quartiers et une interface de paramétrage permettant de configurer et tester différents algorithmes. Fig. 2: Illustration des processus de l’approche Predihood. 4 Préparation des données Dans les travaux de Data Science, il est courant d’estimer que 80% du travail consiste à rechercher, nettoyer, préparer et intégrer les données [8]. Pour l’approche Predihood, il est d’abord nécessaire de définir les concepts de quartier et de variable d’environnement. Ensuite, il faut rechercher des sources qui seront potentiellement utiles à la prédiction. Une fois les sources trouvées, il faut les intégrer de manière à unifier l’accès à ces différentes sources, ce qui correspond au processus d’intégration de données. Enfin, il est nécessaire de préparer les données avant de les utiliser, notamment car celles-ci contiennent des incohérences et des incomplétudes. Ces quatre processus, détaillés ci-après, correspondent au processus général de la préparation de données. 4Elles ont été réalisées en amont de mon stage et j’ai contribué à la recherche de sources et à l’intégration des données lors de mon stage de Licence.
9 4.1 Définition des concepts Il est nécessaire de choisir une définition adéquate pour les notions de quartier et de variable d’environnement. L’unité choisie pour le quartier est l’IRIS5 car elle permet un découpage fin et fiable puisque le fournisseur est l’INSEE6. Un IRIS correspond à une zone d’environ 2.000 habitants. En découpant toute la France ainsi, on obtient un maillage d’approximativement 50.000 IRIS (Annexe B). Dans les centres-villes, les IRIS sont de petite taille, e.g. Villeurbanne est découpé en plus de 40 IRIS, tandis qu’une ville en périphérie urbaine telle que les communes des Monts du Lyonnais n’en comporte que quelques-uns. Les lieux éloignés des centres urbains ne comportent qu’un seul IRIS pour toute la commune. Chaque IRIS possède plus de 600 indicateurs bruts7, e.g. le nombre de restaurants, le nombre de logements construits avant 1950 ou encore le nombre d’habitants par catégorie socio-professionnelle. Afin de qualifier de manière simple l’environnement d’un quartier, six variables d’environnement ont été définies à l’aide des sociologues (Annexe A). Le type de bâtiments représente le type majoritaire de bâtiments dans l’IRIS. L’usage représente l’activité économique majoritaire. La variable paysage définit le caractère naturel, arboré des espaces. Les variables position morphologique et position géographique représentent respectivement la proximité au centre de l’agglomération contenant l’IRIS et la direction de l’IRIS par rapport à ce centre. Enfin, la classe sociale correspond à la richesse des habitants de l’IRIS. Dans la suite, nous utiliserons les termes de quartier et d’IRIS comme synonymes. 4.2 Recherche de sources Après avoir défini les concepts, il faut constituer une base de données regroupant des données sur les quartiers et potentiellement utiles à la prédiction. Pour peupler cette base de données, il est donc nécessaire de rechercher plusieurs sources pertinentes. Pour l’instant, les trois sources suivantes sont considérées : 1. IRIS. Les IRIS sont nos objets d’étude et l’INSEE fournit une grande quantité de données les concernant. Elle met à disposition 647 indicateurs pour chaque IRIS. Parmi ces indicateurs, 17 sont des indicateurs de description (e.g. identifiant, code postal, nom de l’IRIS, ...) et seront utiles pour la visualisation cartographique. Les indicateurs restants permettent de quantifier l’environnement de l’IRIS et sont de différents types : quantités (e.g. nombre de restaurants) et quantités unitaires (e.g. revenu moyen), coefficients (e.g. coefficient de Gini), pourcentages (e.g. pourcentage de chômeurs) ou encore des chaînes de caractères (e.g. le type d’IRIS). Tous ces indicateurs sont livrés dans beaucoup de fichiers Excel dont les jointures ne sont pas toujours évidentes, comme expliqué en Section 4.3. 5Ilots Regroupés pour l’Information Statistique. 6Institut National de la Statistique et des Études Économiques. 7Les indicateurs bruts correspondent aux indicateurs fournis par l’INSEE.
16 Fig. 4: Statuts des clients. Fig. 5: Types de bâtiments. La Figure 6représente l’évolution de la classe sociale et montre que la majorité des clients se situe dans les classes moyenne et moyenne-supérieure. Intuitivement, les habitants se situant dans la classe populaire ont plutôt des logements de type grand ensemble ou immeuble tandis que les personnes de classes moyenne ou moyenne-supérieure habitent plutôt dans des maisons ou des lotissements. La Figure 7illustre l’usage des bâtiments que les clients de Home in Love occupent. Suite à leur mutation, les clients qui habitaient un lieu résidentiel ont tendance à loger dans un lieu commerçant mais ceux qui habitaient dans une zone d’autres activités y restent. Cela se corrèle avec le fait que les personnes en mutation professionnelle ont tendance à devenir locataires de logements collectifs (Figures 4et 5). Fig. 6: Classe sociale. Fig. 7: Usage des bâtiments. La Figure 8illustre l’évolution de la position morphologique où l’on remarque que les quartiers centraux sont en augmentation par rapport aux autres. Les personnes vivant dans des régions rurales déménagent souvent vers des zones plus centrales (central,urbain,péri-urbain) quand elles sont mutées. Enfin, la Figure 9illustre l’évolution des paysages des quartiers habités par les clients Home in Love. On observe une diminution des espaces naturels (i.e. espaces verts,arboré et agricole) au profit des zones urbanisées. En effet, les mutations s’effectuent souvent des zones extra-urbaines (i.e. les campagnes) vers les zones intra-urbaines (i.e. les centres-villes).
17 Fig. 8: Position morphologique. Fig. 9: Paysage. Analyse de la représentativité Puisque les IRIS expertisés représentent seulement 0.6% des IRIS en France, nous devons analyser la représentativité de ces IRIS. Bien que cette analyse soit faite manuellement, elle permet d’étudier le biais que les variables d’environnement peuvent avoir. – Position morphologique. D’après l’INSEE, 16.100 IRIS ont été construits avec les communes de plus de 10.000 habitants et la plupart des communes de 5.000 à 10.000 habitants. Pour couvrir le reste du territoire, un IRIS a été créé pour chacune des communes restantes. Si l’on considère que ces IRIS restants sont de type rural, alors 68% des IRIS en France seraient de type rural. Notre jeu de données contient 14 IRIS sur 268 annotés avec ce type, soit environ 5%. Cette différence peut s’expliquer par le fait que, dans le cadre des mutations professionnelles, les personnes ont tendance à quitter les villes rurales pour se rapprocher des centres urbains, notamment pour vivre plus près de leur travail. Cette analyse montre qu’il y a un biais sur la variable de la position morphologique. Elle montre aussi que, puisque notre jeu de données ne compte que 5% d’IRIS ruraux, il est quasi représentatif des IRIS non ruraux. – Paysage. Cette variable est en lien avec la variable de la position morphologique. En effet, les IRIS éloignés des centres urbains auront tendance à être catégorisés agricoles voire ruraux. Inversement les IRIS des métropoles seront catégorisés soit urbanisés soit espaces verts. Dans notre jeu de données, 46 IRIS sont annotés agricoles ou ruraux, soit 17%. Ce pourcentage est aussi très loin des 68% d’IRIS ruraux. Donc la variable du paysage est biaisée, au détriment du paysage rural. – Classe sociale. C’est une variable plutôt difficile à analyser puisque les classes sociales ne sont pas clairement définies. En France, 59% des ménages appartiennent à la classe moyenne, i.e. que leurs revenus sont compris entre 70% et 150% du revenu médian selon l’INSEE [3]. Les Français de classe moyenne sont répartis sur 71% des IRIS. Notre jeu de données contient 82% d’IRIS appartenant à la classe moyenne, donc la variable de la classe sociale n’est que légèrement biaisée. – Position géographique. Elle est équitablement répartie entre les valeurs puisqu’il y a environ 25 IRIS pour chacune. Il est tout de même important de noter que certaines valeurs telles que centre,nord et sud, comptent deux
18 fois plus d’IRIS. En effet, les populations se concentrent en général dans les zones urbaines, d’où la valeur centre plus importante. Les valeurs nord et sud peuvent s’expliquer par le fait que certaines agglomérations ont parfois leur centre de gravité excentré. De plus amples recherches doivent être menées, notamment avec les sociologues, pour expliquer ces phénomènes. – Type de bâtiments. L’INSEE recense, en 2018, 56% de logements individuels et 44% de logements collectifs12. Pour faire le lien avec notre variable d’environnement, les logements individuels sont les maisons et les lotissements tandis que les logements collectifs sont les logements mixtes, les immeubles et les grands ensembles. Dans notre jeu de données, 183 IRIS sont de type collectif, soit 68%, donc cette variable comporte un biais. – Usage des bâtiments. Cette variable demande une analyse particulière, notamment avec les sociologues, car les données permettant cette analyse sont difficilement exploitables à priori. Pour conclure, la plupart de nos variables d’environnement sont biaisées (de légèrement à fortement). Cela s’explique notamment par le fait que les personnes en mobilité géographique ont tendance à quitter les zones rurales pour venir en ville et que la location est souvent préférée à l’achat propriétaire. Décrivons maintenant l’outil Predihood qui implémente les propositions décrites dans les sections précédentes. 5.3 L’outil Predihood Predihood est tout d’abord une approche, mais c’est aussi un outil facilitant la comparaison de quartiers selon six variables d’environnement. Cet outil se présente sous la forme d’une interface cartographique (Annexe B). Il a été développé en Python avec Flask, un framework open-source pour le développement web en Python, et Scikit-Learn, une bibliothèque populaire open-source pour les techniques de machine learning en Python. Son diagramme de classes est en Annexe I. Détaillons d’abord les jeux de données utilisés dans Predihood, puis deux cas d’utilisation pour notre outil. Jeux de données La prédiction des variables d’environnement à partir des indicateurs INSEE est un problème multiclasse (plusieurs valeurs par variable d’environnement) et multilabel (six variables d’environnement). Pour pallier ce verrou, les jeux de données contiennent les six variables d’environnement mais elles sont traitées séparément lors de la prédiction, ce qui permet de réduire ce double problème à un problème multiclasse. Une entrée du jeu de données correspond à un IRIS avec les informations suivantes : le code IRIS, sa surface, 12 Les logements individuels sont des constructions qui ne comprennent qu’un seul logement et les logements collectifs sont des logements dans un immeuble collectif. Nombre de logements individuels et collectifs en France au 1er janvier 2018.
19 sa densité de population, la totalité des indicateurs INSEE et les 6 variables d’environnement expertisées. L’API Pyris permet de retrouver le code IRIS à partir d’une adresse (pour transformer les adresses des dossiers en IRIS) et le module area permet de calculer la surface d’un IRIS grâce à sa géométrie. Cas d’utilisation 1 Alice est commerciale dans le secteur informatique, ce qui l’oblige à se déplacer régulièrement dans toute la France. Elle vient d’obtenir une mission à Lyon pour quelques mois avant de repartir pour Paris. Alice aimerait trouver un quartier urbain, proche des commerces et, si possible, près d’une salle de sport. Elle sait, de par ses amies, que le quartier de la Part-Dieu est central mais elle voudrait tout de même en comparer plusieurs avant de se décider. Avec Predihood, Alice cherche “Lyon” dans la barre de recherche prévue à cet effet. Ensuite elle compare les différents quartiers grâce aux variables d’environnement, et en repère quelques-uns qui pourraient lui plaire. Ainsi elle regarde en détail les informations de deux IRIS : Part-Dieu et Danton-Bir Akeim. Les indicateurs regroupés (Annexe J) lui indiquent que le premier a beaucoup de commerces et de services (indicateurs service-divers-prive,service-divers-public et animationcommerce-nonalimentaire). Les indicateurs bruts (Annexe J) lui indiquent que le second dispose d’une salle de sport (indicateurs salles multisports et salles de remise en forme). Alice préfère être proche des commerces et se rendra en vélo à sa salle de sport. Elle privilégie donc l’IRIS de la Part-Dieu pour chercher un logement. L’outil propose en plus un score de confiance, qui correspond au nombre de listes Lk vqui ont prédit la valeur proposée. Par exemple, toutes les listes ont prédit que l’IRIS de la Part Dieu était composé d’immeubles (score à 7/7). Fig. 10: Alice a saisi la requête “Lyon” et a cliqué sur l’IRIS de la Part-Dieu pour obtenir son environnement. Cas d’utilisation 2 Bob est enseignant-chercheur en intelligence artificielle à l’Université. Il travaille actuellement sur la création d’un nouvel algorithme
20 d’apprentissage supervisé ainsi que sur l’amélioration d’algorithmes supervisés existants. Il ajoute tout d’abord à l’interface de paramétrage son nouvel algorithme et teste différentes configurations. Il aimerait de plus tester la fiabilité et la robustesse de ses avancées sur de nouveaux jeux de données. Il les intègre donc dans l’interface de paramétrage de Predihood et teste différentes configurations sur le jeu de données des IRIS expertisés, par exemple le nombre de voisins pour sa version améliorée de KNN. Enfin, Bob enseigne un cours sur les techniques d’apprentissage automatique et souhaiterait que ses étudiants travaillent sur un TP de prise en main des algorithmes de Scikit-Learn. Grâce à Predihood, les étudiants de Bob utilisent l’interface pour tester différentes configurations et comprendre l’influence de chaque paramètre. De plus, la possibilité de conserver les résultats des différents algorithmes exécutés, avec l’export au format Excel13, leur permet de rendre un rapport de TP avec une partie “expérimentations” assez détaillée. Fig. 11: Paramétrage de l’algorithme KNN dans l’interface Predihood. Ces deux scénarios illustrent les capacités de Predihood à aider dans la recherche immobilière ainsi que dans le paramétrage générique de classifieurs. Plusieurs perspectives sont envisagées pour l’outil, comme discuté en Section 7. 13 Le fichier Excel généré correspond au tableau des précision pour chaque variable d’environnement (lignes) et chaque ensemble d’indicateurs (colonnes).
21 6 Validation expérimentale Puisque tout approche empirique doit être scientifiquement validée, il est important de vérifier les résultats de notre approche. Pour cela, il est nécessaire de mettre en place un protocole de validation expérimentale notamment pour définir les algorithmes utilisés et leurs paramètres. Deux expérimentations sont ensuite présentées pour illustrer les résultats de l’approche Predihood à l’échelle nationale puis sur le cas de la ville de Lyon. 6.1 Protocole La validation expérimentale a pour objectif de vérifier si la prédiction fournit des résultats satisfaisants, et donc de montrer l’intérêt de la sélection de variables sous forme de listes. Pour ce faire, plusieurs algorithmes ont été testés et nous en avons sélectionné cinq pour ce protocole : Logistic Regression, Random Forest,K-Nearest Neighbours,Support Vector Classification et AdaBoost. Chaque algorithme contient un grand nombre de paramètres, en plus des hyperparamètres, qu’il est important d’ajuster. Grâce à l’interface de paramétrage de Predihood, un bon nombre de configurations ont été testées. Un hyperparamètre très important est la répartition entre les données d’entraînement et celles de test. Le pourcentage retenu est la répartition 80% pour les données d’entraînement et 20% pour les données de test, comme le recommande la littérature [6]. Comme les IRIS expertisés sont déjà peu nombreux, un système de validation croisée a été utilisé pour pallier ce problème puisqu’elle évite de créer les données de validation. Les tableaux de résultats de cette section correspondent aux performances, i.e. à la précision (accuracy en anglais), des algorithmes avec leur meilleure configuration. 6.2 Expérimentation 1 : prédiction sur l’ensemble de la France Cette première expérimentation a pour objectif de montrer les résultats obtenus à l’échelle nationale. Les algorithmes ont pour objectif de prédire correctement les six variables d’environnement. Les Tableaux 1à6illustrent la précision (en %) des algorithmes pour chaque variable d’environnement. Ce calcul de précision correspond au nombre de prédictions correctes par rapport au nombre de prédictions totales. L’ensemble Ireprésente l’ensemble des indicateurs bruts et les listes Lk vsont celles générées lors de la sélection. Les scores soulignés mettent en valeur le meilleur résultat de chaque algorithme. Les scores en gras montrent qu’ils sont meilleurs que la liste I. Les scores en vert correspondent à la meilleure précision obtenue tout algorithme confondu, ce qui permet de mettre en avant les meilleurs algorithmes et la liste qu’ils utilisent. Le Tableau 1illustre les résultats de la prédiction pour le type de bâtiments. Les listes permettent de gagner en moyenne quelques pourcents de précision avec
22 un maximum à 7% (algorithme AdaBoost pour la liste L20) et Random Forest atteint le meilleur score, 60%, avec la liste L20. Le Tableau 2montre les résultats pour l’usage des bâtiments. Ici aussi, Random Forest obtient le meilleur score, avec une précision de 64.9%. La liste L50 gagne 5% de précision avec AdaBoost, même si le score reste moins élevé que celui de Random Forest avec l’ensemble des indicateurs. LR RF KNN SVC AB I46.6 57.0 55.2 45.5 36.5 L10 44.3 59.3 57.8 44.7 41.7 L20 49.2 60.0 56.3 43.6 43.6 L30 45.1 58.9 55.9 43.6 32.1 L40 46.2 59.3 54.8 43.2 27.6 L50 46.6 58.9 54.8 45.5 32.4 L75 44.3 58.2 55.2 45.9 32.0 L100 43.6 57.0 55.2 45.5 36.5 Table 1: Qualité de prédiction pour la variable type de bâtiments. LR RF KNN SVC AB I52.9 64.5 59.3 51.1 55.6 L10 52.6 61.2 63.8 49.6 59.6 L20 55.9 64.1 63.0 49.6 56.6 L30 51.1 61.2 62.3 49.6 60.8 L40 57.8 63.0 60.8 49.2 56.3 L50 56.3 64.9 62.2 46.6 61.1 L75 50.7 63.4 60.8 51.1 58.2 L100 53.7 64.5 59.3 51.1 55.6 Table 2: Qualité de la prédiction pour la variable usage. Le Tableau 3décrit les résultats obtenus pour le paysage. De même, les listes permettent de gagner plusieurs pourcents de précision, par exemple l’algorithme Random Forest gagne 2% de précision avec la liste L20 par rapport à I. Le Tableau 4illustre les résultats obtenus pour la classe sociale. Random Forest est encore une fois le meilleur algorithme avec une précision de 51.8%. Les résultats sont moins élevés pour cette variable d’environnement, et cela peut s’expliquer par le fait que la limite entre chaque valeur n’est pas évidente (e.g. entre moyen et moyen-sup) et que l’expertise réalisée par les sociologue reste subjective (e.g. la classe sociale a été estimée en visionnant le quartier en mode street-view). LR RF KNN SVC AB I53.7 60.8 59.6 47.7 50.3 L10 48.1 62.7 59.6 47.7 51.8 L20 51.5 63.0 60.4 47.7 52.6 L30 50.3 60.8 61.9 47.7 52.5 L40 49.2 62.7 61.5 47.7 49.2 L50 47.7 61.5 61.1 47.7 48.1 L75 52.6 62.3 59.3 47.7 48.5 L100 56.3 60.8 59.6 47.7 50.3 Table 3: Qualité de la prédiction pour la variable paysage. LR RF KNN SVC AB I44.4 51.1 42.1 45.5 36.5 L10 43.6 46.6 43.9 44.7 41.7 L20 39.1 46.6 45.1 43.6 43.6 L30 41.4 49.6 45.1 43.6 32.1 L40 39.1 51.8 46.6 43.2 27.6 L50 42.1 48.1 44.3 45.5 32.4 L75 45.1 48.1 44.0 45.9 32.0 L100 40.7 51.1 42.1 45.5 36.5 Table 4: Qualité de prédiction pour la variable classe sociale.
23 Le Tableau 5décrit les résultats de la position morphologique. L’algorithme AdaBoost gagne jusqu’à 5% de précision, avec la liste L40. Comme pour les résultats précédents, Random Forest est le meilleur avec une précision de 61.2%. Enfin, le Tableau 6illustre les résultats de la prédiction de la position géographique. Cette variable semble plutôt compliquée à prédire puisqu’il est difficile de calculer l’emplacement d’un quartier par rapport à son agglomération avec le type d’indicateurs que nous fournit l’INSEE. Tous les algorithmes, sauf Random Forest, sont meilleurs que Iavec L20. LR RF KNN SVC AB I46.6 59.7 58.2 44.7 45.8 L10 48.5 60.0 60.8 44.0 49.9 L20 44.0 61.2 58.5 44.4 48.5 L30 39.2 61.2 58.2 44.4 48.8 L40 33.5 61.2 58.6 44.4 50.7 L50 36.1 59.3 57.4 44.4 46.2 L75 41.3 60.8 57.1 44.7 49.2 L100 43.2 59.7 58.2 44.7 45.8 Table 5: Qualité de prédiction pour la variable position morphologique. LR RF KNN SVC AB I22.0 33.6 27.2 25.0 15.6 L10 25.3 29.9 27.6 24.6 21.9 L20 26.1 31.3 29.5 25.3 20.1 L30 26.1 31.7 28.3 27.2 17.5 L40 29.1 32.8 28.3 24.6 17.1 L50 25.0 32.1 27.2 23.8 19.0 L75 24.6 32.8 27.2 25.0 17.9 L100 24.6 33.6 27.2 25.0 15.6 Table 6: Qualité de prédiction pour la variable position géographique. Pour conclure cette première expérimentation, les listes générées par la sélection de variables permettent d’améliorer les résultats. L’algorithme Random Forest reste le meilleur parmi les cinq algorithmes utilisés puisqu’il obtient le meilleur score pour toutes les variables d’environnement. 6.3 Expérimentation 2 : prédiction sur la métropole de Lyon Cette seconde expérimentation a pour objectif d’illustrer les performances de Predihood sur la ville de Lyon et ses environs, une zone géographique que nous connaissons. La Figure 10, qui explique le cas d’Alice, illustre la prédiction des variables d’environnement pour l’IRIS de la Part-Dieu et selon l’algorithme Random Forest. Par rapport à la réalité terrain, le quartier de la Part-Dieu est surtout composé d’immeubles et de peu d’espaces verts malgré les initiatives récentes (e.g. le projet de refonte du centre commercial de la Part-Dieu). Les variables d’environnement bâtiment et paysage le confirment. Ensuite, ce quartier est un quartier central dans Lyon, comme le confirme la prédiction des variables position morphologique et position géographique. Enfin, le site meilleursagents.com confirme la classe sociale puisque la valeur moyenne du mètre carré est de 4900 euros à Lyon.
24 7 Discussion Dans cette section, nous allons discuter des pistes d’amélioration, notamment celles prévues d’ici la fin de mon stage (31 juillet). 7.1 Sources de données Dans le cadre de la prédiction de variables, il est souvent intéressant d’utiliser différentes sources de données, que ce soit pour comparer les données ou pour améliorer la prédiction. C’est pourquoi quatre sources pourront être ajoutées à Mongiris : – Prix immobiliers. Intégrer des données de prix pourrait aider à la prédiction des variables d’environnement telles que la classe sociale. Seulement, les prix immobiliers sont rarement libres d’accès, et s’ils le sont c’est à une échelle élevée (e.g. au niveau départemental). Toutefois, l’initiative DVF, qui met à disposition les ventes immobilières récentes, semble intéressante à exploiter en collaboration avec les sociologues. De plus, les données immobilières sont souvent basées sur un découpage en parcelles cadastrales plutôt qu’en IRIS (c’est le cas pour DVF). Un appariement entre les plans cadastraux et les IRIS est donc nécessaire. Le découpage cadastral apporte plus de précision dans les zones rurales. En effet, les communes rurales ne sont souvent pas découpées par l’INSEE, i.e. que la commune correspond à un IRIS, tandis que cette même commune peut être découpée en une dizaine de parcelles cadastrales. – Points d’intérêts. Les points d’intérêts, Point Of Interest (POI ) en anglais, sont des objets du monde réel, comme notre Dame de Fourvière, un supermarché ou encore le Mont Blanc. Les fournisseurs géographiques représentent ces points d’intérêt par des entités, e.g. le fournisseur Geonames représente le POI “Notre Dame de Fourvière” par l’entité 8015555. Les IRIS ne comportant que des indicateurs numériques (e.g. nombre de supermarchés), prendre en compte les points d’intérêt (e.g. nom et type de supermarchés) permettrait d’ajouter de l’information à l’environnement d’un quartier. L’outil GeoAlign [2] permet de collecter les POI de plusieurs fournisseurs de manière unifiée et semi-automatique, ce qui permet une plus grande complétude des POI d’une zone donnée. – Offres d’emploi. De nos jours, il y a pléthore de sites proposant des offres d’emplois (e.g. les moteurs de recherche américains Indeed et Monster, la plateforme gouvernementale PôleEmploi, ...) et des API, telles que Offres d’emploi, sont mises à disposition. Dans le cadre de la recommandation immobilière et de la mutation professionnelle, il peut être intéressant de trouver un quartier voire un logement qui plaît et de trouver un emploi dans une zone géographique proche. – Itinéraires. Les données permettant le calcul d’itinéraires, e.g. les transports en commun tels que les bus et les trains, et les services routiers tels que
25 Google Maps ou Waze sont une source d’informations permettant de qualifier le paysage d’un IRIS. En effet, il est courant de retrouver une grande offre de transports en commun dans les quartiers urbains, inversement une offre plus réduite voire inexistante est observable pour les quartiers ruraux. De plus, les habitants des villes ont tendance à favoriser les transports en commun (moins coûteux et parfois plus rapides), d’où la réduction des trajets en voiture pour les citadins. En revanche, les habitants en périphérie voire en dehors des centres urbains n’ont pas d’autre choix que de prendre leur voiture. De plus, les services routiers permettant le calcul d’itinéraires peuvent compléter les données de l’INSEE quant aux données routières qui sont encore peu référencées. Les sources de données ont été définies au début du projet, et leurs données évoluent. Par exemple, l’INSEE met à jour ses jeux de données tous les ans (lors du recensement de la population) ou environ tous les 4 ans (e.g. pour les équipements). Quand les données ne sont pas accessibles par une API (qui garantit la fraîcheur des données), il faut prévoir un mécanisme de mise à jour des données (e.g. un script d’intégration). 7.2 Traitement des valeurs inconnues Les indicateurs qui n’ont pas de valeur sont complétés par la médiane des valeurs connues de celui-ci. Comme expliqué dans la Section 4.4, ce traitement comporte un biais. La correction de ce biais nécessite un travail supplémentaire dont l’idée générale est de calculer la médiane uniquement avec les IRIS qui sont similaires en termes de variables d’environnement. Par exemple, si un IRIS rural n’a pas de valeur pour l’indicateur transports en commun, la médiane sera calculée uniquement avec les valeurs des transports en communs des IRIS ruraux. 7.3 Distribution des indicateurs Une seconde approche pour la sélection des indicateurs est d’utiliser la distribution des indicateurs dans les IRIS. Ces distributions correspondent aux valeurs des indicateurs normalisés par la densité de population, et sont représentées sous la forme de points reliés. Sur l’axe des abscisses se trouvent les indicateurs (numérotés) et sur l’axe des ordonnées se trouvent les valeurs de chaque indicateur.
32 A Variables d’environnement Les six variables d’environnement résultent d’un travail commun et pluridisciplinaire entre les informaticiens et les sociologues. Ces six variables permettent de définir simplement l’environnement d’un quartier, ce qui facilite aussi la comparaison et la recommandation de ceux-ci. Fig. 14: Liste des six variables d’environnement. B Visualisation des IRIS L’outil Predihood permet de visualiser les IRIS sur une carte (Figure 15). Fig. 15: Visualisation (partielle) d’IRIS pour la requête “Lyon” (d’autres IRIS contenant Lyon dans leur nom ou dans le nom de leur commune sont également affichés par cette requête).
33 C Fichiers clients Home in Love Les Figures 16a et 16b illustrent des extraits des dossiers fournis par Home in Love. Pour chaque dossier sont renseignés l’adresse de l’ancien lieu de vie (colonne B) avec l’expertise des six variables d’environnement (colonnes C à H) et l’adresse du nouveau lieu de vie (colonne I) avec de même l’expertise des six variables d’environnement (colonnes J à O). (a) Exemple d’expertise pour les anciennes adresses des clients Home in Love. (b) Exemple d’expertise pour les nouvelles adresses des clients Home in Love. Fig. 16: Exemple d’expertise des dossiers fournis par Home in Love. D Fichiers INSEE La Figure 17 illustre un extrait de fichier source fourni par l’INSEE. Celui-ci correspond aux données relatives à la démographie, e.g. l’IRIS de la Doua avait une population de 2559 habitants en 2014. Les indicateurs suivants détaillent la répartition de ces habitants par catégorie d’âge. À noter que ce fichier comporte bien plus de colonnes (83 en tout) pour chaque iris. Fig. 17: Exemple de fichier source fourni par l’INSEE.
34 E Indicateurs regroupés La Figure 18 montre la hiérarchie des indicateurs regroupés. Fig. 18: Hiérarchie des indicateurs regroupés.
35 F Détection des valeurs erronées Puisque l’expertise des dossiers clients a été manuelle, certaines valeurs sont erronées. Pour pallier ce problème, un dictionnaire est construit pour regrouper les valeurs par similarité. La mesure de similarité utilisée est celle de Levenshtein avec un seuil d’une opération. Ainsi, deux valeurs sont considérées suffisamment similaires lorsqu’une seule opération (i.e. suppression, ajout ou modification) est nécessaire pour passer de l’une à l’autre. Dans le Tableau 7, on remarque que, pour la variable bâtiment, la valeur “Immeubles” contient deux mentions (“Immeuble” et “Immeubles”) alors que la valeur “Maisons” est toujours bien orthographiée. bâtiment [Immeubles, Immeuble ],[Maisons ],[Grand ensemble ], ... usage [Espaces verts, Espaces vert, Espace verts ], ... ... ... social [Pop, Popu ],[Sup ],[Oui ],[Moyen-sup ],[Moyenne-sup ], ... Table 7: Valeurs des variables d’environnement saisies dans les dossiers clients regroupées par similarité. G Indicateurs spécifiques Le filtrage des indicateurs a été réalisé à partir d’un fichier Excel défini préalablement à la main. Chaque indicateur a un statut : 0 si l’indicateur est conservé, 1 si l’indicateur est considéré comme trop spécifique et donc retiré des indicateurs potentiellement utiles à la prédiction. La Figure 19 illustre un extrait de ce fichier Excel d’aide au filtrage. Fig. 19: Exemples d’indicateurs trop spécifiques.
36 H Hiérarchie des indicateurs La hiérarchie des indicateurs a permis de créer un arbre généalogique de la totalité des indicateurs INSEE avec comme racines (niveau 1) les indicateurs les plus généraux, e.g. la population, le nombre de ménages ou encore le nombre de logements, et comme descendance les indicateurs ordonnés par spécificité (Figure 20). Au total, la hiérarchie contient cinq niveaux. Elle a été construite manuellement, ce qui a été coûteux en temps mais elle présente deux avantages : elle a été définie en Excel donc elle est facilement exploitable par un programme Python et elle pourrait avoir d’autres utilités comme l’aide à la justification. Fig. 20: Exemple de la hiérarchie des indicateurs. I Diagramme de classes de Predihood La modélisation de Predihood se veut générique pour faciliter l’ajout de nouveaux algorithmes et est basée sur Scikit-Learn, ce qui permet d’intégrer tous les algorithmes qu’ils proposent. Scikit-Learn est une des références en termes de librairie pour l’apprentissage automatique et les résultats de leurs algorithmes peuvent servir de référence, notamment pour évaluer la qualité d’un nouvel algorithme. Le projet Predihood se base principalement sur trois classes : Data, Dataset et Method. Les objets (fonctions et attributs) précédés d’un signe - sont des éléments internes à la classe qui n’ont pas lieu d’être utilisés lors de l’utilisation des classes. À l’inverse, les objets précédés d’un signe + sont ceux qui sont considérés comme publics et donc accessibles et utiles à part entière.
37 Fig. 21: Diagramme de classes du projet Predihood. La modélisation de chaque classe est détaillée ci-dessous : – Classe Data. Elle représente les données sous la forme d’une DataFrame. La classe Data contient aussi des attributs tels que les indicateurs du jeu de données (indicators). La méthode init_all_in_one permet de générer une instance contenant les données du fichier Excel nettoyé contenant les clients avec la liste des indicateurs dans le jeu de données. – Classe Dataset. Elle contient une instance de type Data afin d’avoir accès aux données ainsi que les jeux d’apprentissage et de test (X_train,Y_train, X_test et Y_test) puisque les algorithmes utilisés sont de type supervisés. La méthode init_all_in_one permet d’initialiser les données et de créer les jeux de données. – Classe Method. Elle est la classe mère de quatre classes et représente un processus (e.g. le nettoyage des données et la sélection des indicateurs). - La classe MethodCleaning nettoie les données des IRIS expertisés, i.e. les données Home in Love. La fonction clean permet de lancer le processus
38 de nettoyage et permet à l’expert de choisir les valeurs souhaitées pour les valeurs contenant des fautes. - La classe MethodSelection correspond au processus de sélection des indicateurs. Chaque instance de cette classe correspond à une méthode de sélection, i.e. la sélection avec l’algorithme Random Forest est une instance de cette classe et la sélection avec l’algorithme Extra Tree Classifier en est une seconde. L’attribut best_indicators contient les meilleurs indicateurs pour l’instance considérée. - La classe MethodPrediction permet la prédiction des variables d’environnement d’un IRIS et la prédiction des variables d’environnement pour tout le jeu de données des IRIS expertisés. La fonction predict permet notamment de prédire les valeurs des six variables d’environnement de l’IRIS donné en paramètre ou de prédire les valeurs pour tous les IRIS expertisés et ainsi évaluer la qualité de la prédiction avec les jeux d’entraînement et de test. - Enfin la classe Chart permet de modéliser les débuts de réflexion sur l’intégration de la distribution des indicateurs comme sélection d’indicateurs ou comme aide à la prédiction. J Indicateurs de l’IRIS de la Part-Dieu Les Figures 22 et 23 décrivent quelques uns des indicateurs pour l’IRIS de la Part-Dieu, Lyon. Fig. 22: Indicateurs regroupés de l’IRIS de la Part-Dieu.
39 Fig. 23: Indicateurs bruts de l’IRIS de la Part-Dieu.