Gérer des données personnelles : Introduction à la pseudonymisation et l'anonymisation
Abstract
1h de formation sur la gestion des données personelles composée par les parties théroqiues : "Cadre juriduque (RGPD)" et "Introduction à la pseudonimisation et l'anonymisation".
Full text
Gérer des données personnelles Introduction à la pseudonymisation et l’anonymisation AURELIEN MOISAN –BSU MERIC AKDOGAN - BSU DECEMBRE 2024
3 1 CADRE JURIDIQUE
4 Qu’est ce qu’une donnée personnelle ? « Toute information se rapportant à une personne physique identifiée ou identifiable […] nom, un numéro d'identification, des données de localisation, un identifiant en ligne, ou à un ou plusieurs éléments spécifiques propres à son identité physique, physiologique, génétique, psychique, économique, culturelle ou sociale » (RGPD) Un nom, un prénom, un numéro (téléphone, sécurité sociale), un identifiant, une adresse (postale, e-mail, IP), des données biométriques, l’image, la voix… L’identification peut-être réalisée à partir d’une donnée unique, ou en croisant plusieurs données
5 LE RGPD : Règlement Général sur la Protection des Données Règlement applicable à partir de mai 2018 dans l’ensemble des territoire de l’UE. Il renforce le contrôle des citoyens sur le traitement des leurs données personnelles et responsabilise les auteurs de ces traitements. Il concerne toutes les organisations publiques ou privées localisées dans l’Union Européenne ou qui traitent des données personnelles de citoyens européens. Traitement : collecter, analyser, transmettre des données organisées. Qu’elles soient au format papier ou numérique
6 LE RGPD : Les grands principes Licéité Finalité Proportionnalité Sécurité Conservation limité Transparence et information sur l’utilisation
7 2 PSEUDONYMISER DES DONNÉES
8 Qu’est ce que la pseudonymisation ? Un traitement qui vise à « remplacer les données directement identifiantes (nom, prénoms, etc.) d’un jeu de données par des données indirectement identifiantes (alias, numéro séquentiel, etc.) » C’est une processus réversible, les données initiales peuvent être retrouvées grâce une clé de chiffrement, une table de correspondance, ou par croisement avec des données tierces, par conséquent… … les données pseudonymisées restent des données personnelles, elles restent soumises aux obligations du RGPD; (source: CNIL)
9 Pourquoi pseudonymiser les données ? •En tant que responsable du traitement vous devez mettre en place des mesures pour assurer la sécurité des données collectées. La pseudonymisation en fait partie •La pseudonymisation sera préférée à l’anonymisation lorsqu’il sera nécessaire d’identifier les personnes au niveau individuel. Dans ce cas l’anonymisation rendrait votre jeu de données difficilement exploitable
10 Comment pseudonymiser ses données ? Choisissez votre méthode en fonction de la sensibilité et de l’utilité de vos données. Deux éléments indispensables : •les informations permettant de récupérer les données initiales devront être conservées de manière sécurisée (chiffrement, coffre fort de mots de passe…) •éviter les collisions en vous assurant que un ID = une valeur •Le compteur : Il évite les collisions mais donne une indication sur l’ordre du jeu de donnée. Il fonctionne avec une table de correspondance •Le générateur de nombre aléatoire : Attention aux collisions. Il fonctionne avec une table de correspondance •Le hachage : Il garde un lien avec la chaine de caractère initiale, il est exposé aux attaques par dictionnaire. Attentions aux collisions. Il fonctionne avec une table de correspondance. Vous pouvez renforcer votre hachage en utilisant un sel cryptographique (chaine de caractère ajoutée à la chaine initiale au moment du chiffrement). •Le chiffrement : C’est le plus simple à l’usage, on car un peut facilement retrouver la chaine de caractère initiale sans table de correspondance. Mais il est plus complexe à mettre en œuvre (source: CNIL)
17 Comment anonymiser ses données ? Catégoriser les attributs •Quelles-sont les données directement identifiantes ? •Quelles-sont les données quasi-identifiantes ? • Où se trouve l’information pertinente que je veux conserver ? •Quelles-sont les données sensibles ? •Est-ce qu’il existe des valeurs rares qui faciliteraient l’identification ?
18 Comment anonymiser ses données ? Supprimer / masquer les données identifiantes Nom Prénom Genre Age Années d'ancienneté Syndicat Dupont Jean M 35 5 CGT Martin Marie F 28 3FO Lefevre Pierre M42 8CFDT Dubois Anne F31 4 CGC Garcia Luis M45 12 SUD Leclerc Sophie F17 2FO Bertrand Nicolas M 38 14 CFE - CGC Lecomte Isabelle F 33 6 CGT Boucher Julie F 27 1FO Xavier Alice F 75 29 CGC Jeu de données factice créé pour les besoins de cette formation.
19 Comment anonymiser ses données ? Supprimer / masquer les données identifiantes Nom Prénom Genre Age Années d'ancienneté Syndicat **M35 5 CGT ** F 28 3FO ** M 42 8CFDT ** F 31 4 CGC ** M 45 12 SUD ** F 17 2FO ** M 38 14 CFE - CGC ** F 33 6 CGT ** F 27 1FO ** F 75 29 CGC Jeu de données factice créé pour les besoins de cette formation
20 Comment anonymiser ses données ? Généraliser / catégoriser les données quasi-identifiantes L’objectif est de jouer sur la granularité des données afin que les personnes ne puissent plus être identifiées. Ce processus doit être appliqué aux informations quasi-identifiantes telles que l'âge, le lieu de naissance ou de résidence, la profession etc… Exemples : •L'âge →une classe d'âge plus ou moins grande •Le code postal →un département ou une région •La profession →une catégorie socio-professionnelle •Une data au format JJ-MM-AAAA →une date au format MM-AAAA ou AAAA L’objectif est de généraliser suffisamment les données pour les personnes ne soient plus identifiables individuellement.
21 Comment anonymiser ses données ? Généraliser / catégoriser les données quasi-identifiantes Personnels d’enseignement et de recherche Tech gestion administrative Conservateur de bib. DR Inserm ITRF Filière Bibliothèque PRAG Chercheur PU MCF Ens-Chercheur Magasinier des bib. Chargé d’archives PRAG CR CNRS BIATSS Supprimer la valeur
22 Comment anonymiser ses données ? Généraliser / catégoriser les données quasi-identifiantes Genre Age Années d'ancienneté Syndicat M35 5 CGT F28 3FO M42 8CFDT F31 4 CGC M45 12 SUD F17 2FO M38 14 CFE - CGC F33 6 CGT F27 1FO F75 29 CGC Données quasiidentifiantes à généraliser Données sensible + information pertinentes Jeu de données factice créé pour les besoins de cette formation
23 Comment anonymiser ses données ? Généraliser / catégoriser les données quasi-identifiantes Genre Age Années d'ancienneté Syndicat M [30 - 44] [0-9] CGT F [15 - 30] [0-9] FO M [30 - 44] [0-9] CFDT F [30 - 44] [0-9] CGC M [30 - 44] [10-19] SUD F [15 - 30] [0-9] FO M [30 - 44] [10-19] CFE - CGC F [30 - 44] [0-9] CGT F [15 - 30] [0-9] FO F [75 - 89] [20-29] CGC Jeu de données factice créé pour les besoins de cette formation
24 Comment anonymiser ses données ? k-anonymity k-anonymity est une approche mathématique pour montrer qu’un ensemble de données est anonymisé. Elle permet de mesurer le degrés d’anonymisation. kcorrespond au nombre d’individus que l’on peut isoler sur la base d’une combinaison de variable d’identification. Si les données sont anonymisées avec un niveau de k=5, cela revient à dire que pour chaque combinaison de variable quasi-identifiantes j’aurais au mnimum des groupes de 5 individus.
25 Comment anonymiser ses données ? k-anonymity Genre Age Années d'ancienneté Syndicat M [30 - 44] [0-9] CGT F [15 - 30] [0-9] FO M [30 - 44] [0-9] CFDT F [30 - 44] [0-9] CGC M [30 - 44] [10-19] SUD F [15 - 30] [0-9] FO M [30 - 44] [10-19] CFE - CGC F [30 - 44] [0-9] CGT F [15 - 30] [0-9] FO F [76 - 90] [21-30] CGC •Les hommes de entre 31 et 45 ans avec moins de 10 ans d’ancienneté : 2 individus •Les femmes entre 15 et 30 ans avec moins de 10 d’ancienneté : 3 individus •Les femmes de entre 31 et 45 ans avec moins de 10 ans d’ancienneté : 2 individus •Les hommes de entre 31 et 45 ans avec entre 11 et 20 ans d’ancienneté : 2 individus •La valeur extrême est supprimée Ici pour les variables genre, âges et années d’ancienneté, k=2. Jeu de données factice créé pour les besoins de cette formation
26 Comment anonymiser ses données ? La diversité Une fois les données généralisées il faut s’assurer qu’une données sensible ne soit pas identique au sein d’un groupe d’individu.
33 4 DÉMONSTRATION
SORBONNE-UNIVERSITE.FR Sauf mention contraire, cette présentation est mise à disposition selon les termes de la Licence Creative Commons Attribution 4.0 International. MERCI