Objectif
Les ensembles de données synthétiques ont pour objectif de fournir des informations détaillées sur la structure des fichiers présents le Datawarehouse Marché du Travail et Protection sociale.
Ces sets de données sont générés artificiellement par des algorithmes analysant les distributions des données d’origine présentes dans le Datawarehouse et générant de nouvelles données respectant ces mêmes distributions. Les sets de données synthétiques imitent donc les données réelles, sans contenir d’informations sensibles.
Avantages des données synthétiques
Anonymat et sécurité
La grande majorité des fichiers présents au sein du Datawarehouse est constitué de données individuelles, reliés entre par un identifiant unique. Le risque de réidentification à partir de données réelles est donc important. Les données synthétiques permettent de pallier à ce risque en étant anonymes by design. Une fois synthétisées, ces données ne correspondent plus à des situations individuelles réelles et empêchent ainsi tout risque de divulgation d'informations personnelles sensibles. Les données synthétiques permettent donc de partager des informations structurées sans compromettre la sécurité des données réelles, ce qui est particulièrement utile dans les environnements où la confidentialité est critique telle que celui du Datawarehouse.
Flexibilité et rapidité
Les sets de données synthétiques permettent aux utilisateurs d’avoir un accès direct à la structure des principaux fichiers du Datawarehouse, de leurs variables et de leurs codes. Cet accès direct permet aux utilisateurs d’avoir une compréhension supplémentaire de la structure du Datawarehouse, complémentaire à la documentation présente dans l’onglet “accès aux données”. Grâce à cet accès aux méta-données, les utilisateurs ont la possibilité de préparer et tester leurs scripts d’analyse avant de pouvoir travailler avec les données réelles, permettant ainsi un gain de temps important dans les premières étapes de la recherche.
Limitations des sets de données synthétiques
Incohérence des données
En raison du processus de synthèse, certaines incohérences peuvent apparaître. Bien qu’un maximum de cohérence soit conservé au sein de chaque fichier (date de début avant date de fin, etc.), la cohérence entre différents fichiers ne peut être gardée, la génération de chaque fichier synthétique se faisant sur chaque fichier individuel. En consequence, un même individu peut être sujet à des situations incohérentes ou impossibles si l’on prend en compte des fichiers différents, ceux-ci ayant été synthétisés individuellement.
Utilisation limitée à une compréhension de la structure des fichiers et des métadonnées
Ces sets de données peuvent être utilisés uniquement à des fins de compréhension des métadonnées et de la structure de fichiers du Datawarehouse. Ils ne peuvent en aucun cas être utilisés à des fins analytiques. L’objectif de ces sets est de pouvoir donner un aperçu direct des variables présentes dans chacune des sources, des codes présents dans chacune des variables, de leurs formats, etc. afin de préparer les scripts destinés à analyser les fichiers contenant les données réelles. L’existence d’un code unique par individu permet cependant aux utilisateurs de joindre les fichiers entre eux sur base de ces clés.
Structure des sets de données disponibles
Les sets de données synthétiques actuellement disponibles correspondent pour le moment aux sources de données les plus demandées par les utilisateurs du Datawarehouse. Elles ne constituent donc pas une copie exhaustive du Datawarehouse.
La page suivante renseigne les variables présentes dans chacun des sets de données ainsi que les modifications qui y ont été faites si c’est le cas.