Doelstelling
De synthetische datasets hebben als doel gedetailleerde informatie te verstrekken over de structuur van de bestanden die aanwezig zijn in het Datawarehouse Arbeidsmarkt en Sociale Bescherming.
Deze datasets worden kunstmatig gegenereerd door algoritmen die de verdelingen van de oorspronkelijke gegevens in het Datawarehouse analyseren en nieuwe gegevens genereren die dezelfde verdelingen respecteren. De synthetische datasets bootsen dus de echte gegevens na, zonder gevoelige informatie te bevatten.
Voordelen van synthetische gegevens
Anonimiteit en veiligheid
Het overgrote deel van de bestanden in het Datawarehouse bestaat uit individuele gegevens die onderling verbonden zijn via een unieke identificator. Het risico op heridentificatie op basis van echte gegevens is dus aanzienlijk. Synthetische gegevens beperken dit risico doordat ze by design anoniem zijn. Na synthese komen deze gegevens niet langer overeen met reële individuele situaties, waardoor elk risico op openbaarmaking van gevoelige persoonsgegevens wordt uitgesloten. Synthetische gegevens maken het dus mogelijk om gestructureerde informatie te delen zonder de veiligheid van de echte gegevens in gevaar te brengen, wat bijzonder nuttig is in omgevingen waar vertrouwelijkheid cruciaal is, zoals het Datawarehouse.
Flexibiliteit en snelheid
Synthetische datasets geven gebruikers directe toegang tot de structuur van de belangrijkste bestanden van het Datawarehouse, hun variabelen en hun codes. Deze directe toegang biedt een bijkomend inzicht in de structuur van het Datawarehouse, aanvullend op de documentatie in het tabblad “toegang tot de gegevens”. Dankzij deze toegang tot metadata kunnen gebruikers hun analysescripts voorbereiden en testen voordat ze met de echte gegevens werken, wat een aanzienlijke tijdswinst oplevert in de eerste fasen van onderzoek.
Beperkingen van synthetische datasets
Inconsistenties in de gegevens
Door het syntheseproces kunnen bepaalde inconsistenties optreden. Hoewel binnen elk afzonderlijk bestand een maximaal niveau van coherentie wordt behouden (begindatum vóór einddatum, enz.), kan de coherentie tussen verschillende bestanden niet worden gegarandeerd, aangezien elk synthetisch bestand afzonderlijk wordt gegenereerd. Hierdoor kan eenzelfde individu in verschillende bestanden in inconsistente of zelfs onmogelijke situaties terechtkomen, omdat deze bestanden individueel zijn gesynthetiseerd.
Gebruik beperkt tot inzicht in de structuur van de bestanden en metadata
Deze datasets mogen uitsluitend worden gebruikt om inzicht te krijgen in de metadata en de structuur van de bestanden van het Datawarehouse. Ze mogen in geen geval worden gebruikt voor analytische doeleinden. Het doel van deze sets is een direct overzicht te geven van de variabelen in elke bron, de codes binnen elke variabele, hun formaten, enz., zodat scripts kunnen worden voorbereid die later op de echte gegevens worden toegepast. Het bestaan van een unieke code per individu maakt het gebruikers echter wel mogelijk om bestanden onderling te koppelen op basis van deze sleutels.
Structuur van de beschikbare datasets
De momenteel beschikbare synthetische datasets komen overeen met de gegevensbronnen die het meest worden opgevraagd door de gebruikers van het Datawarehouse. Ze vormen dus geen volledige kopie van het Datawarehouse.
De volgende pagina geeft een overzicht van de variabelen die aanwezig zijn in elke dataset, evenals de eventuele aanpassingen die erop zijn toegepast.