__Cet article a été écrit par Shruti Kohli, data scientist, au Department for Work and Pensions (DWP ) Numérique, gouvernement britannique. Cet article a été publié pour la première fois en juin de cette année sur le DWP Digital Blog. Vous pouvez lire l'article original ici. __

Cet article contient des informations du secteur public sous licence Open Government License v3.0.


Dans mon rôle de scientifique principal des données pour le laboratoire d'innovation de DWP Digital, je suis toujours à la recherche de nouvelles façons de travailler pour notre département. Un domaine en particulier que j'ai examiné récemment est celui des données synthétiques et des opportunités qu'elles pourraient ouvrir pour un ministère comme le nôtre. Dans cette optique, nous avons mis en place l'équipe Données synthétiques, Analyse appliquée, Laboratoire d'innovation (SAIL) pour explorer davantage ce domaine.

• Tu veux écrire pour nous? Jetez un œil au [guide pour les contributeurs] d'Apolitique (https://aphysical.co/opinion-writing-becoming-an-aphysical-contributor/)

Les données synthétiques sont essentiellement des données générées artificiellement mais réalistes. Il est créé en canalisant des données sources authentiques via des algorithmes spécialement conçus pour les anonymiser, tout en conservant la structure des informations d'origine. Le nouvel ensemble de données synthétiques peut être utilisé à des fins d'analyse et de modélisation, ce qui apporterait des avantages significatifs à la fois à notre département et à la communauté plus large de la science des données. À l'heure actuelle, les données synthétiques sont un outil émergent et il est important que nous examinions les avantages et les risques potentiels pour un service comme le nôtre avant de commencer à les utiliser.

L'un des principaux avantages que les données synthétiques pourraient offrir est de faire progresser les capacités de test et de partage des données, à la fois en interne et en externe avec d'autres ministères, universités et autres secteurs. Une friction minimale entre les services favorisera la collaboration, ce qui nous aidera en fin de compte à améliorer les services pour nos utilisateurs.

De plus, les données synthétiques pourraient être l'occasion de permettre une meilleure analyse. Plus un ensemble de données est grand, plus il peut être interrogé, et les données synthétiques pourraient aider à générer des ensembles de données fiables qui nous aideront à analyser et à améliorer nos services. Les données du monde réel peuvent être fragiles et difficiles à utiliser d'un point de vue analytique ; les données synthétiques peuvent fournir un ensemble de données plus robuste avec lequel il sera plus facile de travailler.

Opportunités de partage et de collaboration

Les données synthétiques contribueront également à promouvoir la maîtrise et la compréhension des données. Désormais, les données sont verrouillées à huis clos, accessibles uniquement aux data scientists et aux analystes. Les données synthétiques aideront à créer des tableaux de bord rapides qui peuvent être construits sur cette réplique réaliste. Cette littératie des données peut ensuite aider les entreprises à prendre des décisions plus éclairées.

En outre, cela pourrait également ouvrir la porte à un partage accru des données et à une collaboration croisée, en tirant parti des avantages de l'innovation de crowdsourcing, en travaillant avec les industries et les établissements universitaires. Dans le paysage actuel, ces opportunités peuvent être très limitées et nécessitent beaucoup d'efforts pour se matérialiser.

Actuellement, l'anonymisation des données a lieu dans tout le département afin de les garder sécurisées et privées lors du partage avec d'autres départements. Cela peut être un processus long et coûteux, que les données synthétiques pourraient aider à réduire.

Cependant, les données synthétiques ne sont utiles pour un service comme DWP que si elles peuvent répondre à un certain nombre de critères stricts. Tout d'abord, la qualité des données synthétiques doit être évaluée. Dans quelle mesure correspond-il au format des données source d'origine ? Si les caractéristiques de base et les propriétés statistiques ne sont pas conservées, l'utilité des données est perdue.

De même, la robustesse des données produites doit être considérée. Nous devons être sûrs qu'il n'y a pas de valeurs manquantes ou incomplètes dans les données, et qu'une fois formatées, elles sont cohérentes avec l'original.

Peut-être plus important encore, en tant que ministère, nous devons être particulièrement prudents en ce qui concerne la sécurité et la confidentialité des données des personnes. Nous devons être sûrs que les données synthétiques produites ne contiennent aucune information sensible ou susceptible d'identifier l'un de nos utilisateurs.

Comment nous avons exploré les données synthétiques

Dans cet esprit, l'équipe Innovation Lab a exploré les possibilités des données synthétiques afin de rendre compte de nos résultats au département. Plus tôt cette année, nous avons identifié trois leaders de l'industrie des données synthétiques, puis avons organisé un « hackathon » de 3 jours en utilisant des données ouvertes représentatives des cas d'utilisateurs réels de notre département.

Chacun des fournisseurs a été chargé de produire 10 millions d'enregistrements à partir d'environ 5 millions dans l'ensemble de données source. Nous avons ensuite testé chacun des différents fournisseurs de données synthétiques pour la qualité, l'exactitude, la robustesse, la sécurité et la confidentialité, la confidentialité étant particulièrement pondérée dans notre évaluation, compte tenu de son importance pour le département. Les résultats du hackathon ont montré qu'un fournisseur en particulier produisait les données les plus précises, ainsi que les niveaux les plus élevés de sécurité et de confidentialité.

À partir de là, nous avons voulu soumettre nos résultats à une plus grande rigueur académique, afin de remettre en question nos découvertes. Nous nous sommes donc associés à l'Institut Alan Turing (ATI) pour un défi de groupe d'étude de données. L'ATI examine nos résultats et développe des mesures de confidentialité et d'utilité pour les données synthétiques qui pourraient nous aider à valider leur utilisation pour le partage de données.

Ce n'est pas la fin du voyage cependant. Parallèlement à cette considération académique, nous avons proposé d'établir un défi technologique sur les ensembles de données DWP pour tester davantage nos résultats. Le défi technologique consistera à fournir des données entièrement anonymisées qui sont représentatives des données DWP authentiques à des participants externes, et à charger les personnes impliquées de résoudre une tâche spécifique.

Cela nous permettra d'évaluer si les données synthétiques générées peuvent être utilisées pour effectuer une analyse dans la mesure où nous en aurions besoin dans un scénario du monde réel. Il s'agit d'une couche supplémentaire de tests robustes de données synthétiques pour faire progresser notre compréhension de leur utilité pour notre service.

À partir de là, notre espoir serait que nous puissions nous rapprocher de la proposition d'utilisation de données synthétiques dans le cadre de notre boîte à outils de partage de données à travers le département. Cependant, cela ne peut se produire que lorsque nous sommes pleinement convaincus qu'il nous offre la sécurité, la précision et la confidentialité dont nous avons besoin en tant que ministère. — Shruti Kohli

__Nous voulons savoir ce que vous pensez de cet article. Pitch an article à nous ou envoyez vos commentaires à discussion@aphysical.co __

(Crédit photo : DWP Digital)


N'oubliez pas de partager vos propres réflexions avec l'auteur en laissant un commentaire ci-dessous