__Este artículo fue escrito por Shruti Kohli, científico de datos, del Departamento de Trabajo y Pensiones (DWP ) Digital, gobierno del Reino Unido. Este artículo se publicó por primera vez en junio de este año en el Blog digital de DWP. Puede leer el artículo original aquí. __
Este artículo contiene información del sector público con licencia de Open Government License v3.0.
En mi función de científico de datos principal del Laboratorio de innovación de DWP Digital, siempre estoy buscando nuevas formas de trabajar para nuestro departamento. Un área en particular que he estado analizando recientemente son los datos sintéticos y las oportunidades que podrían abrir para un departamento gubernamental como el nuestro. Teniendo esto en cuenta, hemos creado el equipo de Laboratorio de innovación, análisis aplicado y datos sintéticos (SAIL) para explorar más esta área.
__ • ¿Quiere escribirnos? Eche un vistazo a la [guía para colaboradores] de Apolitical (https://apolitical.co/opinion-writing-becoming-an-apolitical-contributor/) __
Los datos sintéticos son esencialmente datos generados artificialmente pero realistas. Se crea canalizando datos de origen auténticos a través de algoritmos que están especialmente diseñados para anonimizar, manteniendo la estructura de la información original. El nuevo conjunto de datos sintéticos se puede utilizar con fines analíticos y de modelado, lo que aportaría importantes beneficios tanto a nuestro departamento como a la comunidad científica de datos en general. Por el momento, los datos sintéticos son en gran medida una herramienta emergente, y es importante que consideremos los posibles beneficios y riesgos para un departamento como el nuestro antes de comenzar a usarlos.
Uno de los beneficios clave que podrían proporcionar los datos sintéticos es el progreso de las capacidades de prueba e intercambio de datos, tanto interna como externamente con otros departamentos gubernamentales, el mundo académico y otros sectores. Una fricción mínima entre los servicios ayudará a la colaboración, lo que, en última instancia, nos ayudará a mejorar los servicios para nuestros usuarios.
Además, los datos sintéticos podrían brindar la oportunidad de permitir un mejor análisis. Cuanto más grande sea un conjunto de datos, más se puede interrogar, y los datos sintéticos podrían ayudar a generar conjuntos de datos fiables que nos ayudarán a analizar y mejorar nuestros servicios. Los datos del mundo real pueden ser frágiles y difíciles de trabajar desde el punto de vista del análisis; Los datos sintéticos pueden proporcionar un conjunto de datos más sólido con el que será más fácil trabajar.
Oportunidades para compartir y colaborar
Los datos sintéticos también ayudarán a promover la alfabetización y la comprensión de los datos. A partir de ahora, los datos están bloqueados detrás de puertas cerradas a las que solo pueden acceder los científicos y analistas de datos. Los datos sintéticos ayudarán a crear cuadros de mando rápidos que se pueden construir en esta réplica realista. Esta alfabetización de datos puede ayudar a las empresas a tomar decisiones más informadas.
Además, también podría abrir las puertas a un mayor intercambio de datos y colaboración cruzada, aprovechando los beneficios de la innovación del crowdsourcing, trabajando con industrias e instituciones académicas. En el panorama actual, estas oportunidades pueden ser muy limitadas y requieren mucho esfuerzo para materializarse.
Actualmente, la anonimización de los datos se lleva a cabo en todo el departamento para mantenerlos seguros y privados cuando se comparten con otros departamentos. Este puede ser un proceso costoso y lento, que los datos sintéticos podrían ayudar a reducir.
Sin embargo, los datos sintéticos solo son útiles para un departamento como DWP si pueden cumplir con una serie de criterios estrictos. En primer lugar, es necesario evaluar la calidad de los datos sintéticos. ¿Qué tan cerca coincide con el formato de los datos de origen originales? Si no se conservan las características básicas y las propiedades estadísticas, se pierde la utilidad de los datos.
Del mismo modo, debe tenerse en cuenta la solidez de los datos producidos. Necesitamos estar seguros de que no hay valores faltantes o incompletos en los datos, y que una vez formateados es consistente con el original.
Quizás lo más importante es que, como departamento gubernamental, debemos ser particularmente cautelosos cuando se trata de la seguridad y privacidad de los datos de las personas. Debemos estar seguros de que los datos sintéticos producidos no contienen ninguna información que sea sensible o que pueda identificar a uno de nuestros usuarios.
Cómo hemos explorado los datos sintéticos
Con todo esto en mente, el equipo del Laboratorio de Innovación ha estado explorando las posibilidades de los datos sintéticos para informar nuestros hallazgos al departamento. A principios de este año, identificamos a tres líderes de la industria de datos sintéticos y luego llevamos a cabo un "hackatón" de 3 días utilizando datos abiertos representativos de los casos de usuarios reales de nuestro departamento.
A cada uno de los proveedores se le asignó la tarea de producir 10 millones de registros de aproximadamente 5 millones en el conjunto de datos de origen. Luego probamos cada uno de los diferentes proveedores de datos sintéticos en cuanto a calidad, precisión, solidez, seguridad y privacidad, con la privacidad dada un peso particular en nuestra evaluación, dada su importancia para el departamento. Los resultados del hackathon mostraron que un proveedor en particular produjo los datos más precisos y también los niveles más altos de seguridad y privacidad.
A partir de aquí, queríamos someter nuestros resultados a un mayor rigor académico, con el fin de desafiar nuestros hallazgos. Entonces, nos hemos asociado con el Instituto Alan Turing (ATI) para un desafío de grupo de estudio de datos. La ATI está examinando nuestros resultados y desarrollando métricas de privacidad y utilidad para datos sintéticos que podrían ayudarnos a validar su uso para compartir datos.
Sin embargo, ese no es el final del viaje. Junto a esta consideración académica, hemos propuesto establecer un desafío tecnológico en conjuntos de datos DWP para probar aún más nuestros hallazgos. El desafío tecnológico implicará proporcionar datos completamente anonimizados que sean representativos de datos auténticos de DWP a los participantes externos, y asignarles a los involucrados la tarea de resolver una tarea específica.
Esto nos permitirá evaluar si los datos sintéticos generados se pueden utilizar para realizar análisis en la medida en que lo requeriríamos en un escenario del mundo real. Es una capa adicional de pruebas sólidas de datos sintéticos para mejorar nuestra comprensión de su utilidad para nuestro departamento.
A partir de ahí, nuestra esperanza sería que podamos acercarnos a proponer el uso de datos sintéticos como parte de nuestro conjunto de herramientas para compartir datos en todo el departamento. Sin embargo, eso solo puede suceder cuando estamos completamente seguros de que nos brinda la seguridad, precisión y privacidad que requerimos como departamento gubernamental. — Shruti Kohli
__Queremos escuchar lo que piensa sobre este artículo. Envíenos un artículo o envíenos sus comentarios a [discusion@apolitical.co](mailto: discusion@apolitical.co) __
(Crédito de la imagen: DWP Digital)
Asegúrate de compartir tus propias ideas con el autor dejando un comentario abajo

Inicia sesión o regístrate para continuar la conversación