__Este artigo foi escrito por Shruti Kohli, cientista de dados do Departamento de Trabalho e Pensões (DWP ) Digital, governo do Reino Unido. Este artigo foi publicado pela primeira vez em junho deste ano no DWP Digital Blog. Você pode ler o artigo original aqui. __

Este artigo contém informações do setor público licenciadas sob a Open Government License v3.0


Em minha função como cientista-chefe de dados para o Laboratório de Inovação da DWP Digital, estou sempre procurando novas maneiras de nosso departamento trabalhar. Uma área em particular que estive examinando recentemente são os dados sintéticos e as oportunidades que eles podem abrir para um departamento governamental como o nosso. Com isso em mente, montamos a equipe de dados sintéticos, análise aplicada e laboratório de inovação (SAIL) para explorar mais essa área.

__• Quer escrever para nós? Dê uma olhada no [guia para colaboradores] do Apolitical (https://apolitical.co/opinion-writing-becoming-an-apolitical-contributor/) __

Os dados sintéticos são essencialmente gerados artificialmente, mas são dados realistas. Ele é criado por meio do encaminhamento de dados de origem autênticos por meio de algoritmos que são especialmente projetados para tornar o anonimato, enquanto mantém a estrutura das informações originais. O novo conjunto de dados sintéticos pode ser usado para fins analíticos e de modelagem, o que traria benefícios significativos para nosso departamento e para a comunidade de ciência de dados em geral. No momento, os dados sintéticos são uma ferramenta emergente e é importante que consideremos os benefícios e riscos potenciais para um departamento como o nosso antes de começarmos a usá-lo.

Um dos principais benefícios que os dados sintéticos podem fornecer é o progresso de testes de dados e recursos de compartilhamento, tanto interna quanto externamente com outros departamentos do governo, academia e outros setores. O atrito mínimo entre os serviços ajudará na colaboração, o que, em última análise, nos ajudará a melhorar os serviços para nossos usuários.

Além disso, os dados sintéticos podem fornecer uma oportunidade para permitir uma análise melhor. Quanto maior um conjunto de dados, mais ele pode ser interrogado, e os dados sintéticos podem ajudar a gerar conjuntos de dados confiáveis que nos ajudarão a analisar e melhorar nossos serviços. Os dados do mundo real podem ser frágeis e difíceis de trabalhar do ponto de vista da análise; os dados sintéticos podem fornecer um conjunto de dados mais robusto com o qual será mais fácil trabalhar.

Oportunidades de compartilhamento e colaboração

Os dados sintéticos também ajudarão a promover a alfabetização e a compreensão dos dados. A partir de agora, os dados estão trancados a portas fechadas, acessíveis apenas a cientistas e analistas de dados. Os dados sintéticos ajudarão a construir painéis rápidos que podem ser construídos nesta réplica realista. Essa alfabetização em dados pode, então, ajudar as empresas a tomar decisões mais informadas.

Além disso, também pode abrir portas para maior compartilhamento de dados e colaboração cruzada, aproveitando os benefícios da inovação de crowdsourcing, trabalhando com indústrias e instituições acadêmicas. No cenário atual, essas oportunidades podem ser muito limitadas e exigir muito esforço para se materializar.

Atualmente, a anonimização dos dados ocorre em todo o departamento para mantê-los seguros e privados ao serem compartilhados com outros departamentos. Esse pode ser um processo caro e demorado, que os dados sintéticos podem ajudar a reduzir.

No entanto, os dados sintéticos só são úteis para um departamento como o DWP se atenderem a vários critérios estritos. Em primeiro lugar, a qualidade dos dados sintéticos deve ser avaliada. Quão próximo corresponde ao formato dos dados de origem originais? Se as principais características e propriedades estatísticas não forem mantidas, a utilidade dos dados será perdida.

Da mesma forma, a robustez dos dados produzidos precisa ser considerada. Precisamos ter certeza de que não há valores ausentes ou incompletos nos dados e que, uma vez formatado, é consistente com o original.

Talvez o mais importante, como departamento governamental, devemos ser particularmente cautelosos no que diz respeito à segurança e privacidade dos dados das pessoas. Precisamos ter certeza de que os dados sintéticos produzidos não contêm informações confidenciais ou que possam identificar um de nossos usuários.

Como temos explorado os dados sintéticos

Com tudo isso em mente, a equipe do Innovation Lab tem explorado as possibilidades dos dados sintéticos para relatar nossas descobertas ao departamento. No início deste ano, identificamos três líderes da indústria de dados sintéticos e, em seguida, conduzimos uma ‘hackathon’ de 3 dias usando dados abertos representativos dos casos reais de usuários de nosso departamento.

Cada um dos fornecedores foi encarregado de produzir 10 milhões de registros de aproximadamente 5 milhões no conjunto de dados de origem. Em seguida, testamos cada um dos diferentes fornecedores de dados sintéticos quanto à qualidade, precisão, robustez, segurança e privacidade, com privacidade dada um peso particular em nossa avaliação, dada sua importância para o departamento. Os resultados do hackathon mostraram que um fornecedor em particular produziu os dados mais precisos e também os mais altos níveis de segurança e privacidade.

A partir daqui, queríamos submeter nossos resultados a mais rigor acadêmico, a fim de desafiar nossas descobertas. Portanto, fizemos uma parceria com o Alan Turing Institute (ATI) para um desafio de grupo de estudo de dados. A ATI está examinando nossos resultados e desenvolvendo métricas de privacidade e utilidade para dados sintéticos que podem nos ajudar a validar seu uso para compartilhamento de dados.

Mas isso não é o fim da jornada. Junto com essa consideração acadêmica, propusemos estabelecer um desafio técnico em conjuntos de dados DWP para testar ainda mais nossas descobertas. O desafio técnico envolverá o fornecimento de dados totalmente anônimos que representam dados DWP autênticos para participantes externos e a tarefa de resolver em massa uma tarefa específica.

Isso nos permitirá avaliar se os dados sintéticos gerados podem ser usados para conduzir análises na extensão que exigiríamos em um cenário do mundo real. É mais uma camada de testes robustos de dados sintéticos para avançar nossa compreensão de sua utilidade para o nosso departamento.

A partir daí, nossa esperança é que possamos chegar mais perto de propor o uso de dados sintéticos como parte de nosso kit de ferramentas de compartilhamento de dados em todo o departamento. No entanto, isso só pode acontecer quando estivermos totalmente confiantes de que nos fornece a segurança, precisão e privacidade que exigimos como departamento governamental. — Shruti Kohli

__ Queremos saber a sua opinião sobre este artigo. Proponha um artigo para nós ou envie seus comentários para [discussão@apolitical.co](mailto: Discussion@apolitical.co) __

(Crédito da foto: DWP Digital)


Certifique-se de partilhar as suas próprias ideias com o autor ao deixar um comentário abaixo