** Este artigo foi escrito por Tim Hill, Padrões de Dados e Líder Técnico do Open Data Institute **


Caso ainda restasse alguma dúvida sobre o assunto, a publicação do Comitê de Padrões na Vida Pública do Reino Unido [relatório](https://www.gov.uk/government/publications/artificial-intelligence-and-public-standards- relatório) sobre inteligência artificial no governo em 10 de fevereiro de 2020 acabou com ele completamente: o aprendizado de máquina saiu do mundo do laboratório de pesquisa e foi para o governo. “A inteligência artificial - e em particular o aprendizado de máquina”, declara, “transformará a maneira como as organizações do setor público tomam decisões e prestam serviços públicos”.

A adição desta nova técnica poderosa ao kit de ferramentas do formulador de políticas, no entanto, não é isenta de riscos. Ao conhecido ditado de que, para um homem com um martelo, tudo parece um prego, deve-se acrescentar outro ditado, bem conhecido entre os cientistas de dados. "Com quatro parâmetros, posso ajustar um elefante", disse certa vez o matemático John von Neumann. "Com cinco, consigo mexer o tronco".

Não se preocupe se você não entender a piada: o argumento de von Neumann é simples. Nos domínios de dados complexos em que o aprendizado de máquina é normalmente empregado, é fácil chegar a resultados espúrios - ou mesmo absurdos.

Abaixo, então, estão quatro questões cruciais a serem consideradas para garantir que seu uso do aprendizado de máquina não seja apenas apertando os parafusos paredes com um martelo configurável quadraticamente - mas, em vez disso, adiciona valor e visão únicos aos seus domínios.

Você tem a equipe certa?

Projetos de aprendizado de máquina bem-sucedidos envolvem mais do que apenas especialistas em ML. No mínimo, eles exigem:

  • Experiência em aprendizado de máquina
  • Habilidades de engenharia de software
  • Uma compreensão profunda do (s) conjunto (s) de dados que estão sendo analisados - como foram coletados, como se relacionam entre si, como são processados, etc.
  • Conhecimento de domínio
  • Representação das partes interessadas
  • Habilidades de gerenciamento suficientes para coordenar todos os itens acima

Só porque existem seis pontos listados acima não significa necessariamente que precisa haver seis indivíduos ou equipes separadas envolvidas; mas é preciso ter cuidado para garantir que cada uma dessas funções seja devidamente preenchida por pessoas com experiência comprovada na área. Em particular, é tentador supor que as funções de ML e engenharia de software podem ser desempenhadas pelas mesmas pessoas, simplesmente porque ambas envolvem computadores. Mas, na verdade, os dois conjuntos de habilidades são distintos - e esperar que um especialista em analítica realize engenharia de software pode levar rapidamente a um código impossível de manter ou pior. Da mesma forma, o conhecimento geral do domínio e a compreensão de uma coleta de dados específica e sua procedência não devem ser confundidos. Pode ser que a mesma pessoa ou equipe possua ambos - mas isso não pode ser simplesmente assumido.

Com relação à representação das partes interessadas, lembre-se de que o público em geral deve ser considerado uma "parte interessada" nos projetos do setor público. Questões de parcialidade e o uso ético do BC precisarão ser examinados cuidadosamente; e, claro, os Princípios Nolan aplicar em todo.

O ML pode responder às perguntas mais relevantes para o seu projeto ou domínio com os dados disponíveis?

Isso pode ser surpreendentemente difícil de avaliar, e é por isso que é tão importante ter a equipe certa antes de começar a examinar seu domínio e pesquisar seus dados: muitas vezes, determinar qual papel o aprendizado de máquina pode desempenhar exigirá uma avaliação especializada de ambos problema que precisa ser resolvido e dos dados disponíveis.

Além disso, essas duas questões podem envolver investigação prolongada: a limpeza de dados pode muitas vezes levar entre 60% e 90% do tempo total do projeto e vale a pena ver quanto é necessário ou possível no início. Além disso, os projetos do setor público serão frequentemente regulamentados de forma rígida, com dados espalhados por vários sites por motivos de segurança e, às vezes, regras complexas de proteção de dados e anonimato que precisam ser cumpridas.

** É necessário ter cuidado para evitar o uso do aprendizado de máquina apenas **

Nos casos em que os dados necessários estão ausentes ou são de baixa qualidade, às vezes pode valer a pena pensar de forma criativa e ver quais aspectos do aprendizado de máquina do problema ainda podem ser úteis na solução. Nesse ponto, no entanto, é preciso ter cuidado para evitar o uso de ML apenas por causa disso: sem uma pergunta bem definida, as tentativas de simplesmente executar algoritmos de aprendizado de máquina comuns em conjuntos de dados existentes quase certamente produzirão resultados espúrios e / ou sem sentido .

Um teste de sanidade útil para verificar a utilidade potencial do ML é se você tem ou não uma boa linha de base para comparar seu desempenho. Qual linha de base deve ser usada dependerá do domínio. Os domínios científicos e médicos muitas vezes têm ferramentas estatísticas bem estabelecidas para tarefas de previsão, cuja precisão pode servir como um comparador útil para os resultados de ML; em outras ocasiões, uma abordagem mais analítica de dados (por exemplo, atribuir a classe majoritária em tarefas de classificação) será apropriada. Se a consulta com os especialistas em domínio e análise de dados falhar em produzir uma heurística de linha de base útil, provavelmente você precisará fazer mais dados e exploração de domínio antes de se envolver novamente com o ML. Por outro lado, se você tiver uma linha de base, mas for baixa, há boas chances de que o ML possa melhorá-la significativamente.

Você pode ser ágil?

A palavra "ágil" foi tão usada ao longo de uma década que muitas vezes parece sem sentido: até mesmo as organizações mais escleróticas afirmam ser "ágil" e usar "metodologias ágeis" agora.

Mas o aprendizado de máquina realmente exige isso. Particularmente nos estágios iniciais, o aprendizado de máquina envolve iterações frequentes e consultas da equipe para identificar recursos significativos, refinar parâmetros e desenvolver infraestrutura. Os primeiros resultados podem parecer absurdos e modelos complexos podem precisar ser descartados nas fases iniciais. Além disso, uma implicação da necessidade de avaliação especializada do problema em seus estágios iniciais é que pode acabar o aprendizado de máquina não é a abordagem certa em primeiro lugar. Como afirma Jurgen Mitsch, analista principal do NHS Trust do Nottingham University Hospital, é vital que os esforços de aprendizado de máquina "comecem pequenos e falhem rápido" para encontrar e refinar a abordagem certa.

** O aprendizado de máquina é uma empresa profundamente colaborativa **

Uma implicação disso é que as abordagens de aprendizado de máquina precisarão da adesão da alta administração a médio e longo prazo se quiserem ter muita chance de sucesso. Se forem necessários ganhos rápidos para garantir mais financiamento, o ML quase certamente não será viável. À medida que a tecnologia de aprendizado de máquina amadurece e se torna mais incorporada à cultura do setor público, pode ser que as iterações sejam aceleradas e os resultados garantidos. Mas não estamos lá agora, e visão e apoio de longo prazo serão necessários para que essa visão seja alcançada.

Você está desenvolvendo um vocabulário compartilhado?

Conforme observado acima, o aprendizado de máquina é uma empresa profundamente colaborativa, que além disso envolve pessoas profundamente especializadas em seus respectivos campos.

Às vezes, isso pode dificultar a comunicação - e precisamente nos momentos em que é mais importante ser claro. A análise de dados tem um vocabulário técnico vasto e às vezes proibitivo, que pode se sobrepor, mas não é idêntico ao usado por especialistas em dados. Esta, por sua vez, tem alguns - mas não muitos - pontos de contato com a engenharia de software. E, claro, os especialistas em domínio geralmente têm seu próprio jargão, que muitas vezes pode ser impenetrável para quem está de fora. Um projeto bem-sucedido precisará superar essas barreiras se for gerar uma visão.

A complexidade dos domínios de aprendizado de máquina quase garante que todos na sala terão "perguntas estúpidas" uns para os outros, e garantir que elas possam ser transmitidas com antecedência e muitas vezes é vital para o sucesso

Em um nível administrativo, isso significa encontrar ferramentas que permitem que cada membro da equipe se comunique e compartilhe informações relevantes de forma assíncrona. Muitas das ferramentas e plataformas usadas para metodologias de desenvolvimento ágil de software - por exemplo, Quadros Kanban, Jira, Azure DevOps, GitHub, etc. - são adequados para isso, mas um tamanho não serve para todos. Reserve um tempo para experimentar e brincar com uma variedade de tecnologias para encontrar a combinação certa para você.

Nem tudo, entretanto, pode ou deve ser feito online. Particularmente nas fases iniciais, é importante realizar reuniões plenárias de mesa redonda com bastante frequência, para que toda a equipe possa estabelecer seu vocabulário compartilhado o mais rápido possível. Nessas reuniões, deve-se tomar cuidado para permitir bastante tempo para discussão, esclarecimento de dúvidas e parafraseia - e em um ambiente aberto e sem julgamentos. A complexidade dos domínios aprendizado de máquina quase garante que todos na sala terão "estúpido perguntas "uns para os outros, e garantir que eles possam ser exibidos com antecedência e, muitas vezes, é vital para o sucesso.

Além disso, o objetivo das perguntas estúpidas se estende além da equipe, para o "mundo real", onde os efeitos do seu projeto precisam ser sentidos. Uma crítica comum ao aprendizado de máquina na área de saúde é que seus resultados são comunicados de forma tão técnica e confusa que se tornam inúteis para os médicos.

Se você não puder criar um resumo em inglês simples das decisões que foram tomadas e das técnicas que estão sendo usadas a cada dia, é uma boa indicação de que sua equipe precisa trabalhar mais na criação de um vocabulário compartilhado - tanto para uma melhor compreensão quanto para impacto no mundo real. - Tim Hill

(Crédito da imagem: Unsplash)