Depois de aprender o que é aprendizado de máquina - e as maneiras como o governo pode usá-lo - é hora de mergulhar mais fundo em como o processo realmente funciona. Quer você esteja pensando em colaborar com especialistas para projetar uma intervenção ou apenas procurando entender e explorar a abordagem, é vital que você obtenha uma base nos fundamentos de como projetar e executar um projeto de aprendizado de máquina.
Apolitical falou com a Dra. Crina Grosan, Professora Sênior no [Departamento de Ciência da Computação da Universidade de Brunel](https: //www. brunel.ac.uk/computer-science) e especialista em inteligência artificial e aprendizado de máquina. Grosan tem experiência no ensino de aprendizado de máquina para formuladores de políticas, por exemplo, ela atualmente dirige uma masterclass da UK Government Digital Service Academy. Ela compartilhou sua orientação para executar um projeto de aprendizado de máquina, dividida em cinco estágios principais:
- Definindo o problema
- Preparando os dados
- Explorar os dados e formular uma hipótese
- Gerando seu modelo de aprendizado de máquina
- Avaliação e refinamento do seu modelo
Grosan usa um cenário para demonstrar como executar um projeto de aprendizado de máquina em termos práticos, desde a coleta de dados até a geração e refinamento de seu modelo de aprendizado de máquina.
“Um exemplo que dou aos meus alunos são os dados sobre os resultados dos testes das escolas primárias em todos os bairros de Londres”, disse Grosan. “Eu forneço a eles os resultados, junto com outros conjuntos de dados sobre os bairros, incluindo taxas de emprego, níveis de renda e posicionamento geográfico. Então eu pergunto se eles podem identificar algum problema e se os dados podem dizer-lhes alguma coisa. ”
** 1 . Definindo o problema **
O ** problema ** pode ser definido antes ou depois de você preparar e explorar os dados, dependendo da situação.
_ ** Problema = a pergunta ou problema que você está tentando resolver ** _
Em alguns casos, você começa com um problema e, em seguida, busca coletar dados relevantes para abordá-lo ou resolvê-lo.
No exemplo das pontuações dos testes das crianças, você pode começar com o problema de que as crianças de determinados bairros apresentam um desempenho ruim em comparação com as de outros bairros. A próxima etapa seria coletar e explorar dados para descobrir o porquê disso.
Em outros cenários, você começa com dados, mas sem um problema claro. Em seguida, conduzindo uma análise exploratória dos dados, você encontra o problema que deseja resolver e, em seguida, formula uma ** hipótese ** para testar.
_ ** Hipótese = a suposição que você deseja testar ** _
Por exemplo, você já pode ter dados sobre os resultados dos testes das crianças, taxas de desemprego, níveis de renda e posicionamento geográfico, juntamente com vários outros indicadores por bairro. Você pode então explorar as conexões entre esses indicadores para identificar um problema.
Por exemplo, você pode descobrir que as crianças tendem a ter um desempenho ruim em bairros onde as taxas de desemprego são altas. Com base nisso, você poderia formular uma hipótese: o mau desempenho dos alunos está ligado às taxas de desemprego do bairro.
** 2 . Preparando os dados **
A preparação pode ser dividida em duas partes: ** coleta ** e ** pré-processamento **.
_ ** Coleta = o processo de coleta de dados ** _
_ ** Pré-processamento = transformação de dados brutos em um formato compreensível e estruturado ** _
Primeiro, você coleta os dados. Se você tiver várias fontes, integre-as combinando vários conjuntos de dados.
Em seguida, você começa a pré-processar os dados. O objetivo é transformar os dados em um formato compreensível que possa ser usado para aprendizado de máquina.
Isso significa limpar os dados porque pode haver muito ruído - dados essencialmente sem sentido e redundantes. Você precisará remover outliers, repetições e inconsistências e normalizar os dados.
Por exemplo, pode ser que uma pessoa tenha 120 anos e todas as outras no conjunto de dados não tenham mais que 70. Nesse caso, a pessoa de 120 anos pode ser uma pessoa atípica e, portanto, pode ser eliminada para evitar distorcer a adição que você querer fazer.
Você também precisa remover inconsistências. Por exemplo, depois de combinar vários conjuntos de dados comparando-os entre si, você pode descobrir que tem dois números de telefone diferentes para o mesmo nome. Se o número de telefone for importante para a análise, limpe o errado.
Também existem maneiras de normalizar os dados. Pode ser que, para alguns registros, você tenha valores da ordem de milhões. Para outros, você pode ter valores entre 0 e 1. Isso significa que, quando você combina esses conjuntos de valores, os menores não contribuirão para o resultado porque são insignificantes em comparação com os valores grandes. É por isso que você os normaliza para que fiquem todos dentro do mesmo intervalo - neste caso, tornando-os todos entre 0 e 1.
** 3 . Explorando os dados e formulando uma hipótese **
A próxima etapa é fazer uma ** análise exploratória ** dos dados que você possui.
** _ Análise exploratória = investigação inicial de dados usando estatísticas para encontrar padrões _ **
Por exemplo, você pode encontrar a taxa de aprovação percentual de crianças por bairro.
Você também pode querer começar a fazer gráficos visuais para mapear conexões entre ** indicadores ** nos dados.
_ ** Indicador = uma característica mensurável dos dados ** _
Por exemplo, conexões entre pontuações de testes e níveis de renda, taxas de desemprego ou posicionamento geográfico.
Esta análise o ajudará a entender o problema e formular uma ou mais hipóteses.
** 4 . Gerando seu modelo de aprendizado de máquina **
Agora você está pronto para começar a construir seu ** modelo **.
_ ** Modelo = Um sistema de aprendizado de máquina baseado em relações matemáticas ** _
O modelo deve testar sua hipótese: neste caso, ele investigará a relação entre os resultados dos testes das crianças e as taxas de desemprego.
Com base nos dados que você tem de outros bairros, com seu modelo de aprendizado de máquina, você pode prever que se o desemprego estiver entre w e x, os resultados dos alunos ficarão entre ye z.
Neste exemplo, as taxas de desemprego são o “** indicador ” e as pontuações dos testes são o “ output. **”
_ ** Saída = Um valor que o modelo gera com base em relações matemáticas ** _
A relação entre o (s) indicador (es) e o (s) produto (s) pode (m) ser expressa de várias maneiras, por exemplo como uma regra - “se o indicador for x, então o resultado será y” - ou como uma fórmula matemática. Usando o relacionamento que seu modelo gerou, você poderá avaliar a precisão de sua hipótese.
Nesse caso, você poderá determinar se há uma conexão entre os resultados do teste e as taxas de desemprego e, em caso afirmativo, qual é essa conexão.
Depois de confirmar sua hipótese, você pode usar seu modelo para gerar previsões. Sempre que você alterar qualquer um dos valores do indicador, seu modelo será capaz de gerar novos valores de saída, com base na relação entre os dois. Isso permite que você investigue questões como: se você diminuir a taxa de desemprego para x, que efeito isso terá nas pontuações do teste?
Portanto, em vez de fazer alterações imediatamente na vida real, você pode simulá-las com aprendizado de máquina para fazer previsões. Isso ajuda a orientar as intervenções que podem ser colocadas em prática posteriormente. Talvez, em alguns bairros, possam ser tomadas medidas para impulsionar o emprego, o que pode melhorar o desempenho das crianças.
** 5. Avaliando e refinando seu modelo **
Você pode inserir dados conhecidos em seu modelo de aprendizado de máquina para ** avaliar ** sua precisão.
** Avaliação = ** Avaliação da precisão do seu modelo de aprendizado de máquina
Por exemplo, se você souber a taxa de desemprego de um bairro e os resultados médios de exames, poderá inserir a taxa de desemprego para testar a média de resultados de exames gerados pelo modelo. Aplique o modelo de aprendizado de máquina com vários valores diferentes até ficar satisfeito com os resultados que ele oferece. Isso é chamado de “** treinamento **.”
_ ** Treinamento = Testando e melhorando seu modelo de aprendizado de máquina ** _
Seu modelo se aproximará e nunca será exato para todos os indicadores de dados que você possui. Portanto, use ** métricas de desempenho ** para avaliar o quão próximo o modelo está da realidade.
_ ** Métricas de desempenho = medidas para avaliar seu modelo de aprendizado de máquina ** _
Voltando ao exemplo, para alguns dos bairros pode ser perto de 100% de precisão, mas para outros, pode ser pior. Ainda assim, você pode medir um nível de desempenho geral em todos os bairros.
Os níveis de desempenho também podem ajudá-lo a testar a validade de sua hipótese. Às vezes, identificamos relacionamentos que não existem. Por exemplo, pode ser que a correlação entre pontuações baixas em testes e altas taxas de desemprego seja uma coincidência ou que pontuações baixas em testes realmente causem alto desemprego, e não o contrário. Em casos como esses, uma baixa taxa de precisão durante o treinamento pode invalidar sua hipótese.
No entanto, a baixa precisão não significa necessariamente que sua hipótese não seja válida. Pode ser que os parâmetros do modelo de aprendizado de máquina não sejam os corretos. Tente trocá-los ou teste alguns outros modelos, caso o modelo inicial não fosse adequado para o problema em questão. No entanto, se nenhuma dessas mudanças levar a melhorias, talvez seja necessário abandonar sua hipótese e testar outra.
E quando você estiver avaliando seu modelo, não se esqueça de considerar o tipo de tecnologia que você está usando para executar os algoritmos de aprendizado de máquina.
Por exemplo, se você está com pressa para chegar a uma decisão, pode ser necessário usar um método que não consuma muito tempo. Ou, se você não tiver computadores de alto desempenho disponíveis, pode escolher um que funcione em um computador com uma especificação simples. Felizmente, existem vários métodos, portanto, certifique-se de escolher o correto para você.
Então, como você pode melhorar o nível de desempenho do seu modelo? Ao alterar alguns dos parâmetros na relação do modelo, você pode obter uma melhor aproximação da realidade. Isso é chamado de ** refinamento **.
_ ** Refinamento = Melhorar a precisão do seu modelo de aprendizado de máquina ** _
Avaliação e refinamento andam de mãos dadas - continue avaliando e refinando até ficar satisfeito com seus resultados. — Anna Goulden
(Crédito da imagem: Unsplash)
Certifique-se de partilhar as suas próprias ideias com o autor ao deixar um comentário abaixo

Inicie sessão ou registe-se para continuar a conversa