** Este artigo foi escrito por Martin Hackl, diretor digital do Ministério Federal da Justiça austríaco. **
Em todo o mundo, estamos vendo um movimento crescente por “Justiça Aberta” e transparência.
Como outros movimentos “abertos”, os proponentes da justiça aberta argumentam que os cidadãos devem ter o direito de acesso aos documentos judiciais e que a transparência melhorará a responsabilização e a eficácia do sistema judicial.
Mas tornar esses veredictos judiciais livremente acessíveis cria um desafio: como você garante que a privacidade dos cidadãos não seja violada?
**Quer escrever para nós? Dê uma olhada no [guia para colaboradores] do Apolitical (https://apolitical.co/opinion-writing-becoming-an-apolitical-contributor/) **
Atualmente, na maioria dos países europeus, os veredictos dos tribunais são anonimizados manualmente, o que obviamente consome muito tempo e recursos humanos, limitando, portanto, o número de documentos que podem ser disponibilizados ao público. No entanto, essa tarefa repetitiva segue padrões claros, o que significa que está perfeitamente posicionada para ser resolvida usando algoritmos de aprendizado de máquina / aprendizado profundo. Esses algoritmos tornam possível responder aos desvios dos padrões existentes, bem como tomar "decisões" relacionadas ao contexto (por exemplo, como lidar com certas passagens do texto), tornando-os superiores às abordagens baseadas apenas em regras.
No judiciário da Áustria, desenvolvemos um algoritmo de aprendizado de máquina para tornar essas informações anônimas. Ainda estamos testando o algoritmo para garantir que ele atenda aos rígidos controles de qualidade, mas existem várias lições importantes que podemos extrair para funcionários públicos em outros países e áreas que estão fazendo experiências com aprendizado de máquina.
Em contraste com projetos de software convencionais, o desenvolvimento de projetos com AI requer um abordagem adaptada já que o desenvolvimento é focado no treinamento de modelos com [dados] de alta qualidade (https://apolitical.co/en/solution_article/small-british-city-using-data-play-days-jump-start-tech -indústria) em vez de regras de negócios de codificação. Portanto, nosso processo de desenvolvimento de um sistema de aprendizado de máquina pode ser dividido em três estágios; começando com a coleta de dados de qualidade garantida existentes, até a geração de um modelo de aprendizado de máquina e iteração de seu desempenho. Aqui estão algumas dicas importantes a serem consideradas em cada etapa.
** 1) Comece coletando seus dados existentes e esteja ciente de sua qualidade **
Para permitir que um algoritmo torne o texto anônimo, ele deve primeiro ser treinado. Para fazer isso, uma quantidade correspondente de dados é necessária.
Na Áustria, apenas o Supremo Tribunal é atualmente obrigado por lei a publicar seus veredictos. Quando esses veredictos são publicados, eles são tornados anônimos manualmente usando marcadores pretos. Isso significa que o texto original ainda está disponível em bancos de dados internos e, portanto, eles fornecem um excelente banco de dados para treinamento de algoritmos contra um “padrão ouro” de aproximadamente 66.000 veredictos judiciais.
** Há um enorme potencial para a inteligência artificial melhorar o trabalho que fazemos no setor público **
Outra fonte valiosa são os veredictos de outros tribunais que são armazenados digitalmente em aplicativos internos. Este banco de dados consiste em aproximadamente 800.000 documentos não anotados. Além disso, ambos os conjuntos de dados são complementados com dados cadastrados que consistem em informações sobre as partes no processo. Esses três bancos de dados juntos formam uma base perfeita para desenvolver algoritmos muito precisos.
Ao lado dos veredictos do tribunal e dados de registro correspondentes, dicionários publicamente disponíveis (por exemplo, endereços, registros de empresas) são integrados para complementar o conjunto de dados para otimizar ainda mais o treinamento do modelo.
** 2) Em seguida, escolha um modelo - não há um para governar todos eles **
Sabíamos desde o início que tínhamos dados excelentes para treinar nosso algoritmo. A próxima etapa envolveu escolher nossa abordagem de aprendizado de máquina.
Felizmente, várias bibliotecas de código aberto disponíveis gratuitamente para PNL (como Spacy ou Stanford-PNL) podem ser encontradas na Internet hoje. Eles também oferecem modelos pré-treinados para reconhecer nomes ou locais. Mas como você leva isso em conta com as regras específicas para os nomes serem anônimos em veredictos judiciais?
Em nossa abordagem, decidimos, portanto, implementar um uso combinado de diferentes tecnologias e modelos para garantir os melhores resultados possíveis, aproveitando os modelos de código aberto existentes. Portanto, algoritmos prontos para uso, bem como de processamento de linguagem natural (PNL) e aprendizado de máquina (ML) personalizados são implantados junto com métodos tradicionais (como pesquisa difusa ou métodos baseados em expressão regular) para seguir o melhor da categoria abordagem para compensar os pontos fracos das ferramentas individuais e alavancar seus pontos fortes.
** Tarefas repetitivas que seguem um padrão claro tendem a se tornar mais eficientes com o uso de inteligência artificial e isso só irá acelerar com o amadurecimento da tecnologia. Como o anonimato dos veredictos do tribunal atualmente consome uma grande quantidade de recursos humanos, entregar o trabalho a um algoritmo liberaria essas pessoas para realizar outras tarefas complexas e de valor agregado **
De uma perspectiva arquitetônica, isso levou ao desenvolvimento de modelos pequenos e direcionados, em vez de usar um grande “modelo universal” para garantir flexibilidade e adaptabilidade rápida a novos requisitos. Essa combinação de diferentes abordagens de última geração foi selecionada para compensar os pontos fracos das ferramentas individuais e alavancar seus pontos fortes e, portanto, está preparada para fornecer o melhor resultado possível para nosso caso de uso.
** 3) Por último, certifique-se de iterar e avaliar **
Ter um grande conjunto de dados de alta qualidade e uma arquitetura apropriada são dois ativos principais que aumentam a probabilidade de sucesso.
Depois de definir e esclarecer os requisitos de anonimato, os modelos são treinados no conjunto de dados. Em ciclos de sprint curtos, uma amostra escolhida aleatoriamente de decisões judiciais é processada usando os algoritmos desenvolvidos e passa por uma revisão humana completa e imediata. Além disso, os principais indicadores gerais de desempenho para a qualidade do anonimato são calculados, como a capacidade do algoritmo de reconhecer apenas os nomes e endereços que realmente precisam ser anônimos, para avaliar o impacto geral das mudanças.
Os índices mais importantes são chamados de: precisão, recall e pontuação F1 (agregada). O feedback gerado e os números são alimentados diretamente de volta para o próximo ciclo de desenvolvimento para garantir uma melhoria e otimização direcionadas dos modelos. Essa abordagem iterativa permite que a equipe do projeto acompanhe imediatamente quaisquer deficiências nos modelos e faça correções antes dos próximos ciclos de treinamento.
A partir de junho de 2020, as decisões judiciais são tornadas anônimas pela AI e, em seguida, publicadas na coleção interna dos tribunais. Enquanto 99,5% das informações que precisam ser anonimizadas são reconhecidas corretamente (o que fala ao nosso KPI sobre recall), o algoritmo ainda é muito rígido com certas informações e está anonimizando muito (o que é capturado pelo KPI sobre precisão). Para manter a legibilidade das decisões, este é o ponto de partida para outras melhorias que ainda são necessárias antes que o algoritmo possa entrar em operação.
** Mas lembre-se, a inteligência artificial não é infalível **
Como vimos neste exemplo simples, há um enorme potencial para inteligência artificial para melhorar o trabalho que fazemos em setor público. Tarefas repetitivas que seguem um padrão claro tendem a se tornar mais eficientes com o uso de inteligência artificial, e isso só vai aumentar à medida que a tecnologia amadurece. Como o anonimato das decisões judiciais atualmente consome uma grande quantidade de recursos humanos, entregar o trabalho a um algoritmo liberaria essas pessoas para realizar outras tarefas complexas e de valor agregado.
Embora os algoritmos desenvolvidos recentemente ao longo dos últimos meses e anos tenham melhorado significativamente, não há garantia de que estejam funcionando perfeitamente e sempre precisos. Especialmente porque há sempre a possibilidade de que novas constelações e circunstâncias sejam retratadas em decisões judiciais e que diferem significativamente dos padrões anteriores, o que pode levar a falhas nos resultados de anonimato. Além disso, as palavras e frases usadas às vezes são ambíguas, e o significado por trás de uma expressão é muito relacionado ao contexto, podendo levar a resultados abaixo do ideal. Já que [o uso de IA na área judicial também deve estar atento aos riscos éticos](https://www.coe.int/en/web/cepej/cepej-european-ethical-charter-on-the-use-of -artificial-intelligence-ai-in-judicial-systems-and-their-environment), é importante cuidar de conjuntos de dados de treinamento balanceados que não contenham qualquer viés.
** Lembre-se de que nenhum sistema ou algoritmo - assim como os seres humanos - é infalível **
Todos esses aspectos apontam para a necessidade de garantia de qualidade de documentos processados automaticamente e saídas de anonimato geradas. No nosso caso, certos critérios de qualidade foram implementados, pois revisar cada documento processado seria quase tão demorado quanto fazer todo o anonimato manualmente. Esses critérios são baseados em parâmetros definidos e determinam se uma anonimização por máquina é - com uma certa probabilidade - correta.
Dependendo da variedade e granularidade, uma categorização em diferentes níveis de qualidade (por exemplo, verde, amarelo, vermelho) pode ser implementada. Em devida consideração a esses níveis de qualidade, as capacidades humanas para garantia da qualidade podem se concentrar em documentos, que foram presumivelmente processados e anonimizados incorretamente (os vermelhos). Os verdes podem ser publicados automaticamente sem qualquer interação humana.
Em resumo, a inteligência artificial oferece grandes oportunidades para tarefas repetitivas que seguem padrões claros. No entanto, lembre-se de que nenhum sistema ou algoritmo - assim como os seres humanos - é infalível. Se você aprendeu a lidar com essas falhas, também pode começar a terceirizar suas atividades repetitivas para a inteligência artificial. Aqui vamos nós! - Martin Hackl
(Crédito da imagem: Newspaper Club //Flickr)

Inicie sessão ou registe-se para continuar a conversa