Este artículo está escrito por Martin Hackl, director digital del Ministerio Federal de Justicia de Austria.
En todo el mundo, estamos viendo un movimiento creciente de "Justicia Abierta" y transparencia.
Al igual que otros movimientos "abiertos", los defensores de la justicia abierta sostienen que los ciudadanos deberían tener derecho a acceder a los documentos judiciales, y que la transparencia mejorará la responsabilidad y la eficacia del sistema judicial.
Pero hacer que estos veredictos judiciales sean de libre acceso crea un desafío: ¿cómo se asegura de que no se viole la privacidad de los ciudadanos?
¿Quieres escribir para nosotros? Echa un vistazo a la guía de Apolitical para contribuyentes
Actualmente, en la mayoría de los países europeos, los veredictos judiciales se anonimizan a mano, lo que obviamente requiere mucho tiempo y recursos humanos, lo que limita la cantidad de documentos que pueden ponerse a disposición del público. Sin embargo, esta tarea repetitiva sigue patrones claros, lo que significa que está excelentemente posicionada para ser resuelta mediante el uso de algoritmos de aprendizaje automático / aprendizaje profundo. Estos algoritmos hacen posible responder a las desviaciones de los patrones existentes, así como tomar "decisiones" relacionadas con el contexto (por ejemplo, cómo manejar ciertos pasajes de texto), haciéndolos superiores a los enfoques basados únicamente en reglas.
En el poder judicial de Austria desarrollamos un algoritmo de aprendizaje automático para anonimizar esta información. Todavía estamos probando el algoritmo para asegurarnos de que cumpla con los estrictos controles de calidad, pero hay varias lecciones clave que podemos extraer de los servidores públicos de otros países y campos que están experimentando con el aprendizaje automático.
A diferencia de los proyectos de software convencionales, el desarrollo de proyectos con IA requiere un enfoque adaptado, ya que el desarrollo se centra en la capacitación de modelos con datos de alta calidad en lugar de codificar las reglas comerciales. Por lo tanto, nuestro proceso de desarrollo de un sistema de aprendizaje automático se puede dividir en tres etapas; comenzando con la recopilación de datos existentes de calidad garantizada, hasta generar un modelo de aprendizaje automático e iterar su rendimiento. Aquí hay algunos consejos clave a tener en cuenta en cada etapa.
1) Comience por recopilar sus datos existentes y tome conciencia de su calidad.
Para habilitar un algoritmo para anonimizar texto, primero debe ser entrenado. Para hacer eso, es necesaria una cantidad correspondiente de datos.
En Austria, solo la Corte Suprema está obligada por ley a publicar sus veredictos . Cuando se publican estos veredictos, se anonimizan manualmente mediante marcadores negros. Esto significa que el texto original todavía está disponible en las bases de datos internas y, por lo tanto, proporcionan una excelente base de datos para entrenar algoritmos contra un "estándar de oro" de aproximadamente 66,000 sentencias judiciales.
Existe un gran potencial para que la inteligencia artificial mejore el trabajo que hacemos en el sector público.
Otra fuente valiosa son los veredictos de otros tribunales que se almacenan digitalmente en aplicaciones internas. Esta base de datos consta de aproximadamente 800,000 documentos sin anotaciones. Además, ambos conjuntos de datos se complementan con datos registrados que consisten en información sobre las partes en el procedimiento. Estas tres bases de datos juntas forman una base perfecta para desarrollar algoritmos muy precisos.
Además de los veredictos judiciales y los datos de registro correspondientes, los diccionarios disponibles públicamente (por ejemplo, direcciones, registros de la empresa) se integran para complementar el conjunto de datos para optimizar aún más la capacitación del modelo.
2) Luego elija un modelo: no hay uno que los gobierne a todos
Sabíamos desde el principio que teníamos excelentes datos para entrenar nuestro algoritmo. El siguiente paso consistió en elegir nuestro enfoque de aprendizaje automático.
Afortunadamente, en la actualidad se puede encontrar en Internet una serie de bibliotecas de código abierto disponibles gratuitamente para PNL (como Spacy o Stanford-PNL). Estos también ofrecen modelos pre-entrenados para reconocer nombres o ubicaciones. Pero, ¿cómo tiene esto en cuenta con las reglas específicas para que los nombres se anonimicen en los veredictos de los tribunales?
En nuestro enfoque, decidimos implementar un uso combinado de diferentes tecnologías y modelos para garantizar los mejores resultados posibles mientras aprovechamos los modelos de código abierto existentes. Por lo tanto, los algoritmos listos para usar, así como el procesamiento personalizado del lenguaje natural (NLP) y el aprendizaje automático (ML) se implementan junto con los métodos tradicionales (como la búsqueda difusa o los métodos basados en expresiones regulares) para seguir a los mejores enfoque para compensar las debilidades de las herramientas individuales y aprovechar sus fortalezas.
Las tareas repetitivas que siguen un patrón claro seguramente se volverán más eficientes mediante el uso de inteligencia artificial y esto solo se acelerará a medida que la tecnología madure. Dado que las sentencias judiciales de anonimato actualmente consumen cantidades tan enormes de recursos humanos, entregar el trabajo a un algoritmo liberaría a estas personas para realizar otras tareas complejas y de valor agregado.
Desde una perspectiva arquitectónica, esto condujo al desarrollo de modelos pequeños y específicos en lugar de utilizar un "modelo universal" importante para garantizar la flexibilidad y la rápida adaptabilidad a los nuevos requisitos. Esta combinación de diferentes enfoques de vanguardia se seleccionó para compensar las debilidades de las herramientas individuales y aprovechar sus puntos fuertes y, por lo tanto, está preparada para ofrecer el mejor resultado posible para nuestro caso de uso.
3) Por último, asegúrese de repetir y evaluar
Tener un conjunto de datos grande y de alta calidad y una arquitectura apropiada son dos activos principales que aumentan la probabilidad de éxito.
Después de definir y aclarar los requisitos para la anonimización, los modelos se entrenan en el conjunto de datos. En ciclos cortos de sprint, una muestra elegida al azar de decisiones judiciales se procesa utilizando los algoritmos desarrollados y se somete a una revisión humana inmediata y exhaustiva. Además, se calculan los indicadores generales de rendimiento clave para la calidad de la anonimización, como la capacidad del algoritmo para reconocer solo aquellos nombres y direcciones que realmente necesitan ser anonimizados, para evaluar el impacto general de los cambios.
Las cifras clave más importantes se denominan: precisión, recuperación y puntuación F1 (agregada). La retroalimentación y las cifras generadas retroalimentan directamente el próximo ciclo de desarrollo para garantizar una mejora y optimización específicas de los modelos. Este enfoque iterativo permite al equipo del proyecto hacer un seguimiento inmediato de cualquier debilidad en los modelos y hacer correcciones justo antes de los próximos ciclos de capacitación.
A partir de junio de 2020, las decisiones judiciales son anonimizadas por la IA y luego publicadas en la colección interna de los tribunales. Si bien el 99.5% de la información que necesita ser anonimizada se reconoce correctamente (lo que habla con nuestro KPI sobre la recuperación), el algoritmo todavía es demasiado estricto con cierta información y anonimiza demasiado (lo que el KPI captura sobre precisión). Para mantener la legibilidad de las decisiones, este es el punto de partida para mejoras adicionales que aún se requieren antes de que el algoritmo pueda comenzar a funcionar.
Pero recuerda, la inteligencia artificial no es infalible
Como hemos visto en este sencillo ejemplo, existe un gran potencial para que la inteligencia artificial mejore el trabajo que hacemos en el sector público. Las tareas repetitivas que siguen un patrón claro seguramente se volverán más eficientes mediante el uso de inteligencia artificial y esto solo se acelerará a medida que la tecnología madure. Debido a que las decisiones judiciales de anonimato actualmente consumen cantidades tan enormes de recursos humanos, entregar el trabajo a un algoritmo liberaría a estas personas para realizar otras tareas complejas y de valor agregado.
A pesar de que los algoritmos desarrollados recientemente en el transcurso de los últimos meses y años han mejorado significativamente, no hay garantía de que funcionen perfectamente y sean siempre precisos. Especialmente porque siempre existe la posibilidad de que nuevas constelaciones y circunstancias se describan en decisiones judiciales y que difieran significativamente de los patrones anteriores, lo que puede conducir a fallas en los resultados de anonimización. Además, las palabras y frases que se usan a veces son ambiguas, y el significado detrás de una expresión está muy relacionado con el contexto, lo que puede conducir a resultados subóptimos. Dado que el uso de IA en el área judicial también debe prestar atención a los riesgos éticos , es importante cuidar los conjuntos de datos de capacitación equilibrados que no contengan ningún sesgo.
Tenga en cuenta que ningún sistema o algoritmo, como los seres humanos, es infalible
Todos estos aspectos apuntan a la necesidad de garantizar la calidad de los documentos procesados automáticamente y los resultados de anonimización generados. En nuestro caso, se han implementado ciertos criterios de calidad, ya que revisar cada documento procesado requeriría casi tanto tiempo como hacer todo el anonimato manualmente. Estos criterios se basan en parámetros definidos y determinan si una anonimización basada en máquina es, con cierta probabilidad, correcta.
Dependiendo de la variedad y granularidad, se puede implementar una categorización en diferentes niveles de calidad (por ejemplo, verde, amarillo, rojo). Teniendo debidamente en cuenta estos niveles de calidad, las capacidades humanas para el aseguramiento de la calidad pueden centrarse en documentos, que se presume que se procesaron y se anonimizaron incorrectamente (los rojos). Los verdes se pueden publicar automáticamente sin ninguna interacción humana.
En resumen, la inteligencia artificial ofrece grandes oportunidades para tareas repetitivas que siguen patrones claros. Sin embargo, tenga en cuenta que ningún sistema o algoritmo, como los seres humanos, es infalible. Si ha aprendido a lidiar con tales fallas, también puede comenzar a externalizar sus actividades repetitivas a la inteligencia artificial. ¡Aquí vamos! - Martin Hackl
(Crédito de la imagen: Newspaper Club // Flickr)

Inicia sesión o regístrate para continuar la conversación