Este artículo está escrito por Tim Hill, responsable de estándares de datos y técnico del Open Data Institute
En caso de que quedara alguna duda al respecto, la publicación del informe del Comité de Estándares en la Vida Pública del Reino Unido sobre inteligencia artificial en el gobierno el 10 de febrero de 2020 terminó por completo: el aprendizaje automático se ha movido del mundo del laboratorio de investigación y ha entrado gobierno. "La inteligencia artificial, y en particular el aprendizaje automático", declara, "transformará la forma en que las organizaciones del sector público toman decisiones y prestan servicios públicos".
Sin embargo, la adición de esta nueva y poderosa técnica al conjunto de herramientas del legislador no está exenta de riesgos. Al conocido adagio de que, para un hombre con un martillo, todo parece un clavo debería agregarse otro dicho, conocido entre los científicos de datos. "Con cuatro parámetros, puedo colocar un elefante", bromeó una vez el matemático John von Neumann. "Con cinco, puedo hacer que mueva su tronco".
No se preocupe si no entiende el chiste: el punto de von Neumann es simple. En los dominios de datos complejos en los que se suele utilizar el aprendizaje automático, es fácil obtener resultados espurios, o incluso absurdos.
A continuación, a continuación, hay cuatro cuestiones cruciales que debe considerar para asegurarse de que su uso del aprendizaje automático no sea solo golpear los tornillos en las paredes con un martillo configurable cuadráticamente, sino que agregue un valor y una visión únicos a sus dominios.
¿Tienes el equipo adecuado?
Los proyectos de aprendizaje automático exitosos involucran más que solo expertos en ML. Como mínimo, requieren:
- Experiencia en aprendizaje automático
- Habilidades de ingeniería de software
- Una comprensión profunda de los conjuntos de datos que se analizan: cómo se recopilaron, cómo se relacionan entre sí, cómo se procesan, etc.
- Conocimiento del dominio
- Representación de los interesados
- Habilidades de gestión suficientes para coordinar todo lo anterior.
El hecho de que haya seis viñetas enumeradas anteriormente no necesariamente significa que debe haber seis personas o equipos separados involucrados; pero se debe tener cuidado para garantizar que cada uno de estos roles sea desempeñado adecuadamente por personas con un historial probado en el área. En particular, es tentador suponer que los roles de ingeniería de software y ML pueden ser realizados por las mismas personas, simplemente porque ambos involucran computadoras. Pero, de hecho, los dos conjuntos de habilidades son distintos, y esperar que un especialista en análisis realice una ingeniería de software puede conducir rápidamente a un código que no se puede mantener o peor. Del mismo modo, el conocimiento general del dominio y la comprensión de una recopilación de datos específica y su procedencia no deben combinarse. Podría ser el caso de que la misma persona o equipo posea ambos, pero esto no se puede suponer simplemente.
Con respecto a la representación de los interesados, recuerde que el público en general debe considerarse un "interesado" en los proyectos del sector público. Las cuestiones de sesgo y el uso ético de ML deberán examinarse cuidadosamente; y, por supuesto, los Principios de Nolan se aplican en todas partes.
¿Puede ML responder las preguntas más relevantes para su proyecto o dominio con los datos a mano?
Esto puede ser sorprendentemente difícil de evaluar, por eso es tan importante contar con el equipo adecuado antes de comenzar a examinar su dominio y rastrear sus datos: muy a menudo, determinar qué papel puede desempeñar el aprendizaje automático requerirá la evaluación de expertos problema que necesita ser resuelto y de los datos disponibles.
Ambas preguntas, además, pueden implicar una investigación prolongada: la limpieza de datos a menudo puede tomar entre 60% y 90% del tiempo total del proyecto, y vale la pena ver cuánto se requiere o es posible desde el principio. Además, los proyectos del sector público a menudo estarán estrictamente regulados, con datos dispersos en varios sitios por razones de seguridad y, a veces, se deben cumplir reglas complejas de protección de datos y anonimización.
Se debe tener cuidado para evitar el uso del aprendizaje automático por el simple hecho de
En los casos en que los datos necesarios están ausentes o son de baja calidad, a veces vale la pena pensar creativamente y ver qué aspectos del problema de aprendizaje automático pueden ser útiles para resolver. En este punto, sin embargo, se debe tener cuidado para evitar el uso de ML por el simple motivo: sin una pregunta bien definida, los intentos de ejecutar algoritmos comunes de aprendizaje automático sobre conjuntos de datos existentes casi con certeza arrojarán resultados espurios y / o sin sentido. .
Una prueba de cordura útil para verificar la utilidad potencial de ML es si tiene o no una buena línea de base para comparar su rendimiento. La línea de base que debe usarse dependerá del dominio. Los dominios científicos y médicos a menudo tendrán herramientas estadísticas bien establecidas para tareas predictivas, cuya precisión puede servir como un comparador útil para los resultados de LD; en otras ocasiones, será apropiado un enfoque más analítico de datos (por ejemplo, asignar la clase mayoritaria en tareas de clasificación). Si la consulta con expertos en análisis de datos y dominios no produce una heurística de referencia útil, probablemente necesite hacer más exploración de datos y dominios antes de volver a comprometerse con ML. Por otro lado, si tiene una línea de base, pero es baja, es muy probable que ML pueda mejorarla significativamente.
¿Puedes ser ágil?
La palabra " ágil " se ha usado en exceso durante una década ahora que a menudo parece no tener sentido: incluso las organizaciones más escleróticas afirman ser "ágiles" y utilizar ahora "metodologías ágiles".
Pero el aprendizaje automático realmente exige esto. Particularmente en las primeras etapas, el aprendizaje automático implica iteraciones frecuentes y consultas de equipo para identificar características significativas, refinar parámetros y desarrollar infraestructura. Los primeros resultados pueden parecer absurdos y los modelos complejos podrían necesitar ser desechados en las primeras fases. Además, una implicación de la necesidad de una evaluación experta del problema en sus primeras etapas es que, en primer lugar, puede resultar que el aprendizaje automático no sea el enfoque correcto. Como lo expresa Jurgen Mitsch, analista principal del NHS Trust del Nottingham University Hospital, es vital que los esfuerzos de aprendizaje automático "comiencen poco y fracasen rápidamente" para encontrar y refinar el enfoque correcto.
El aprendizaje automático es una empresa profundamente colaborativa
Una de las implicaciones de esto es que los enfoques de aprendizaje automático necesitarán la aceptación de la alta gerencia a mediano y largo plazo si tienen muchas posibilidades de tener éxito. Si se necesitan ganancias rápidas para asegurar más fondos, entonces ML seguramente no será viable. A medida que la tecnología de aprendizaje automático madura y se integra más en la cultura del sector público, puede darse el caso de que se puedan acelerar las iteraciones y garantizar los resultados. Pero no estamos allí ahora, y se necesitará previsión y apoyo a largo plazo para lograr esta visión.
¿Estás desarrollando un vocabulario compartido?
Como se señaló anteriormente, el aprendizaje automático es una empresa profundamente colaborativa, que además involucra a personas profundamente especializadas en sus respectivos campos.
Esto a veces puede dificultar la comunicación, y precisamente en los momentos en que es más importante ser claro. El análisis de datos tiene un vocabulario técnico vasto y, a veces, prohibitivo, que puede superponerse pero no es idéntico al utilizado por los especialistas en datos. Esto, a su vez, tiene algunos, pero no muchos, puntos de contacto con la ingeniería de software. Y, por supuesto, los expertos en dominios a menudo tendrán su propia jerga, que a menudo puede ser impenetrable para los extraños. Un proyecto exitoso necesitará superar estas barreras si va a dar una idea.
La complejidad de los dominios de aprendizaje automático casi garantiza que todos en la sala tengan "preguntas estúpidas" entre sí, y garantizar que se puedan emitir temprano y, a menudo, es vital para el éxito
A nivel administrativo, esto significa encontrar herramientas que permitan a cada miembro del equipo comunicarse y compartir información relevante de forma asincrónica. Muchas de las herramientas y plataformas utilizadas para las metodologías ágiles de desarrollo de software, por ejemplo, tableros Kanban, Jira, Azure DevOps, GitHub, etc., son adecuadas para esto, pero un tamaño no sirve para todos. Tómese el tiempo para experimentar y jugar con una variedad de tecnologías para encontrar la combinación adecuada para usted.
Sin embargo, no todo puede o debe hacerse en línea. Particularmente en las primeras etapas, es importante celebrar reuniones plenarias de mesa redonda con bastante frecuencia, para que todo el equipo pueda establecer su vocabulario compartido lo más rápido posible. Dentro de estas reuniones, se deberá tener cuidado para permitir suficiente tiempo para la discusión, aclarar preguntas y parafrasear, y dentro de un entorno que no juzgue y sea abierto. La complejidad de los dominios de aprendizaje automático casi garantiza que todos en la sala tengan "preguntas estúpidas" entre sí, y garantizar que se puedan emitir temprano y, a menudo, es vital para el éxito.
El punto de las preguntas estúpidas, además, se extiende más allá del equipo, hacia el "mundo real" donde los efectos de su proyecto deben sentirse. Una crítica común del aprendizaje automático en el cuidado de la salud es que sus resultados se comunican de una manera tan técnica y confusa que se vuelven inútiles para los médicos.
Si no puede crear un resumen en inglés simple de las decisiones tomadas y las técnicas que se utilizan cada día, es una buena indicación de que su equipo necesita trabajar más para crear un vocabulario compartido, tanto para mejorar la comprensión como para para el impacto en el mundo real. - Tim Hill
(Crédito de la imagen: Unsplash)

Inicia sesión o regístrate para continuar la conversación