Una vez que haya aprendido qué es el aprendizaje automático, y las formas en que el gobierno puede usarlo, es hora de profundizar en cómo funciona realmente el proceso. Ya sea que esté pensando en colaborar con expertos para diseñar una intervención o simplemente esté buscando comprender y explorar el enfoque, es vital que conozca los fundamentos básicos de cómo diseñar y ejecutar un proyecto de aprendizaje automático.

Apolitical habló con la Dra. Crina Grosan, profesora titular del Departamento de Informática de la Universidad de Brunel y especialista en inteligencia artificial y aprendizaje automático. Grosan tiene experiencia en la enseñanza del aprendizaje automático a los responsables políticos, por ejemplo, actualmente dirige una clase magistral de la Academia de Servicios Digitales del Gobierno del Reino Unido . Ella compartió su guía para ejecutar un proyecto de aprendizaje automático, dividido en cinco etapas clave:

  1. Definiendo el problema
  2. Preparando los datos
  3. Explorando los datos y formulando una hipótesis
  4. Generando su modelo de aprendizaje automático
  5. Evaluando y refinando su modelo

Grosan utiliza un escenario para demostrar cómo ejecutar un proyecto de aprendizaje automático en términos prácticos, desde la recopilación de datos hasta la generación y el perfeccionamiento de su modelo de aprendizaje automático.

"Un ejemplo que doy a mis alumnos son los datos sobre los resultados de las pruebas de la escuela primaria en los distritos de Londres", dijo Grosan. “Les doy los resultados, junto con otros conjuntos de datos sobre los municipios, incluidas las tasas de empleo, los niveles de ingresos y el posicionamiento geográfico. Luego les pregunto si pueden identificar algún problema y si los datos pueden decirles algo ”.

1. Definiendo el problema

El problema se puede definir antes o después de que haya preparado y explorado los datos, según la situación.

Problema = la pregunta o problema que intenta abordar

En algunos casos, comienza con un problema y luego busca recopilar datos relevantes para abordarlo o resolverlo.

En el ejemplo de los puntajes de los exámenes de los niños, puede comenzar con el problema de que los niños en determinados distritos se desempeñan mal en comparación con los de otros distritos. El siguiente paso sería recopilar y explorar datos para descubrir por qué esto es así.

En otros escenarios, comienza con datos pero sin un problema claro. Luego, al realizar un análisis exploratorio de los datos, encuentra el problema que desea resolver y luego formula una hipótesis para probar.

Hipótesis = la suposición que quieres probar

Por ejemplo, es posible que ya tenga datos sobre los resultados de las pruebas infantiles, las tasas de desempleo, los niveles de ingresos y el posicionamiento geográfico, junto con varios otros indicadores por municipio. Luego puede explorar las conexiones entre estos indicadores para identificar un problema.

Por ejemplo, puede encontrar que los niños tienden a tener un mal desempeño en los municipios donde las tasas de desempleo son altas. Sobre esta base, podría formular una hipótesis: el bajo rendimiento de los estudiantes está relacionado con las tasas de desempleo en el municipio.

2. Preparando los datos

La preparación se puede dividir en dos partes: recolección y preprocesamiento .

Colección = el proceso de recopilación de datos

Preprocesamiento = transformación de datos en bruto en un formato comprensible y estructurado

Primero, recopilas los datos . Si tiene varias fuentes, integrelas combinando varios conjuntos de datos.

Luego comienza a preprocesar los datos. El objetivo es transformar los datos en un formato comprensible que pueda usarse para el aprendizaje automático.

Esto significa limpiar los datos porque puede haber mucho ruido, esencialmente datos sin sentido y redundantes. Deberá eliminar valores atípicos, repeticiones e inconsistencias, y normalizar los datos.

Por ejemplo, podría ser que una persona tenga 120 años mientras que todos los demás en el conjunto de datos no tengan más de 70 años. En este caso, la persona de 120 años puede ser un caso atípico y, por lo tanto, podría eliminarse para evitar sesgar la adición quiero hacer.

También necesita eliminar inconsistencias. Por ejemplo, después de hacer coincidir varios conjuntos de datos comparándolos entre sí, es posible que tenga dos números de teléfono diferentes para el mismo nombre. Si el número de teléfono es importante para el análisis, limpie el incorrecto.

También hay formas de normalizar los datos. Podría ser que para algunos registros tenga valores del orden de millones. Para otros, puede tener valores entre 0 y 1. Esto significa que, cuando combina esos conjuntos de valores, los más pequeños no contribuirán al resultado porque son insignificantes en comparación con los valores grandes. Es por eso que los normaliza para que todos estén dentro del mismo rango, en este caso, al hacerlos todos entre 0 y 1.

3. Explorando los datos y formulando una hipótesis.

El siguiente paso es hacer un análisis exploratorio de los datos que tiene.

Análisis exploratorio = investigación inicial de datos usando estadísticas para encontrar patrones

Por ejemplo, puede encontrar el porcentaje de aprobación de niños por distrito.

También es posible que desee comenzar a hacer gráficos visuales para mapear las conexiones entre los indicadores en los datos.

Indicador = una característica medible a partir de los datos

Por ejemplo, conexiones entre puntajes de exámenes y niveles de ingresos, tasas de desempleo o posicionamiento geográfico.

Este análisis lo ayudará a comprender el problema y formular una o más hipótesis.

4. Generando su modelo de aprendizaje automático

Ahora estás listo para comenzar a construir tu modelo .

Modelo = Un sistema de aprendizaje automático basado en relaciones matemáticas.

El modelo debe probar su hipótesis: en este caso, investigará la relación entre los puntajes de las pruebas de los niños y las tasas de desempleo.

Con base en los datos que tiene de otros distritos, con su modelo de aprendizaje automático puede predecir que si el desempleo está entre w y x, los resultados de los estudiantes estarán entre y y z.

En este ejemplo, las tasas de desempleo son el " indicador " y los puntajes de las pruebas son el " resultado " . "

Salida = Un valor que genera el modelo basado en relaciones matemáticas

La relación entre el (los) indicador (es) y la (s) salida (s) puede expresarse de varias maneras, por ejemplo, como una regla: "si el indicador es x, entonces la salida será y", o como una fórmula matemática. Usando la relación que ha generado su modelo, podrá evaluar la precisión de su hipótesis.

En este caso, podrá determinar si existe una conexión entre los resultados de las pruebas y las tasas de desempleo y, de ser así, cuál es esa conexión.

Una vez que haya confirmado su hipótesis, puede usar su modelo para generar predicciones. Cada vez que cambie alguno de los valores del indicador, su modelo podrá generar nuevos valores de salida, en función de la relación entre ambos. Esto le permite investigar preguntas como: si baja la tasa de desempleo a x, ¿qué efecto tendrá esto en los puntajes de los exámenes?

Por lo tanto, en lugar de realizar cambios inmediatos en la vida real, puede simularlos con el aprendizaje automático para hacer predicciones. Esto ayuda a guiar las intervenciones que se pueden poner en práctica más adelante. Quizás, en algunos distritos, se podrían tomar medidas para impulsar el empleo que podría mejorar el logro de los niños.

5) Evaluando y refinando su modelo

Puede ingresar datos conocidos en su modelo de aprendizaje automático para evaluar su precisión.

Evaluación = Evaluar la precisión de su modelo de aprendizaje automático

Por ejemplo, si conoce la tasa de desempleo de una ciudad y los resultados promedio del examen, puede ingresar la tasa de desempleo para probar qué resultados promedio del examen genera el modelo. Aplique el modelo de aprendizaje automático con varios valores diferentes hasta que esté satisfecho con los resultados que le brinda. Esto se llama " entrenamiento ".

Entrenamiento = Probar y mejorar su modelo de aprendizaje automático

Su modelo será aproximado y nunca será exacto para todos los indicadores de datos que tenga. Por lo tanto, utilice las métricas de rendimiento para evaluar qué tan cerca está el modelo de la realidad.

Métricas de rendimiento = Mediciones para evaluar su modelo de aprendizaje automático

Volviendo al ejemplo, para algunos distritos puede estar cerca del 100% de precisión, pero para otros, podría ser peor. Aún así, puede medir un nivel de rendimiento general en todos los municipios.

Los niveles de rendimiento también pueden ayudarlo a probar la validez de su hipótesis. A veces detectamos relaciones que no están ahí. Por ejemplo, podría ser que la correlación entre los puntajes bajos de las pruebas y las altas tasas de desempleo sea una coincidencia o que los puntajes bajos de las pruebas realmente causen un alto desempleo en lugar de lo contrario. En casos como estos, una baja tasa de precisión durante el entrenamiento puede invalidar su hipótesis.

Sin embargo, la baja precisión no necesariamente significa que su hipótesis no sea válida. Puede ser que los parámetros del modelo de aprendizaje automático no sean los correctos. Intente cambiarlos o pruebe algunos otros modelos en caso de que el inicial no sea adecuado para el problema en cuestión. Sin embargo, si ninguno de estos cambios conduce a mejoras, es posible que deba abandonar su hipótesis y probar otra.

Y cuando evalúe su modelo, no olvide considerar el tipo de tecnología que está utilizando para ejecutar los algoritmos de aprendizaje automático.

Por ejemplo, si se apresura a tomar una decisión, es posible que deba usar un método que no requiera mucho tiempo. O si no tiene computadoras de alto rendimiento disponibles, puede elegir una que se ejecute en una computadora con una especificación simple. Afortunadamente, hay varios métodos, así que asegúrese de elegir el más adecuado para usted.

Entonces, ¿cómo puede mejorar el nivel de rendimiento de su modelo? Al cambiar algunos de los parámetros en la relación del modelo, puede obtener una mejor aproximación de la realidad. Esto se llama refinamiento .

Refinamiento = Mejora de la precisión de su modelo de aprendizaje automático

La evaluación y el refinamiento van de la mano: continúe evaluando y refinando hasta que esté satisfecho con sus resultados. - Anna Goulden

(Crédito de la imagen: Unsplash)


Asegúrate de compartir tus propias ideas con el autor dejando un comentario abajo