Este artículo de opinión fue escrito por Marylene Wamukoya, gestión de proyectos y datos en el Centro de Investigación de Población y Salud de África. Aparece en nuestro suministro digital de noticias del gobierno .


El segundo Foro Mundial de Datos de la ONU se celebró el mes pasado en Dubai, Emiratos Árabes Unidos. El foro bienal brinda una oportunidad para que varios actores en el ecosistema de datos impulsen el uso de datos de calidad para el logro de los Objetivos de Desarrollo Sostenible (ODS) para 2030.

El Centro Africano de Investigación sobre Población y Salud (APHRC) tuvo una delegación en el Foro para hablar en una sesión titulada " Revolución de datos en África : avances y experiencias a nivel regional, nacional y subnacional" .

El objetivo de la sesión fue resaltar la cadena de valor de los datos, desde la comunidad hasta la investigación, hasta los encargados de formular políticas gubernamentales y otros tomadores de decisiones. Destacó tres desarrollos particulares: portales de intercambio de datos en línea que permiten la conservación de datos basados en la población, asociaciones con el gobierno para mejorar los sistemas de datos y la vigilancia demográfica en las comunidades africanas de barrios marginales .

En la última sesión plenaria del último día del Foro, una de las panelistas, Nnenna Nwakanma , nos hizo esta pregunta: ¿cuáles son sus conclusiones del Foro de Datos de la ONU?

Una de las mejores conclusiones que obtuve al asistir a varias de las sesiones y eventos paralelos fue que necesitamos reflexionar profundamente sobre cómo definimos el término 'científico de datos'. Esto se debe a la creciente conciencia de la importancia de los datos en los aspectos cotidianos de la vida y el posterior crecimiento de una disciplina conocida como "ciencia de datos".

Esto me hizo pensar mucho sobre la ciencia de datos y lo que realmente significa. O'Neil y Schutt (en su libro Doing Data Science ) definen a un científico de datos como:

“Alguien que sepa extraer significado e interpretar datos, lo que requiere herramientas y métodos de estadística y aprendizaje automático, además de ser humano. Ella pasa mucho tiempo en el proceso de recopilación, limpieza y munging de datos, porque los datos nunca están limpios. Este proceso requiere persistencia, estadísticas y habilidades de ingeniería de software, habilidades que también son necesarias para comprender los sesgos en los datos y para depurar la salida de registro del código ".

Una investigación más profunda reveló que el científico de datos ideal debe poseer habilidades de programación, habilidades estadísticas, habilidades de aprendizaje automático, cálculo multivariable y álgebra lineal, discusión de datos, visualización y comunicación de datos, ingeniería de software e intuición de datos. ¿Es posible que un ser humano posea todas estas habilidades para ser bueno en todas ellas?

Sí, lo es, si uno tiene inteligencia sobrehumana y habilidades que desafían el tiempo para adquirir la educación y el aprendizaje necesarios dentro de su vida útil. O si uno fuera el monstruo de Frankenstein, compuesto por varias partes de un comunicador de datos, estadístico, matemático, desarrollador web, gerente de producto, entre otros, como lo demostró Stephan Kolassa.

Claramente, la tarea de encontrar el científico de datos ideal requeriría esfuerzos hercúleos. Es raro encontrar el conjunto de habilidades y experiencia deseadas en un individuo. Sin embargo, es posible construir un equipo de ciencia de datos compuesto por expertos en cada una de las habilidades individuales mencionadas anteriormente. Y el equipo , lo que es más importante, también debe ser multicultural y con diversidad de género.

¿Por qué es importante el desarrollo de un equipo de ciencia de datos para APHRC? El Centro ha estado a la vanguardia de la investigación para la toma de decisiones basada en evidencia en África desde 2002. Los datos de población rica y salud urbana generados por varios programas de investigación son nuestro activo más valioso, y se encuentran en nuestros datos en línea. plataforma de intercambio donde están disponibles para su uso por diversos actores a pedido.

Hasta ahora, los datos se han analizado descriptivamente y han podido proporcionar información histórica sobre una variedad de temas. Sin embargo, como se muestra en la siguiente figura , para que el valor de los datos aumente, deben madurar analíticamente mediante análisis diagnósticos, predictivos y luego prescriptivos.

El análisis prescriptivo requiere el uso de Machine Learning (ML) e Inteligencia Artificial (AI), los cuales "aprenden su inteligencia" de un ser humano, no solo de los datos que reciben. Por ejemplo, un equipo del Instituto de Tecnología de Massachusetts descubrió que la predicción de ingresos de una IA era "sorprendentemente racista y sexista" debido a la naturaleza de los datos que se habían alimentado.

Sin la intervención del equipo, que ajustó los algoritmos, las habilidades predictivas de la IA habrían fallado a grupos privados de sus derechos como las mujeres y las minorías. Vemos entonces que un equipo diverso de ciencia de datos puede reducir la producción de IA que está sesgada, especialmente en los casos en que los datos utilizados para construir la IA ya estaban sesgados en primera instancia.

Es comprensible que reunir un equipo así tenga sus propias implicaciones financieras. Aquí es donde alcanzar primero la fruta baja, antes de escalar a operaciones completas, sería ideal. Esto implica dos cosas: primero, aprovechar las plataformas de ML disponibles en Google o Microsoft para realizar operaciones básicas y segundo, capitalizar la experiencia actualmente disponible en el Centro. Esto puede ser seguido por una reestructuración ampliada de un equipo que tenga la experiencia necesaria y la inversión en infraestructura que soporte ML e IA.

Los roles que lleva a cabo el equipo de ciencia de datos incluirían, entre otros, un ingeniero de visualización de datos, un ingeniero de ML y un periodista de datos.

El equipo eventual de ciencia de datos debe considerar el tipo de ciencia de datos que desean seguir. Eso lo determinará en parte el equipo: podría concentrarse en limpiar y analizar datos para su uso en pronósticos, modelado y visualización (un equipo analítico) o en ingeniería de software para desarrollar productos utilizando datos existentes (equipo de construcción).

Un equipo diverso impulsaría la producción de productos de investigación variados y de alta calidad que brinden recetas informadas para la toma de decisiones inclusiva y basada en evidencia. Esto a su vez dirigiría la visión del Centro de transformar vidas en África a través de la investigación , así como los esfuerzos de Kenia para no dejar a nadie atrás en la implementación de los ODS. - Marylene Wamukoya

(Crédito de la imagen: Pexels)