Este artículo está escrito por Aiden Liu , estudiante de informática en la Universidad de Columbia, Basil J. White , analista de políticas de una agencia del gabinete federal de EE. UU., Y Beth A. Martin , instructora adjunta y practicante de experiencia del usuario (UX).


  • El problema: las bases de datos relacionales requieren que los analistas generen conexiones manualmente entre puntos de datos y no se pueden agregar datos adicionales en una fecha posterior.

  • Por qué es importante: realizar conexiones manuales cuando se trabaja con bases de datos relacionales lleva tiempo, lo que puede resultar muy ineficaz cuando se trabaja con volúmenes de datos.

  • La solución: las bases de datos Graph producen automáticamente conexiones de datos, permiten agregar datos adicionales posteriormente y pueden mejorar significativamente la eficiencia.

Aprovecha al máximo tus hojas de cálculo

¿Tiene una hoja de cálculo ineficiente que almacena toda la información de sus clientes? Imagine que podría crear una tabla de datos de clientes que almacene el nombre, la identificación y la dirección de la empresa de cada cliente. Imagine que también tiene una tabla de datos de transacciones que almacena la identificación de cada cliente y las transacciones pasadas. Dado que ambas tablas contienen el ID del cliente, podríamos vincular las dos tablas en función de este elemento común [Figura 1].

Figura 1- Tabla de datos de clientes y tabla de datos de transacciones

Figura 1: Tabla de datos de clientes y tabla de datos de transacciones

Crea una base de datos relacional

Este escenario ilustra cómo una base de datos relacional que organiza los datos en tablas (tablas de datos de transacciones y clientes) los vincula basándose en un elemento de datos común (ID de cliente). Las bases de datos relacionales son una práctica estándar en la organización de datos en la actualidad: siete de las diez bases de datos más populares en 2021 son bases de datos relacionales . En una base de datos relacional, puede realizar operaciones simples, como la búsqueda de un cliente específico, hasta operaciones más complejas, como unir tablas por los datos comunes, como describimos anteriormente. Sin embargo, las bases de datos relacionales tienen sus límites: \ (1) No identifican ni generan conexiones de datos entre tablas de datos automáticamente. Por el contrario, debe unir manualmente dos tablas para encontrar conexiones de datos.

(2) Una vez creadas las bases de datos relacionales, no puede agregar nuevos atributos a los datos. De nuestro ejemplo anterior, no puede agregar nuevos datos (o un 'atributo'), como el puesto de trabajo del cliente.

Ver la jerarquía visual

Una alternativa a una base de datos relacional es una base de datos jerárquica. A diferencia de las bases de datos relacionales, que organizan los datos en tablas con filas y columnas, las bases de datos de gráficos organizan los datos en una taxonomía similar a un árbol genealógico. Cada punto de datos se representa como un nodo (o una hoja de árbol) en lugar de una fila en la tabla, y se conectan automáticamente entre sí por un borde (o una rama de árbol) basado en elementos comunes [Figura 2]. Cuantos más datos agregue a la base de datos del gráfico, se generarán más nodos y bordes. Usemos los datos del cliente mencionados anteriormente nuevamente para comprender cómo funciona una base de datos de gráficos. El nombre de cada cliente se convierte en un nodo; su ID, dirección de la empresa o cualquier atributo que se agregue más adelante se representan como nodos que se conectan automáticamente entre sí por bordes.

Figura 2- Nodos (puntos de datos) que están conectados por bordes en una base de datos de gráficos

Figura 2: Nodos (puntos de datos) que están conectados por bordes en una base de datos de gráficos

Aproveche los nuevos conocimientos

Debido a la generación automática de conexiones entre datos, puede utilizar bases de datos de gráficos para identificar conexiones previamente desconocidas. Consideremos un ejemplo en el que los analistas utilizan datos para asignar fondos de ayuda de COVID-19 a los solicitantes. Tradicionalmente, con las bases de datos relacionales, los analistas necesitan recopilar datos de diferentes departamentos gubernamentales, ya que la información personal del solicitante puede aparecer en múltiples tablas de datos, como tablas de datos sobre empleo, vivienda y resúmenes de cuentas bancarias [Figura 3]. Los analistas buscarían en cada base de datos manualmente para identificar puntos de datos relacionados con el solicitante. Por ejemplo, ¿el solicitante ha recibido fondos de otras fuentes antes? ¿Estaba el solicitante cubierto por algún seguro médico?

Figura 3- Búsqueda a través de bases de datos relacionales en la información de un solicitante de fondos de ayuda COVID-19

Figura 3: Búsqueda a través de bases de datos relacionales en la información de un solicitante de fondos de ayuda COVID-19

Después del examen manual de esos puntos de datos, los analistas deben integrar esos puntos de datos para ver si están conectados de alguna manera para determinar las calificaciones y necesidades específicas del solicitante. El trabajo real es mucho más que la ilustración de arriba. Las bases de datos relacionales no identifican conexiones de datos; con las bases de datos de gráficos, sin embargo, solo necesita cargar todos los datos y dejar que las bases de datos hagan todo el trabajo duro para visualizar las conexiones de datos. El gráfico final podría verse como [Figura 4].

Figura 4- Búsqueda a través de bases de datos de gráficos en la información de un solicitante de fondos de ayuda COVID-19

Figura 4: Búsqueda a través de bases de datos de gráficos en la información de un solicitante de fondos de ayuda COVID-19

Con esta base de datos gráfica, los analistas pueden decir fácilmente que el solicitante X está calificado para los fondos de ayuda COVID-19 según los datos conectados.

Nuestro punto clave para llevar

Para los analistas que manejan miles de puntos de datos todos los días, las bases de datos de gráficos visualizarán automáticamente esos puntos de datos en gráficos en forma de árbol, lo que permite comprender las relaciones entre los puntos de datos. Esta es una ventaja notable sobre las bases de datos relacionales, ya que estas últimas requieren que los analistas identifiquen y generen conexiones manualmente entre puntos de datos.

La visualización de gráficos mejora significativamente la eficiencia del análisis de datos, ya que reduce el tiempo de búsqueda y conexión de datos. Le permite tomar decisiones directamente basadas en las conexiones de datos identificadas.

👋 ¡Puedes crear una publicación como esta! Comparta sus pensamientos con una comunidad de servidores públicos. Aprende más

(Crédito de la imagen: Unsplash)


Asegúrate de compartir tus propias ideas con el autor dejando un comentario abajo