¿Son las mallas de datos y los tejidos de datos la iniciativa más novedosa y revolucionaria, o simples términos de moda para vender soluciones? Es difícil decirlo, pero estas nuevas iniciativas corporativas comparten un objetivo común: gestionar datos dispares. A menudo, se puede obtener mayor valor de los datos si se utilizan datos dispares para el análisis sin tener que copiarlos de forma excesiva y repetida. Las mallas de datos y los tejidos de datos adoptan enfoques diferentes para resolver el problema de los datos dispares.
Tanto la malla de datos como la estructura de datos se centran en los metadatos y una capa semántica para aprovechar múltiples fuentes de datos para el análisis. Sin embargo, la principal diferencia parece radicar en el contexto.
En términos sencillos, la malla de datos consiste en la capacidad de ofrecer diversas fuentes de datos a un motor analítico. La malla de datos se basa en el hecho de que se conoce la estructura de los archivos de datos de origen y que el contexto de los datos es sólido. El uso de la malla de datos presupone que se conoce quién, cuándo, dónde, por qué y cómo se crearon los datos. La malla de datos podría ser la estrategia que se utilice, por ejemplo, si se desea analizar datos de varios almacenes de datos de la empresa. Es un caso de uso donde los metadatos originales están bastante bien definidos.
Data Fabric se centra en la orquestación, la gestión de metadatos y la adición de contexto a los datos. En Data Fabric, la gestión de la capa semántica es fundamental. Utilice la capa semántica para representar datos corporativos críticos y desarrollar un lenguaje común para sus datos. Una capa semántica en un proyecto de Data Fabric podría mapear datos complejos a términos comerciales familiares, como producto, cliente o ingresos, para ofrecer una visión unificada y consolidada de los datos en toda la organización. Los ensayos farmacéuticos son un buen ejemplo de dónde podría utilizar Data Fabric, ya que los datos de un ensayo provienen de una combinación de máquinas, informes y otros estudios donde los datos tienen pocos metadatos precisos en los que basarse. Estos datos también pueden ser "dispersos", lo que significa que una cantidad significativa de filas y columnas están en blanco o nulas.
En realidad, no existen soluciones integrales de malla de datos ni de tejido de datos. Al momento de escribir este artículo, no existía una solución completa para la malla de datos y el tejido de datos. En otras palabras, la malla de datos y el tejido de datos no son productos de software, sino iniciativas estratégicas que requieren múltiples soluciones.
Hoy en día, las empresas pueden utilizar diversas tecnologías para crear una malla de datos o una estructura de datos. Aquí hay algunos ejemplos:
Bases de datos tradicionales
Las bases de datos modernas pueden aprovechar tablas externas en una malla de datos. Rocket® Vertica®, por ejemplo, permite usar archivos PARQUET y otros tipos de archivos sin problemas, sin necesidad de cargarlos en el repositorio principal. Además, si dispone de datos semiestructurados en formato AVRO, JSON o TEXT, existe una forma sencilla de aprovechar las funciones de esquema en lectura para utilizarlos. Esta funcionalidad resulta valiosa para crear una malla de datos si dispone de fuentes dispares y desea aprovecharlas como si fueran datos de una base de datos .
Motores de consulta
Toda una generación de motores de consulta (a veces llamados aceleradores de consulta) también hace posible la malla de datos. Soluciones como Dremio, Starburst y Druid se centran principalmente en el análisis de tablas externas. Si bien a veces carecen de compatibilidad con ACID y de la capacidad de realizar análisis con alta concurrencia, suelen ser útiles para la implementación de la malla de datos. Cada vez más bases de datos tradicionales han incorporado motores de consulta para permitir consultas fluidas tanto en la base de datos como en el lago de datos.
Herramientas de visualización
Algunas herramientas de visualización avanzadas cuentan con un sistema de capa semántica. MicroStrategy, por ejemplo, ofrece una capa de abstracción que proporciona una forma coherente de interpretar datos de múltiples fuentes. Además, transforma datos complejos en términos empresariales familiares. Esta capacidad no solo simplifica la estructura de datos, sino que también aprovecha las funcionalidades de las tablas externas de la base de datos. En conjunto, puede resultar sumamente potente.
bases de datos de grafos
Las bases de datos de grafos son excelentes para la orquestación y el contexto, y constituyen la base de muchas soluciones de tejido de datos. Implementar un tejido de datos con una base de datos de grafos es un proyecto importante, pero al completarlo se obtiene un verdadero tejido de datos.
Virtualización de datos
Las herramientas de virtualización de datos, como las que ofrecen AtScale y Denodo, proporcionan una visión coherente para que los equipos de BI y ciencia de datos puedan consumir los datos. Las bases de datos modernas también cuentan con capacidades de virtualización de datos.
Catálogo de datos
Un catálogo de datos es un inventario organizado de los activos de datos de la organización. Empresas como Collibra ofrecen catálogos de descubrimiento y gobernanza de datos mediante la recopilación, organización, acceso y enriquecimiento de metadatos.
Almacén de objetos local
Puede resultar útil almacenar todos tus archivos en una ubicación centralizada. Los almacenes de objetos te permiten gestionar de forma centralizada bases de datos, repositorios de datos y lagos de datos en un solo lugar, con un rendimiento, seguridad y recuperación ante desastres excepcionales. Por ello, los almacenes de objetos como los de Pure, Vast, Dell ECS y muchos otros pueden ser de gran ayuda para la creación de mallas de datos.
La malla de datos es una forma de acceder a datos que pueden ser dispares y funciona particularmente bien cuando todas las fuentes de datos:
Si la malla de datos tiene una debilidad, es el contexto. Si su análisis se pregunta "¿según quién?", entonces una estructura de datos puede ser más eficaz para comprenderlo. Los ingenieros de datos a menudo se topan con información contradictoria al integrar diversas fuentes. Por ejemplo, un sistema nuevo podría reportar la edad de un cliente como 32 años, mientras que los datos heredados podrían reportar al mismo cliente como de 30 años. El linaje de datos es una característica adicional de la estructura de datos que permite decidir en qué fuentes de datos confiar más cuando existen conflictos.
Las soluciones de tejido de datos tienden a combinar más herramientas para resolver problemas de datos dispersos. Estas herramientas son más elegantes y, por lo general, más complejas que las mallas de datos. Pueden incluir mayores capacidades de transformación, seguridad granular mejorada e interfaces gráficas para la gobernanza y el linaje de datos. Sin embargo, una debilidad del tejido de datos es que probablemente requerirá un esfuerzo considerable para crear y gestionar una capa semántica.
Los proveedores que promueven una estrategia de tejido de datos suelen destacar las capacidades de un grafo de conocimiento. Un grafo de conocimiento reemplaza la estrategia de integración de datos de malla de datos con una representación semántica de datos estructurados y no estructurados, que a menudo admite mejor múltiples esquemas y dimensiones cambiantes.
Más que nunca, los datos suelen estar ubicados en diversas bases de datos y lagos de datos. Las bases de datos en la nube varían considerablemente en cuanto al acceso a datos externos. Algunas soluciones requieren que los datos se almacenen en formatos específicos en almacenes de datos y no ofrecen soporte para lagos de datos. Otras, en cambio, sí lo admiten, pero requieren varias herramientas para ello. Busque una solución que pueda manejar formatos comunes (como ORC, PARQUET, AVRO y JSON) y que le permita aprovechar esas fuentes para realizar análisis diarios con facilidad y rapidez. Busque soluciones que puedan acceder a otras bases de datos de su organización ( virtualización de datos ) para que el acceso a cualquier dato sea sencillo.
Rocket® Vertica®
Analice grandes cantidades de datos empresariales en tiempo real con una base de datos analítica de alto rendimiento diseñada para la IA, la escalabilidad y la flexibilidad.
