Was ist Data Mesh und Data Fabric?

5 Minuten Lesezeit

Überblick

Sind Data Mesh und Data Fabric die neueste und wichtigste Innovation oder nur neue Schlagwörter, um Lösungen zu verkaufen? Schwer zu sagen, aber diese neuen Unternehmensinitiativen haben ein gemeinsames Ziel: den Umgang mit heterogenen Daten. Oft lässt sich ein höherer Nutzen aus Daten erzielen, wenn man heterogene Daten für Analysen nutzen kann, ohne sie aufwendig und wiederholt kopieren zu müssen. Data Mesh und Data Fabric verfolgen unterschiedliche Ansätze zur Lösung dieses Problems.

 

Datennetz und Datenstruktur

Worin besteht der Unterschied zwischen Data Mesh und Data Fabric?

Sowohl Data Mesh als auch Data Fabric konzentrieren sich auf Metadaten und eine semantische Schicht, um verschiedene Datenquellen für Analysen zu nutzen. Der Hauptunterschied scheint jedoch im Kontext zu liegen.

Vereinfacht ausgedrückt, ermöglicht ein Data Mesh die Bereitstellung verschiedener Datenquellen für eine Analyse-Engine. Es setzt voraus, dass die Struktur der Quelldateien bekannt ist und der Datenkontext klar definiert ist. Die Verwendung eines Data Mesh erfordert Kenntnisse darüber, wer, wann, wo, warum und wie die Daten erstellt wurden. Ein Data Mesh kann beispielsweise die richtige Strategie sein, um Daten aus mehreren Data Warehouses im Unternehmen zu analysieren. In diesem Anwendungsfall sind die ursprünglichen Metadaten weitgehend klar definiert.

Data Fabric konzentriert sich auf Orchestrierung, Metadatenmanagement und die Anreicherung von Daten mit Kontext. Im Mittelpunkt von Data Fabric steht die Verwaltung der semantischen Schicht. Diese dient der Darstellung kritischer Unternehmensdaten und der Entwicklung eines gemeinsamen Datendialekts. In einem Data-Fabric-Projekt kann eine semantische Schicht komplexe Daten in verständliche Geschäftsbegriffe wie Produkt, Kunde oder Umsatz übersetzen und so eine einheitliche, konsolidierte Datensicht im gesamten Unternehmen ermöglichen. Pharmazeutische Studien sind ein gutes Beispiel für den Einsatz von Data Fabric, da die Studiendaten aus einer Kombination von Maschinen, Berichten und anderen Untersuchungen stammen und oft nur wenige verlässliche Metadaten aufweisen. Diese Daten können zudem „spärlich“ sein, d. h. viele Zeilen und Spalten sind leer oder enthalten den Wert Null.

 

Es gibt keine fertigen Komplettlösungen für Data Mesh oder Data Fabric. Zum Zeitpunkt der Veröffentlichung dieses Artikels existierte keine zentrale Anlaufstelle für Data Mesh und Fabric. Anders ausgedrückt: Data Mesh und Fabric sind keine Softwareprodukte, sondern vielmehr strategische Initiativen, die mehrere Lösungen erfordern.

Heutzutage nutzen Unternehmen verschiedene Technologien, um ein Datennetz oder eine Dateninfrastruktur zu erstellen. Hier einige Beispiele:

Traditionsdatenbanken

Moderne Datenbanken können externe Tabellen im Data-Mesh-Stil nutzen. Rocket® Vertica® ermöglicht beispielsweise die nahtlose Verwendung von PARQUET-Dateien und anderen Dateitypen, ohne diese in das Haupt-Repository laden zu müssen. Darüber hinaus bietet Rocket® Vertica® eine einfache Möglichkeit, semistrukturierte Daten in AVRO, JSON oder TEXT mithilfe von Schema-on-Read-Funktionen zu verwenden. Diese Funktionalität ist besonders wertvoll für die Erstellung eines Data Mesh, wenn Sie unterschiedliche Datenquellen haben und diese wie Daten in einer Datenbank nutzen möchten .

Abfrage-Engines

Eine ganze Generation von Abfrage-Engines (manchmal auch Abfragebeschleuniger genannt) ermöglicht ebenfalls Data Meshes. Lösungen wie Dremio, Starburst und Druid konzentrieren sich primär auf die Analyse externer Tabellen. Zwar mangelt es ihnen mitunter an ACID-Konformität und der Fähigkeit zu Analysen mit hoher Parallelität, dennoch sind sie für die Realisierung von Data Meshes oft hilfreich. Immer mehr traditionelle Datenbanken integrieren Abfrage-Engines, um nahtlose Abfragen innerhalb einer Datenbank und eines Data Lakes zu ermöglichen.

Visualisierungswerkzeuge

Einige fortschrittliche Visualisierungswerkzeuge verfügen über ein semantisches Schichtensystem. MicroStrategy bietet beispielsweise eine Abstraktionsebene, die eine einheitliche Interpretation von Daten aus verschiedenen Quellen ermöglicht. Darüber hinaus werden komplexe Daten in verständliche Geschäftsbegriffe übersetzt. Diese Funktion vereinfacht nicht nur die Datenstruktur, sondern nutzt auch die externen Tabellenfunktionen Ihrer Datenbank. In Kombination ist sie äußerst leistungsstark.

Graphdatenbanken

Graphdatenbanken eignen sich hervorragend für Orchestrierung und Kontextmanagement und bilden die Grundlage vieler Data-Fabric-Lösungen. Die Implementierung einer Data Fabric mit einer Graphdatenbank ist zwar ein umfangreiches Projekt, doch nach erfolgreicher Umsetzung erhalten Sie eine echte Data Fabric.

Datenvirtualisierung

Datenvirtualisierungstools wie die von AtScale und Denodo bieten BI- und Data-Science-Teams eine einheitliche Datenansicht. Moderne Datenbanken verfügen ebenfalls über Datenvirtualisierungsfunktionen.

Datenkatalog

Ein Datenkatalog ist ein systematisches Verzeichnis der Datenbestände eines Unternehmens. Unternehmen wie Collibra bieten Kataloge für die Datenermittlung und -verwaltung an, indem sie Metadaten sammeln, organisieren, zugänglich machen und anreichern.

Lokaler Objektspeicher

Es kann hilfreich sein, alle Dateien zentral zu speichern. Objektspeicher ermöglichen die zentrale Verwaltung von Datenbanken, Datenrepositorys und Data Lakes mit hervorragender Performance, Sicherheit und Disaster Recovery. Daher eignen sich Objektspeicher wie die von Pure, Vast, Dell ECS und vielen anderen Anbietern hervorragend für die Erstellung von Data Meshes.

 

Datennetz oder Datenstruktur?

Ein Data Mesh ist eine Methode, um auf möglicherweise heterogene Daten zuzugreifen, und funktioniert besonders gut, wenn alle Datenquellen:

  1. Struktur haben
  2. Die Abmessungen sollten sich nicht wesentlich ändern.
  3. Verwenden Sie keine Daten mit geringer Datendichte.

Die größte Schwäche von Data Meshes liegt im Kontext. Wenn Ihre Analysen die Frage „Wem zufolge?“ aufwerfen, kann eine Data Fabric hierbei wertvolle Unterstützung bieten. Dateningenieure stoßen bei der Integration verschiedener Datenquellen häufig auf widersprüchliche Informationen. Beispielsweise könnte ein neues System das Alter eines Kunden mit 32 Jahren angeben, während ältere Daten für denselben Kunden ein Alter von 30 Jahren ausweisen. Die Datenherkunft ist eine zusätzliche Funktion der Data Fabric, mit der Sie bei Konflikten entscheiden können, welchen Datenquellen Sie mehr vertrauen.

Data-Fabric-Lösungen kombinieren in der Regel mehrere Tools, um Ihre heterogenen Datenprobleme zu lösen. Diese Tools sind eleganter und meist komplexer als Data Meshes. Sie bieten beispielsweise erweiterte Transformationsmöglichkeiten, verbesserte, feingranulare Sicherheitsfunktionen sowie grafische Oberflächen für Governance und Datenherkunft. Ein Nachteil von Data Fabrics ist jedoch der erhebliche Aufwand für die Erstellung und Verwaltung einer semantischen Schicht.

Anbieter, die eine Data-Fabric-Strategie bewerben, heben häufig die Möglichkeiten eines Wissensgraphen hervor. Ein Wissensgraph ersetzt die Data-Mesh-Datenintegrationsstrategie durch eine semantische Repräsentation sowohl strukturierter als auch unstrukturierter Daten – eine Repräsentation, die häufig mehrere Schemata und sich ändernde Dimensionen besser unterstützt.

 

Neue Datenbankfunktionen für Data Mesh

Daten sind heutzutage häufiger denn je in Datenbanken und Data Lakes verteilt. Cloud-Datenbanken unterscheiden sich stark hinsichtlich des Zugriffs auf externe Daten. Manche Lösungen erfordern die Speicherung von Daten in bestimmten Formaten in Data Warehouses und bieten keine Unterstützung für Data Lakes. Andere unterstützen zwar Data Lakes, benötigen dafür aber mehrere Tools. Achten Sie auf eine Lösung, die gängige Formate (wie ORC, PARQUET, AVRO, JSON) verarbeiten und diese Quellen reibungslos und schnell in Ihre täglichen Analysen einbinden kann. Suchen Sie nach Lösungen, die auf andere Datenbanken in Ihrem Unternehmen zugreifen können ( Datenvirtualisierung ), um einen uneingeschränkten Datenzugriff zu gewährleisten.

Ähnliche Produkte

Rocket® Vertica®

Analysieren Sie große Mengen an Unternehmensdaten in Echtzeit mit einer leistungsstarken Analysedatenbank, die für KI, Skalierbarkeit und Flexibilität entwickelt wurde.