Che cosa sono Data Mesh e Data Fabric?

5 minuti di lettura

Panoramica

Data mesh e data fabric rappresentano l'ultima grande iniziativa o semplici parole d'ordine per vendere soluzioni? È difficile dirlo, ma queste nuove iniziative aziendali hanno un obiettivo comune: gestire dati eterogenei. Spesso è possibile ottenere maggiore valore dai propri dati se si riesce a utilizzare dati eterogenei per le analisi senza doverli copiare ripetutamente e in modo eccessivo. Data mesh e data fabric adottano approcci diversi per risolvere il problema dei dati eterogenei.

 

Rete dati e tessuto dati

Qual è la differenza tra data mesh e data fabric?

Sia la mesh di dati che la struttura dati si concentrano sui metadati e su un livello semantico per sfruttare più fonti di dati a fini analitici. Tuttavia, la differenza principale sembra risiedere nel contesto.

In parole semplici, il data mesh consiste nella capacità di offrire diverse fonti di dati a un motore analitico. Il data mesh si basa sul presupposto che si conosca la struttura dei file di dati di origine e che il contesto dei dati sia ben definito. L'utilizzo del data mesh presuppone che si conoscano chi, quando, dove, perché e come i dati sono stati creati. Il data mesh potrebbe essere la strategia da utilizzare, ad esempio, se si desidera analizzare dati provenienti da diversi data warehouse all'interno della propria azienda. Si tratta di un caso d'uso in cui i metadati originali sono piuttosto ben definiti.

Data Fabric si concentra sull'orchestrazione, sulla gestione dei metadati e sull'aggiunta di contesto ai dati. In Data Fabric, l'attenzione si concentra sulla gestione del livello semantico. Il livello semantico viene utilizzato per rappresentare i dati aziendali critici e per sviluppare un linguaggio comune per i dati. Un livello semantico in un progetto Data Fabric potrebbe mappare dati complessi in termini aziendali familiari come prodotto, cliente o fatturato, per offrire una visione unificata e consolidata dei dati in tutta l'organizzazione. Le sperimentazioni cliniche farmaceutiche sono un buon esempio di applicazione di Data Fabric, poiché i dati di una sperimentazione provengono da una combinazione di macchinari, report e altri studi, per i quali i metadati accurati sono scarsi. Questi dati possono anche essere "scarsi", ovvero un numero significativo di righe e colonne sono vuote o nulle.

 

Non esistono soluzioni "chiavi in ​​mano" per data mesh o data fabric. Al momento della stesura di questo articolo, non esisteva un unico punto di riferimento per data fabric e data mesh. In altre parole, data mesh e data fabric non sono prodotti software, bensì iniziative strategiche che richiedono molteplici soluzioni.

Oggi le aziende possono utilizzare diverse tecnologie per creare una rete di dati o un'infrastruttura di dati. Ecco alcuni esempi:

Database tradizionali

I database moderni possono sfruttare tabelle esterne in stile data mesh. Rocket® Vertica®, ad esempio, consente di utilizzare file PARQUET e altri tipi di file senza problemi, senza doverli caricare nel repository principale. Inoltre, se si dispone di dati semi-strutturati in formato AVRO, JSON o TEXT, esiste un modo semplice per sfruttare le funzionalità di schema on read per utilizzare i dati. Questa funzionalità è preziosa per la creazione di un data mesh quando si hanno fonti di dati eterogenee e si desidera utilizzarle come si farebbe con i dati in un database .

motori di interrogazione

Un'intera generazione di motori di query (a volte chiamati acceleratori di query) rende possibile anche il data mesh. Soluzioni come Dremio, Starburst e Druid si concentrano principalmente sull'analisi di tabelle esterne. A volte mancano di conformità ACID e della capacità di eseguire analisi con elevata concorrenza, ma sono spesso utili per la missione del data mesh. Sempre più database tradizionali hanno integrato motori di query per consentire query senza soluzione di continuità all'interno di un database e di un data lake.

Strumenti di visualizzazione

Alcuni strumenti di visualizzazione avanzati dispongono di un sistema a livelli semantici. MicroStrategy, ad esempio, offre un livello di astrazione che fornisce un metodo coerente per interpretare i dati provenienti da diverse fonti. Inoltre, mappa dati complessi in termini aziendali familiari. Questa funzionalità non solo semplifica la struttura dei dati, ma può anche sfruttare le capacità delle tabelle esterne del database. Insieme, possono risultare estremamente potenti.

Database a grafo

I database a grafo eccellono nell'orchestrazione e nella gestione del contesto e sono il motore di molte soluzioni di data fabric. Implementare un data fabric con un database a grafo è un progetto impegnativo, ma una volta completato si otterrà un vero e proprio data fabric.

Virtualizzazione dei dati

Gli strumenti di virtualizzazione dei dati, come quelli offerti da AtScale e Denodo, forniscono ai team di Business Intelligence e Data Science una visione coerente per l'utilizzo dei dati. Anche i database moderni dispongono di funzionalità di virtualizzazione dei dati.

Catalogo dati

Un catalogo dati è un inventario organizzato delle risorse dati presenti in un'organizzazione. Aziende come Collibra forniscono cataloghi per la scoperta e la governance dei dati, raccogliendo, organizzando, rendendo accessibili e arricchendo i metadati.

Archivio di oggetti locale

Può essere utile archiviare tutti i file in una posizione centrale. Gli object store consentono di gestire centralmente database, repository di dati e data lake in un unico luogo, offrendo prestazioni, sicurezza e ripristino di emergenza eccellenti. Per questo motivo, gli object store di Pure, Vast, Dell ECS e molti altri possono essere d'aiuto nella creazione di data mesh.

 

Rete di dati o tessuto di dati?

La mesh di dati è un modo per accedere a dati che possono essere eterogenei e funziona particolarmente bene quando tutte le fonti di dati:

  1. Avere struttura
  2. Hanno dimensioni che non cambiano molto
  3. Non avere dati scarsamente popolati

Se il data mesh ha un punto debole, è il contesto. Se la tua analisi si interroga su "secondo chi?", allora un data fabric può essere più efficace per comprenderlo. Gli ingegneri dei dati si imbattono spesso in informazioni contrastanti quando integrano diverse fonti. Ad esempio, un nuovo sistema potrebbe indicare un'età di 32 anni per un cliente, mentre i dati preesistenti potrebbero indicare lo stesso cliente a 30 anni. La tracciabilità dei dati è una funzionalità aggiuntiva del data fabric che consente di decidere a quali fonti di dati dare maggiore fiducia in caso di conflitti.

Le soluzioni di data fabric tendono a combinare più strumenti per risolvere il problema dei dati eterogenei. Questi strumenti sono più eleganti e solitamente più complessi rispetto a quelli di data mesh. Potrebbero includere maggiori capacità di trasformazione, una sicurezza più granulare e interfacce grafiche per la governance e la tracciabilità dei dati. Tuttavia, un punto debole del data fabric è che probabilmente sarà necessario dedicare uno sforzo considerevole alla creazione e alla gestione di un livello semantico.

I fornitori che promuovono una strategia di data fabric spesso enfatizzano le capacità di un knowledge graph. Un knowledge graph sostituisce la strategia di integrazione dati data mesh con una rappresentazione semantica di dati strutturati e non strutturati, che spesso supporta meglio schemi e dimensioni multiple in continua evoluzione.

 

Nuove funzionalità del database per le mesh di dati

Oggi più che mai, i dati sono spesso distribuiti in modo eterogeneo in database e data lake. I database cloud variano notevolmente in termini di accesso ai dati esterni. Alcune soluzioni richiedono che i dati siano archiviati in formati specifici nei data warehouse e non offrono supporto per i data lake. Altre, invece, supportano i data lake ma richiedono l'utilizzo di diversi strumenti. È fondamentale trovare una soluzione in grado di gestire i formati più comuni (come ORC, PARQUET, AVRO, JSON) e di sfruttare queste fonti per le analisi quotidiane in modo semplice e veloce. È inoltre importante scegliere soluzioni che consentano l'accesso ad altri database dell'organizzazione ( virtualizzazione dei dati ) per garantire la massima accessibilità a tutti i dati.

Prodotti correlati

Rocket® Vertica®

Analizza grandi quantità di dati aziendali in tempo reale con un database analitico ad alte prestazioni, progettato per l'intelligenza artificiale, la scalabilità e la flessibilità.