Será que data mesh e data fabric são a mais recente e melhor iniciativa, ou apenas novos termos da moda para vender soluções? É difícil dizer, mas essas novas iniciativas corporativas emergentes têm um objetivo em comum: lidar com dados díspares. Muitas vezes, é possível obter mais valor dos dados se você puder usar dados díspares para suas análises sem precisar copiá-los excessivamente e repetidamente. Data mesh e data fabric adotam abordagens diferentes para resolver o problema de dados díspares.
Tanto a malha de dados quanto a estrutura de dados se concentram em metadados e em uma camada semântica para aproveitar múltiplas fontes de dados para análises. No entanto, a principal diferença parece estar no contexto.
Em termos simples, a malha de dados (data mesh) consiste na capacidade de oferecer diversas fontes de dados a um mecanismo analítico. A malha de dados pressupõe o conhecimento da estrutura dos arquivos de dados de origem e a solidez do contexto dos dados. O uso da malha de dados pressupõe o conhecimento de quem, quando, onde, por que e como os dados foram criados. A malha de dados pode ser a estratégia ideal, por exemplo, para analisar dados de vários data warehouses da empresa. Trata-se de um caso de uso em que os metadados originais estão bem definidos.
A arquitetura de dados (Data Fabric) concentra-se na orquestração, no gerenciamento de metadados e na adição de contexto aos dados. Nela, o foco está no gerenciamento da camada semântica. Utilize a camada semântica para representar dados corporativos críticos e desenvolver um dialeto comum para seus dados. Uma camada semântica em um projeto de Data Fabric pode mapear dados complexos em termos comerciais familiares, como produto, cliente ou receita, para oferecer uma visão unificada e consolidada dos dados em toda a organização. Ensaios clínicos farmacêuticos são um bom exemplo de onde você pode usar a arquitetura de dados, já que os dados de um ensaio provêm de uma combinação de máquinas, relatórios e outros estudos, onde os dados têm poucos metadados precisos para se basear. Esses dados também podem ser "esparsos", o que significa que um número significativo de linhas e colunas estão em branco ou nulas.
Na realidade, não existem soluções prontas para uso, como data mesh ou data fabric. Até a data de publicação deste artigo, não havia uma solução completa para data mesh e data fabric. Em outras palavras, data mesh e data fabric não são produtos de software. São, geralmente, iniciativas estratégicas que exigem múltiplas soluções.
Atualmente, as empresas podem usar diversas tecnologias para criar uma malha de dados ou uma estrutura de dados. Aqui estão alguns exemplos:
Bancos de dados tradicionais
Bancos de dados modernos podem aproveitar tabelas externas em um estilo de malha de dados. O Rocket® Vertica®, por exemplo, permite usar arquivos PARQUET e outros tipos de arquivo perfeitamente, sem precisar carregá-los no repositório principal. Além disso, se você tiver dados semiestruturados em AVRO, JSON ou TEXT, existe uma maneira fácil de aproveitar os recursos de esquema na leitura para utilizar os dados. Essa funcionalidade é valiosa para a criação de uma malha de dados quando você tem fontes distintas e deseja utilizá-las como se fossem dados em um banco de dados .
Mecanismos de consulta
Toda uma geração de mecanismos de consulta (às vezes chamados de aceleradores de consulta) também torna possível a malha de dados. Soluções como Dremio, Starburst e Druid focam principalmente na análise de tabelas externas. Elas podem não ser compatíveis com ACID e não conseguem realizar análises com alta concorrência, mas geralmente são úteis para a missão da malha de dados. Cada vez mais bancos de dados tradicionais têm adicionado mecanismos de consulta para permitir consultas integradas tanto no banco de dados quanto no data lake.
Ferramentas de visualização
Algumas ferramentas avançadas de visualização possuem um sistema de camadas semânticas. O MicroStrategy, por exemplo, oferece uma camada de abstração que proporciona uma maneira consistente de interpretar dados de múltiplas fontes. Além disso, ele mapeia dados complexos em termos de negócios familiares. Essa capacidade não apenas simplifica a estrutura de dados, como também pode aproveitar os recursos de tabelas externas do seu banco de dados. Combinadas, essas funcionalidades podem ser extremamente poderosas.
Bancos de dados de grafos
Bancos de dados de grafos são excelentes em orquestração e contexto, sendo os motores por trás de muitas soluções de malha de dados. Implementar uma malha de dados com um banco de dados de grafos é um projeto significativo, mas, ao final, você obterá uma verdadeira malha de dados.
Virtualização de dados
Ferramentas de virtualização de dados, como as oferecidas pela AtScale e Denodo, proporcionam uma visão consistente para que as equipes de BI e Ciência de Dados consumam os dados. Bancos de dados modernos também possuem recursos de virtualização de dados.
Catálogo de dados
Um catálogo de dados é um inventário organizado dos ativos de dados em uma organização. Empresas como a Collibra fornecem catálogos de descoberta e governança de dados, coletando, organizando, acessando e enriquecendo metadados.
Armazenamento de objetos local
Pode ser útil armazenar todos os seus arquivos em um local central. Os armazenamentos de objetos permitem gerenciar bancos de dados, repositórios de dados e data lakes de forma centralizada, com excelente desempenho, segurança e recuperação de desastres. Por esse motivo, soluções de armazenamento de objetos como as da Pure, Vast, Dell ECS e muitas outras podem auxiliar na criação de malhas de dados.
A malha de dados é uma forma de acessar dados que podem estar dispersos e funciona particularmente bem quando todas as fontes de dados:
Se a malha de dados tem uma fraqueza, é o contexto. Se sua análise questiona "segundo quem?", então uma malha de dados pode ser mais poderosa para entender isso. Engenheiros de dados frequentemente se deparam com informações conflitantes ao integrar fontes de dados. Por exemplo, um novo sistema pode reportar a idade de um cliente como 32 anos, enquanto dados legados podem reportar o mesmo cliente como 30 anos. A linhagem de dados é um recurso adicional da malha de dados que permite decidir em quais fontes de dados confiar mais quando há conflitos.
As soluções de Data Fabric tendem a combinar mais ferramentas para resolver seu problema de dados heterogêneos. Essas ferramentas são mais elegantes e geralmente mais complexas do que as do Data Mesh. Elas podem incluir maiores capacidades de transformação, segurança aprimorada e granular, interfaces gráficas para governança e linhagem de dados. No entanto, uma das desvantagens do Data Fabric é que você provavelmente terá que investir um esforço significativo na criação e no gerenciamento de uma camada semântica.
Os fornecedores que promovem uma estratégia de malha de dados frequentemente destacam os recursos de um grafo de conhecimento. Um grafo de conhecimento substitui a estratégia de integração de dados em malha por uma representação semântica de dados estruturados e não estruturados – uma representação que geralmente oferece melhor suporte a múltiplos esquemas e dimensões variáveis.
Mais do que nunca, os dados estão frequentemente localizados em diversos bancos de dados e data lakes. Os bancos de dados em nuvem variam muito em termos de acesso a dados externos. Algumas soluções exigem que os dados sejam armazenados em formatos específicos em data warehouses e não oferecem suporte a data lakes. Outras ainda oferecem suporte a data lakes, mas exigem várias ferramentas para isso. Procure uma solução que possa lidar com formatos comuns (como ORC, PARQUET, AVRO, JSON) e aproveitar essas fontes em análises diárias com facilidade e rapidez. Busque soluções que possam acessar outros bancos de dados em sua organização ( virtualização de dados ) para que nenhum dado seja difícil de acessar.
Rocket® Vertica®
Analise grandes volumes de dados empresariais em tempo real com um banco de dados analítico de alto desempenho, desenvolvido para IA, escalabilidade e flexibilidade.
