Les concepts de maillage de données et de tissu de données représentent-ils la dernière innovation majeure ou de simples termes à la mode destinés à vendre des solutions ? Difficile à dire, mais ces nouvelles initiatives d'entreprise ont un objectif commun: la gestion des données hétérogènes. On peut souvent tirer davantage de valeur de ses données en les utilisant pour ses analyses, même hétérogènes, sans avoir à les dupliquer de manière excessive et répétée. Le maillage de données et le tissu de données proposent des approches différentes pour résoudre ce problème.
Les architectures de maillage et de tissu de données s'appuient toutes deux sur les métadonnées et une couche sémantique pour exploiter de multiples sources de données à des fins analytiques. Cependant, la principale différence semble résider dans le contexte.
En termes simples, un maillage de données permet de fournir diverses sources de données à un moteur d'analyse. Il repose sur la connaissance de la structure des fichiers de données sources et sur la précision du contexte des données. Son utilisation suppose de connaître l'origine, la date, le lieu, la raison et le mode de création des données. Le maillage de données peut être la stratégie à privilégier, par exemple, pour analyser des données provenant de plusieurs entrepôts de données au sein de votre entreprise. Ce cas d'usage est pertinent lorsque les métadonnées d'origine sont relativement bien définies.
L'architecture de données (ou data fabric) se concentre sur l'orchestration, la gestion des métadonnées et l'enrichissement du contexte des données. Au sein de cette architecture, la gestion de la couche sémantique est primordiale. Cette couche permet de représenter les données critiques de l'entreprise et de développer un langage commun pour vos données. Dans un projet d'architecture de données, la couche sémantique peut traduire des données complexes en termes métiers courants tels que produit, client ou chiffre d'affaires, offrant ainsi une vue unifiée et consolidée des données à l'échelle de l'organisation. Les essais cliniques pharmaceutiques constituent un bon exemple d'application de l'architecture de données, car les données d'un essai proviennent d'une combinaison de machines, de rapports et d'autres études, et les métadonnées précises sont souvent rares. Ces données peuvent également être « parcimonieuses », c'est-à-dire qu'un nombre important de lignes et de colonnes sont vides ou nulles.
Il n'existe pas de solutions clés en main pour les réseaux de données (data mesh ou data fabric). À l'heure où nous écrivons ces lignes, aucun fournisseur unique ne propose de solutions pour les réseaux de données et les architectures de données. Autrement dit, les réseaux de données et les architectures de données ne sont pas des logiciels. Il s'agit plutôt d'initiatives stratégiques nécessitant plusieurs solutions.
Aujourd'hui, les entreprises peuvent utiliser plusieurs technologies pour créer un maillage ou une infrastructure de données. Voici quelques exemples:
Bases de données traditionnelles
Les bases de données modernes peuvent exploiter des tables externes dans un système de maillage de données. Rocket® Vertica®, par exemple, permet d'utiliser des fichiers PARQUET et d'autres types de fichiers de manière transparente, sans les charger dans le référentiel principal. De plus, si vous disposez de données semi-structurées aux formats AVRO, JSON ou TEXT, il est possible d'utiliser facilement les fonctionnalités de schéma à la lecture. Cette fonctionnalité est précieuse pour la création d'un maillage de données lorsque vous avez des sources disparates et souhaitez les exploiter comme vous le feriez avec des données d'une base de données .
Moteurs de requêtes
Toute une génération de moteurs de requêtes (parfois appelés accélérateurs de requêtes) rend également possible le maillage de données. Des solutions comme Dremio, Starburst et Druid se concentrent principalement sur l'analyse de tables externes. Elles ne sont pas toujours conformes aux propriétés ACID et ne permettent pas toujours d'effectuer des analyses à haute concurrence, mais elles sont souvent utiles pour la mise en œuvre du maillage de données. De plus en plus de bases de données traditionnelles intègrent des moteurs de requêtes pour permettre des requêtes fluides à la fois dans une base de données et dans un lac de données.
Outils de visualisation
Certains outils de visualisation avancés intègrent un système de couches sémantiques. MicroStrategy, par exemple, propose une couche d'abstraction qui permet d'interpréter de manière cohérente les données provenant de sources multiples. De plus, elle traduit les données complexes en termes métier compréhensibles. Cette fonctionnalité simplifie non seulement la structure des données, mais permet également d'exploiter les capacités des tables externes de votre base de données. Combinée, elle offre une puissance considérable.
bases de données graphiques
Les bases de données graphiques excellent dans l'orchestration et la contextualisation, et constituent le moteur de nombreuses solutions de data fabric. La mise en œuvre d'une data fabric avec une base de données graphique représente un projet d'envergure, mais vous obtiendrez une véritable data fabric une fois achevée.
virtualisation des données
Les outils de virtualisation des données, tels que ceux proposés par AtScale et Denodo, offrent une vue cohérente des données aux équipes de BI et de science des données. Les bases de données modernes disposent également de fonctionnalités de virtualisation des données.
Catalogue de données
Un catalogue de données est un inventaire organisé des actifs de données d'une organisation. Des entreprises comme Collibra proposent des catalogues de découverte et de gouvernance des données en collectant, organisant, accédant et enrichissant les métadonnées.
Magasin d'objets sur site
Il peut être judicieux de centraliser le stockage de tous vos fichiers. Les solutions de stockage objet vous permettent de gérer de manière centralisée bases de données, référentiels de données et lacs de données, tout en bénéficiant d'excellentes performances, d'une sécurité renforcée et d'une reprise après sinistre optimale. C'est pourquoi des solutions comme Pure, Vast, Dell ECS et bien d'autres facilitent la mise en place d'un maillage de données.
Le maillage de données est une méthode d'accès à des données potentiellement disparates et fonctionne particulièrement bien lorsque toutes les sources de données:
Le point faible des réseaux de données est leur manque de contexte. Si votre analyse s'interroge sur les sources de données (« selon qui ? »), une architecture de données structurée (ou « data fabric ») peut s'avérer plus efficace pour répondre à cette question. Les ingénieurs de données sont souvent confrontés à des informations contradictoires lors de l'intégration de différentes sources. Par exemple, un nouveau système peut indiquer qu'un client a 32 ans, tandis que les données existantes peuvent indiquer qu'il a 30 ans. La traçabilité des données est une fonctionnalité supplémentaire des architectures de données structurées qui vous permet de choisir les sources de données les plus fiables en cas de conflit.
Les solutions de data fabric tendent à combiner davantage d'outils pour résoudre vos problèmes de données hétérogènes. Ces outils sont à la fois plus performants et généralement plus complexes que les solutions de data mesh. Ils peuvent inclure des capacités de transformation plus étendues, une sécurité renforcée et granulaire, ainsi que des interfaces graphiques pour la gouvernance et la traçabilité des données. Cependant, le principal inconvénient des solutions de data fabric réside dans le temps et les efforts considérables qu'elles nécessitent généralement pour la création et la gestion d'une couche sémantique.
Les fournisseurs qui vantent les mérites d'une stratégie de réseau de données mettent souvent en avant les capacités d'un graphe de connaissances. Ce dernier remplace la stratégie d'intégration de données par maillage par une représentation sémantique des données structurées et non structurées, qui prend généralement mieux en charge les schémas et dimensions multiples et évolutifs.
Plus que jamais, les données sont souvent réparties dans des bases de données et des lacs de données. Les bases de données cloud présentent de grandes disparités en matière d'accès aux données externes. Certaines solutions exigent que les données soient stockées dans des formats spécifiques au sein d'entrepôts de données et ne prennent pas en charge les lacs de données. D'autres, en revanche, les prennent en charge, mais nécessitent plusieurs outils. Privilégiez une solution capable de gérer les formats courants (tels que ORC, PARQUET, AVRO et JSON) et d'exploiter ces sources pour vos analyses quotidiennes, avec fluidité et rapidité. Optez également pour des solutions permettant d'accéder aux autres bases de données de votre organisation ( virtualisation des données ) afin de garantir un accès aisé à toutes les données.
Rocket® Vertica®
Analysez de grandes quantités de données d'entreprise en temps réel grâce à une base de données analytique haute performance conçue pour l'IA, l'évolutivité et la flexibilité.
