QUESTIONS & RÉPONSES La collection de Solve DSI - Yann-Eric Devars
← Revenir aux réponses

Que faut-il savoir sur « Data lakes » — Partie III : Mise en œuvre opérationnelle › 1. Architecture des données ?

Extrait de Gouvernance des données

En complément ou en alternative, on observe la montée en puissance des data lakes, ces réservoirs massifs capables de stocker des volumes volumineux (potentiellement hétérogènes) sans exiger de schéma prédéfini.

Les lacs de données sont souvent bâtis sur des technologies distribuées, propices au traitement en parallèle des fichiers ou enregistrements de nature diverse : logs, documents texte, images, flux de capteurs, etc.

Ce modèle se veut plus flexible, car il n’impose pas de structuration préalable.

On peut ainsi capturer rapidement les données, les garder à disposition, puis définir leur usage et leur format au moment où on en a besoin .

Toutefois, si la gouvernance n’est pas correctement assurée, un data lake peut rapidement se transformer en « marécage » d’informations disparates, dans lequel il devient difficile de retrouver les éléments recherchés ou de garantir leur qualité.

D’où la nécessité d’appliquer des référentiels de métadonnées, des catalogues ou des outils de gouvernance rigoureux pour préserver la lisibilité du contenu.