HeadlinesBriefing favicon HeadlinesBriefing.com

Construire un Lakehouse avec DuckDB et DuckLake

Towards Data Science •
×

Il y a de nombreuses années, si vous vouliez stocker de grandes quantités de données pouvant être interrogées de manière sensée, une base de données comme Oracle ou Postgres était votre choix principal. La prochaine grande avancée a été l'entrepôt de données, suivi du lac de données. Les lacs de données ont permis aux organisations de stocker des volumes beaucoup plus importants de données brutes structurées, semi-structurées et non structurées à moindre coût. Des entreprises comme Databricks, Snowflake et AWS facturent cher, mais vous pouvez développer un lac de données efficace pour un coût proche de zéro avec DuckDB et l'extension DuckLake.

DuckDB et DuckLake sont tous deux sous licence MIT, open source et gratuits. DuckLake, développé par l'équipe de DuckDB, gère les métadonnées dans une base de données relationnelle au lieu de fichiers co-localisés avec les données Parquet.

L'article parcourt la création d'un DuckLake local, l'examen des métadonnées, les requêtes de voyage dans le temps, l'évolution du schéma d'une table et l'utilisation de données S3 basées sur le cloud avec DuckLake.

Entités clés : Entreprises : Oracle, Databricks, Snowflake, AWS