HeadlinesBriefing favicon HeadlinesBriefing.com

Construyendo un Lakehouse con DuckDB y DuckLake

Towards Data Science •
×

Hace muchos años, si quería almacenar grandes cantidades de datos que pudieran consultarse de manera sensata, una base de datos como Oracle o Postgres era su principal opción. El siguiente gran avance fue el almacén de datos, seguido por el lago de datos. Los lagos de datos permitieron a las organizaciones almacenar volúmenes mucho mayores de datos estructurados, semiestructurados y no estructurados en bruto de forma barata. Empresas como Databricks, Snowflake y AWS cobran mucho, pero puede desarrollar un lago de datos efectivo por casi cero costo con DuckDB y la extensión DuckLake.

Tanto DuckDB como DuckLake tienen licencia MIT, son de código abierto y gratuitos. DuckLake, desarrollado por el equipo de DuckDB, gestiona los metadatos en una base de datos relacional en lugar de en archivos colocados junto a los datos Parquet.

El artículo recorre la creación de un DuckLake local, el examen de metadatos, consultas de viaje en el tiempo, la evolución del esquema de una tabla y el uso de datos S3 basados en la nube con DuckLake.

Entidades clave: Empresas: Oracle, Databricks, Snowflake, AWS