HeadlinesBriefing favicon HeadlinesBriefing.com

Построение Data Lakehouse с DuckDB и DuckLake

Towards Data Science •
×

Многие годы назад, если вы хотели хранить большие объемы данных, которые можно было бы осмысленно запрашивать, база данных вроде Oracle или Postgres была вашим главным выбором. Следующим большим шагом стало хранилище данных, за которым последовало озеро данных. Озера данных позволили организациям хранить гораздо большие объемы сырых структурированных, полуструктурированных и неструктурированных данных дешево. Компании вроде Databricks, Snowflake и AWS взимают высокую плату, но вы можете разработать эффективное озеро данных почти за нулевую стоимость с DuckDB и расширением DuckLake.

И DuckDB, и DuckLake лицензированы по MIT, являются открытым исходным кодом и бесплатны для использования. DuckLake, разработанный командой DuckDB, управляет метаданными в реляционной базе данных вместо файлов, расположенных рядом с данными Parquet.

Статья проводит через создание локального DuckLake, изучение метаданных, time-travel запросы, эволюцию схемы таблицы и использование облачных данных S3 с DuckLake.

Ключевые сущности: Компании: Oracle, Databricks, Snowflake, AWS