HeadlinesBriefing HeadlinesBriefing 12 languages

Building a Data Lakehouse with DuckDB and DuckLake

Towards Data Science ·

🇬🇧 English

Many years ago, if you wanted to store large amounts of data that could be sensibly queried, a database like Oracle or Postgres was your main choice. The next big advance was the data warehouse, followed by the data lake. Data lakes allowed organisations to store much larger volumes of raw structured, semi-structured, and unstructured data cheaply. Companies like Databricks, Snowflake, and AWS charge heavily, but you can develop an effective data lake for almost zero cost with Duck DB and the Duck Lake extension.

Both Duck DB and Duck Lake are MIT-licensed, open-source, and free to use. Duck Lake, developed by the Duck DB team, manages metadata in a relational database instead of files co-located with Parquet data.

The article walks through creating a local Duck Lake, examining metadata, time-travel queries, evolving a table schema, and using cloud-based S3 data with Duck Lake.

View original article →


🇸🇦 العربية

بناء بحيرة بيانات (Data Lakehouse) باستخدام DuckDB و DuckLake

منذ سنوات عديدة، إذا كنت تريد تخزين كميات كبيرة من البيانات يمكن الاستعلام عنها بشكل معقول، كان قاعدة بيانات مثل Oracle أو Postgres هي خيارك الرئيسي. كان التطور الكبير التالي هو مستودع البيانات، تلاها بحيرة البيانات. سمحت بحيرات البيانات للمؤسسات بتخزين أحجام أكبر بكثير من البيانات الخام المهيكلة وشبه المهيكلة وغير المهيكلة بتكلفة رخيصة. تفرض شركات مثل Databricks و Snowflake و AWS رسومًا باهظة، لكن يمكنك تطوير بحيرة بيانات فعالة بتكلفة قريبة من الصفر باستخدام DuckDB وإضافة DuckLake.

كلا من DuckDB و DuckLake مرخصان بموجب رخصة MIT، ومفتوحا المصدر، ومجانيان للاستخدام. تم تطوير DuckLake من قبل فريق DuckDB، ويدير البيانات الوصفية في قاعدة بيانات علائقية بدلاً من الملفات الموجودة بجانب بيانات Parquet.

توضح المقالة إنشاء بحيرة DuckLake محلية، وفحص البيانات الوصفية، واستعلامات السفر عبر الزمن، وتطوير مخطط الجدول، واستخدام بيانات S3 المستندة إلى السحابة مع DuckLake.

الكيانات الرئيسية: الشركات: Oracle، Databricks، Snowflake، AWS

ما هو DuckLake؟

DuckLake هو إضافة مجانية ومفتوحة المصدر لـ DuckDB تدير بيانات بحيرة البيانات الوصفية في قاعدة بيانات علائقية بدلاً من بجانب ملفات Parquet، مما يتيح استعلامات السفر عبر الزمن وتطور المخطط.

العربية version →


🇧🇩 বাংলা

DuckDB এবং DuckLake দিয়ে ডেটা লেকহাউস তৈরি

অনেক বছর আগে, যদি আপনি বড় পরিমাণে ডেটা সংরক্ষণ করতে চান যেগুলো যুক্তিসঙ্গতভাবে কোয়েরি করা যায়, তবে Oracle বা Postgres-এর মতো ডেটাবেস আপনার প্রধান পছন্দ ছিল। পরবর্তী বড় অগ্রগতি ছিল ডেটা ওয়ারহাউস, তারপর ডেটা লেক। ডেটা লেক সংস্থাগুলোকে কাঁচা স্ট্রাকচার্ড, সেমি-স্ট্রাকচার্ড এবং আনস্ট্রাকচার্ড ডেটার অনেক বড় আকার সংরক্ষণ করার অনুমতি দেয় সস্তে। Databricks, Snowflake, এবং AWS-এর মতো কোম্পানিগুলো ভारी ফি চার্জ করে, কিন্তু আপনি DuckDB এবং DuckLake এক্সটেনশনের সাথে প্রায় শূন্য খরচে একটি কার্যকর ডেটা লেক विकশিত করতে পারেন।

DuckDB এবং DuckLake উভয়ই MIT-লাইসেন্সড, ওপেন-সোর্স, এবং ব্যবহার করার জন্য নিখরচে। DuckLake, DuckDB টিম দ্বারা বিকশিত, Parquet ডেটার সাথে সহ-অবস্থিত ফাইলগুলির পরিবর্তে একটি রিলেশনাল ডেটাবেসে মেটাডেটা পরিচালনা করে।

লেখাটি একটি লোকাল DuckLake তৈরি করার মাধ্যমে, মেটাডেটা পরীক্ষা করার মাধ্যমে, টাইম-ট্রাভেল কোয়েরি, একটি টেবিল স্কিমা বিকাশ করার মাধ্যমে, এবং DuckLake-এর সাথে ক্লাউড-ভিত্তিক S3 ডেটা ব্যবহার করার মাধ্যমে চলে।

মূল エンティটি: কোম্পানিগুলো: Oracle, Databricks, Snowflake, AWS

DuckLake কী?

DuckLake হল DuckDB-এর জন্য একটি নিখরচে, ওপেন-সোর্স এক্সটেনশন যা ডেটা লেক মেটাডেটা একটি রিলেশনাল ডেটাবেসে পরিচালনা করে Parquet ফাইলগুলির পাশে না रहकर, টাইম-ট্রাভেল কোয়েরি এবং স্কিমা ইভোল্যুশন সক্ষম করে।

বাংলা version →


🇩🇪 Deutsch

Data Lakehouse mit DuckDB und DuckLake aufbauen

Vor vielen Jahren war eine Datenbank wie Oracle oder Postgres die Hauptwahl, wenn Sie große Datenmengen speichern wollten, die sinnvoll abgefragt werden konnten. Der nächste große Fortschritt war das Data Warehouse, gefolgt vom Data Lake. Data Lakes ermöglichten Organisationen, viel größere Mengen an rohen strukturierten, halbstrukturierten und unstrukturierten Daten günstig zu speichern. Unternehmen wie Databricks, Snowflake und AWS verlangen hohe Gebühren, aber Sie können mit DuckDB und der DuckLake-Erweiterung ein effektives Data Lake für fast null Kosten entwickeln.

Sowohl DuckDB als auch DuckLake sind MIT-lizenziert, Open Source und kostenlos nutzbar. DuckLake, entwickelt vom DuckDB-Team, verwaltet Metadaten in einer relationalen Datenbank statt in Dateien, die zusammen mit Parquet-Daten abgelegt sind.

Der Artikel führt durch die Erstellung eines lokalen DuckLake, die Untersuchung von Metadaten, Time-Travel-Abfragen, die Weiterentwicklung eines Tabellenschemas und die Nutzung cloud-basierter S3-Daten mit DuckLake.

Wichtige Entitäten: Unternehmen: Oracle, Databricks, Snowflake, AWS

Was ist DuckLake?

DuckLake ist eine kostenlose Open-Source-Erweiterung für DuckDB, die Data-Lake-Metadaten in einer relationalen Datenbank statt neben Parquet-Dateien verwaltet und so Time-Travel-Abfragen und Schema-Evolution ermöglicht.

Deutsch version →


🇪🇸 Español

Construyendo un Lakehouse de Datos con DuckDB y DuckLake

Hace muchos años, si quería almacenar grandes cantidades de datos que pudieran consultarse de manera sensata, una base de datos como Oracle o Postgres era su principal opción. El siguiente gran avance fue el almacén de datos, seguido por el lago de datos. Los lagos de datos permitieron a las organizaciones almacenar volúmenes mucho mayores de datos estructurados, semiestructurados y no estructurados en bruto de forma barata. Empresas como Databricks, Snowflake y AWS cobran mucho, pero puede desarrollar un lago de datos efectivo por casi cero costo con DuckDB y la extensión DuckLake.

Tanto DuckDB como DuckLake tienen licencia MIT, son de código abierto y gratuitos. DuckLake, desarrollado por el equipo de DuckDB, gestiona los metadatos en una base de datos relacional en lugar de en archivos colocados junto a los datos Parquet.

El artículo recorre la creación de un DuckLake local, el examen de metadatos, consultas de viaje en el tiempo, la evolución del esquema de una tabla y el uso de datos S3 basados en la nube con DuckLake.

Entidades clave: Empresas: Oracle, Databricks, Snowflake, AWS

¿Qué es DuckLake?

DuckLake es una extensión gratuita y de código abierto para DuckDB que gestiona los metadatos del lago de datos en una base de datos relacional en lugar de junto a los archivos Parquet, lo que permite consultas de viaje en el tiempo y evolución de esquemas.

Español version →


🇫🇷 Français

Construire un Lakehouse de Données avec DuckDB et DuckLake

Il y a de nombreuses années, si vous vouliez stocker de grandes quantités de données pouvant être interrogées de manière sensée, une base de données comme Oracle ou Postgres était votre choix principal. La prochaine grande avancée a été l'entrepôt de données, suivi du lac de données. Les lacs de données ont permis aux organisations de stocker des volumes beaucoup plus importants de données brutes structurées, semi-structurées et non structurées à moindre coût. Des entreprises comme Databricks, Snowflake et AWS facturent cher, mais vous pouvez développer un lac de données efficace pour un coût proche de zéro avec DuckDB et l'extension DuckLake.

DuckDB et DuckLake sont tous deux sous licence MIT, open source et gratuits. DuckLake, développé par l'équipe de DuckDB, gère les métadonnées dans une base de données relationnelle au lieu de fichiers co-localisés avec les données Parquet.

L'article parcourt la création d'un DuckLake local, l'examen des métadonnées, les requêtes de voyage dans le temps, l'évolution du schéma d'une table et l'utilisation de données S3 basées sur le cloud avec DuckLake.

Entités clés : Entreprises : Oracle, Databricks, Snowflake, AWS

Qu'est-ce que DuckLake ?

DuckLake est une extension gratuite et open source pour DuckDB qui gère les métadonnées du lac de données dans une base de données relationnelle au lieu de les placer à côté des fichiers Parquet, permettant les requêtes de voyage dans le temps et l'évolution de schéma.

Français version →


🇮🇳 हिन्दी

DuckDB और DuckLake के साथ डेटा लेकहाउस बनाना

कई साल पहले, यदि आप बड़ी मात्रा में डेटा संग्रहीत करना चाहते थे जिसे समझदारी से क्वेरी किया जा सके, तो Oracle या Postgres जैसा डेटाबेस आपका मुख्य विकल्प था। अगली बड़ी प्रगति डेटा वेयरहाउस थी, जिसके बाद डेटा लेक आया। डेटा लेक ने संगठनों को कच्चे संरचित, अर्ध-संरचित और असंरचित डेटा के बहुत बड़े संस्करणों को सस्ते में संग्रहीत करने की अनुमति दी। Databricks, Snowflake, और AWS जैसी कंपनियां भारी शुल्क लेती हैं, लेकिन आप DuckDB और DuckLake एक्सटेंशन के साथ लगभग शून्य लागत पर एक प्रभावी डेटा लेक विकसित कर सकते हैं।

DuckDB और DuckLake दोनों MIT-लाइसेंस प्राप्त, ओपन-सोर्स और उपयोग करने के लिए मुफ़्त हैं। DuckLake, DuckDB टीम द्वारा विकसित, मेटाडेटा को Parquet डेटा के साथ सह-स्थित फ़ाइलों के बजाय एक रिलेशनल डेटाबेस में प्रबंधित करता है।

लेख एक स्थानीय DuckLake बनाने, मेटाडेटा की जांच करने, टाइम-ट्रैवल क्वेरी, एक टेबल स्कीमा को विकसित करने, और DuckLake के साथ क्लाउड-आधारित S3 डेटा का उपयोग करने के माध्यम से चलता है।

मुख्य संस्थाएं: कंपनियां: Oracle, Databricks, Snowflake, AWS

DuckLake क्या है?

DuckLake, DuckDB के लिए एक मुफ़्त, ओपन-सोर्स एक्सटेंशन है जो डेटा लेक मेटाडेटा को Parquet फ़ाइलों के साथ-साथ के बजाय एक रिलेशनल डेटाबेस में प्रबंधित करता है, जिससे टाइम-ट्रैवल क्वेरी और स्कीमा इवोल्यूशन सक्षम होती है।

हिन्दी version →


🇮🇩 Bahasa Indonesia

Membangun Data Lakehouse dengan DuckDB dan DuckLake

Bertahun-tahun yang lalu, jika Anda ingin menyimpan sejumlah besar data yang dapat dikueri dengan masuk akal, database seperti Oracle atau Postgres adalah pilihan utama Anda. Kemajuan besar berikutnya adalah gudang data, diikuti oleh danau data. Danau data memungkinkan organisasi untuk menyimpan volume data mentah terstruktur, semi-terstruktur, dan tidak terstruktur yang jauh lebih besar dengan biaya murah. Perusahaan seperti Databricks, Snowflake, dan AWS mengenakan biaya tinggi, tetapi Anda dapat mengembangkan danau data yang efektif dengan biaya hampir nol menggunakan DuckDB dan ekstensi DuckLake.

Baik DuckDB maupun DuckLake dilisensikan MIT, open source, dan gratis digunakan. DuckLake, yang dikembangkan oleh tim DuckDB, mengelola metadata di database relasional, bukan di file yang ditempatkan bersama data Parquet.

Artikel ini memandu pembuatan DuckLake lokal, pemeriksaan metadata, kueri time-travel, mengembangkan skema tabel, dan menggunakan data S3 berbasis cloud dengan DuckLake.

Entitas Kunci: Perusahaan: Oracle, Databricks, Snowflake, AWS

Apa itu DuckLake?

DuckLake adalah ekstensi gratis dan open source untuk DuckDB yang mengelola metadata data lake di database relasional, bukan di samping file Parquet, memungkinkan kueri time-travel dan evolusi skema.

Bahasa Indonesia version →


🇯🇵 日本語

DuckDB と DuckLake でデータレイクハウスを構築する

長い前、大量のデータを合理的にクエリ可能な形で保存したい場合、Oracle や Postgres のようなデータベースが主な選択肢でした。次の大きな進歩はデータウェアハウス、そしてデータレイクでした。データレイクにより、組織は構造化、半構造化、非構造化の生データを大量に安価に保存できるようになりました。Databricks、Snowflake、AWS などの企業は高額な料金を請求しますが、DuckDB と DuckLake 拡張を使えば、ほぼゼロコストで効果的なデータレイクを開発できます。

DuckDB と DuckLake はともに MIT ライセンスで、オープンソース、無料で利用できます。DuckLake は DuckDB チームによって開発され、Parquet データと共に配置されるファイルではなく、リレーショナルデータベースでメタデータを管理します。

この記事では、ローカル DuckLake の作成、メタデータの確認、タイムトラベルクエリ、テーブルスキーマの進化、クラウドベースの S3 データを DuckLake で使用する方法を説明します。

主要エンティティ: 企業: Oracle、Databricks、Snowflake、AWS

DuckLake とは何ですか?

DuckLake は DuckDB 用の無料・オープンソース拡張で、データレイクのメタデータを Parquet ファイルと共存させる代わりにリレーショナルデータベースで管理し、タイムトラベルクエリとスキーマ進化を可能にします。

日本語 version →


🇧🇷 Português

Construindo um Lakehouse de Dados com DuckDB e DuckLake

Há muitos anos, se você quisesse armazenar grandes quantidades de dados que pudessem ser consultados de forma sensata, um banco de dados como Oracle ou Postgres era sua principal escolha. O próximo grande avanço foi o data warehouse, seguido pelo data lake. Data lakes permitiram que organizações armazenassem volumes muito maiores de dados brutos estruturados, semiestruturados e não estruturados de forma barata. Empresas como Databricks, Snowflake e AWS cobram caro, mas você pode desenvolver um data lake eficaz por quase zero custo com DuckDB e a extensão DuckLake.

Tanto DuckDB quanto DuckLake são licenciados sob MIT, open source e gratuitos. DuckLake, desenvolvido pela equipe do DuckDB, gerencia metadados em um banco de dados relacional em vez de arquivos co-localizados com dados Parquet.

O artigo percorre a criação de um DuckLake local, examinando metadados, consultas de viagem no tempo, evoluindo o esquema de uma tabela e usando dados S3 baseados na nuvem com DuckLake.

Entidades-chave: Empresas: Oracle, Databricks, Snowflake, AWS

O que é DuckLake?

DuckLake é uma extensão gratuita e open source para DuckDB que gerencia metadados de data lake em um banco de dados relacional em vez de junto a arquivos Parquet, permitindo consultas de viagem no tempo e evolução de esquema.

Português version →


🇷🇺 Русский

Построение Data Lakehouse с DuckDB и DuckLake

Многие годы назад, если вы хотели хранить большие объемы данных, которые можно было бы осмысленно запрашивать, база данных вроде Oracle или Postgres была вашим главным выбором. Следующим большим шагом стало хранилище данных, за которым последовало озеро данных. Озера данных позволили организациям хранить гораздо большие объемы сырых структурированных, полуструктурированных и неструктурированных данных дешево. Компании вроде Databricks, Snowflake и AWS взимают высокую плату, но вы можете разработать эффективное озеро данных почти за нулевую стоимость с DuckDB и расширением DuckLake.

И DuckDB, и DuckLake лицензированы по MIT, являются открытым исходным кодом и бесплатны для использования. DuckLake, разработанный командой DuckDB, управляет метаданными в реляционной базе данных вместо файлов, расположенных рядом с данными Parquet.

Статья проводит через создание локального DuckLake, изучение метаданных, time-travel запросы, эволюцию схемы таблицы и использование облачных данных S3 с DuckLake.

Ключевые сущности: Компании: Oracle, Databricks, Snowflake, AWS

Что такое DuckLake?

DuckLake — это бесплатное расширение с открытым исходным кодом для DuckDB, которое управляет метаданными озера данных в реляционной базе данных вместо хранения рядом с файлами Parquet, что позволяет выполнять time-travel запросы и эволюцию схемы.

Русский version →


🇨🇳 简体中文

使用 DuckDB 与 DuckLake 构建数据湖仓

多年前,如果您想要存储大量可合理查询的数据,Oracle 或 Postgres 等数据库是您的主要选择。下一个重大进展是数据仓库,随后是数据湖。数据湖允许组织廉价地存储更大体量的原始结构化、半结构化和非结构化数据。Databricks、Snowflake 和 AWS 等公司收费高昂,但您可以使用 DuckDB 和 DuckLake 扩展以近乎零成本开发高效的数据湖。

DuckDB 和 DuckLake 均采用 MIT 许可证,开源且免费使用。DuckLake 由 DuckDB 团队开发,在关系型数据库中管理元数据,而非与 Parquet 数据共同存放在文件中。

本文将演示创建本地 DuckLake、检查元数据、时间旅行查询、演进表模式,以及将 DuckLake 与基于云的 S3 数据配合使用。

关键实体:公司:Oracle、Databricks、Snowflake、AWS

什么是 DuckLake?

DuckLake 是一个免费的开源扩展,用于 DuckDB,它在关系型数据库中管理数据湖元数据,而不是与 Parquet 文件一起存放,从而支持时间旅行查询和模式演进。

简体中文 version →