DuckDB 2.0 alpha теперь доступен и обеспечивает значительные улучшения производительности, особенно для запросов S3. На ноутбуке M5 один запрос занял 7,7 секунды по сравнению с 18,8 секундами в версии 1.5.5 — ускорение более чем в 2 раза. Ключевое улучшение — асинхронный I/O, который разделяет сетевые загрузки от работы CPU по декодированию. Вместо того чтобы работники последовательно загружались, ждали и декодировали, версия 2.0 использует выделенный пул загрузок, который держит десятки групп строк в полёте, в то время как работники сосредоточены исключительно на декодировании. Этот параллельный подход держит сеть и CPU заняты одновременно. Тест использовал Parquet-файл размером 2,2 GB из S3, содержащий 228 миллионов строк. Пользователи, строящие пайплайны, а не движки баз данных, заметят разницу при работе с облачным хранилищем. Полное тестирование требует понимания формы данных и подходов к моделированию. Запускайте собственные бенчмарки перед тем, как приводить результаты.
Источник: Hacker News · Сводку подготовил HeadlinesBriefing