DuckDB 2.0 alpha ya está disponible y delivers mejoras significativas de rendimiento, especialmente para consultas S3. En una prueba con una laptop M5, una consulta tardó 7.7 segundos frente a 18.8 segundos en la versión 1.5.5 — una aceleración superior a 2x. El avance clave es la E/S asíncrona, que separa las descargas de red del trabajo de decodificación CPU.
En lugar de que los workers descarguen, esperen y decodifiquen secuencialmente, la versión 2.0 utiliza un pool de descarga dedicado que mantiene docenas de grupos de filas en vuelo mientras los workers se enfocan solo en decodificar. Este enfoque paralelo mantiene ocupados tanto la red como la CPU simultáneamente. La prueba usó un archivo Parquet de 2.2 GB desde S3 con 228 millones de filas.
Los usuarios que construyen pipelines en lugar de motores de base de datos notarán la diferencia más al trabajar con almacenamiento en la nube. La requisa completa requiere entender la forma de los datos y los enfoques de modelado. Ejecuta tus propios benchmarks antes de citar resultados.
Fuente: Hacker News · Resumido por HeadlinesBriefing