HeadlinesBriefing favicon HeadlinesBriefing.com

Guía práctica para empezar con dbt

Towards Data Science •
×

Como ingeniero de datos independiente, a veces experimento periodos de inactividad. Al buscar en el mercado en línea posibles puestos de trabajo, una de las habilidades más demandadas que veo constantemente es la experiencia con dbt. Para darme la mayor posibilidad posible de encontrar trabajo, decidí aprender todo lo necesario para hablar de dbt con seguridad. Este artículo destila ese proceso y lo talentoso, con una práctica abundante y ejemplos del mundo real. No tengo afiliación con dbt ni Duck DB; dbt Core es herramienta código abierto gratuito bajo Apache 2.0, y Duck DB tiene licencia MIT.

Los dbt proporcionan una amplia gama de capacidades, pero como introducción, me centréo en lo básico como modelos, fuentes, pruebas de datos y documentación. Si ha trabajado en proyectos de análisis, probablemente se ha encontrado con una carpeta llena de scripts SQL. Cuando comenzó todo, todo parece manejable, pero a medida que el proyecto crece, el cambio de un nombre de columna puede romper informes o trabajos posteriores. El SQL tradicional a menudo se trata como scripts independientes en lugar de un proyecto de software, y dbt ofrece una solución.

dbt (herramienta de construcción de datos) fue creada a mediados de 2010 pordbt Labs. Se convirtió en unCLI de código abierto llamado dbt Core y una versión de pago llamada dbt Platform. dbt transforma datos en bases de datos o almacenes, está muy unido aSnowflake, Big Query, Redshift y Databricks, y también que maneja la testing de calidad de datos, documentación de datasets, reutilización de SQL mediante macros, gestión de entornos y ejecución de transformaciones por trabajos o CI/CD. Mis ejemplos usan Duck DB local.

Entidades clave: Empresas: dbt Labs, Snowflake, Big Query, Redshift, Databricks