HeadlinesBriefing favicon HeadlinesBriefing.com

Pipeline de données sur AWS : Hypothèses locales

Towards Data Science •
×

Pendant des mois, j'ai construit un pipeline de données sur ma machine Windows avec ingestion RSS dans WSL2, Postgres dans Docker, orchestration Kestra et transformations dbt. Tout fonctionnait localement car tout tournait sur une seule machine. Le déplacer vers AWS via CLI a révélé des hypothèses cachées.

Configurer une instance EC2 t3.small avec Ubuntu 22.04 était facile. Les surprises incluaient un disque de 8 Go trop petit, nécessitant growpart et resize2fs, mais les instances Nitro plus récentes nomment les lecteurs `nvme0n1` au lieu de `xvda`. L'instance est devenue "dégradée" pendant le tirage de l'image de Kestra, corrigé en ajoutant un fichier d'échange de 1 Go. Une adresse IP élastique et des restrictions de groupe de sécurité ont ajouté des tâches mineures.

Transférer le pipeline avec rsync, Docker et docker compose a fonctionné, mais les flux de Kestra vivent dans sa base de données interne, pas dans des fichiers, donc mon flux fetch_rss a nécessité un collage manuel de YAML. Cela a mis en évidence un modèle d'hypothèses qui se brisent une par une.

Le vrai défi n'était pas AWS lui-même, mais les dépendances cachées basées sur des hypothèses de "même machine", apprenant plus que la construction originale.