HeadlinesBriefing favicon HeadlinesBriefing.com

Pipeline Data di AWS: Asumsi Lokal

Towards Data Science •
×

Selama berbulan-bulan, saya membangun pipeline data di mesin Windows saya menggunakan ingesi RSS di WSL2, Postgres di Docker, orkestrasi Kestra, dan transformasi dbt. Semuanya bekerja secara lokal karena semuanya berjalan di satu mesin. Memindahkannya ke AWS melalui CLI mengungkapkan asumsi tersembunyi.

Menyiapkan instansi EC2 t3.small dengan Ubuntu 22.04 mudah. Kejutan termasuk disk 8GB yang terlalu kecil, memerlukan growpart dan resize2fs, tetapi instansi Nitro yang lebih baru menamai drive sebagai `nvme0n1` bukan `xvda`. Instansi menjadi "terganggu" selama penarikan gambar Kestra, diperbaiki dengan menambahkan file swap 1GB. IP elastis dan pembatasan grup keamanan menambah tugas kecil.

Mentransfer pipeline dengan rsync, Docker, dan docker compose berhasil, tetapi aliran Kestra hidup di basis data internalnya, bukan di file, jadi aliran fetch_rss saya memerlukan penempelan YAML manual. Ini menonjolkan pola asumsi yang rusak satu per satu.

Tantangan sebenarnya bukan AWS itu sendiri, melainkan ketergantungan tersembunyi yang dibangun di atas asumsi "mesin yang sama", yang mengajari lebih banyak daripada pembangunan asli.