HeadlinesBriefing favicon HeadlinesBriefing.com

AWS-এ ডেটা পাইপলাইন: স্থানীয় অনুমান

Towards Data Science •
×

মাস ধরে, আমি আমার Windows মেশিনে WSL2-এ RSS ইনজেশন, Docker-এ Postgres, Kestra অর্কেস্ট্রেশন এবং dbt ট্রান্সফরমেশন ব্যবহার করে একটি ডেটা পাইপলাইন তৈরি করেছি। সবকিছু স্থানীয়ভাবে কাজ করছিল কারণ সবকিছু একই মেশিনে চলছিল। CLI-এর মাধ্যমে AWS-এ স্থানান্তর করলে লুকানো অনুমান প্রকাশ পায়।

Ubuntu 22.04 সহ একটি t3.small EC2 ইনস্ট্যান্স সেট আপ করা সহজ ছিল। বিস্ময়ের মধ্যে ছিল 8GB ডিস্ক যা খুব ছোট ছিল, যার জন্য growpart এবং resize2fs প্রয়োজন ছিল, কিন্তু নতুন Nitro ইনস্ট্যান্স ড্রাইভকে `xvda`-এর পরিবর্তে `nvme0n1` নাম দেয়। Kestra-এর ইমেজ টানার সময় ইনস্ট্যান্সটি "impaired" হয়ে গিয়েছিল, যা 1GB swap ফাইল যোগ করে ঠিক করা হয়। একটি Elastic IP এবং সিকিউরিটি গ্রুপের সীমাবদ্ধতা ছোট কাজ যোগ করেছিল।

rsync, Docker এবং docker compose দিয়ে পাইপলাইন স্থানান্তর কাজ করেছিল, কিন্তু Kestra-এর ফ্লো তার অভ্যন্তরীণ ডেটাবেসে থাকে, ফাইলে নয়, তাই আমার fetch_rss ফ্লো-তে ম্যানুয়াল YAML পেস্ট করা দরকার ছিল। এটি একটি প্যাটার্ন হাইলাইট করে যেখানে অনুমানগুলো একে একে ভাঙে।

প্রকৃত চ্যালেঞ্জ AWS নয়, বরং "একই মেশিন" অনুমানের উপর নির্মিত লুকানো নির্ভরতা, যা মূল নির্মাণের চেয়ে বেশি শেখায়।