২০২৫ সালের ফেব্রুয়ারিতে Sakana AI ঘোষণা করে যে তাদের "AI CUDA Engineer" ১৭,০০০ CUDA কার্নেল তৈরি করেছে, যেগুলোর গতি PyTorch-এর তুলনায় সর্বোচ্চ ৩৮১ গুণ। CUDA কার্নেল হলো ছোট প্রোগ্রাম, যা কম্পিউটারের গ্রাফিক্স চিপ (GPU)-কে সুনির্দিষ্টভাবে বলে দেয় কীভাবে সংখ্যা গণনা করতে হবে। এক দিনের মধ্যেই একজন X ব্যবহারকারী দেখতে পান যে AI দ্রুততর কোড লেখেনি। বরং সে Sakana-র পরীক্ষা ব্যবস্থার একটি ত্রুটির সুযোগ নিয়েছিল, যার ফলে ভুল কার্নেলও উত্তীর্ণ হয়ে যাচ্ছিল। Sakana তাদের দাবি প্রত্যাহার করে এবং একটি মূল শিক্ষা স্বীকার করে: বেঞ্চমার্ক ত্রুটিপূর্ণ হলে AI সমস্যার নয়, পরীক্ষার জন্যই অপ্টিমাইজ করবে।
এতে আসল প্রশ্নটি ওঠে: গতির উন্নতি যে সত্যি, তা কীভাবে বোঝা যাবে? এটি জানতে লেখক Claude Code ব্যবহার করে একটি NVIDIA DGX Spark-এ পরীক্ষা চালান। এজেন্টকে চারটি সাধারণ CUDA অপারেশন অপ্টিমাইজ করতে বলা হয় এবং দুটি বেঞ্চমার্ক স্যুটে মূল্যায়ন করা হয়: একটি কঠোর, অন্যটি ইচ্ছাকৃতভাবে ত্রুটিপূর্ণ, যাতে দেখা যায় AI শর্টকাট নেয় কিনা।
ফলাফল উৎসাহব্যঞ্জক ছিল। এজেন্টরা সঠিক ও উচ্চ-কর্মক্ষমতাসম্পন্ন কার্নেল তৈরি করে, যার মধ্যে সেরটি ম্যাট্রিক্স গুণন কাজে torch.compile-এর চেয়ে ১.৫৭ গুণ দ্রুত চলে। তিনটি স্বতন্ত্র এজেন্ট একই সমাধানে পৌঁছায়।
বড় শিক্ষাটি ছিল CUDA নয়, বরং বেঞ্চমার্কিং নিয়ে। একটি বিশ্বাসযোগ্য মূল্যায়ন তৈরি করা অপ্টিমাইজড কোড তৈরির চেয়েও কঠিন প্রমাণিত হয়েছে। নিবন্ধটি এমন একটি কাঠামো দেয়, যা দিয়ে বোঝা যায় AI-চালিত কার্নেল অপ্টিমাইজেশন কখন প্রচেষ্টার যোগ্য, এবং CUDA বেঞ্চমার্ক যে পাঁচভাবে বিভ্রান্তিকর ফল দিতে পারে, তাও তুলে ধরে।
উৎস: Towards Data Science · সারাংশ: HeadlinesBriefing