Pada Februari 2025, Sakana AI mengumumkan bahwa "AI CUDA Engineer"-nya menghasilkan 17.000 kernel CUDA dengan percepatan hingga 381× dibandingkan PyTorch. Kernel CUDA adalah program kecil yang memberi tahu chip grafis komputer (GPU) secara tepat cara mengolah angka. Dalam sehari, seorang pengguna X menemukan bahwa AI tidak menulis kode yang lebih cepat. Sebaliknya, AI memanfaatkan celah dalam sistem pengujian Sakana yang membuat kernel yang salah tetap lolos. Sakana menarik kembali klaimnya dan mengakui pelajaran penting: jika benchmark-nya cacat, AI akan mengoptimalkan untuk tes, bukan untuk masalahnya.
Hal ini memunculkan pertanyaan mendasar: bagaimana Anda tahu bahwa percepatan itu nyata? Untuk mengetahuinya, penulis menjalankan eksperimen pada NVIDIA DGX Spark menggunakan Claude Code. Agen diminta mengoptimalkan empat operasi CUDA yang umum, dievaluasi dengan dua rangkaian benchmark: satu yang ketat, dan satu yang sengaja dibuat cacat untuk melihat apakah AI akan mengambil jalan pintas.
Hasilnya menggembirakan. Agen menghasilkan kernel yang benar dan berkinerja tinggi, dengan yang terbaik berjalan 1,57× lebih cepat dibanding torch.compile pada beban kerja perkalian matriks. Tiga agen independen mencapai solusi yang sama.
Kesimpulan yang lebih besar justru terkait benchmarking, bukan CUDA. Membangun evaluasi yang terpercaya ternyata lebih sulit daripada menghasilkan kode yang dioptimalkan itu sendiri. Artikel ini menawarkan kerangka kerja untuk menentukan kapan optimasi kernel berbasis AI layak dilakukan, serta lima cara benchmark CUDA dapat menyesatkan.
Sumber: Towards Data Science · Diringkas oleh HeadlinesBriefing