Pertama kali saya menggunakan agen pengodean, saya terpukau. Sebelum memakai agen, saya terus menyalin dan menempel antara IDE dan antarmuka chat AI. Melihat agen mengedit file secara langsung dan memperbaiki kesalahannya sendiri secara real time sungguh mengagumkan. Namun setelah beberapa hari, rasa antusias itu memudar karena sering muncul bug. Agen sepenuhnya berhenti merespons sampai saya memulai ulangnya, dan agen sering menyatakan tugas selesai padahal pekerjaan baru saja dimulai.
Saya mengira bahwa dalam enam bulan, agen akan sama mengesankannya secara teknis dengan LLM yang mendasarinya. Ternyata agen pengodean tetap buruk. Pengembangan berbantuan AI memang jelas maju, tetapi model yang melakukan sebagian besar pekerjaan berat, sementara agen tetap menjadi hambatan. Perbedaan ini penting: model, seperti GPT Astra, Claude Sonnet, atau GLM-5.3, menghasilkan teks dan kode, sedangkan agen, seperti Claude Code dari Anthropic atau Codex dari OpenAI, adalah perangkat lunak yang menghubungkan model itu dengan basis kode dan sistem komputer. Sebuah analogi menyebutkan bahwa model adalah otak dan agen adalah tubuh.
Keluhan terbesar adalah betapa buruknya agen dalam mengelola tugas. Dalam satu contoh, sebuah aplikasi web open-source membutuhkan fitur perlindungan kata sandi sekitar 1,5 ribu baris kode. Agen memecah pekerjaan menjadi 10 subtugas lalu menjalankannya satu per satu, padahal semuanya bisa berjalan paralel di komputer yang dirancang untuk multitasking. Claude Code hanya sedikit melakukan multitasking, menunggu subagen dan pengujian end-to-end selesai sebelum melanjutkan.
Agen juga tidak pandai mendelegasikan pekerjaan. Model canggih bisa menghabiskan waktu memindai 50 ribu baris kode untuk mencari pola tertentu, padahal model yang lebih murah dan cepat bisa menanganinya. Agen tidak pernah menyarankan pergantian model, sehingga pengguna harus mengatur pemilihan model secara manual, pekerjaan yang menurut penulis bisa dilakukan oleh LLM.
Sumber: Hacker News · Diringkas oleh HeadlinesBriefing