Dalam makalah mereka Frugal GPT, Lingjiao Chen, Matei Zaharia, dan James Zou menjelaskan tiga cara untuk memotong biaya memanggil model bahasa besar (LLM): adaptasi prompt, aproksimasi LLM, dan kaskade LLM. Para penulis melaporkan bahwa kaskade mereka mencoba model yang lebih murah terlebih dahulu dan dapat menyamai kinerja model individu terbaik dengan pengurangan biaya hingga 98 persen. Saya membangun agen kecil yang dapat saya periksa panggilan demi panggilan. Agen ini memeriksa daftar apartemen terhadap persyaratan penyewa, seperti kamar tidur dua di Austin di bawah $1.500 yang mengizinkan anjing. Versi pertama saya mengirim setiap daftar ke model yang kuat, bahkan ketika nama kota atau angka sewa sudah mengesampingkan daftar tersebut. Itu berarti 2.500 panggilan model untuk menemukan 101 kecocokan nyata.
Artikel ini mengukur tiga titik awal, bukan satu. Yang pertama mengirim setiap pasangan ke model. Yang kedua adalah agen yang sudah mencari berdasarkan kota. Yang ketiga menjalankan kueri basis data pada kota, kamar tidur, dan sewa sebelum model mana pun melihat daftar. Saya mengambil sampel tetap sebanyak 500 daftar dari kumpulan data publik iklan sewa Amerika Serikat tahun 2019. Saya menulis lima persyaratan penyewa dan memberi skor setiap versi agen terhadap jawaban yang sama. Model yang kuat adalah gpt-6-sol milik Open AI, yang saya sebut Sol, dan model yang lebih murah adalah gpt-6-luna, yang saya sebut Luna. Saya melacak setiap panggilan dengan Weights & Biases (W&B) Weave.
Dibandingkan dengan titik awal kueri basis data, versi akhir membutuhkan biaya sekitar 25 kali lebih murah. Perkiraan biaya adalah $0,008 dibandingkan $0,20 untuk 2.500 pemeriksaan yang sama, dan versi akhir mengembalikan semua 101 kecocokan tanpa kesalahan. Membiarkan kode menyelesaikan bidang hewan peliharaan menyumbang sekitar 44 persen dari penurunan itu, dan menggunakan model yang lebih murah dengan cadangan yang kuat menyumbang sekitar 39 persen. Prompt yang lebih pendek dan jawaban yang digunakan kembali menyumbang sisanya.
Tiga temuan mengejutkan saya. Kolom biaya Weave menunjukkan $0,0000 untuk setiap panggilan. Sol melewatkan kecocokan 10 kali dari 10 dengan daftar lengkap, dan menemukannya 10 kali dari 10 hanya dengan judul dan badan. Mengirim lebih sedikit teks memberikan jawaban yang lebih baik. Kedua model melaporkan kepercayaan diri 5 pada hampir setiap jawaban. Aturan yang meningkat di bawah 5 hampir tidak pernah terpicu, sehingga tidak dapat melakukan banyak pekerjaan. Artikel ini juga mengatakan di mana tes tersebut lemah. Hanya satu dari 101 kecocokan yang bergantung pada membaca teks, sehingga tes tersebut mengukur biaya jauh lebih baik daripada mengukur pemahaman.
Sumber: Towards Data Science · Diringkas oleh HeadlinesBriefing