Ini pertanyaan yang layak diajukan ke tim keuangan Anda: berapa sisa anggaran AI tahun ini? Untuk sejumlah perusahaan yang mengejutkan, jawaban jujurnya adalah "tidak banyak". Beberapa habis pada bulan April. Anggaran tahunan, habis dalam satu kuartal.
Alasan yang lebih besar adalah bagaimana kita menggunakannya. Kita telah beralih dari bertanya pada chatbot menjadi menjalankan agen. Dan agen tidak hanya menjawab.
Mereka memanggil alat, membaca file, memeriksa hasil, dan memanggil lebih banyak alat. Setiap langkah itu menghabiskan token. Satu permintaan agen bisa memakan biaya berkali-kali lipat dari pesan obrolan biasa.
Tidak membantu bahwa harga itu sendiri terus berubah. Ada langganan. Ada akses API bayar sesuai pemakaian.
Ada promosi yang muncul selama beberapa bulan untuk mencegah orang beralih, dan model tingkat atas baru yang muncul setiap beberapa bulan dengan titik harga mereka sendiri. Jadi sebelum kita masuk ke cara memotong tagihan, mari pastikan kita semua memahami apa yang sebenarnya kita bayar. Karena begitu Anda melihat cara kerja meteran, penghematan menjadi jelas.
Sebuah LLM memprediksi satu token pada satu waktu. Untuk setiap token, ia menjalankan tumpukan matematika. Untuk memprediksi token berikutnya, ia membutuhkan matematika untuk setiap token sebelumnya.
Berputar-putar, sampai menghasilkan token khusus "Saya selesai". Bayangkan setiap panggilan API sebagai jalan tol. Anda membayar untuk masuk (token input), dan Anda membayar untuk keluar (token output).
Output adalah jalur yang lebih mahal. Ambil contoh jajaran produk Anthropic. Claude Fable 5 berada di $10 per juta token masuk dan $50 per juta keluar. Itu selisih 10x antara model termurah dan termahal dari perusahaan yang sama.
Sekarang cari baris terkecil di lembar harga itu. Token yang di-cache berharga sepersepuluh dari token normal. Simpan angka itu di saku Anda.
Itu lebih berharga dari semua yang lain di artikel ini digabungkan. Tanpa caching, model membutuhkan seluruh percakapan setiap saat. Anda mengirim pesan satu.
Ia mengirim kembali pesan satu plus balasannya. Anda mengirim seluruhnya plus pesan tiga. Ia mengirim semua itu kembali plus balasan dua.
Sumber: Towards Data Science · Diringkas oleh HeadlinesBriefing