HeadlinesBriefing favicon HeadlinesBriefing.com

Caching Prompt GPT-6: AI Lebih Cepat & Murah

OpenAI Blog •
×

GPT-6 memperkenalkan sistem caching prompt yang ditingkatkan yang menawarkan tingkat cache hit yang lebih tinggi secara default dan diskon hingga 90% pada token input yang di-cache. Sistem ini menggunakan kembali prefix yang dibagikan dalam jendela 30 menit, mengurangi latensi dan biaya untuk tugas agen yang berjalan lama. Alat baru meliputi Dashboard Caching Prompt untuk memantau tingkat hit dan alat diagnostik untuk menganalisis cache miss dengan membandingkan permintaan dan mengidentifikasi perubahan pada model, alat, atau input.

Pengembang kini dapat menggunakan breakpoint cache eksplisit untuk memilih prefix prompt mana yang akan di-cache dan menyesuaikan usaha reasoning tanpa memecahkan cache. Untuk menjaga stabilitas cache, pertahankan definisi dan skema alat yang konsisten, gunakan allowed_tools untuk relevansi, dan tambahkan instruksi baru melalui pesan pengembang alih-alih menimpa yang lama. Prapemanasan menyiapkan konteks yang diketahui di awal, memindahkan pemrosesan dari waktu tunggu pengguna.

Kontrol opsional ini dibangun di atas performa default, memungkinkan pengembang menyesuaikan caching untuk beban kerja mereka. Mulailah dengan memantau tingkat hit, menyelidiki miss, dan mengikuti panduan caching prompt yang diperbarui atau menggunakan Codex untuk meninjau kode.