HeadlinesBriefing favicon HeadlinesBriefing.com

OpenAI Siap Mengikuti Jev dengan Cepat

Hacker News •
×

Jev dari Type Safe memperkenalkan versi baru model bahasa besar yang menggemparkan dunia AI. Menurut Vercel, "Jev diadopsi lebih cepat daripada model lain mana pun dalam sejarah AI Gateway." Tetapi awan mulai terbentuk. OpenAI tidak diragukan lagi memperhatikan – dan memutuskan apa yang harus dilakukan selanjutnya. Saya mendoakan yang terbaik untuk Type Safe, tetapi jika mereka benar-benar memenuhi janji mereka, maka saya khawatir OpenAI berada dalam posisi yang baik untuk mengikuti dengan cepat – tidak hanya untuk mereplikasi produk unggulan Jev, tetapi juga untuk memasukkan kemampuan itu ke dalam model dan agen mendatang dan menawarkan perilaku baru yang benar-benar berguna yang tidak dapat direproduksi oleh Jev.

OpenAI selama bertahun-tahun menggunakan LLM mereka sebagai pengklasifikasi implisit; mereka hanya belum melatihnya untuk tugas klasifikasi umum dan belum mengemas klasifikasi umum sebagai produk mandiri. Jika OpenAI dapat mereplikasi pelatihan tersebut, maka mereka akan dapat mereplikasi Jev dalam waktu singkat. Selain itu, OpenAI berada dalam posisi untuk menggunakan pengklasifikasi baru ini di dalam model dan agen yang ada, yang dapat berguna untuk pemilihan model cepat, pemikiran yang lebih efisien, guardrail keamanan yang lebih baik, dan model yang umumnya lebih cerdas, lebih cepat, dan lebih murah.

Faktor kunci yang menentukan semua ini adalah apakah Type Safe memiliki parit. Parit terbesar yang saya lihat ada pada data pelatihan dan proses pelatihan Type Safe. Asumsi utama saya adalah Jev menggunakan sesuatu yang cukup dekat dengan model bahasa besar konvensional. Sebagai bukti, Latent Space melaporkan bahwa banyak klon awal memang berbasis LLM. Diberikan keadaan dan serangkaian pertanyaan, LLM Jev menghasilkan satu token atau, lebih tepatnya, menghasilkan distribusi probabilitas atas semua token berikutnya yang mungkin. Logprob yang terkait dengan setiap token yang mungkin pada langkah itu kemudian diolah menjadi format apa pun yang perlu dikembalikan oleh Jev. Untuk pertanyaan noul, Jev hanya melihat dua token, true dan false, mengabaikan yang lain, dan menormalkan probabilitasnya menjadi satu probabilitas bahwa jawabannya true. Untuk pertanyaan pilihan, Jev dapat diminta dengan daftar kemungkinan dan melihat probabilitas relatif dari token tersebut untuk membangun distribusi penuh, memilih yang tertinggi sebagai pemenang. Pola pilihan hampir sama dengan yang saya blog pada tahun 2025 di Supercharging LLM Classifications with Logprobs, dan bahkan tanpa fine-tuning sudah menunjukkan harapan. Saya belum memikirkan secara mendalam tentang primitif score, tetapi saya menduga itu adalah varian dari pola yang sama. Bagian dari premis posting ini adalah bahwa OpenAI mungkin siap memanfaatkan ide ini dengan cepat, dan ini menjadi lebih jelas jika Anda memahami caranya. OpenAI telah menggunakan model bahasa besar secara implisit sebagai pengklasifikasi khusus setidaknya sejak diperkenalkannya pemanggilan alat. Pada awal 2024 saya menulis Tool Invocation – Demonstrating the Marvel of GPT's Flexibility, di mana saya membujuk model GPT untuk mengungkapkan bagaimana tepatnya ia memutuskan untuk memanggil alat. Berikut adalah tampilan sesi obrolan secara internal. Di sini ada pesan pengguna, lalu respons asisten tanpa pemanggilan alat diikuti oleh pesan pengguna dengan pemanggilan alat: Saya memberi kode warna pada teks untuk menunjukkan batas token. Jika Anda belum pernah melihat Chat ML sebelumnya, itu adalah bahasa markup internal yang diperkenalkan OpenAI untuk mengatur prompt percakapan pengguna-agen. dan adalah token yang dicadangkan yang membatasi pesan, dan token pertama setelah mengidentifikasi pembicara, baik pengguna atau asisten. Tepat setelah assistant, ve...