HeadlinesBriefing favicon HeadlinesBriefing.com

Apa itu RLCD? Rahasia di Balik Jev

Hacker News •
×

Dari pemodelan reward berpasangan hingga keputusan multi-arah yang dikalibrasi, Jev tampak misterius ketika dilihat sebagai alternatif dari model bahasa. Ini menjadi jauh lebih sederhana ketika dilihat sebagai langkah selanjutnya dalam pemodelan reward. Ide intinya adalah: RLCD = pemodelan preferensi multi-arah + kalibrasi probabilitas. Lebih spesifiknya, RLCD adalah tujuan Plackett–Luce yang dikondisikan skema. Jev mengubah tujuan itu menjadi produk dengan menambahkan keluaran yang diketik dan inferensi paralel. Itulah rahasianya: model reward tidak lagi tersembunyi di balik generator. Model reward menjadi model itu sendiri.

Pemodelan reward dimulai dengan skalar. Model reward konvensional menerima konteks dan jawaban kandidat, lalu menghasilkan skalar. Model reward hasil memberi skor pada jawaban akhir. Model reward proses memberi skor pada langkah penalaran individu. Dalam kedua kasus, objek yang dipelajari adalah angka yang tampak absolut. Masalahnya adalah angka ini sebenarnya tidak absolut. Reward 0.8 tidak memiliki makna yang stabil di seluruh masalah, kumpulan kandidat, checkpoint, atau keluarga model. Ini terutama berguna untuk membandingkan kandidat yang dihasilkan dalam kondisi serupa. Sinyal operasional selalu berupa preferensi relatif.

PPRM membuat preferensi menjadi eksplisit. Model Reward Preferensi Berpasangan LLaMA-Berry, atau PPRM, secara langsung mengekspos perbandingan. Diberikan masalah dan dua solusi, PPRM menjawab: Apakah jawaban pertama lebih baik dari jawaban kedua? Ini adalah model Bradley–Terry. LLaMA-Berry mengimplementasikan perbandingan sebagai keputusan model bahasa yang dibatasi pada token Ya dan Tidak. Ini melatih evaluator pada hampir 7,8 juta pasang solusi matematika dan menggunakan DPO untuk meningkatkan tugas prediksi berpasangan. Perubahan esensial bersifat konseptual: pemodelan reward menjadi pemodelan probabilitas preferensi.

Plackett–Luce adalah PPRM multi-arah. PPRM membandingkan dua kandidat. Antarmuka keputusan nyata biasanya menerima lebih dari dua. Tetapkan setiap kandidat utilitas yang bergantung pada konteks, lalu normalisasi semua kandidat bersama-sama. Ini adalah model pilihan Luce, juga dikenal sebagai logit multinomial. Ketika K=2, ia tereduksi persis menjadi Bradley–Terry. Oleh karena itu, PPRM adalah kasus biner dari geometri pilihan yang sama. Jika supervisi berisi peringkat lengkap, kemungkinan Plackett–Luce lengkap berulang kali memilih kandidat terbaik berikutnya yang tersisa.

Entitas Kunci: Perusahaan: LLaMA-Berry