HeadlinesBriefing favicon HeadlinesBriefing.com

Wrapper LLM mirip Jev dengan dukungan model vision

Hacker News •
×

Pengembang menemukan Jev dan proyek self-hosted seperti Open Jev dan Sem If, yang menggunakan trik lama: membaca probabilitas token LLM. Metode ini melibatkan pembuatan prompt dengan state dan pertanyaan pilihan multiple, kemudian mengirim permintaan Chat Completions dengan parameter seperti {"max_completion_tokens": 1, "logprobs": true, "top_logprobs": 20} untuk mendapatkan jawaban single-token dengan probabilitas alternatif. Pendekatan ini juga bekerja dengan model vision.

Penulis memperluas format teks/JSON Jev dengan menambahkan field attachments untuk gambar dalam eksperimen lokal. Contoh Python-nya mengambil frame kamera, mengirim JPEG base64, dan menilai visibilitas orang, setting (dalam/luar), dan kecerahan. Meng menggunakan Gemma 4 12B pada RTX 3090,他们 mencapai ~1 frame per detik dengan tiga pertanyaan per frame. gpt-6-luna dari Open AI mencapai ~0.2 FPS karena koneksi terpisah.

Fleksibilitas ini memungkinkan perubahan kondisi melalui deskripsi teks biasa daripada model CV khusus.