HeadlinesBriefing favicon HeadlinesBriefing.com

vision モデル対応 Jev 类似 LLM ラッパー

Hacker News •
×

開発者が Jev と Open Jev や Sem If などの自己ホスト project を発見し、 ancient 手法: LLM トーカンの確率を読み取る。この手法では、状態と複数選択問題を含むプロンプトを作成し、{"max_completion_tokens": 1, "logprobs": true, "top_logprobs": 20} などのパラメータ付きで Chat Completions リクエストを送信して、単一トーカンの回答と代替確率を取得する。このアプローチは vision モデルでも機能する。著者は Jev のテキスト/JSON 形式に画像用の attachments フィールドを追加してロCALE実験で拡張した。Python の例では、カメラフレームをキャプチャし、base64 JPEG を送信し、人物の可視性、屋内/屋外設定、明るさを評価する。RTX 3090 上の Gemma 4 12B を使用して、1秒あたり約1フレーム、1フレームあたり3つの質問を達成した。Open AI の gpt-6-luna は別接続のため約0.2 FPS。柔軟性により、専用 CV モデルではなく、プレーンテキスト記述で条件を変更できる。