HeadlinesBriefing favicon HeadlinesBriefing.com

Jev-ähnlicher LLM-Wrapper mit Vision-Modell-Unterstützung

Hacker News •
×

Ein Entwickler entdeckte Jev und self-hostbare Projekte wie Open Jev und Sem If, die einen alten Trick nutzen: LLM-Token-Wahrscheinlichkeiten auslesen. Die Methode beinhaltet das Erstellen von Prompts mit Zustand und Mehrfachwahlfragen, gefolgt von der Sendung von Chat Completions-Anfragen mit Parametern wie {"max_completion_tokens": 1, "logprobs": true, "top_logprobs": 20}, um Einzel-Token-Antworten mit alternativen Wahrscheinlichkeiten zu erhalten. Dieser Ansatz funktioniert auch mit Vision-Modellen.

Der Autor erweiterte Jevs Text/JSON-Format um ein attachments-Feld für Bilder in lokalen Experimenten. Sein Python-Example erfasst Kamerabilder, sendet base64 JPEGs und bewertet Sichtbarkeit von Personen, Innen-/Außenumgebung und Helligkeit. Mit Gemma 4 12B auf RTX 3090 erzielten sie ~1 Frame pro Sekunde mit drei Fragen pro Frame.

Open AIs gpt-6-luna erzielte ~0.2 FPS aufgrund separater Verbindungen. Die Flexibilität ermöglicht es, Bedingungen via plain text descriptions statt spezialisierter CV-Modelle zu ändern.