HeadlinesBriefing favicon HeadlinesBriefing.com

Wrapper LLM similaire à Jev avec support des modèles de vision

Hacker News •
×

Un développeur a découvert Jev et des projets auto-hébergés comme Open Jev et Sem If, utilisant une vieille astuce : lire les probabilités des tokens LLM. La méthode implique de concevoir des prompts avec des états et des questions à choix multiples, puis d'envoyer des demandes Chat Completions avec des paramètres comme {"max_completion_tokens": 1, "logprobs": true, "top_logprobs": 20} pour obtenir des réponses d'un token avec des probabilités alternatives. Cette approche fonctionne également avec les modèles de vision.

L'auteur a étendu le format texte/JSON de Jev en ajoutant un champ attachments pour les images dans des expériences locales. Son exemple Python capture des images de la webcam, envoie des JPEG en base64 et évalue la visibilité des personnes, le cadre (indoors/outdoors) et la luminosité. En utilisant Gemma 4 12B sur RTX 3090, ils ont atteint ~1 image par seconde avec trois questions par image.

Le gpt-6-luna d'Open AI a atteint ~0.2 FPS en raison de connexions séparées. La flexibilité permet de changer les conditions via des descriptions textuelles plutôt que des modèles CV spécialisés.