HeadlinesBriefing favicon HeadlinesBriefing.com

Wrapper de LLM similar a Jev con soporte para modelos de visión

Hacker News •
×

Un desarrollador descubrió Jev y proyectos autohospedados como Open Jev y Sem If, que usan una técnica antigua: leer probabilidades de tokens de LLM. El método implica crear prompts con estado y preguntas de opción múltiple, luego enviar solicitudes Chat Completions con parámetros como {"max_completion_tokens": 1, "logprobs": true, "top_logprobs": 20} para obtener respuestas de un token con probabilidades alternativas. Este enfoque también funciona con modelos de visión.

El autor extendió el formato texto/JSON de Jev agregando un campo attachments para imágenes en experimentos locales. Su ejemplo Python captura frames de la cámara, envía JPEGs en base64 y evalúa la visibilidad de personas, entorno interior/exterior y brillo. Usando Gemma 4 12B en RTX 3090, lograron ~1 frame por segundo con tres preguntas por frame.

El gpt-6-luna de Open AI alcanzó ~0.2 FPS debido a conexiones separadas. La flexibilidad permite cambiar condiciones mediante descripciones de texto plano en lugar de modelos CV especializados.