HeadlinesBriefing favicon HeadlinesBriefing.com

Wrapper LLM tipo Jev com suporte a modelos de visão

Hacker News •
×

Um desenvolvedor descobriu Jev e projetos auto-hospedados como Open Jev e Sem If, que usam um truque antigo: ler probabilidades de tokens de LLM. O método envolve criar prompts com estado e perguntas de múltipla escolha, depois enviar requisições Chat Completions com parâmetros como {"max_completion_tokens": 1, "logprobs": true, "top_logprobs": 20} para obter respostas de único token com probabilidades alternativas. Essa abordagem também funciona com modelos de visão.

O autor estendeu o formato texto/JSON do Jev adicionando um campo attachments para imagens em experimentos locais. Seu exemplo Python captura quadros da câmera, envia JPEGs em base64 e evaluates visibilidade de pessoas, ambiente (interior/exterior) e brilho. Usando Gemma 4 12B na RTX 3090, eles alcançaram ~1 quadro por segundo com três perguntas por quadro.

O gpt-6-luna da Open AI alcançou ~0.2 FPS devido a conexões separadas. A flexibilidade permite alterar condições via descrições de texto simples em vez de modelos CV especializados.