HeadlinesBriefing favicon HeadlinesBriefing.com

Обертка LLM, похожая на Jev, с поддержкой моделей vision

Hacker News •
×

Разработчик обнаружил Jev и саморазмещаемые проекты, такие как Open Jev и Sem If, которые используют старый трюк: чтение вероятностей токенов LLM. Метод включает составление промптов с состоянием и вопросами с множественным выбором, затем отправку запросов Chat Completions с параметрами, такими как {"max_completion_tokens": 1, "logprobs": true, "top_logprobs": 20}, для получения ответа из одного токена с альтернативными вероятностями. Этот подход также работает с vision-моделями. Автор расширил текстовый/JSON-формат Jev, добавив поле attachments для изображений в локальных экспериментах. Его пример на Python захватывает кадры камеры, отправляет JPEG в base64 и оценивает видимость людей, внутреннее/внешнее освещение и яркость. Используя Gemma 4 12B на RTX 3090, они достигли ~1 кадра в секунду с тремя вопросами на кадр. Gpt-6-luna от Open AI показала ~0.2 FPS из-за отдельных соединений. Гибкость позволяет изменять условия через описания на plain text, а не через специализированные CV-модели.