HeadlinesBriefing favicon HeadlinesBriefing.com

类似 Jev 的 LLM 包装器,支持视觉模型

Hacker News •
×

一位开发者发现了 Jev 以及类似 Open Jev 和 Sem If 的自托管项目,它们使用一种旧技巧:读取 LLM 的 token 概率。该方法通过精心设计包含状态和多选问题的提示词,然后发送带有参数(如 {"max_completion_tokens": 1, "logprobs": true, "top_logprobs": 20})的 Chat Completions 请求,从而获取单个 token 的答案及其备选概率。这种方法同样适用于视觉模型。作者通过在 Jev 的文本/JSON 格式中添加一个 attachments 字段来扩展其功能,用于在本地实验中附加图像。他们的 Python 示例捕获摄像头帧,发送 base64 编码的 JPEG 图像,并评估人物可见性、室内/室外场景以及亮度。在 RTX 3090 上使用 Gemma 4 12B,他们实现了每秒约 1 帧、每帧三个问题的处理速度。而 Open AI 的 gpt-6-luna 由于需要单独连接,仅达到约 0.2 FPS。这种灵活性允许通过纯文本描述而非专门的 CV 模型来改变条件。