HeadlinesBriefing favicon HeadlinesBriefing.com

विजन मॉडल समर्थन के साथ Jev-जैसा LLM रैपर

Hacker News •
×

एक डेवलपर ने Jev और स्व-होस्टेड प्रोजेक्ट्स जैसे Open Jev और Sem If की खोज की, जो पुरातन तरीके का उपयोग करते हैं: LLM टोकन की संभावनाएं पढ़ना। इस तरीके में राज्य और बहु-विकल्प प्रश्नों के साथ प्रॉम्पट तैयार किए जाते हैं, फिर Chat Completions अनुरोध {"max_completion_tokens": 1, "logprobs": true, "top_logprobs": 20} जैसे पैरामीटर्स के साथ भेजे जाते हैं ताकि एकल-टोकन उत्तर और विकल्प संभावनाएं मिल सकें। यह तरीका विजन मॉडल्स के साथ भी काम करता है। लेखक ने स्थानीय प्रयोगों में छवियों के लिए एक attachments फील्ड जोड़कर Jev के टेक्स्ट/JSON फॉर्मेट का विस्तार किया। उनका Python उदाहरण कैमरा फ्रेम कैप्चर करता है, base64 JPEG भेजता है, और व्यक्ति की दृश्यता, इंडोर/आउटडोर सेटिंग और चमक का मूल्यांकन करता है। RTX 3090 पर Gemma 4 12B का उपयोग करके, उन्होंने प्रति फ्रेम तीन प्रश्नों के साथ ~1 फ्रेम प्रति सेकंड हासिल किया। Open AI का gpt-6-luna अलग-अलग कनेक्शन के कारण ~0.2 FPS पर रहा। लचीलापूर्णता विशेष CV मॉडल्स के बजाय सादे टेक्ट्ट वर्णनों के माध्यम से परिस्थितियां बदलने की अनुमति देती है।