HeadlinesBriefing HeadlinesBriefing.com

डीपसीक विज़न मॉडल इमेज इनपुट गाइड

Hacker News •
×

DeepSeek-v4-flash-vision-exp मॉडल टेक्स्ट के साथ इमेज स्वीकार करता है, जिससे विवरण, OCR और चार्ट विश्लेषण सक्षम होता है। समर्थित फॉर्मेट में JPEG, PNG, GIF और WebP शामिल हैं, जो फ़ाइल कंटेंट से पहचाने जाते हैं।

OpenAI-संगत चैट कम्पलीशन API (बेस URL: https://api.deepseek.com) के माध्यम से इमेज प्रदान करने के तीन तरीके हैं। पहला, बेस64-एन्कोडेड इंलाइन इमेज सीधे रिक्वेस्ट में एम्बेड की जाती हैं, जो 48 MiB रिक्वेस्ट बॉडी लिमिट की ओर गिनी जाती हैं। दूसरा, बाहरी HTTPS URL (अधिकतम 8192 कैरेक्टर) 60 सेकंड में 32 MiB तक की इमेज डाउनलोड करते हैं। तीसरा, फाइल्स API इमेज को एक बार अपलोड करता है (प्रति फाइल 64 MiB तक) और `file_id` द्वारा संदर्भित करता है, जो पुन: उपयोग या बड़े पेलोड के लिए आदर्श है।

एक `detail` पैरामीटर (`low`, `high`, `original`, `auto`) URL इनपुट के लिए प्रीप्रोसेसिंग को नियंत्रित करता है। इमेज को लगभग 800×800 समकक्ष पर रिसाइज़ किया जाता है, प्रति इमेज 384 टोकन पर कैप किया जाता है। सीमाओं में प्रति रिक्वेस्ट 600 इमेज, 64 MiB कुल बिना file_id (file_id के साथ 200 MiB), और 8192 px अधिकतम आयाम शामिल हैं।

यह मॉडल Anthropic-संगत `/messages` एंडपॉइंट और OpenAI Responses API के साथ भी काम करता है, समान कंटेंट ब्लॉक आकार का उपयोग करके। इमेज केवल यूज़र मैसेज में अनुमत हैं; अन्य मॉडल त्रुटि लौटाते हैं।

मुख्य संस्थाएं: कंपनियां: DeepSeek

स्रोत: Hacker News · HeadlinesBriefing द्वारा सारांशित