يقبل نموذج DeepSeek-v4-flash-vision-exp الصور مع النص، مما يتيح الوصف، OCR، وتحليل الرسوم البيانية. تتضمن التنسيقات المدعومة JPEG، PNG، GIF، و WebP، ويتم اكتشافها من محتوى الملف.
توفر ثلاث طرق الصور عبر واجهة برمجة تطبيقات Chat Completions المتوافقة مع OpenAI (عنوان URL الأساسي: https://api.deepseek.com). أولاً، الصور المضمنة المشفرة بـ base64 تُضمّن مباشرة في الطلبات، وتحسب ضمن حد 48 MiB لجسم الطلب. ثانياً، روابط HTTPS الخارجية (بحد أقصى 8192 حرفاً) تقوم بتنزيل صور تصل إلى 32 MiB خلال 60 ثانية. ثالثاً، واجهة برمجة تطبيقات Files ترفع الصور مرة واحدة (حتى 64 MiB لكل ملف) وتشير إليها بواسطة `file_id`، وهو مثالي لإعادة الاستخدام أو الأحمال الكبيرة.
تتحكم معلمة `detail` (`low`، `high`، `original`، `auto`) في المعالجة المسبقة لمدخلات URL. يتم تغيير حجم الصور إلى ما يعادل 800×800 تقريباً، بحد أقصى 384 توكن لكل صورة. تشمل الحدود 600 صورة لكل طلب، 64 MiB إجمالاً بدون file_id (200 MiB مع file_id)، وبُعد أقصى 8192 بكسل.
يعمل النموذج أيضاً مع نقطة نهاية `/messages` المتوافقة مع Anthropic و OpenAI Responses API، باستخدام أشكال كتل محتوى مماثلة. الصور مسموحة فقط في رسائل المستخدم؛ تُرجع النماذج الأخرى أخطاء.
الكيانات الرئيسية: الشركات: DeepSeek
المصدر: Hacker News · لخّصه HeadlinesBriefing