DeepSeek-v4-flash-vision-exp モデルはテキストとともに画像を受け入れ、説明、OCR、グラフ分析を可能にします。対応形式は JPEG、PNG、GIF、WebP で、ファイルの内容から検出されます。
OpenAI 互換の Chat Completions API(ベース URL: https://api.deepseek.com)を通じて画像を提供する 3 つの方法があります。第一に、base64 エンコードされたインライン画像がリクエストに直接埋め込まれ、48 MiB のリクエストボディ制限にカウントされます。第二に、外部 HTTPS URL(最大 8192 文字)が 60 秒以内に最大 32 MiB の画像をダウンロードします。第三に、Files API が画像を 1 回アップロード(ファイルあたり最大 64 MiB)し、`file_id` で参照します。これは再利用や大きなペイロードに最適です。
`detail` パラメータ(`low`、`high`、`original`、`auto`)は URL 入力の前処理を制御します。画像は約 800×800 相当にリサイズされ、画像あたり 384 トークンに制限されます。制限には、リクエストあたり 600 枚の画像、file_id なしで合計 64 MiB(file_id ありで 200 MiB)、最大寸法 8192 ピクセルが含まれます。
このモデルは、Anthropic 互換の `/messages` エンドポイントと OpenAI Responses API でも動作し、類似のコンテンツブロック形状を使用します。画像はユーザーメッセージでのみ許可され、他のモデルではエラーが返されます。
主要エンティティ: 企業: DeepSeek
出典: Hacker News · 要約:HeadlinesBriefing