HeadlinesBriefing HeadlinesBriefing.com

DeepSeek 视觉模型图像输入指南

Hacker News •
×

DeepSeek-v4-flash-vision-exp 模型接受图像和文本,支持描述、OCR 和图表分析。支持的格式包括 JPEG、PNG、GIF 和 WebP,通过文件内容检测。

通过 OpenAI 兼容的 Chat Completions API(基础 URL:https://api.deepseek.com)提供图像的三种方法。首先,base64 编码的内联图像直接嵌入请求中,计入 48 MiB 的请求体限制。其次,外部 HTTPS URL(最多 8192 字符)在 60 秒内下载最大 32 MiB 的图像。第三,Files API 上传一次图像(每个文件最多 64 MiB)并通过 `file_id` 引用,适合重复使用或大负载。

`detail` 参数(`low`、`high`、`original`、`auto`)控制 URL 输入的预处理。图像调整为约 800×800 等效分辨率,每张图像上限 384 token。限制包括每个请求 600 张图像,无 file_id 时总计 64 MiB(有 file_id 时 200 MiB),最大尺寸 8192 像素。

该模型也适用于 Anthropic 兼容的 `/messages` 端点和 OpenAI Responses API,使用类似的内容块结构。图像仅允许在用户消息中;其他模型会返回错误。

关键实体:公司:DeepSeek

来源: Hacker News · 由HeadlinesBriefing整理摘要