HeadlinesBriefing HeadlinesBriefing.com

DeepSeek Vision-Modell Bild-Eingabeanleitung

Hacker News •
×

Das Modell DeepSeek-v4-flash-vision-exp akzeptiert Bilder neben Text, ermöglicht Beschreibung, OCR und Diagrammanalyse. Unterstützte Formate sind JPEG, PNG, GIF und WebP, erkannt anhand des Dateiinhalts.

Drei Methoden stellen Bilder über die OpenAI-kompatible Chat Completions API bereit (Basis-URL: https://api.deepseek.com). Erstens werden base64-kodierte Inline-Bilder direkt in Anfragen eingebettet und zählen zum 48 MiB Request-Body-Limit. Zweitens laden externe HTTPS-URLs (maximal 8192 Zeichen) Bilder bis 32 MiB innerhalb von 60 Sekunden herunter. Drittens lädt die Files API Bilder einmal hoch (bis 64 MiB pro Datei) und referenziert sie per `file_id`, ideal für Wiederverwendung oder große Payloads.

Ein `detail`-Parameter (`low`, `high`, `original`, `auto`) steuert die Vorverarbeitung für URL-Eingaben. Bilder werden auf ca. 800×800 Äquivalent skaliert, begrenzt auf 384 Token pro Bild. Limits umfassen 600 Bilder pro Anfrage, 64 MiB gesamt ohne file_id (200 MiB mit), und 8192 px maximale Dimension.

Das Modell funktioniert auch mit dem Anthropic-kompatiblen `/messages`-Endpunkt und der OpenAI Responses API, unter Verwendung analoger Content-Block-Formen. Bilder sind nur in Benutzernachrichten erlaubt; andere Modelle geben Fehler zurück.

Schlüsselentitäten: Unternehmen: DeepSeek

Quelle: Hacker News · Zusammengefasst von HeadlinesBriefing