HeadlinesBriefing favicon HeadlinesBriefing.com

DeepSeek-V4.1-Flash: Kleineres und schnelleres KI-Modell

Hacker News •
×

DeepSeek hat DeepSeek-V4.1-Flash eingeführt, das kleinste Modell seiner neuen Architekturfamilie, das ein natives visuelles Verständnis besitzt und für höhere Kapazität, schnellere Inferenz und höheren Durchsatz entwickelt wurde. Das Modell verwendet eine asymmetrische Architektur mit 552B-Parametern MoE und einem neuen Causal Encoder–Decoder-Design, das nur 8B aktive Parameter für die Eingabe und 16B für die Ausgabe erfordert. Im Vergleich zur vorherigen Generation reduziert V4.1-Flash den KV-Cache-Bedarf auf 1/4 des HBM und 1/8 des SSD-Speichers, wodurch die Agentenkosten durch Komprimierung der Cache-Hit-Gebühren deutlich gesenkt werden.

Das Modell ist jetzt live auf der DeepSeek API mit nativer multimodaler Unterstützung verfügbar; Benutzer sollten ihr Modell auf deepseek-flash setzen. V4-Flash und V4-Flash-Vision-Exp sind eingestellt, mit vorübergehender Weiterleitung an V4.1-Flash zur Sicherstellung der Kompatibilität. DeepSeek berichtet von niedrigeren API-Preisen aufgrund verbesserter Effizienz, gibt die Einsparungen an die Nutzer weiter und behält Spitzen-/Nebensaisonpreise bei, wobei die Nebensaisonpreise 50 % der Spitzenpreise betragen.

Das Unternehmen arbeitet mit der Open-Source-Community an der Inferenzunterstützung zusammen und untersucht Bereitstellungsoptionen, wobei Anfragen für groß angelegte Setups mit 2.000 GPUs und Speicherclustern willkommen geheißen werden. Das Modell ist auf Hugging Face unter deepseek-ai/DeepSeek-V4.1-Flash verfügbar.