HeadlinesBriefing favicon HeadlinesBriefing.com

DeepSeek-V4.1-Flash : Modèle d'IA plus petit et plus rapide

Hacker News •
×

DeepSeek a introduit DeepSeek-V4.1-Flash, le plus petit modèle de sa nouvelle famille d'architectures, présentant une compréhension visuelle native et conçu pour une capacité supérieure, une inférence plus rapide et un débit plus élevé. Le modèle utilise une architecture asymétrique avec un MoE de 552B de paramètres et un nouveau design Encodeur–Décodeur Causality, nécessitant seulement 8B de paramètres actifs pour l'entrée et 16B pour la sortie. Comparé à la génération précédente, V4.1-Flash réduit les besoins en cache KV à 1/4 de la HBM et 1/8 du stockage SSD, réduisant considérablement les coûts des agents en compressant les frais de cache hit.

Le modèle est désormais disponible sur l'API DeepSeek avec un support natif multimodal ; les utilisateurs doivent définir leur modèle sur deepseek-flash. V4-Flash et V4-Flash-Vision-Exp sont retirés, avec un routage temporaire vers V4.1-Flash pour assurer la compatibilité. DeepSeek rapporte des prix d'API plus bas grâce à une efficacité améliorée, en transmettant les économies aux utilisateurs, et maintient une tarification en pic/creux avec des tarifs crepus à 50% des tarifs pic.

L'entreprise collabore avec la communauté open-source pour le support d'inférence et explore des options de déploiement, en invitant les demandes pour des configurations à grande échelle impliquant 2 000 GPU et des clusters de stockage. Le modèle est disponible sur Hugging Face sous le nom deepseek-ai/DeepSeek-V4.1-Flash.