HeadlinesBriefing favicon HeadlinesBriefing.com

DeepSeek-V4.1-Flash: Modelo de IA más pequeño y rápido

Hacker News •
×

DeepSeek ha introducido DeepSeek-V4.1-Flash, el modelo más pequeño de su nueva familia de arquitecturas, que presenta comprensión visual nativa y está diseñado para mayor capacidad, inferencia más rápida y mayor rendimiento. El modelo utiliza una arquitectura asimétrica con MoE de 552B de parámetros y un nuevo diseño Causal Encoder–Decoder, que requiere solo 8B de parámetros activos para la entrada y 16B para la salida. En comparación con la generación anterior, V4.1-Flash reduce las necesidades de caché KV a 1/4 de HBM y 1/8 de almacenamiento SSD, reduciendo significativamente los costos de los agentes al comprimir las tarifas de caché acierto.

El modelo ya está en vivo en la API de DeepSeek con soporte nativo multimodal; los usuarios deben establecer su modelo en deepseek-flash. V4-Flash y V4-Flash-Vision-Exp están retirados, con enrutamiento temporal a V4.1-Flash para compatibilidad. DeepSeek informa de precios más bajos en la API debido a una mayor eficiencia, pasando los ahorros a los usuarios, y mantiene precios pico/fuera de pico con tarifas fuera de pico al 50% de las tarifas pico.

La empresa está colaborando con la comunidad de código abierto en el soporte de inferencia y explorando opciones de implementación, invitando a consultas para configuraciones a gran escala que involucren 2,000 GPUs y clústeres de almacenamiento. El modelo está disponible en Hugging Face como deepseek-ai/DeepSeek-V4.1-Flash.