HeadlinesBriefing favicon HeadlinesBriefing.com

DeepSeek-V4.1-Flash: Modelo de IA menor e mais rápido

Hacker News •
×

DeepSeek introduziu o DeepSeek-V4.1-Flash, o menor modelo de sua nova família de arquiteturas, que apresenta compreensão visual nativa e foi projetado para maior capacidade, inferência mais rápida e maior throughput. O modelo usa uma arquitetura assimétrica com MoE de 552B de parâmetros e um novo design Causal Encoder–Decoder, exigindo apenas 8B de parâmetros ativos para entrada e 16B para saída. Em comparação com a geração anterior, o V4.1-Flash reduz as necessidades de cache KV para 1/4 da HBM e 1/8 do armazenamento SSD, reduzindo significativamente os custos dos agentes ao comprimir as taxas de cache hit.

O modelo já está disponível na API da DeepSeek com suporte nativo multimodal; os usuários devem definir seu modelo como deepseek-flash. O V4-Flash e o V4-Flash-Vision-Exp foram aposentados, com roteamento temporário para o V4.1-Flash para garantir compatibilidade. A DeepSeek relata preços mais baixos na API devido à maior eficiência, repassando as economias aos usuários, e mantém preços de pico/fora de pico com taxas fora de pico em 50% das taxas de pico.

A empresa está colaborando com a comunidade de código aberto no suporte à inferência e explorando opções de implantação, convidando consultas para configurações em larga escala envolvendo 2.000 GPUs e clusters de armazenamento. O modelo está disponível no Hugging Face como deepseek-ai/DeepSeek-V4.1-Flash.