HeadlinesBriefing favicon HeadlinesBriefing.com

DeepSeek-V4.1-Flash:更小更快的 AI 模型

Hacker News •
×

DeepSeek 发布了 DeepSeek-V4.1-Flash,这是其新架构系列中最小的模型,具备原生视觉理解能力,旨在实现更高能力、更快推理和更高吞吐量。该模型采用不对称架构,包含 552B 参数的 MoE 和全新的 Causal Encoder–Decoder 设计,输入仅需 8B 活跃参数,输出需 16B。相比上一代,V4.1-Flash 将 KV 缓存需求降低至 HBM 的 1/4 和 SSD 存储的 1/8,通过压缩缓存命中费用显著降低代理成本。该模型现已在 DeepSeek API 上线,支持原生多模态;用户应将模型设置为 deepseek-flash。V4-Flash 和 V4-Flash-Vision-Exp 已退役,临时路由至 V4.1-Flash 以保证兼容性。DeepSeek 报告因效率提升而降低 API 价格,将节省传递给用户,并保持峰值/非峰值定价,非峰值费率为峰值的 50%。公司正与开源社区合作推理支持,并探索部署选项,欢迎就涉及 2,000 块 GPU 和存储集群的大规模部署进行咨询。该模型在 Hugging Face 上可用,路径为 deepseek-ai/DeepSeek-V4.1-Flash。