HeadlinesBriefing favicon HeadlinesBriefing.com

DeepSeek-V4.1-Flash: Меньшая и быстрее модель ИИ

Hacker News •
×

DeepSeek представила DeepSeek-V4.1-Flash — наименьшую модель в новой семействе архитектур, обладающую нативным визуальным пониманием и предназначенную для повышения возможностей, ускорения вывода и увеличения пропускной способности. Модель использует асимметричную архитектуру с MoE из 552B параметров и новую конструкцию Causal Encoder–Decoder, требующую только 8B активных параметров для входа и 16B для выхода. По сравнению с предыдущим поколением, V4.1-Flash снижает потребность в KV-кэше до 1/4 HBM и 1/8 SSD-хранилища, значительно снижая затраты на агентов за счет сжатия платы за попадание в кэш. Модель теперь доступна в API DeepSeek с нативной мультимодальной поддержкой; пользователям следует установить модель на deepseek-flash. V4-Flash и V4-Flash-Vision-Exp выведены из эксплуатации, с временной маршрутизацией на V4.1-Flash для обеспечения совместимости. DeepSeek сообщает о снижении цен на API благодаря повышенной эффективности, передавая экономию пользователям, и сохраняет пиковые/непиковые тарифы с непиковыми ставками в 50% от пиковых. Компания сотрудничает с сообществом открытого исходного кода по поддержке вывода и изучает варианты развертывания, приглашая запросы о крупномасштабных установках, включающих 2000 GPU и кластеры хранения. Модель доступна на Hugging Face как deepseek-ai/DeepSeek-V4.1-Flash.