HeadlinesBriefing favicon HeadlinesBriefing.com

DeepSeek-V4.1-Flash: より小さくより速い AI モデル

Hacker News •
×

DeepSeek は DeepSeek-V4.1-Flash を発表しました。これは新しいアーキテクチャーファミリーの中で最小のモデルで、ネイティブな視覚理解を備え、より高い能力、より高速な推論、より高いスループットのために設計されています。このモデルは、552B パラメータの MoE と新しい Causal Encoder–Decoder 設計を備えた非対称アーキテクチャを使用し、入力にはわずか 8B のアクティブパラメータ、出力には 16B が必要です。前世代と比較して、V4.1-Flash は KV キャッシュの必要量を HBM の 1/4 と SSD ストレージの 1/8 に削減し、キャッシュヒット料金を圧縮することでエージェントコストを大幅に低減します。このモデルは現在、ネイティブなマルチモーダルサポートを備えた DeepSeek API で利用可能です。ユーザーはモデルを deepseek-flash に設定する必要があります。V4-Flash と V4-Flash-Vision-Exp は退役し、互換性のために一時的に V4.1-Flash にルーティングされます。DeepSeek は効率の向上により API 価格を引き下げ、その節約をユーザーに還元するとともに、ピーク/オフピーク価格を維持し、オフピーク料金をピーク料金の 50% に設定しています。同社はオープンソースコミュニティと推論サポートでの協力を行い、導入オプションを検討しています。2,000 GPU とストレージクラスターを含む大規模なセットアップについてはお問い合わせください。このモデルは Hugging Face で deepseek-ai/DeepSeek-V4.1-Flash として利用可能です。