HeadlinesBriefing favicon HeadlinesBriefing.com

DeepSeek-V4.1-Flash: Model AI Lebih Kecil dan Lebih Cepat

Hacker News •
×

DeepSeek memperkenalkan DeepSeek-V4.1-Flash, model terkecil dalam keluarga arsitektur baru yang memiliki pemahaman visual asli dan dirancang untuk kapasitas yang lebih besar, inferensi yang lebih cepat, dan throughput yang lebih tinggi. Model ini menggunakan arsitektur asimetris dengan MoE berparameter 552B dan desain baru Causal Encoder–Decoder yang hanya memerlukan 8B parameter aktif untuk input dan 16B untuk output. Dibandingkan dengan generasi sebelumnya, V4.1-Flash mengurangi kebutuhan cache KV menjadi 1/4 dari HBM dan 1/8 dari penyimpanan SSD, secara signifikan menurunkan biaya agen melalui kompresi biaya cache hit.

Model ini sekarang langsung tersedia di API DeepSeek dengan dukungan multimodal asli; pengguna harus mengatur model mereka menjadi deepseek-flash. V4-Flash dan V4-Flash-Vision-Exp telah dicabut, dengan peralihan sementara ke V4.1-Flash untuk kompatibilitas. DeepSeek melaporkan harga API yang lebih rendah karena peningkatan efisiensi, dengan mengalihkan penghematan kepada pengguna, dan mempertahankan harga puncak/luar puncak dengan tarif luar puncak sebesar 50% dari tarif puncak.

Perusahaan ini bekerjasama dengan komunitas sumber terbuka untuk dukungan inferensi dan mengeksplorasi opsi penerapan, serta mengundang pertanyaan terkait penyiapan skala besar yang melibatkan 2.000 GPU dan kluster penyimpanan. Model ini tersedia di Hugging Face sebagai deepseek-ai/DeepSeek-V4.1-Flash.