HeadlinesBriefing favicon HeadlinesBriefing.com

Qwen 3.8 27B di Cerebras 1500 token/detik

Hacker News •
×

Qwen 3.8 27B kini tersedia di endpoint publik Cerebras, memberikan throughput 1500 token/detik. Endpoint ini dapat diakses melalui tingkat uji coba gratis dan bayar sesuai pemakaian, dengan batas kecepatan dan harga yang berlaku. Untuk kapasitas khusus dan SLA produksi, Cerebras menawarkan Endpoint Khusus.

Semua model di endpoint publik Cerebras adalah versi asli tanpa pruning. Platform ini tidak meng-host model yang dipruning di API bersama. Meskipun Cerebras meneliti teknik pruning seperti REAP (Router-weighted Expert Activation Pruning), model yang dipruning ini dibagikan di Hugging Face untuk penelitian tetapi tidak dilayani melalui API.

Cerebras menggunakan kuantisasi selektif hanya-berat selama penyimpanan untuk menjaga kualitas. Bobot disimpan dalam format parsial 16-bit/8-bit/4-bit, dengan lapisan sensitif dipertahankan dalam presisi penuh dan didekuantisasi saat itu juga. Aktivasi, perhatian, dan cache KV tetap dalam presisi penuh dan tanpa kuantisasi.

Cerebras berkomitmen untuk melayani model asli tanpa perubahan arsitektur. Teknik kompresi masa depan akan ditawarkan sebagai endpoint terpisah dengan nama spesifik. Model yang dipruning REAP tersedia di Hugging Face untuk penelitian, tetapi tidak dalam produksi.

Entitas kunci: Perusahaan: Cerebras, Hugging Face