HeadlinesBriefing favicon HeadlinesBriefing.com

Qwen 3.8 27B en Cerebras 1500 tokens/s

Hacker News •
×

Qwen 3 3.8 27B ahora está disponible en los endpoints públicos de Cerebras, ofreciendo un rendimiento de 1500 tokens/s. Estos endpoints son accesibles mediante prueba gratuita y niveles de po por uso, sujetos a límites de velocidad y precios.. Para capacidad dedicada y SLA de producción, Cerebras ofrece Endpoints Dedicados.

Todos los modelos en los endpoints públicos de Cerebras son versiones originales, sin podar. La plataforma no aloja modelos podados en su API compartida. Aunque Cerebras investiga técnicas de pod como REAP (Poda de Activación de Expertos Ponderada por Router), estos modelos podados se comparten en Hugging Face para investigación pero no se sirven a través de la API.

Cerebras utiliza cuantización selectiva solo de pesos durante el almacenamiento para preservar la calidad. Los pesos se almacenan en formatos parciales de 16 bits/8 bits/4 bits, con capas sensibles se mantienen en precisión completa y se se des-cuantizan sobre la marcha. Las activaciones, la atención y el caché KV permanecen en precisión completa y sin cuantizar.

Cerebras se compromete a servir modelos originales sin cambios arquitectónicos. Las futuras técnicas de compresión se of ofrecerían como endpoints separados con nombres específicos. Los modelos podados con REAP están disponibles en Hugging Face para investigación, pero no en producción.

Entidades clave: Empresas: Cerebras, Hugging Face