HeadlinesBriefing favicon HeadlinesBriefing.com

Qwen 3.8 27B sur Cerebras 1500 tokens/s

Hacker News •
×

Qwen 3.8 27B est désormais disponible sur les endpoints publics de Cerebras, offrant un débit de 1500 tokens/s. Ces endpoints sont accessibles via les niveaux d'essai gratuit et de paiement à l'utilisation, soumis à des limites de débit et à la tarification. Pour une capacité dédiée et des SLA de production, Cerebras propose des endpoints dédiés.

Tous les modèles sur les endpoints publics de Cerebras sont des versions originales, non élaguées. La plateforme n'héberge pas de modèles élagués sur son API partagée. Bien que Cerebras recherche des techniques d'élagage comme REAP (élagage d'activation d'experts pondéré par routeur), ces modèles élagués sont partagés sur Hugging Face pour la recherche mais ne sont pas servis via l'API.

Cerebras utilise une quantification sélective des poids uniquement pendant le stockage pour préserver la qualité. Les poids sont stockés dans des formats partiels 16 bits/8 bits/4 bits, avec des couches sensibles conservées en pleine précision et déquantifiées à la volée. Les activations, l'attention et le cache KV restent en pleine précision et non quantifiés.

Cerebras s'engage à servir des modèles originaux sans changements architecturaux. Les futures techniques de compression seraient proposées comme des endpoints séparés avec des noms spécifiques. Les modèles élagués REAP sont disponibles sur Hugging Face pour la recherche, mais pas en production.

Entités clés : Entreprises : Cerebras, Hugging Face