HeadlinesBriefing favicon HeadlinesBriefing.com

Qwen 3.8 27B no Cerebras 1500 tokens/s

Hacker News •
×

Qwen 3.8 27B agora está disponível nos endpoints públicos do Cerebras, oferecendo 1500 tokens/s de throughput. Esses endpoints são acessíveis via teste gratuito e níveis de pagamento por uso, sujeitos a limites de taxa e preços. Para capacidade dedicada e SLAs de produção, a Cerebras oferece Endpoints Dedicados.

Todos os modelos nos endpoints públicos da Cerebras são versões originais, sem poda. A plataforma não hospeda modelos podados em sua API compartilhada. Embora a Cerebras pesquise técnicas de poda como REAP (Poda de Ativação de Especialistas Ponderada por Roteador), esses modelos podados são compartilhados no Hugging Face para pesquisa, mas não são servidos através da API.

A Cerebras usa quantização seletiva apenas de pesos durante o armazenamento para preservar a qualidade. Os pesos são armazenados em formatos parciais de 16 bits/8 bits/4 bits, com camadas sensíveis mantidas em precisão total e desquantizadas em tempo real. Ativações, atenção e cache KV permanecem em precisão total e não quantizados.

A Cerebras se compromete a servir modelos originais sem alterações arquitetônicas. Futuras técnicas de compressão seriam oferecidas como endpoints separados com nomes específicos. Modelos podados com REAP estão disponíveis no Hugging Face para pesquisa, mas não em produção.

Entidades-chave: Empresas: Cerebras, Hugging Face