HeadlinesBriefing favicon HeadlinesBriefing.com

Qwen 3.8 27B在Cerebras上1500 tokens/s

Hacker News •
×

Qwen 3.8 27B现已在Cerebras公共端点提供,吞吐量达1500 tokens/s。这些端点可通过免费试用和按需付费层级访问,受速率限制和定价约束。对于专用容量和生产SLA,Cerebras提供专用端点。

Cerebras公共端点上的所有模型均为原始未剪枝版本。该平台不在其共享API上托管剪枝模型。虽然Cerebras研究剪枝技术如REAP(路由器加权专家激活剪枝),但这些剪枝模型仅在Hugging Face上共享用于研究,不通过API提供服务。

Cerebras在存储期间使用选择性权重仅量化以保持质量。权重以部分16位/8位/4位格式存储,敏感层保持全精度并即时反量化。激活、注意力和KV缓存保持全精度且未量化。

Cerebras承诺提供原始模型,不进行架构更改。未来的压缩技术将作为具有特定名称的独立端点提供。REAP剪枝模型可在Hug Face上用于研究,但不用于生产。

关键实体:公司:Cerebras、Hugging Face