HeadlinesBriefing favicon HeadlinesBriefing.com

Fireworks lança Ember-1: Modelo Kimi K3 eficiente

Hacker News •
×

Ember-1 é um novo modelo especializado da Fireworks Research que oferece a qualidade de Kimi K3 com 40% menos tokens. Construído sobre Kimi K3, ele aprendeu a cortar o raciocínio desnecessário enquanto preserva o pensamento essencial. Testado em benchmarks externos, testes A/B ao vivo com clientes e cargas de trabalho internas de codificação e agentes, a qualidade permaneceu consistente.

Disponível hoje, Ember-1 lança uma série de modelos especializados moldados pelas necessidades dos desenvolvedores. A Fireworks Research desenvolveu Ember-1 após os usuários solicitarem as capacidades de codificação de Kimi K3 a menor custo, já que longas sequências de raciocínio tornaram a codificação automatizada cara em escala. Reduzir as configurações de esforço sacrificou muita qualidade, então a equipe se concentrou em treinar o modelo para raciocinar de forma mais eficiente.

Mais de 50 experimentos de treinamento e 200 avaliações foram realizados, levando a novos algoritmos de treinamento que encurtam o raciocínio sem perder precisão. O treinamento ocorreu na Fireworks Serverless Training, permitindo experimentação rápida, preços por uso e ciclos de pesquisa a lançamento mais rápidos. Ember-1 foi avaliado em diversas tarefas para garantir que as economias de tokens se transferissem para várias cargas de trabalho, e então validado no Specialized Intelligence Index, benchmarks públicos e tráfego de produção ao vivo.

O modelo aborda a ineficiência em modelos de raciocínio como Kimi K3, que gastam mais de 90% dos tokens em raciocínio interno em vez de respostas. Isso se torna caro em cargas de trabalho agenticas multi-turno, onde o raciocínio anterior é relido e refaturado. Ember-1 preserva a autocrítica útil enquanto elimina o raciocínio excessivo, usando feedback de tarefas e ambiente para aprender um raciocínio eficiente.

O treinamento abrangiu matemática, codificação, acompanhamento de instruções, conversa, busca, uso de ferramentas e engenharia de software, incluindo interações prolongadas. Os resultados confirmam que a qualidade foi mantida em sete benchmarks e no tráfego de produção de dois clientes.