HeadlinesBriefing favicon HeadlinesBriefing.com

Fireworks startet Ember-1: Effizientes Kimi K3-Modell

Hacker News •
×

Ember-1 ist ein neues spezialisiertes Modell von Fireworks Research, das Kimi K3-Qualität mit 40% weniger Tokens bietet. Aufbauend auf Kimi K3, hat es gelernt, unnötige Schlüsse zu reduzieren, während es wesentliche Gedanken bewahrt. In externen Benchmarks, Live-Kunden-A/B-Tests und internen Codierungs- und Agenten-Workloads blieb die Qualität konsistent.

Heute verfügbar, startet Ember-1 eine Reihe spezialisierter Modelle, die durch Entwicklerbedürfnisse geformt sind. Fireworks Research entwickelte Ember-1 nachdem Benutzer die Codierungsfähigkeiten von Kimi K3 zu geringeren Kosten angefordert hatten, da lange Reasoning-Traces automatisierte Codierung auf großem Maßstab teuer gemacht haben. Die Reduzierung der Anstrengungseinstellungen opferte zu viel Qualität, daher konzentrierte sich das Team auf das Training des Modells, um effizienter zu argumentieren. Über 50 Trainingsexperimente und 200 Bewertungen wurden durchgeführt, was zu neuen Training-Algorithmen führte, die das Reasoning verkürzen, ohne die Genauigkeit zu verlieren.

Das Training fand auf Fireworks Serverless Training statt, was schnelle Experimente, Pay-per-use-Preisgestaltung und schnellere Forschungs-zu-Launch-Zyklen ermöglichte. Ember-1 wurde auf verschiedene Aufgaben evaluiert, um sicherzustellen, dass Token-Einsparungen auf verschiedene Workloads übertragen werden, und wurde dann auf dem Specialized Intelligence Index, öffentlichen Benchmarks und Live-Produktionstrafik validiert. Das Modell adressiert Ineffizienzen in Reasoning-Modellen wie Kimi K3, die mehr als 90% der Tokens für internes Reasoning anstelle von Antworten ausgeben.

Dies wird in multi-turn agentischen Workloads teuer, wo vorheriges Reasoning erneut gelesen und abgerechnet wird. Ember-1 bewahrt nützliche Selbstreflexion, während es übermäßiges Reasoning eliminiert, und verwendet Feedback von Aufgaben und Umgebung, um effizientes Reasoning zu lernen. Das Training umfasste Mathematik, Codierung, Anweisungsfolgen, Konversation, Suche, Tool-Nutzung und Software-Ingenieurwesen, einschließlich erweiterter Interaktionen.

Die Ergebnisse bestätigen, dass die Qualität über sieben Benchmarks und den Produktionstrafik zweier Kunden aufrechterhalten wurde.