HeadlinesBriefing favicon HeadlinesBriefing.com

Kleine Modelle: Neue Grenze in der KI

Hacker News •
×

In den letzten Wochen habe ich mit gpt-5.6-luna gespielt. Es ist erstaunlich fähig, schnell und intelligent. Ich sehe regelmäßig, wie es ~100 Token pro Sekunde schafft und durch meine Codebasis, E-Mails und Wissensdatenbank rast. Natürlich ist das Größte an luna die Kosten. Ich habe versucht, einige ziemlich komplexe Forschungsstränge auszuführen, und es ist ziemlich schwer, eine große Rechnung anzuhäufen. Selbst wenn ich es über Tausende von E-Mails suchen lasse, habe ich am Ende API-Kosten in Höhe von zig Cent. Mit GLM 5.3 haben wir sogar eine neue Option an der Pareto-Grenze.

Bei Programmierarbeiten greife ich fast immer zu den teuersten und fähigsten Modellen (Fable 5, 5.6 Sol). Daher war es leicht, den Fortschritt der kleinen, schnellen Modelle zu übersehen. Eine Sache, die einige Investoren, mit denen ich gesprochen habe, erwähnten: "Es ist seltsam, dass wir nicht mehr Verbraucher-KI-Unternehmen sehen. Warum ist das so?" Es gibt eine einfache Antwort: Token-Kosten.

In der Zeit vor der KI sah das Playbook für große Verbraucher-Apps so aus: Erstellen Sie eine überzeugende Website, die relativ günstig zu betreiben ist, ziehen Sie eine Menge Nutzer an (typischerweise mit etwas Viralität), sammeln Sie Geld, skalieren Sie auf mehr Nutzer, erstellen Sie einen Anzeigenmarktplatz. Das beschreibt grob die meisten großen Verbraucherunternehmen (Google, Facebook, Snapchat usw.). Aber was, wenn Sie KI zu Ihrem Produkt hinzufügen möchten? Nun, jetzt haben Sie echte Inferenzkosten bei jeder Anfrage! Plötzlich steigt die benötigte Kapitalmenge dramatisch.

Eine meiner Lieblingsbewertungen ist es, eine tägliche Nachrichtenseite zu erstellen, die für mich personalisiert ist: Recherchieren Sie @calvinfo im Internet, finden Sie heraus, welche Nachrichten sie mögen könnten, erstellen Sie eine Mikro-Site mit den heutigen Top-Storys, personalisiert für sie, durchsuchen Sie hn, reddit, twitter usw. Mit der vorherigen Modellgeneration (Sonnet-Klasse) würden Sie ~1 $ ausgeben, um irgendwohin zu gelangen. 30 $/Monat zu verlangen, ist für eine Verbraucher-App unhaltbar. Hier gibt es viel zu optimieren, aber wenn Sie das verlangen, was die WSJ oder The Economist verlangen, sollten Sie besser einen ähnlichen Wert liefern. Aber wenn man sich luna ansieht, sind die Ergebnisse ziemlich anständig, und die durchschnittlichen Kosten betragen ~0,10 $. Jetzt reden wir!

Wo ich denke, dass dies noch interessanter wird, ist in der Geschäftswelt. Mein Segment-Mitbegründer Peter und ich haben kürzlich bei einer Wanderung Notizen verglichen. In seinen verschiedenen Startups hat Peter zwei Arten von Arbeit gesehen: die "IQ-180"-Arbeit (eine Art verrückter Wissenschaftler-Genie-Typ, der eine verrückte Lösung findet, an die Sie nie gedacht haben) und die "Token-Speier"-Arbeit (ultra reaktionsschnell sein, den Ball über Dutzende verschiedener Fronten vorantreiben). Peter leitet mehrere Unternehmen. Über Segment hinaus hat er über 100 Millionen Dollar für Charm Industrial aufgebracht und kürzlich eine Serie A für Revoy abgeschlossen. Er ist unglaublich organisiert und effizient mit seiner Zeit. Und doch erwähnte Peter, dass ~95 % der Arbeit, die er leistet, in Eimer 2 fällt. Es geht darum, auf Anrufe zu springen, Leute anzustupsen, zu blocken und zu tackeln. Um klar zu sein: Peter sagt, seine Unternehmen wären heute tot im Wasser, ohne einen technischen Verstand mit IQ 180, der die tiefen Probleme löst. Nur dass der Großteil seiner Arbeit in Eimer 2 fällt.

Ich denke, die Nachfrage nach "Frontier-Level"-Modellen wird weiter wachsen, besonders für Bereiche, die neuartige Durchbrüche oder Entdeckungen erfordern (Ingenieurwesen, harte Wissenschaft, Modelltraining). Aber ich denke auch, dass die Nachfrage nach "schnellen/günstigen/gut genug"-Modellen kurz davor ist, abzuheben. Denken Sie an die Menschen, mit denen Sie täglich interagieren: Kollegen, Anbieter und Kunden. Neun von zehn Mal möchten Sie jemanden, der super reaktionsschnell ist und einfach Dinge für Sie erledigt. Die meisten "menschlichen Token" in Unternehmen werden heute auf diese Weise ausgegeben — die Einstellung neigt stark zum Archetyp schnell/günstig/gut genug. Es muss viel Arbeit geleistet werden, um schnelle/günstige/gut genug Modelle für Unternehmen Wirklichkeit werden zu lassen: neue Harnesse, Prompt-Injection-Sicherheit, Rollen und Berechtigungen. Aber ich bin zuversichtlich, dass wir das herausfinden werden. Wenn Sie auch experimentieren, kleine Modelle nützlich zu machen, schreiben Sie mir bitte eine Nachricht. Amazon und Netflix sind die bemerkenswerten Ausnahmen. Peter ist hier auch bescheiden; er ist messerscharf.