HeadlinesBriefing HeadlinesBriefing.com

KI-Rechnung ist Mautstelle: Hören Sie auf, doppelt zu zahlen

Towards Data Science •
×

Hier ist eine Frage, die Sie Ihrem Finanzteam stellen sollten: Wie viel vom diesjährigen KI-Budget ist noch übrig? Für eine überraschende Anzahl von Unternehmen lautet die ehrliche Antwort „nicht viel“. Einige sind im April schon leer. Das Jahresbudget, in einem Quartal verschwunden.

Der größere Grund ist, wie wir es nutzen. Wir sind vom Fragenstellen an Chatbots zum Ausführen von Agenten übergegangen. Und Agenten antworten nicht nur.

Sie rufen Tools auf, lesen Dateien, überprüfen Ergebnisse und rufen weitere Tools auf. Jeder dieser Schritte verbraucht Tokens. Eine einzige Agentenanfrage kann ein Vielfaches dessen kosten, was eine einfache Chat-Nachricht kostet.

Es hilft nicht, dass sich die Preisgestaltung selbst ständig ändert. Es gibt Abonnements. Es gibt Pay-as-you-go-API-Zugriff.

Es gibt Aktionen, die für ein paar Monate erscheinen, um Leute vom Wechseln abzuhalten, und alle paar Monate kommen neue Top-Modelle mit eigenen Preispunkten. Bevor wir also darauf eingehen, wie man die Rechnung senkt, stellen wir sicher, dass wir alle verstehen, wofür wir eigentlich bezahlen. Denn sobald Sie sehen, wie der Zähler funktioniert, werden die Einsparungen offensichtlich.

Ein LLM sagt jeweils ein Token voraus. Für jedes Token führt es einen Stapel Mathematik aus. Um das nächste Token vorherzusagen, benötigt es die Mathematik für jedes einzelne Token davor.

Runde um Runde, bis es ein spezielles „Ich bin fertig“-Token produziert. Stellen Sie sich jeden API-Aufruf als eine Mautstraße vor. Sie zahlen für die Einfahrt (Eingabe-Tokens) und Sie zahlen für die Ausfahrt (Ausgabe-Tokens).

Die Ausgabe ist die teurere Spur. Nehmen Sie Anthropics Produktpalette als Beispiel. Claude Fable 5 kostet 10 $ pro Million Tokens Eingabe und 50 $ pro Million Ausgabe. Das ist ein 10-facher Unterschied zwischen dem günstigsten und dem teuersten Modell desselben Unternehmens.

Suchen Sie nun nach der kleinsten Zeile auf diesem Preisschild. Zwischengespeicherte Tokens kosten ein Zehntel normaler Tokens. Behalten Sie diese Zahl im Hinterkopf.

Sie ist mehr wert als alles andere in diesem Artikel zusammen. Ohne Caching benötigt das Modell jedes Mal die gesamte Konversation. Sie senden Nachricht eins.

Es sendet Nachricht eins plus seine Antwort zurück. Sie senden das Ganze plus Nachricht drei. Es sendet das alles plus Antwort zwei zurück.

Quelle: Towards Data Science · Zusammengefasst von HeadlinesBriefing