HeadlinesBriefing HeadlinesBriefing 12 languages

Your AI Bill Is a Toll Booth. Stop Paying Twice.

Towards Data Science ·

🇬🇧 English

Here's a question worth asking your finance team: how much of this year's AI budget is left? For a surprising number of companies, the honest answer is "not much". Some are running dry by April. The annual budget, gone in a quarter. The bigger reason is how we're using it. We've moved from asking chatbots questions to running agents. And agents don't just answer. They call tools, read files, check results and call more tools. Every one of those steps burns tokens. One agentic request can cost many times what a plain chat message does.

It doesn't help that the pricing itself keeps moving. There are subscriptions. There's pay-as-you-go API access. There are promos that appear for a few months to stop people switching, and new top-tier models landing every few months with their own price points. So before we get into how to cut the bill, let's make sure we all understand what we're actually paying for. Because once you see how the meter works, the savings become obvious.

An LLM predicts one token at a time. For each token, it runs a stack of maths. To predict the next token, it needs the maths for every single token before it. Round and round, until it produces a special "I'm done" token. Picture every API call as a toll road. You pay to drive in (input tokens), and you pay to drive back out (output tokens). Output is the pricier lane. Take Anthropic's lineup as an example. Claude Fable 5 sits at $10 per million tokens in and $50 per million out. That's a 10x spread between the cheapest and priciest model from the same company.

Now look for the smallest line on that price sheet. Cached tokens cost one tenth of normal tokens. Keep that number in your pocket. It's worth more than everything else in this article combined. Without caching, the model needs the whole conversation every single time. You send message one. It sends back message one plus its reply. You send the whole lot plus message three. It sends all of that back plus reply two.

View original article →


🇸🇦 العربية

فاتورة الذكاء الاصطناعي الخاصة بك هي كشك رسوم مرور: توقف عن الدفع مرتين

إليك سؤال يستحق أن تطرحه على فريقك المالي: كم تبقى من ميزانية الذكاء الاصطناعي لهذا العام؟ بالنسبة لعدد مذهل من الشركات، الإجابة الصادقة هي "ليس كثيرًا". بعضها ينفد بحلول أبريل. الميزانية السنوية، تختفي في ربع سنة. السبب الأكبر هو كيف نستخدمها. لقد انتقلنا من طرح الأسئلة على روبوتات الدردشة إلى تشغيل الوكلاء. والوكلاء لا يجيبون فقط. إنهم يستدعون الأدوات، ويقرؤون الملفات، ويتحققون من النتائج ويستدعون المزيد من الأدوات. كل خطوة من تلك الخطوات تحرق الرموز. يمكن أن يكلف طلب وكيل واحد أضعاف ما تكلفه رسالة دردشة عادية. لا يساعد أن التسعير نفسه يستمر في التحرك. هناك اشتراكات. هناك وصول API للدفع حسب الاستخدام. هناك عروض ترويجية تظهر لبضعة أشهر لمنع الناس من التبديل، ونماذج جديدة من الدرجة الأولى تصل كل بضعة أشهر بنقاط سعرها الخاصة. لذا قبل أن ندخل في كيفية خفض الفاتورة، دعنا نتأكد من أننا جميعًا نفهم ما ندفع مقابله بالفعل. لأنه بمجرد أن ترى كيف يعمل العداد، تصبح المدخرات واضحة. LLM يتنبأ برمز واحد في كل مرة. لكل رمز، يقوم بتشغيل مجموعة من العمليات الحسابية. للتنبؤ بالرمز التالي، يحتاج إلى العمليات الحسابية لكل رمز قبله. مرارًا وتكرارًا، حتى ينتج رمزًا خاصًا "انتهيت". تخيل كل استدعاء API كطريق برسوم مرور. تدفع للدخول (رموز الإدخال)، وتدفع للخروج (رموز الإخراج). الإخراج هو المسار الأغلى. خذ تشكيلة Anthropic كمثال. Claude Fable 5 بسعر 10 دولارات لكل مليون رمز دخول و50 دولارًا لكل مليون خروج. هذا فرق 10x بين أرخص وأغلى نموذج من نفس الشركة. الآن ابحث عن أصغر سطر في ورقة الأسعار تلك. الرموز المخزنة مؤقتًا تكلف عُشر الرموز العادية. احتفظ بهذا الرقم في جيبك. إنه يساوي أكثر من كل شيء آخر في هذه المقالة مجتمعة. بدون التخزين المؤقت، يحتاج النموذج إلى المحادثة بأكملها في كل مرة. ترسل الرسالة الأولى. يعيد إرسال الرسالة الأولى بالإضافة إلى رده. ترسل المجموعة بأكملها بالإضافة إلى الرسالة الثالثة. يعيد إرسال كل ذلك بالإضافة إلى الرد الثاني.

لماذا تتضاعف تكاليف الذكاء الاصطناعي للشركات التي تستخدم الوكلاء؟

تتضاعف تكاليف الذكاء الاصطناعي لأن الوكلاء لا يجيبون على الأسئلة فقط—يستدعون الأدوات، ويقرؤون الملفات، ويتحققون من النتائج، وكل خطوة تحرق الرموز. يمكن أن يكلف طلب وكيل واحد أضعاف رسالة دردشة عادية، وبدون التخزين المؤقت، يعيد النموذج معالجة تاريخ المحادثة بالكامل في كل مرة، مما يضاعف التكاليف أكثر.

العربية version →


🇧🇩 বাংলা

আপনার AI বিল একটি টোল বুথ: দুবার পেমেন্ট বন্ধ করুন

এখানে একটি প্রশ্ন যা আপনার ফাইন্যান্স টিমকে জিজ্ঞাসা করার মতো: এই বছরের AI বাজেট কতটুকু বাকি আছে? আশ্চর্যজনক সংখ্যক কোম্পানির জন্য, সৎ উত্তর হল "অনেক না"। কিছু এপ্রিলের মধ্যে শেষ হয়ে যায়। বার্ষিক বাজেট, এক ত্রৈমাসিকে শেষ। বড় কারণ হল আমরা এটি কীভাবে ব্যবহার করছি। আমরা চ্যাটবটকে প্রশ্ন করা থেকে এজেন্ট চালানোর দিকে চলে এসেছি। এবং এজেন্টরা শুধু উত্তর দেয় না। তারা টুল কল করে, ফাইল পড়ে, ফলাফল চেক করে এবং আরও টুল কল করে। সেই প্রতিটি পদক্ষেপ টোকেন পোড়ায়। একটি এজেন্টিক অনুরোধের খরচ একটি সাধারণ চ্যাট বার্তার চেয়ে অনেক গুণ বেশি হতে পারে। এটি সাহায্য করে না যে মূল্য নির্ধারণ নিজেই চলতে থাকে। সাবস্ক্রিপশন আছে। পে-অ্যাজ-ইউ-গো API অ্যাক্সেস আছে। কয়েক মাসের জন্য প্রদর্শিত প্রোমো আছে যা লোকেদের স্যুইচ করতে বাধা দেয়, এবং প্রতি কয়েক মাসে তাদের নিজস্ব মূল্য পয়েন্ট সহ নতুন টপ-টায়ার মডেল আসে। তাই বিল কমানোর উপায়ে যাওয়ার আগে, আসুন নিশ্চিত করি যে আমরা সবাই বুঝি আমরা আসলে কীসের জন্য অর্থ প্রদান করছি। কারণ একবার আপনি দেখতে পান যে মিটার কীভাবে কাজ করে, সঞ্চয় স্পষ্ট হয়ে যায়। একটি LLM একবারে একটি টোকেন ভবিষ্যদ্বাণী করে। প্রতিটি টোকেনের জন্য, এটি গণিতের একটি স্ট্যাক চালায়। পরবর্তী টোকেন ভবিষ্যদ্বাণী করতে, এটির আগের প্রতিটি টোকেনের জন্য গণিতের প্রয়োজন হয়। বারবার, যতক্ষণ না এটি একটি বিশেষ "আমি শেষ" টোকেন তৈরি করে। প্রতিটি API কলকে একটি টোল রোড হিসাবে কল্পনা করুন। আপনি ভিতরে যাওয়ার জন্য অর্থ প্রদান করেন (ইনপুট টোকেন), এবং আপনি বাইরে আসার জন্য অর্থ প্রদান করেন (আউটপুট টোকেন)। আউটপুট আরও ব্যয়বহুল লেন। Anthropic-এর লাইনআপকে উদাহরণ হিসাবে নিন। Claude Fable 5-এর দাম প্রতি মিলিয়ন টোকেনে $10 ইনপুট এবং প্রতি মিলিয়নে $50 আউটপুট। এটি একই কোম্পানির সবচেয়ে সস্তা এবং সবচেয়ে ব্যয়বহুল মডেলের মধ্যে 10x ব্যবধান। এখন সেই মূল্য তালিকার সবচেয়ে ছোট লাইনটি দেখুন। ক্যাশড টোকেনের দাম সাধারণ টোকেনের দশমাংশ। সেই সংখ্যাটি আপনার পকেটে রাখুন। এটি এই নিবন্ধের বাকি সবকিছুর চেয়ে বেশি মূল্যবান। ক্যাশিং ছাড়া, মডেলটির প্রতিবার পুরো কথোপকথনের প্রয়োজন হয়। আপনি বার্তা এক পাঠান। এটি বার্তা এক এবং তার উত্তর ফেরত পাঠায়। আপনি পুরো লট এবং বার্তা তিন পাঠান। এটি সেই সব এবং উত্তর দুই ফেরত পাঠায়।

এজেন্ট ব্যবহারকারী কোম্পানিগুলির জন্য AI খরচ কেন বিস্ফোরিত হচ্ছে?

AI খরচ বিস্ফোরিত হচ্ছে কারণ এজেন্টরা শুধু প্রশ্নের উত্তর দেয় না—তারা টুল কল করে, ফাইল পড়ে এবং ফলাফল চেক করে, প্রতিটি পদক্ষেপ টোকেন পোড়ায়। একটি এজেন্টিক অনুরোধের খরচ একটি সাধারণ চ্যাট বার্তার চেয়ে অনেক গুণ বেশি হতে পারে, এবং ক্যাশিং ছাড়া, মডেলটি প্রতিবার পুরো কথোপকথনের ইতিহাস পুনরায় প্রক্রিয়া করে, খরচ আরও বাড়িয়ে দেয়।

বাংলা version →


🇩🇪 Deutsch

Ihre KI-Rechnung ist eine Mautstelle: Hören Sie auf, doppelt zu zahlen

Hier ist eine Frage, die Sie Ihrem Finanzteam stellen sollten: Wie viel vom diesjährigen KI-Budget ist noch übrig? Für eine überraschende Anzahl von Unternehmen lautet die ehrliche Antwort „nicht viel“. Einige sind im April schon leer. Das Jahresbudget, in einem Quartal verschwunden.

Der größere Grund ist, wie wir es nutzen. Wir sind vom Fragenstellen an Chatbots zum Ausführen von Agenten übergegangen. Und Agenten antworten nicht nur.

Sie rufen Tools auf, lesen Dateien, überprüfen Ergebnisse und rufen weitere Tools auf. Jeder dieser Schritte verbraucht Tokens. Eine einzige Agentenanfrage kann ein Vielfaches dessen kosten, was eine einfache Chat-Nachricht kostet.

Es hilft nicht, dass sich die Preisgestaltung selbst ständig ändert. Es gibt Abonnements. Es gibt Pay-as-you-go-API-Zugriff.

Es gibt Aktionen, die für ein paar Monate erscheinen, um Leute vom Wechseln abzuhalten, und alle paar Monate kommen neue Top-Modelle mit eigenen Preispunkten. Bevor wir also darauf eingehen, wie man die Rechnung senkt, stellen wir sicher, dass wir alle verstehen, wofür wir eigentlich bezahlen. Denn sobald Sie sehen, wie der Zähler funktioniert, werden die Einsparungen offensichtlich.

Ein LLM sagt jeweils ein Token voraus. Für jedes Token führt es einen Stapel Mathematik aus. Um das nächste Token vorherzusagen, benötigt es die Mathematik für jedes einzelne Token davor.

Runde um Runde, bis es ein spezielles „Ich bin fertig“-Token produziert. Stellen Sie sich jeden API-Aufruf als eine Mautstraße vor. Sie zahlen für die Einfahrt (Eingabe-Tokens) und Sie zahlen für die Ausfahrt (Ausgabe-Tokens).

Die Ausgabe ist die teurere Spur. Nehmen Sie Anthropics Produktpalette als Beispiel. Claude Fable 5 kostet 10 $ pro Million Tokens Eingabe und 50 $ pro Million Ausgabe. Das ist ein 10-facher Unterschied zwischen dem günstigsten und dem teuersten Modell desselben Unternehmens.

Suchen Sie nun nach der kleinsten Zeile auf diesem Preisschild. Zwischengespeicherte Tokens kosten ein Zehntel normaler Tokens. Behalten Sie diese Zahl im Hinterkopf.

Sie ist mehr wert als alles andere in diesem Artikel zusammen. Ohne Caching benötigt das Modell jedes Mal die gesamte Konversation. Sie senden Nachricht eins.

Es sendet Nachricht eins plus seine Antwort zurück. Sie senden das Ganze plus Nachricht drei. Es sendet das alles plus Antwort zwei zurück.

Warum explodieren die KI-Kosten für Unternehmen, die Agenten einsetzen?

KI-Kosten explodieren, weil Agenten nicht nur Fragen beantworten – sie rufen Tools auf, lesen Dateien und überprüfen Ergebnisse, wobei jeder Schritt Tokens verbraucht. Eine einzige Agentenanfrage kann ein Vielfaches einer einfachen Chat-Nachricht kosten, und ohne Caching verarbeitet das Modell jedes Mal die gesamte Konversationshistorie neu, was die Kosten weiter vervielfacht.

Deutsch version →


🇪🇸 Español

Tu Factura de IA es un Peaje: Deja de Pagar Dos Veces

Aquí hay una pregunta que vale la pena hacerle a tu equipo financiero: ¿cuánto del presupuesto de IA de este año queda? Para un número sorprendente de empresas, la respuesta honesta es "no mucho". Algunas se quedan sin fondos en abril. El presupuesto anual, desaparecido en un trimestre.

La razón principal es cómo lo estamos usando. Hemos pasado de hacer preguntas a chatbots a ejecutar agentes. Y los agentes no solo responden.

Llaman herramientas, leen archivos, verifican resultados y llaman a más herramientas. Cada uno de esos pasos quema tokens. Una solicitud de agente puede costar muchas veces lo que cuesta un mensaje de chat simple.

No ayuda que los precios sigan cambiando. Hay suscripciones. Hay acceso API de pago por uso.

Hay promociones que aparecen por unos meses para evitar que la gente cambie, y nuevos modelos de primer nivel que llegan cada pocos meses con sus propios precios. Así que antes de entrar en cómo reducir la factura, asegurémonos de que todos entendemos por qué estamos pagando realmente. Porque una vez que veas cómo funciona el medidor, los ahorros se vuelven obvios.

Un LLM predice un token a la vez. Para cada token, ejecuta una pila de matemáticas. Para predecir el siguiente token, necesita las matemáticas para cada token anterior.

Una y otra vez, hasta que produce un token especial "he terminado". Imagina cada llamada API como una carretera de peaje. Pagas para entrar (tokens de entrada) y pagas para salir (tokens de salida).

La salida es el carril más caro. Tomemos la línea de productos de Anthropic como ejemplo. Claude Fable 5 cuesta $10 por millón de tokens de entrada y $50 por millón de salida. Eso es una diferencia de 10x entre el modelo más barato y el más caro de la misma empresa.

Ahora busca la línea más pequeña en esa hoja de precios. Los tokens en caché cuestan una décima parte de los tokens normales. Guarda ese número en tu bolsillo.

Vale más que todo lo demás en este artículo combinado. Sin almacenamiento en caché, el modelo necesita toda la conversación cada vez. Envías el mensaje uno.

Devuelve el mensaje uno más su respuesta. Envías todo más el mensaje tres. Devuelve todo más la respuesta dos.

¿Por qué se disparan los costos de IA para las empresas que usan agentes?

Los costos de IA se disparan porque los agentes no solo responden preguntas: llaman herramientas, leen archivos y verifican resultados, y cada paso quema tokens. Una solicitud de agente puede costar muchas veces un mensaje de chat simple, y sin almacenamiento en caché, el modelo reprocesa todo el historial de la conversación cada vez, multiplicando aún más los costos.

Español version →


🇫🇷 Français

Votre Facture IA est un Péage : Arrêtez de Payer Deux Fois

Voici une question à poser à votre équipe financière : combien reste-t-il du budget IA de cette année ? Pour un nombre surprenant d'entreprises, la réponse honnête est « pas grand-chose ». Certaines sont à sec dès avril. Le budget annuel, disparu en un trimestre.

La raison principale est la façon dont nous l'utilisons. Nous sommes passés de questions posées aux chatbots à l'exécution d'agents. Et les agents ne se contentent pas de répondre.

Ils appellent des outils, lisent des fichiers, vérifient des résultats et appellent d'autres outils. Chacune de ces étapes brûle des tokens. Une seule requête d'agent peut coûter plusieurs fois ce qu'un simple message de chat coûte.

Cela n'aide pas que la tarification elle-même bouge constamment. Il y a des abonnements. Il y a un accès API à l'utilisation.

Il y a des promos qui apparaissent pendant quelques mois pour empêcher les gens de changer, et de nouveaux modèles haut de gamme arrivent tous les quelques mois avec leurs propres prix. Alors avant de voir comment réduire la facture, assurons-nous de tous comprendre ce pour quoi nous payons réellement. Parce qu'une fois que vous voyez comment le compteur fonctionne, les économies deviennent évidentes.

Un LLM prédit un token à la fois. Pour chaque token, il exécute une pile de maths. Pour prédire le token suivant, il a besoin des maths pour chaque token précédent.

Encore et encore, jusqu'à ce qu'il produise un token spécial « j'ai fini ». Imaginez chaque appel API comme une route à péage. Vous payez pour entrer (tokens d'entrée), et vous payez pour sortir (tokens de sortie).

La sortie est la voie la plus chère. Prenons la gamme Anthropic comme exemple. Claude Fable 5 coûte 10 $ par million de tokens en entrée et 50 $ par million en sortie. C'est un écart de 10x entre le modèle le moins cher et le plus cher de la même entreprise.

Cherchez maintenant la plus petite ligne sur cette feuille de prix. Les tokens en cache coûtent un dixième des tokens normaux. Gardez ce nombre dans votre poche.

Il vaut plus que tout le reste de cet article combiné. Sans mise en cache, le modèle a besoin de toute la conversation à chaque fois. Vous envoyez le message un.

Il renvoie le message un plus sa réponse. Vous envoyez le tout plus le message trois. Il renvoie tout cela plus la réponse deux.

Pourquoi les coûts de l'IA explosent-ils pour les entreprises utilisant des agents ?

Les coûts de l'IA explosent parce que les agents ne se contentent pas de répondre aux questions—ils appellent des outils, lisent des fichiers et vérifient des résultats, chaque étape brûlant des tokens. Une seule requête d'agent peut coûter plusieurs fois un simple message de chat, et sans mise en cache, le modèle retraite tout l'historique de la conversation à chaque fois, multipliant encore les coûts.

Français version →


🇮🇳 हिन्दी

आपका AI बिल एक टोल बूथ है: दो बार भुगतान करना बंद करें

यहाँ एक सवाल है जो आपकी वित्त टीम से पूछने लायक है: इस साल का AI बजट कितना बचा है? आश्चर्यजनक रूप से कई कंपनियों के लिए, ईमानदार जवाब है "ज़्यादा नहीं"। कुछ अप्रैल तक खत्म हो जाती हैं। वार्षिक बजट, एक तिमाही में गायब। बड़ा कारण यह है कि हम इसका उपयोग कैसे कर रहे हैं। हम चैटबॉट से सवाल पूछने से एजेंट चलाने की ओर बढ़ गए हैं। और एजेंट सिर्फ जवाब नहीं देते। वे टूल कॉल करते हैं, फ़ाइलें पढ़ते हैं, परिणाम जांचते हैं और और टूल कॉल करते हैं। उनमें से हर कदम टोकन जलाता है। एक एजेंटिक अनुरोध की लागत एक सादे चैट संदेश से कई गुना अधिक हो सकती है। मदद नहीं करता कि कीमतें खुद चलती रहती हैं। सब्सक्रिप्शन हैं। पे-एज़-यू-गो API एक्सेस है। कुछ महीनों के लिए दिखने वाले प्रोमो हैं जो लोगों को स्विच करने से रोकते हैं, और हर कुछ महीनों में अपने स्वयं के मूल्य बिंदुओं के साथ नए टॉप-टियर मॉडल आते हैं। तो इससे पहले कि हम बिल कम करने के तरीके में आएं, आइए सुनिश्चित करें कि हम सभी समझते हैं कि हम वास्तव में किसके लिए भुगतान कर रहे हैं। क्योंकि एक बार जब आप देखते हैं कि मीटर कैसे काम करता है, बचत स्पष्ट हो जाती है। एक LLM एक बार में एक टोकन की भविष्यवाणी करता है। प्रत्येक टोकन के लिए, यह गणित का एक ढेर चलाता है। अगले टोकन की भविष्यवाणी करने के लिए, इसे इससे पहले के हर एक टोकन के लिए गणित की आवश्यकता होती है। गोल-गोल, जब तक यह एक विशेष "मैं कर चुका हूँ" टोकन उत्पन्न नहीं करता। हर API कॉल को एक टोल रोड के रूप में चित्रित करें। आप अंदर जाने के लिए भुगतान करते हैं (इनपुट टोकन), और आप बाहर आने के लिए भुगतान करते हैं (आउटपुट टोकन)। आउटपुट अधिक महंगी लेन है। Anthropic की लाइनअप को उदाहरण के रूप में लें। Claude Fable 5 की कीमत $10 प्रति मिलियन टोकन इनपुट और $50 प्रति मिलियन आउटपुट है। यह एक ही कंपनी के सबसे सस्ते और सबसे महंगे मॉडल के बीच 10x का अंतर है। अब उस प्राइस शीट पर सबसे छोटी लाइन देखें। कैश्ड टोकन की लागत सामान्य टोकन के दसवें हिस्से के बराबर है। उस नंबर को अपनी जेब में रखें। यह इस लेख में बाकी सब चीजों से अधिक मूल्यवान है। कैशिंग के बिना, मॉडल को हर बार पूरी बातचीत की आवश्यकता होती है। आप संदेश एक भेजते हैं। यह संदेश एक और उसका उत्तर वापस भेजता है। आप पूरा लॉट और संदेश तीन भेजते हैं। यह वह सब और उत्तर दो वापस भेजता है।

एजेंट का उपयोग करने वाली कंपनियों के लिए AI लागत क्यों बढ़ रही है?

AI लागत बढ़ रही है क्योंकि एजेंट सिर्फ सवालों के जवाब नहीं देते—वे टूल कॉल करते हैं, फ़ाइलें पढ़ते हैं और परिणाम जांचते हैं, प्रत्येक कदम टोकन जलाता है। एक एजेंटिक अनुरोध की लागत एक सादे चैट संदेश से कई गुना अधिक हो सकती है, और कैशिंग के बिना, मॉडल हर बार पूरे वार्तालाप इतिहास को फिर से संसाधित करता है, लागत को और गुणा करता है।

हिन्दी version →


🇮🇩 Bahasa Indonesia

Tagihan AI Anda adalah Gerbang Tol: Berhenti Membayar Dua Kali

Ini pertanyaan yang layak diajukan ke tim keuangan Anda: berapa sisa anggaran AI tahun ini? Untuk sejumlah perusahaan yang mengejutkan, jawaban jujurnya adalah "tidak banyak". Beberapa habis pada bulan April. Anggaran tahunan, habis dalam satu kuartal.

Alasan yang lebih besar adalah bagaimana kita menggunakannya. Kita telah beralih dari bertanya pada chatbot menjadi menjalankan agen. Dan agen tidak hanya menjawab.

Mereka memanggil alat, membaca file, memeriksa hasil, dan memanggil lebih banyak alat. Setiap langkah itu menghabiskan token. Satu permintaan agen bisa memakan biaya berkali-kali lipat dari pesan obrolan biasa.

Tidak membantu bahwa harga itu sendiri terus berubah. Ada langganan. Ada akses API bayar sesuai pemakaian.

Ada promosi yang muncul selama beberapa bulan untuk mencegah orang beralih, dan model tingkat atas baru yang muncul setiap beberapa bulan dengan titik harga mereka sendiri. Jadi sebelum kita masuk ke cara memotong tagihan, mari pastikan kita semua memahami apa yang sebenarnya kita bayar. Karena begitu Anda melihat cara kerja meteran, penghematan menjadi jelas.

Sebuah LLM memprediksi satu token pada satu waktu. Untuk setiap token, ia menjalankan tumpukan matematika. Untuk memprediksi token berikutnya, ia membutuhkan matematika untuk setiap token sebelumnya.

Berputar-putar, sampai menghasilkan token khusus "Saya selesai". Bayangkan setiap panggilan API sebagai jalan tol. Anda membayar untuk masuk (token input), dan Anda membayar untuk keluar (token output).

Output adalah jalur yang lebih mahal. Ambil contoh jajaran produk Anthropic. Claude Fable 5 berada di $10 per juta token masuk dan $50 per juta keluar. Itu selisih 10x antara model termurah dan termahal dari perusahaan yang sama.

Sekarang cari baris terkecil di lembar harga itu. Token yang di-cache berharga sepersepuluh dari token normal. Simpan angka itu di saku Anda.

Itu lebih berharga dari semua yang lain di artikel ini digabungkan. Tanpa caching, model membutuhkan seluruh percakapan setiap saat. Anda mengirim pesan satu.

Ia mengirim kembali pesan satu plus balasannya. Anda mengirim seluruhnya plus pesan tiga. Ia mengirim semua itu kembali plus balasan dua.

Mengapa biaya AI meledak untuk perusahaan yang menggunakan agen?

Biaya AI meledak karena agen tidak hanya menjawab pertanyaan—mereka memanggil alat, membaca file, dan memeriksa hasil, dengan setiap langkah menghabiskan token. Satu permintaan agen bisa memakan biaya berkali-kali lipat dari pesan obrolan biasa, dan tanpa caching, model memproses ulang seluruh riwayat percakapan setiap saat, melipatgandakan biaya lebih lanjut.

Bahasa Indonesia version →


🇯🇵 日本語

AIの請求書は有料道路:二重払いをやめよう

財務チームに聞く価値のある質問があります:今年のAI予算はどれだけ残っていますか?驚くほど多くの企業で、正直な答えは「あまりない」です。4月には底をつくところもあります。年間予算が四半期で消えます。大きな理由は、私たちの使い方にあります。チャットボットに質問する段階から、エージェントを実行する段階に移行しました。エージェントは単に答えるだけではありません。ツールを呼び出し、ファイルを読み、結果を確認し、さらにツールを呼び出します。これらの各ステップでトークンを消費します。1つのエージェントリクエストは、通常のチャットメッセージの何倍ものコストがかかる可能性があります。価格設定自体が常に変動していることも問題です。サブスクリプションがあります。従量課金のAPIアクセスがあります。ユーザーの乗り換えを防ぐために数ヶ月間表示されるプロモーションや、数ヶ月ごとに独自の価格帯で登場する新しいトップティアモデルもあります。そこで、請求額を削減する方法に入る前に、実際に何に対して支払っているのかを全員が理解していることを確認しましょう。メーターの仕組みがわかれば、節約方法は明らかです。LLMは一度に1つのトークンを予測します。各トークンに対して、一連の計算を実行します。次のトークンを予測するには、その前のすべてのトークンに対する計算が必要です。これを繰り返し、特別な「終了」トークンが生成されるまで続きます。各API呼び出しを有料道路として想像してください。入場料(入力トークン)を支払い、退出料(出力トークン)を支払います。出力の方が高価なレーンです。例としてAnthropicのラインナップを見てみましょう。Claude Fable 5は、入力が100万トークンあたり10ドル、出力が100万トークンあたり50ドルです。同じ会社の最も安いモデルと最も高いモデルの間には10倍の差があります。次に、その価格表で最も小さな行を探してください。キャッシュされたトークンは、通常のトークンの10分の1のコストです。その数字を覚えておいてください。この記事の他のすべてを合わせたよりも価値があります。キャッシュがない場合、モデルは毎回会話全体を必要とします。メッセージ1を送信します。モデルはメッセージ1とその応答を返信します。全体とメッセージ3を送信します。モデルはそれらすべてと応答2を返信します。

エージェントを使用する企業でAIコストが急騰するのはなぜですか?

AIコストが急騰するのは、エージェントが単に質問に答えるだけでなく、ツールを呼び出し、ファイルを読み、結果を確認し、各ステップでトークンを消費するためです。1つのエージェントリクエストは通常のチャットメッセージの何倍ものコストがかかる可能性があり、キャッシュがない場合、モデルは毎回会話履歴全体を再処理するため、コストがさらに倍増します。

日本語 version →


🇧🇷 Português

Sua Conta de IA é um Pedágio: Pare de Pagar Duas Vezes

Aqui está uma pergunta que vale a pena fazer à sua equipe financeira: quanto do orçamento de IA deste ano sobrou? Para um número surpreendente de empresas, a resposta honesta é "não muito". Algumas estão secando em abril. O orçamento anual, desaparecido em um trimestre.

A razão maior é como estamos usando. Passamos de fazer perguntas a chatbots para executar agentes. E agentes não apenas respondem.

Eles chamam ferramentas, leem arquivos, verificam resultados e chamam mais ferramentas. Cada um desses passos queima tokens. Uma única solicitação de agente pode custar muitas vezes o que uma mensagem de chat simples custa.

Não ajuda que o próprio preço continue mudando. Há assinaturas. Há acesso API de pagamento por uso.

Há promoções que aparecem por alguns meses para impedir que as pessoas mudem, e novos modelos de ponta chegando a cada poucos meses com seus próprios preços. Então, antes de entrarmos em como cortar a conta, vamos garantir que todos entendamos pelo que estamos realmente pagando. Porque uma vez que você vê como o medidor funciona, as economias se tornam óbvias.

Um LLM prevê um token de cada vez. Para cada token, ele executa uma pilha de matemática. Para prever o próximo token, ele precisa da matemática para cada token anterior.

Volta e volta, até produzir um token especial "terminei". Imagine cada chamada de API como uma estrada com pedágio. Você paga para entrar (tokens de entrada) e paga para sair (tokens de saída).

A saída é a pista mais cara. Pegue a linha de produtos da Anthropic como exemplo. Claude Fable 5 custa $10 por milhão de tokens de entrada e $50 por milhão de saída. Isso é uma diferença de 10x entre o modelo mais barato e o mais caro da mesma empresa.

Agora procure a menor linha nessa folha de preços. Tokens em cache custam um décimo dos tokens normais. Guarde esse número no bolso.

Vale mais do que todo o resto deste artigo combinado. Sem cache, o modelo precisa de toda a conversa toda vez. Você envia a mensagem um.

Ele envia de volta a mensagem um mais sua resposta. Você envia tudo mais a mensagem três. Ele envia tudo isso de volta mais a resposta dois.

Por que os custos de IA estão explodindo para empresas que usam agentes?

Os custos de IA estão explodindo porque os agentes não apenas respondem perguntas—eles chamam ferramentas, leem arquivos e verificam resultados, com cada etapa queimando tokens. Uma solicitação de agente pode custar muitas vezes uma mensagem de chat simples, e sem cache, o modelo reprocessa todo o histórico da conversa toda vez, multiplicando ainda mais os custos.

Português version →


🇷🇺 Русский

Ваш Счет за ИИ — Это Платный Мост: Перестаньте Платить Дважды

Вот вопрос, который стоит задать вашей финансовой команде: сколько бюджета на ИИ осталось в этом году? Для удивительного числа компаний честный ответ — «немного». Некоторые иссякают к апрелю. Годовой бюджет исчезает за квартал. Главная причина — как мы его используем. Мы перешли от вопросов чат-ботам к запуску агентов. А агенты не просто отвечают. Они вызывают инструменты, читают файлы, проверяют результаты и вызывают больше инструментов. Каждый из этих шагов сжигает токены. Один запрос агента может стоить в несколько раз больше, чем обычное сообщение в чате. Не помогает и то, что цены постоянно меняются. Есть подписки. Есть оплата по мере использования API. Есть акции, которые появляются на несколько месяцев, чтобы помешать людям переключаться, и новые топовые модели, выходящие каждые несколько месяцев со своими ценами. Поэтому, прежде чем мы перейдем к тому, как сократить счет, давайте убедимся, что все понимаем, за что мы на самом деле платим. Потому что, как только вы увидите, как работает счетчик, экономия становится очевидной. LLM предсказывает один токен за раз. Для каждого токена он выполняет набор вычислений. Чтобы предсказать следующий токен, ему нужны вычисления для каждого предыдущего токена. Снова и снова, пока не появится специальный токен «я закончил». Представьте каждый вызов API как платную дорогу. Вы платите за въезд (входные токены) и платите за выезд (выходные токены). Выход — более дорогая полоса. Возьмем линейку Anthropic в качестве примера. Claude Fable 5 стоит 10 долларов за миллион токенов на входе и 50 долларов за миллион на выходе. Это разница в 10 раз между самой дешевой и самой дорогой моделью одной компании. Теперь найдите самую маленькую строку в этом прайс-листе. Кэшированные токены стоят одну десятую обычных токенов. Держите это число в кармане. Оно стоит больше, чем все остальное в этой статье вместе взятое. Без кэширования модели нужен весь разговор каждый раз. Вы отправляете сообщение один. Она отправляет обратно сообщение один плюс свой ответ. Вы отправляете все плюс сообщение три. Она отправляет все это обратно плюс ответ два.

Почему затраты на ИИ взлетают для компаний, использующих агентов?

Затраты на ИИ взлетают, потому что агенты не просто отвечают на вопросы — они вызывают инструменты, читают файлы и проверяют результаты, причем каждый шаг сжигает токены. Один запрос агента может стоить в несколько раз больше обычного сообщения в чате, а без кэширования модель каждый раз заново обрабатывает всю историю разговора, что еще больше увеличивает затраты.

Русский version →


🇨🇳 简体中文

你的AI账单是收费站:别再付双倍钱

这里有一个值得问你的财务团队的问题:今年AI预算还剩多少?对于数量惊人的公司来说,诚实的答案是“不多了”。有些公司在四月就用完了。年度预算,一个季度就没了。更大的原因是我们如何使用它。我们已经从向聊天机器人提问转向运行代理。代理不只是回答问题。它们调用工具、读取文件、检查结果并调用更多工具。每一步都会消耗令牌。一个代理请求的成本可能是普通聊天消息的许多倍。定价本身也在不断变化。有订阅制。有按需付费的API访问。有持续几个月的促销活动来阻止用户切换,还有每隔几个月就推出的新顶级模型,各有自己的定价。所以,在我们讨论如何削减账单之前,让我们确保大家都明白我们到底在为什么付费。因为一旦你看到计费方式如何运作,节省就变得显而易见。一个LLM一次预测一个令牌。对于每个令牌,它运行一堆数学运算。要预测下一个令牌,它需要对之前每个令牌进行数学运算。循环往复,直到产生一个特殊的“我完成了”令牌。把每个API调用想象成一条收费公路。你付费进入(输入令牌),付费离开(输出令牌)。输出是更贵的车道。以Anthropic的产品线为例。Claude Fable 5的输入价格为每百万令牌10美元,输出价格为每百万令牌50美元。同一家公司最便宜和最贵模型之间有10倍的差距。现在看看价格表上最小的那行。缓存令牌的成本是普通令牌的十分之一。记住这个数字。它比本文中其他所有内容加起来都更有价值。没有缓存,模型每次都需要整个对话。你发送消息一。它返回消息一加上它的回复。你发送全部加上消息三。它返回全部加上回复二。

为什么使用代理的公司AI成本会飙升?

AI成本飙升是因为代理不只是回答问题——它们调用工具、读取文件、检查结果,每一步都消耗令牌。一个代理请求的成本可能是普通聊天消息的许多倍,而且没有缓存,模型每次都会重新处理整个对话历史,进一步增加成本。

简体中文 version →