財務チームに聞く価値のある質問があります:今年のAI予算はどれだけ残っていますか?驚くほど多くの企業で、正直な答えは「あまりない」です。4月には底をつくところもあります。年間予算が四半期で消えます。大きな理由は、私たちの使い方にあります。チャットボットに質問する段階から、エージェントを実行する段階に移行しました。エージェントは単に答えるだけではありません。ツールを呼び出し、ファイルを読み、結果を確認し、さらにツールを呼び出します。これらの各ステップでトークンを消費します。1つのエージェントリクエストは、通常のチャットメッセージの何倍ものコストがかかる可能性があります。価格設定自体が常に変動していることも問題です。サブスクリプションがあります。従量課金のAPIアクセスがあります。ユーザーの乗り換えを防ぐために数ヶ月間表示されるプロモーションや、数ヶ月ごとに独自の価格帯で登場する新しいトップティアモデルもあります。そこで、請求額を削減する方法に入る前に、実際に何に対して支払っているのかを全員が理解していることを確認しましょう。メーターの仕組みがわかれば、節約方法は明らかです。LLMは一度に1つのトークンを予測します。各トークンに対して、一連の計算を実行します。次のトークンを予測するには、その前のすべてのトークンに対する計算が必要です。これを繰り返し、特別な「終了」トークンが生成されるまで続きます。各API呼び出しを有料道路として想像してください。入場料(入力トークン)を支払い、退出料(出力トークン)を支払います。出力の方が高価なレーンです。例としてAnthropicのラインナップを見てみましょう。Claude Fable 5は、入力が100万トークンあたり10ドル、出力が100万トークンあたり50ドルです。同じ会社の最も安いモデルと最も高いモデルの間には10倍の差があります。次に、その価格表で最も小さな行を探してください。キャッシュされたトークンは、通常のトークンの10分の1のコストです。その数字を覚えておいてください。この記事の他のすべてを合わせたよりも価値があります。キャッシュがない場合、モデルは毎回会話全体を必要とします。メッセージ1を送信します。モデルはメッセージ1とその応答を返信します。全体とメッセージ3を送信します。モデルはそれらすべてと応答2を返信します。
出典: Towards Data Science · 要約:HeadlinesBriefing