HeadlinesBriefing favicon HeadlinesBriefing.com

スマートルーティングでLLMコスト10倍削減

ByteByteGo •
×

アプリケーションが大規模言語モデル(LLM)を採用する場合、通常は最も高性能なモデルを選択します。つまり、すべてのリクエストがその高価なモデルに送信されます。このアプローチは実装が簡単ですが、長期的にはかなり高額になる可能性があります。例えば、「このサポートチケットを請求、技術、アカウント関連に分類する」というリクエストは、「これらの財務記録が正しく一致しない理由を調査し、考えられる原因を説明する」と同じレベルの推論を必要としません。

スマートモデルルーティングを使用すると、この問題を解決できます。このようなルーティングアプローチでは、各リクエストに対して特定のモデルを選択します。言い換えれば、単純な作業は安価な小さなモデルに送信され、難しい作業はより高性能なモデルにルーティングされます。ほとんどのリクエストが単純な場合、このアプローチは総コストを大幅に削減でき、時には約10倍にもなります。また、応答の品質は目立って低下しません。

ただし、コスト削減は保証されていません。アプリケーションが受け取るリクエストの種類、モデル間の価格差、ルーティングシステムの性能にも依存します。LLM APIの使用総コストは通常、処理されるトークン数に依存します。入力トークンには、ユーザーのメッセージ、システム指示、会話履歴、モデルに提供されたドキュメントが含まれます。出力トークンは、応答内で生成されるトークンです。より大きく高性能なモデルは、より多くの計算リソースを必要とするため、一般的にコストが高くなります。

例えば、月に100万件のリクエストを処理する必要があるカスタマーサポートアプリケーションを想像してください。各リクエストが最も強力なモデルに送信される場合、会社はかなり単純な作業に対してもプレミアム価格を支払わなければなりません。これは、ファイルの名前変更、サポートチケットの並べ替え、日付のフォーマットのためにシニアソフトウェアアーキテクトを雇うようなもので、能力の無駄遣いであり、リソース管理が不十分です。