HeadlinesBriefing favicon HeadlinesBriefing.com

AIチャットボットの内部:Enterキーを押したときに何が起こるか

ByteByteGo •
×

AIチャットボットでEnterキーを押すと、回答が表示されるまでに約12の処理ステージが発生します。入力されたメッセージはモデルに直接送信されるのではなく、システムプロンプト、ツール定義、メモリ、ナレッジベースドキュメント、会話履歴、および新しい入力を含むドキュメントに組み立てられます。このプロセスはコンテキストエンジニアリングと呼ばれ、モデルにどの情報がどの順序で届くかを決定します。

モデルは設計上 Stateless(無状態)であり、これは各ターンで会話履歴をゼロから再構築し、他のユーザーとリソースを共有することを意味します。テキストが表示される前の初期の停止には、プリフィルとデコードのステップ、キャッシュ、およびストリーミングプロセスが含まれます。異なるプロバイダーはこのドキュメントを異なる方法で構造化します—一部は事前にすべてを取得し、他のプロバイダーは処理中にモデルが情報を取得することを許可します。

組み立てられたドキュメントは精度に影響を与えます。なぜならモデルには有限の注意予算があるからです。追加されるトークンごとに精度が徐々に低下し、単純なタスクでも同様です。これが、同一のモデルを使用している2つの製品が異なる回答を生み出す理由です—質問をラップするドキュメントが異なるためです。同じ基礎となるモデルアーキテクチャだが、コンテキストエンジニアリングのアプローチが異なるため、出力が異なります。入力の組み立てから安全チェック、ストリーミングレスポンスまでのこの旅を理解することで、AIの回答がなぜ変動するのか、そしてEnterキーを押してから最初の単語が表示されるまでの間の見かけ上のアイドル時間に何が起こっているのかが明らかになります。