少し前、私たちは可能な限り最高のセマンティックコード検索プラットフォームを構築することに着手しました。それは、grepが表面化するものではなく、実際のリポジトリからLLMエージェントに正確で引用可能な証拠を提供するRAGパイプラインです。最終的な解決策はAir Contextでした。私たちはそれを機能させ、本番環境に導入し、その過程で多くの経験を積みました。この一連の投稿では、初日に誰かに教えてもらいたかった部分を共有します。
コーディングエージェントは、間違いなくこの10年のソフトウェア開発における最大の技術的飛躍です。しかし、ますます多くの開発プロセスがエージェント駆動型になるにつれて、エージェントの効率性と生成されるコードの品質がますます重要になっています。特に大規模なコードベースの場合、エージェントは関連するコードの断片を探すのに多くの時間を費やすことになります。
正しいコードスニペットを見つけようとして、エージェントはキーワード検索やgrepなどの従来のコード検索ツールに頼ることになります。これらのツールでは、エージェントが事前に検索する正確なテキストを知っている必要があります。ここで検索拡張生成(RAG)の出番です。ソースコードのセマンティクスを捉える方法でインデックスを作成し、エージェントがフリーテキスト検索を使用してオンデマンドで関連する断片を取得できるようにすれば、エージェントの強みを活かすインターフェースを作成できます。
エージェント時代の多くの素晴らしいアイデアと同様に、ネイティブのプロトタイプ実装は非常に簡単です。十分に評価されたプロダクショングレードのソリューションは、そうではありません。このシリーズの最初の部分では、パイプラインの初期段階である、生のソースファイルを適切にスコープされたユニットに分割する解析とチャンク化、およびそれらのユニットをセマンティック検索をサポートする表現に変換するベクトル化について説明します。
出典: Hacker News · 要約:HeadlinesBriefing