HeadlinesBriefing HeadlinesBriefing 12 languages

Benchmarking retrieval for agents on messy real-world company knowledge

Hacker News ·

🇬🇧 English

How teams do retrieval is changing fast. Cursor recently stopped searching your code via embeddings in favour of relying only on grep and indexed search. Others are swapping their traditional rerankers for new models like Jev. One of the most important kinds of knowledge that agents rely on is company knowledge: documentation, tickets, chat messages, internal wikis, and code. Yet most teams cannot tell which retrieval works best on it.

Kapa is a platform for indexing your company knowledge and letting your agents search them for context. The Company Knowledge Bench is what we built for ourselves to improve our own system: 1,000 eval cases annotated from real production data. Fixed retrieval (traditional RAG), agentic grep and Kapa: 7 retrievers on 1,000 eval cases. The takeaway: a frontier model with nothing but grep matches a tuned modern retrieval pipeline at 0.61, but takes five times as long. An optimized agentic retriever (Kapa Deep) does better still: 0.65 in about five seconds.

Public benchmarks do not work for us because none of them cover all the use cases and types of queries that we see. Use cases include developers asking about a product over docs, API specs, code and GitHub issues; sales and employees asking about products over Slack, Confluence, Notion; support teams drafting replies from old tickets. Queries vary from long messages to precise searches like "webhook retry backoff config". The Company Knowledge Bench scores retrieval on completeness, minimality, and source quality.

View original article →


🇸🇦 العربية

قياس أداء الاسترجاع للوكلاء على معرفة الشركة الفوضوية

كيف تقوم الفرق بالاسترجاع يتغير بسرعة. توقف Cursor مؤخرًا عن البحث في الكود الخاص بك عبر التضمينات لصالح الاعتماد فقط على grep والبحث المفهرس. آخرون يستبدلون معيدات الترتيب التقليدية الخاصة بهم بنماذج جديدة مثل Jev. أحد أهم أنواع المعرفة التي يعتمد عليها الوكلاء هي معرفة الشركة: التوثيق، التذاكر، رسائل الدردشة، الويكيات الداخلية، والكود. ومع ذلك، لا تستطيع معظم الفرق تحديد أي استرجاع يعمل بشكل أفضل عليها.

Kapa هو منصة لفهرسة معرفة شركتك والسماح لوكلائك بالبحث فيها للحصول على السياق. Company Knowledge Bench هو ما بنيناه لأنفسنا لتحسين نظامنا الخاص: 1,000 حالة تقييم مشروحة من بيانات إنتاج حقيقية. الاسترجاع الثابت (RAG التقليدي)، grep الوكيل، وKapa: 7 أدوات استرجاع على 1,000 حالة تقييم. الخلاصة: نموذج حدودي مع grep فقط يطابق خط أنابيب استرجاع حديث مضبوط عند 0.61، لكنه يستغرق خمس مرات أطول. أداة استرجاع وكيل محسنة (Kapa Deep) تفعل أفضل: 0.65 في حوالي خمس ثوانٍ.

المعايير العامة لا تعمل لصالحنا لأن أيا منها لا يغطي جميع حالات الاستخدام وأنواع الاستعلامات التي نراها. تشمل حالات الاستخدام المطورين الذين يسألون عن منتج عبر المستندات، مواصفات API، الكود، ومشكلات GitHub؛ المبيعات والموظفين الذين يسألون عن المنتجات عبر Slack وConfluence وNotion؛ فرق الدعم التي تصوغ ردودًا من التذاكر القديمة. تختلف الاستعلامات من الرسائل الطويلة إلى عمليات البحث الدقيقة مثل "webhook retry backoff config". يسجل Company Knowledge Bench الاسترجاع على الاكتمال، الأقلية، وجودة المصدر.

كيف يسجل Company Knowledge Bench الاسترجاع؟

يسجل Company Knowledge Bench الاسترجاع على ثلاث خصائص: الاكتمال (لا يحتاج الوكيل إلى أي شيء آخر للإجابة على الاستعلام)، الأقلية (إزالة أي جزء يضر بالاكتمال)، وجودة المصدر (استخدام أعلى المصادر جودة المتاحة). يستخدم 1,000 حالة تقييم مشروحة من بيانات إنتاج حقيقية.

العربية version →


🇧🇩 বাংলা

অগোছালো কোম্পানির জ্ঞানের উপর এজেন্টদের জন্য পুনরুদ্ধার বেঞ্চমার্কিং

দলগুলি কীভাবে পুনরুদ্ধার করে তা দ্রুত পরিবর্তিত হচ্ছে। Cursor সম্প্রতি এম্বেডিংয়ের মাধ্যমে আপনার কোড অনুসন্ধান বন্ধ করে দিয়েছে এবং শুধুমাত্র grep এবং সূচীকৃত অনুসন্ধানের উপর নির্ভর করতে শুরু করেছে। অন্যরা তাদের ঐতিহ্যবাহী রির্যাঙ্কারদের Jev-এর মতো নতুন মডেল দিয়ে প্রতিস্থাপন করছে। এজেন্টরা যে সবচেয়ে গুরুত্বপূর্ণ জ্ঞানের উপর নির্ভর করে তা হল কোম্পানির জ্ঞান: ডকুমেন্টেশন, টিকিট, চ্যাট বার্তা, অভ্যন্তরীণ উইকি এবং কোড। তবুও বেশিরভাগ দল বলতে পারে না কোন পুনরুদ্ধার সবচেয়ে ভালো কাজ করে।

Kapa হল আপনার কোম্পানির জ্ঞান সূচীকরণ এবং আপনার এজেন্টদের প্রসঙ্গের জন্য এটি অনুসন্ধান করার অনুমতি দেওয়ার একটি প্ল্যাটফর্ম। Company Knowledge Bench আমরা আমাদের নিজস্ব সিস্টেম উন্নত করার জন্য নিজেদের জন্য তৈরি করেছি: 1,000 মূল্যায়ন কেস বাস্তব উৎপাদন ডেটা থেকে টীকাযুক্ত। ফিক্সড রিট্রিভাল (ঐতিহ্যবাহী RAG), এজেন্টিক grep এবং Kapa: 1,000 মূল্যায়ন কেসে 7 পুনরুদ্ধারকারী। মূল কথা: শুধুমাত্র grep সহ একটি ফ্রন্টিয়ার মডেল 0.61-এ একটি টিউন করা আধুনিক পুনরুদ্ধার পাইপলাইনের সাথে মেলে, কিন্তু পাঁচ গুণ বেশি সময় নেয়। একটি অপ্টিমাইজড এজেন্টিক পুনরুদ্ধারকারী (Kapa Deep) আরও ভাল করে: প্রায় পাঁচ সেকেন্ডে 0.65।

পাবলিক বেঞ্চমার্ক আমাদের জন্য কাজ করে না কারণ তাদের কেউই আমাদের দেখা সমস্ত ব্যবহারের ক্ষেত্রে এবং ক্যোয়ারী প্রকারগুলি কভার করে না। ব্যবহারের ক্ষেত্রে ডেভেলপাররা ডক্স, API স্পেক, কোড এবং GitHub ইস্যুগুলির মাধ্যমে একটি পণ্য সম্পর্কে জিজ্ঞাসা করে; বিক্রয় এবং কর্মচারীরা Slack, Confluence, Notion-এর মাধ্যমে পণ্য সম্পর্কে জিজ্ঞাসা করে; সহায়তা দলগুলি পুরানো টিকিট থেকে উত্তর খসড়া করে। ক্যোয়ারীগুলি দীর্ঘ বার্তা থেকে "webhook retry backoff config"-এর মতো সুনির্দিষ্ট অনুসন্ধান পর্যন্ত পরিবর্তিত হয়। Company Knowledge Bench সম্পূর্ণতা, ন্যূনতমতা এবং উৎসের গুণমানের উপর পুনরুদ্ধার স্কোর করে।

Company Knowledge Bench কীভাবে পুনরুদ্ধার স্কোর করে?

Company Knowledge Bench তিনটি বৈশিষ্ট্যের উপর পুনরুদ্ধার স্কোর করে: সম্পূর্ণতা (এজেন্টের ক্যোয়ারী উত্তর দিতে আর কিছুর প্রয়োজন নেই), ন্যূনতমতা (কোনো অংশ সরানো সম্পূর্ণতার ক্ষতি করে), এবং উৎসের গুণমান (সর্বোচ্চ মানের উপলব্ধ উৎস ব্যবহার করা)। এটি বাস্তব উৎপাদন ডেটা থেকে টীকাযুক্ত 1,000 মূল্যায়ন কেস ব্যবহার করে।

বাংলা version →


🇩🇪 Deutsch

Benchmarking der Abfrage für Agenten auf unordentlichem Unternehmenswissen

Wie Teams Abfragen durchführen, ändert sich schnell. Cursor hat kürzlich aufgehört, Ihren Code über Embeddings zu durchsuchen, und verlässt sich stattdessen nur auf grep und indizierte Suche. Andere ersetzen ihre traditionellen Reranker durch neue Modelle wie Jev. Eine der wichtigsten Arten von Wissen, auf die Agenten angewiesen sind, ist Unternehmenswissen: Dokumentation, Tickets, Chat-Nachrichten, interne Wikis und Code. Doch die meisten Teams können nicht sagen, welche Abfrage am besten funktioniert.

Kapa ist eine Plattform zur Indexierung Ihres Unternehmenswissens, damit Ihre Agenten es für den Kontext durchsuchen können. Der Company Knowledge Bench ist das, was wir für uns selbst gebaut haben, um unser eigenes System zu verbessern: 1.000 Evaluierungsfälle, die aus echten Produktionsdaten annotiert wurden. Feste Abfrage (traditionelles RAG), agentisches grep und Kapa: 7 Abfragesysteme auf 1.000 Evaluierungsfällen. Das Fazit: Ein Frontier-Modell mit nichts als grep erreicht eine getunte moderne Abfrage-Pipeline bei 0,61, benötigt aber fünfmal so lange. Ein optimierter agentischer Abfragesystem (Kapa Deep) macht es noch besser: 0,65 in etwa fünf Sekunden.

Öffentliche Benchmarks funktionieren für uns nicht, weil keiner von ihnen alle Anwendungsfälle und Abfragearten abdeckt, die wir sehen. Anwendungsfälle umfassen Entwickler, die über Dokumente, API-Spezifikationen, Code und GitHub-Issues nach einem Produkt fragen; Vertrieb und Mitarbeiter, die über Slack, Confluence, Notion nach Produkten fragen; Support-Teams, die Antworten aus alten Tickets verfassen. Abfragen variieren von langen Nachrichten bis zu präzisen Suchen wie „webhook retry backoff config“. Der Company Knowledge Bench bewertet die Abfrage nach Vollständigkeit, Minimalität und Quellenqualität.

Wie bewertet Company Knowledge Bench die Abfrage?

Company Knowledge Bench bewertet die Abfrage nach drei Eigenschaften: Vollständigkeit (der Agent braucht nichts weiter, um die Abfrage zu beantworten), Minimalität (das Entfernen eines Chunks schadet der Vollständigkeit) und Quellenqualität (Verwendung der höchstmöglichen verfügbaren Quellen). Es verwendet 1.000 Evaluierungsfälle, die aus echten Produktionsdaten annotiert wurden.

Deutsch version →


🇪🇸 Español

Evaluación comparativa de la recuperación para agentes sobre conocimiento empresarial desordenado

La forma en que los equipos realizan la recuperación está cambiando rápidamente. Cursor recientemente dejó de buscar tu código mediante embeddings para confiar solo en grep y búsqueda indexada. Otros están reemplazando sus rerankers tradicionales por nuevos modelos como Jev. Uno de los tipos de conocimiento más importantes en los que confían los agentes es el conocimiento empresarial: documentación, tickets, mensajes de chat, wikis internas y código. Sin embargo, la mayoría de los equipos no pueden determinar qué recuperación funciona mejor.

Kapa es una plataforma para indexar tu conocimiento empresarial y permitir que tus agentes lo busquen para obtener contexto. El Company Knowledge Bench es lo que construimos para nosotros mismos para mejorar nuestro propio sistema: 1,000 casos de evaluación anotados a partir de datos de producción reales. Recuperación fija (RAG tradicional), grep agéntico y Kapa: 7 recuperadores en 1,000 casos de evaluación. La conclusión: un modelo fronterizo con solo grep iguala un pipeline de recuperación moderno ajustado con 0.61, pero toma cinco veces más tiempo. Un recuperador agéntico optimizado (Kapa Deep) hace aún mejor: 0.65 en unos cinco segundos.

Los benchmarks públicos no funcionan para nosotros porque ninguno cubre todos los casos de uso y tipos de consultas que vemos. Los casos de uso incluyen desarrolladores preguntando sobre un producto a través de documentos, especificaciones de API, código y problemas de GitHub; ventas y empleados preguntando sobre productos a través de Slack, Confluence, Notion; equipos de soporte redactando respuestas a partir de tickets antiguos. Las consultas varían desde mensajes largos hasta búsquedas precisas como "webhook retry backoff config". Company Knowledge Bench puntúa la recuperación en integridad, minimalidad y calidad de fuente.

¿Cómo puntúa Company Knowledge Bench la recuperación?

Company Knowledge Bench puntúa la recuperación en tres propiedades: integridad (el agente no necesita nada más para responder la consulta), minimalidad (eliminar cualquier fragmento perjudica la integridad) y calidad de fuente (usar las fuentes de mayor calidad disponibles). Utiliza 1,000 casos de evaluación anotados de datos de producción reales.

Español version →


🇫🇷 Français

Évaluation comparative de la récupération pour les agents sur des connaissances d'entreprise désordonnées

La façon dont les équipes effectuent la récupération change rapidement. Cursor a récemment cessé de rechercher votre code via des embeddings pour ne compter que sur grep et la recherche indexée. D'autres remplacent leurs rerankers traditionnels par de nouveaux modèles comme Jev. L'un des types de connaissances les plus importants sur lesquels les agents s'appuient est la connaissance d'entreprise : documentation, tickets, messages de chat, wikis internes et code. Pourtant, la plupart des équipes ne peuvent pas dire quelle récupération fonctionne le mieux.

Kapa est une plateforme pour indexer vos connaissances d'entreprise et permettre à vos agents de les rechercher pour obtenir du contexte. Le Company Knowledge Bench est ce que nous avons construit pour nous-mêmes afin d'améliorer notre propre système : 1 000 cas d'évaluation annotés à partir de données de production réelles. Récupération fixe (RAG traditionnel), grep agentique et Kapa : 7 récupérateurs sur 1 000 cas d'évaluation. Le point clé : un modèle de frontière avec seulement grep correspond à un pipeline de récupération moderne réglé à 0,61, mais prend cinq fois plus de temps. Un récupérateur agentique optimisé (Kapa Deep) fait encore mieux : 0,65 en environ cinq secondes.

Les benchmarks publics ne fonctionnent pas pour nous car aucun ne couvre tous les cas d'utilisation et types de requêtes que nous voyons. Les cas d'utilisation incluent les développeurs posant des questions sur un produit via des documents, des spécifications API, du code et des problèmes GitHub ; les ventes et employés posant des questions sur des produits via Slack, Confluence, Notion ; les équipes de support rédigeant des réponses à partir d'anciens tickets. Les requêtes varient des longs messages aux recherches précises comme "webhook retry backoff config". Company Knowledge Bench note la récupération sur l'exhaustivité, la minimalité et la qualité des sources.

Comment Company Knowledge Bench note-t-il la récupération ?

Company Knowledge Bench note la récupération sur trois propriétés : l'exhaustivité (l'agent n'a besoin de rien d'autre pour répondre à la requête), la minimalité (supprimer un fragment nuit à l'exhaustivité) et la qualité des sources (utiliser les sources de la plus haute qualité disponibles). Il utilise 1 000 cas d'évaluation annotés à partir de données de production réelles.

Français version →


🇮🇳 हिन्दी

अव्यवस्थित कंपनी ज्ञान पर एजेंटों के लिए पुनर्प्राप्ति बेंचमार्किंग

टीमें पुनर्प्राप्ति कैसे करती हैं, यह तेज़ी से बदल रहा है। Cursor ने हाल ही में एम्बेडिंग के माध्यम से आपके कोड की खोज करना बंद कर दिया और केवल grep और अनुक्रमित खोज पर निर्भर रहना शुरू कर दिया। अन्य लोग अपने पारंपरिक रीरैंकर्स को Jev जैसे नए मॉडलों से बदल रहे हैं। एजेंट जिस सबसे महत्वपूर्ण ज्ञान पर निर्भर करते हैं, वह कंपनी का ज्ञान है: दस्तावेज़ीकरण, टिकट, चैट संदेश, आंतरिक विकी और कोड। फिर भी अधिकांश टीमें यह नहीं बता सकतीं कि कौन सी पुनर्प्राप्ति सबसे अच्छा काम करती है।

Kapa आपकी कंपनी के ज्ञान को अनुक्रमित करने और आपके एजेंटों को संदर्भ के लिए उसे खोजने देने का एक प्लेटफ़ॉर्म है। Company Knowledge Bench हमने अपने सिस्टम को बेहतर बनाने के लिए खुद बनाया: 1,000 मूल्यांकन मामले वास्तविक उत्पादन डेटा से एनोटेट किए गए। फिक्स्ड रिट्रीवल (पारंपरिक RAG), एजेंटिक grep और Kapa: 1,000 मूल्यांकन मामलों पर 7 पुनर्प्राप्तिकर्ता। निष्कर्ष: केवल grep के साथ एक फ्रंटियर मॉडल 0.61 पर एक ट्यून किए गए आधुनिक पुनर्प्राप्ति पाइपलाइन से मेल खाता है, लेकिन पांच गुना अधिक समय लेता है। एक अनुकूलित एजेंटिक पुनर्प्राप्तिकर्ता (Kapa Deep) और भी बेहतर करता है: लगभग पांच सेकंड में 0.65।

सार्वजनिक बेंचमार्क हमारे लिए काम नहीं करते क्योंकि उनमें से कोई भी हमारे द्वारा देखे जाने वाले सभी उपयोग मामलों और क्वेरी प्रकारों को कवर नहीं करता है। उपयोग मामलों में डेवलपर्स द्वारा दस्तावेज़ों, API विनिर्देशों, कोड और GitHub मुद्दों के माध्यम से उत्पाद के बारे में पूछना शामिल है; बिक्री और कर्मचारी Slack, Confluence, Notion के माध्यम से उत्पादों के बारे में पूछते हैं; सहायता टीमें पुराने टिकटों से उत्तर तैयार करती हैं। क्वेरीज़ लंबे संदेशों से लेकर "webhook retry backoff config" जैसी सटीक खोजों तक भिन्न होती हैं। Company Knowledge Bench पूर्णता, न्यूनतमता और स्रोत गुणवत्ता पर पुनर्प्राप्ति को स्कोर करता है।

Company Knowledge Bench पुनर्प्राप्ति को कैसे स्कोर करता है?

Company Knowledge Bench पुनर्प्राप्ति को तीन गुणों पर स्कोर करता है: पूर्णता (एजेंट को क्वेरी का उत्तर देने के लिए और कुछ नहीं चाहिए), न्यूनतमता (किसी भी खंड को हटाने से पूर्णता को नुकसान होता है), और स्रोत गुणवत्ता (उपलब्ध उच्चतम गुणवत्ता वाले स्रोतों का उपयोग करना)। यह वास्तविक उत्पादन डेटा से एनोटेट किए गए 1,000 मूल्यांकन मामलों का उपयोग करता है।

हिन्दी version →


🇮🇩 Bahasa Indonesia

Tolok ukur pengambilan untuk agen pada pengetahuan perusahaan yang berantakan

Bagaimana tim melakukan pengambilan berubah dengan cepat. Cursor baru-baru ini berhenti mencari kode Anda melalui embeddings dan hanya mengandalkan grep dan pencarian terindeks. Yang lain mengganti perangking ulang tradisional mereka dengan model baru seperti Jev. Salah satu jenis pengetahuan terpenting yang diandalkan agen adalah pengetahuan perusahaan: dokumentasi, tiket, pesan obrolan, wiki internal, dan kode. Namun sebagian besar tim tidak dapat mengetahui pengambilan mana yang paling baik.

Kapa adalah platform untuk mengindeks pengetahuan perusahaan Anda dan memungkinkan agen Anda mencarinya untuk konteks. Company Knowledge Bench adalah apa yang kami bangun untuk diri kami sendiri untuk meningkatkan sistem kami: 1.000 kasus evaluasi yang dianotasi dari data produksi nyata. Pengambilan tetap (RAG tradisional), grep agen, dan Kapa: 7 pengambil pada 1.000 kasus evaluasi. Kesimpulannya: model frontier dengan hanya grep cocok dengan pipeline pengambilan modern yang disetel pada 0,61, tetapi membutuhkan waktu lima kali lebih lama. Pengambil agen yang dioptimalkan (Kapa Deep) melakukan lebih baik lagi: 0,65 dalam waktu sekitar lima detik.

Tolok ukur publik tidak berfungsi untuk kami karena tidak ada yang mencakup semua kasus penggunaan dan jenis kueri yang kami lihat. Kasus penggunaan termasuk pengembang yang bertanya tentang produk melalui dokumen, spesifikasi API, kode, dan masalah GitHub; penjualan dan karyawan yang bertanya tentang produk melalui Slack, Confluence, Notion; tim dukungan yang menyusun balasan dari tiket lama. Kueri bervariasi dari pesan panjang hingga pencarian tepat seperti "webhook retry backoff config". Company Knowledge Bench memberi skor pengambilan berdasarkan kelengkapan, minimalitas, dan kualitas sumber.

Bagaimana Company Knowledge Bench memberi skor pengambilan?

Company Knowledge Bench memberi skor pengambilan pada tiga properti: kelengkapan (agen tidak memerlukan apa pun lagi untuk menjawab kueri), minimalitas (menghapus bagian mana pun merusak kelengkapan), dan kualitas sumber (menggunakan sumber berkualitas tertinggi yang tersedia). Ini menggunakan 1.000 kasus evaluasi yang dianotasi dari data produksi nyata.

Bahasa Indonesia version →


🇯🇵 日本語

エージェントのための乱雑な企業知識における検索ベンチマーク

チームが検索を行う方法は急速に変化しています。Cursorは最近、埋め込みによるコード検索をやめ、grepとインデックス検索のみに依存するようになりました。他のチームは、従来のリランカーをJevのような新しいモデルに交換しています。エージェントが依存する最も重要な知識の1つは、企業知識です:ドキュメント、チケット、チャットメッセージ、内部Wiki、コード。しかし、ほとんどのチームはどの検索が最適かを判断できません。

Kapaは、企業知識をインデックス化し、エージェントがコンテキストのためにそれを検索できるようにするプラットフォームです。Company Knowledge Benchは、私たち自身のシステムを改善するために構築したものです:実際の本番データから注釈が付けられた1,000件の評価ケース。固定検索(従来のRAG)、エージェンティックgrep、Kapa:1,000件の評価ケースにおける7つの検索機能。要点:grepのみを使用するフロンティアモデルは、調整された最新の検索パイプラインと0.61で一致しますが、5倍の時間がかかります。最適化されたエージェンティック検索(Kapa Deep)はさらに優れており、約5秒で0.65を達成します。

公開ベンチマークは、私たちが見るすべてのユースケースとクエリタイプをカバーしていないため、私たちには機能しません。ユースケースには、開発者がドキュメント、API仕様、コード、GitHubの問題を通じて製品について質問する;営業や従業員がSlack、Confluence、Notionを通じて製品について質問する;サポートチームが古いチケットから返信を作成する、などが含まれます。クエリは長いメッセージから「webhook retry backoff config」のような正確な検索までさまざまです。Company Knowledge Benchは、完全性、最小性、ソース品質に基づいて検索をスコアリングします。

Company Knowledge Benchはどのように検索をスコアリングしますか?

Company Knowledge Benchは、3つの特性に基づいて検索をスコアリングします:完全性(エージェントがクエリに答えるために他に何も必要としない)、最小性(チャンクを削除すると完全性が損なわれる)、ソース品質(利用可能な最高品質のソースを使用する)。実際の本番データから注釈が付けられた1,000件の評価ケースを使用します。

日本語 version →


🇧🇷 Português

Avaliação comparativa de recuperação para agentes em conhecimento empresarial bagunçado

Como as equipes fazem a recuperação está mudando rapidamente. A Cursor recentemente parou de pesquisar seu código por meio de embeddings para confiar apenas em grep e pesquisa indexada. Outros estão trocando seus rerankers tradicionais por novos modelos como Jev. Um dos tipos mais importantes de conhecimento em que os agentes confiam é o conhecimento empresarial: documentação, tickets, mensagens de chat, wikis internas e código. No entanto, a maioria das equipes não consegue dizer qual recuperação funciona melhor.

Kapa é uma plataforma para indexar seu conhecimento empresarial e permitir que seus agentes o pesquisem para obter contexto. O Company Knowledge Bench é o que construímos para nós mesmos para melhorar nosso próprio sistema: 1.000 casos de avaliação anotados a partir de dados de produção reais. Recuperação fixa (RAG tradicional), grep agentivo e Kapa: 7 recuperadores em 1.000 casos de avaliação. A conclusão: um modelo de fronteira com apenas grep corresponde a um pipeline de recuperação moderno ajustado em 0,61, mas leva cinco vezes mais tempo. Um recuperador agentivo otimizado (Kapa Deep) faz ainda melhor: 0,65 em cerca de cinco segundos.

Os benchmarks públicos não funcionam para nós porque nenhum deles cobre todos os casos de uso e tipos de consultas que vemos. Os casos de uso incluem desenvolvedores perguntando sobre um produto por meio de documentos, especificações de API, código e problemas do GitHub; vendas e funcionários perguntando sobre produtos por meio de Slack, Confluence, Notion; equipes de suporte redigindo respostas a partir de tickets antigos. As consultas variam de mensagens longas a pesquisas precisas como "webhook retry backoff config". O Company Knowledge Bench pontua a recuperação em integridade, minimalidade e qualidade da fonte.

Como o Company Knowledge Bench pontua a recuperação?

O Company Knowledge Bench pontua a recuperação em três propriedades: integridade (o agente não precisa de mais nada para responder à consulta), minimalidade (remover qualquer fragmento prejudica a integridade) e qualidade da fonte (usar as fontes da mais alta qualidade disponíveis). Ele usa 1.000 casos de avaliação anotados a partir de dados de produção reais.

Português version →


🇷🇺 Русский

Бенчмаркинг поиска для агентов на основе запутанных корпоративных знаний

То, как команды осуществляют поиск, быстро меняется. Cursor недавно прекратил поиск вашего кода с помощью эмбеддингов в пользу использования только grep и индексированного поиска. Другие заменяют свои традиционные реранкеры новыми моделями, такими как Jev. Одним из наиболее важных видов знаний, на которые полагаются агенты, являются корпоративные знания: документация, тикеты, сообщения чата, внутренние вики и код. Тем не менее, большинство команд не могут определить, какой поиск работает лучше всего.

Kapa — это платформа для индексации ваших корпоративных знаний и предоставления вашим агентам возможности искать их для получения контекста. Company Knowledge Bench — это то, что мы создали для себя, чтобы улучшить нашу собственную систему: 1 000 оценочных случаев, аннотированных на основе реальных производственных данных. Фиксированный поиск (традиционный RAG), агентный grep и Kapa: 7 поисковых систем на 1 000 оценочных случаев. Вывод: фронтальная модель только с grep соответствует настроенному современному конвейеру поиска с результатом 0,61, но занимает в пять раз больше времени. Оптимизированный агентный поиск (Kapa Deep) работает еще лучше: 0,65 примерно за пять секунд.

Публичные бенчмарки не работают для нас, потому что ни один из них не охватывает все варианты использования и типы запросов, которые мы видим. Варианты использования включают разработчиков, задающих вопросы о продукте через документы, спецификации API, код и проблемы GitHub; продавцов и сотрудников, задающих вопросы о продуктах через Slack, Confluence, Notion; команды поддержки, составляющие ответы на основе старых тикетов. Запросы варьируются от длинных сообщений до точных поисков, таких как "webhook retry backoff config". Company Knowledge Bench оценивает поиск по полноте, минимальности и качеству источника.

Как Company Knowledge Bench оценивает поиск?

Company Knowledge Bench оценивает поиск по трем свойствам: полнота (агенту больше ничего не нужно для ответа на запрос), минимальность (удаление любого фрагмента вредит полноте) и качество источника (использование доступных источников наивысшего качества). Он использует 1 000 оценочных случаев, аннотированных на основе реальных производственных данных.

Русский version →


🇨🇳 简体中文

为代理在混乱的公司知识上进行检索基准测试

团队进行检索的方式正在迅速变化。Cursor 最近停止使用嵌入搜索代码,转而仅依赖 grep 和索引搜索。其他人正在用 Jev 等新模型替换传统的重排序器。代理依赖的最重要知识之一是公司知识:文档、工单、聊天消息、内部维基和代码。然而,大多数团队无法判断哪种检索效果最好。

Kapa 是一个用于索引公司知识并让代理搜索上下文的平台。Company Knowledge Bench 是我们为改进自身系统而构建的:1,000 个评估案例,来自真实生产数据并经过标注。固定检索(传统 RAG)、代理 grep 和 Kapa:7 个检索器在 1,000 个评估案例上。要点:一个仅使用 grep 的前沿模型与经过调优的现代检索管道匹配,得分为 0.61,但耗时是其五倍。优化的代理检索器(Kapa Deep)表现更好:约五秒内达到 0.65。

公共基准测试对我们不适用,因为它们没有涵盖我们看到的所有用例和查询类型。用例包括开发人员通过文档、API 规范、代码和 GitHub 问题询问产品;销售和员工通过 Slack、Confluence、Notion 询问产品;支持团队根据旧工单起草回复。查询从长消息到精确搜索(如“webhook retry backoff config”)不等。Company Knowledge Bench 根据完整性、最小性和源质量对检索进行评分。

Company Knowledge Bench 如何对检索进行评分?

Company Knowledge Bench 根据三个属性对检索进行评分:完整性(代理无需其他信息即可回答查询)、最小性(移除任何块会损害完整性)和源质量(使用可用的最高质量源)。它使用了来自真实生产数据的 1,000 个标注评估案例。

简体中文 version →