HeadlinesBriefing HeadlinesBriefing.com

Abfrage-Benchmarking Agenten: Unternehmenswissen

Hacker News •
×

Wie Teams Abfragen durchführen, ändert sich schnell. Cursor hat kürzlich aufgehört, Ihren Code über Embeddings zu durchsuchen, und verlässt sich stattdessen nur auf grep und indizierte Suche. Andere ersetzen ihre traditionellen Reranker durch neue Modelle wie Jev. Eine der wichtigsten Arten von Wissen, auf die Agenten angewiesen sind, ist Unternehmenswissen: Dokumentation, Tickets, Chat-Nachrichten, interne Wikis und Code. Doch die meisten Teams können nicht sagen, welche Abfrage am besten funktioniert.

Kapa ist eine Plattform zur Indexierung Ihres Unternehmenswissens, damit Ihre Agenten es für den Kontext durchsuchen können. Der Company Knowledge Bench ist das, was wir für uns selbst gebaut haben, um unser eigenes System zu verbessern: 1.000 Evaluierungsfälle, die aus echten Produktionsdaten annotiert wurden. Feste Abfrage (traditionelles RAG), agentisches grep und Kapa: 7 Abfragesysteme auf 1.000 Evaluierungsfällen. Das Fazit: Ein Frontier-Modell mit nichts als grep erreicht eine getunte moderne Abfrage-Pipeline bei 0,61, benötigt aber fünfmal so lange. Ein optimierter agentischer Abfragesystem (Kapa Deep) macht es noch besser: 0,65 in etwa fünf Sekunden.

Öffentliche Benchmarks funktionieren für uns nicht, weil keiner von ihnen alle Anwendungsfälle und Abfragearten abdeckt, die wir sehen. Anwendungsfälle umfassen Entwickler, die über Dokumente, API-Spezifikationen, Code und GitHub-Issues nach einem Produkt fragen; Vertrieb und Mitarbeiter, die über Slack, Confluence, Notion nach Produkten fragen; Support-Teams, die Antworten aus alten Tickets verfassen. Abfragen variieren von langen Nachrichten bis zu präzisen Suchen wie „webhook retry backoff config“. Der Company Knowledge Bench bewertet die Abfrage nach Vollständigkeit, Minimalität und Quellenqualität.

Quelle: Hacker News · Zusammengefasst von HeadlinesBriefing