टीमें पुनर्प्राप्ति कैसे करती हैं, यह तेज़ी से बदल रहा है। Cursor ने हाल ही में एम्बेडिंग के माध्यम से आपके कोड की खोज करना बंद कर दिया और केवल grep और अनुक्रमित खोज पर निर्भर रहना शुरू कर दिया। अन्य लोग अपने पारंपरिक रीरैंकर्स को Jev जैसे नए मॉडलों से बदल रहे हैं। एजेंट जिस सबसे महत्वपूर्ण ज्ञान पर निर्भर करते हैं, वह कंपनी का ज्ञान है: दस्तावेज़ीकरण, टिकट, चैट संदेश, आंतरिक विकी और कोड। फिर भी अधिकांश टीमें यह नहीं बता सकतीं कि कौन सी पुनर्प्राप्ति सबसे अच्छा काम करती है।
Kapa आपकी कंपनी के ज्ञान को अनुक्रमित करने और आपके एजेंटों को संदर्भ के लिए उसे खोजने देने का एक प्लेटफ़ॉर्म है। Company Knowledge Bench हमने अपने सिस्टम को बेहतर बनाने के लिए खुद बनाया: 1,000 मूल्यांकन मामले वास्तविक उत्पादन डेटा से एनोटेट किए गए। फिक्स्ड रिट्रीवल (पारंपरिक RAG), एजेंटिक grep और Kapa: 1,000 मूल्यांकन मामलों पर 7 पुनर्प्राप्तिकर्ता। निष्कर्ष: केवल grep के साथ एक फ्रंटियर मॉडल 0.61 पर एक ट्यून किए गए आधुनिक पुनर्प्राप्ति पाइपलाइन से मेल खाता है, लेकिन पांच गुना अधिक समय लेता है। एक अनुकूलित एजेंटिक पुनर्प्राप्तिकर्ता (Kapa Deep) और भी बेहतर करता है: लगभग पांच सेकंड में 0.65।
सार्वजनिक बेंचमार्क हमारे लिए काम नहीं करते क्योंकि उनमें से कोई भी हमारे द्वारा देखे जाने वाले सभी उपयोग मामलों और क्वेरी प्रकारों को कवर नहीं करता है। उपयोग मामलों में डेवलपर्स द्वारा दस्तावेज़ों, API विनिर्देशों, कोड और GitHub मुद्दों के माध्यम से उत्पाद के बारे में पूछना शामिल है; बिक्री और कर्मचारी Slack, Confluence, Notion के माध्यम से उत्पादों के बारे में पूछते हैं; सहायता टीमें पुराने टिकटों से उत्तर तैयार करती हैं। क्वेरीज़ लंबे संदेशों से लेकर "webhook retry backoff config" जैसी सटीक खोजों तक भिन्न होती हैं। Company Knowledge Bench पूर्णता, न्यूनतमता और स्रोत गुणवत्ता पर पुनर्प्राप्ति को स्कोर करता है।
स्रोत: Hacker News · HeadlinesBriefing द्वारा सारांशित