HeadlinesBriefing HeadlinesBriefing.com

अपार्टमेंट खोज: कम कॉल, अच्छे मैच

Towards Data Science •
×

अपने पेपर Frugal GPT में, Lingjiao Chen, Matei Zaharia और James Zou एक बड़े भाषा मॉडल (LLM) को कॉल करने की लागत कम करने के तीन तरीके बताते हैं: प्रॉम्प्ट अनुकूलन, LLM अनुमान और LLM कैस्केड। लेखक रिपोर्ट करते हैं कि उनका कैस्केड पहले सस्ते मॉडल आज़माता है और 98 प्रतिशत तक लागत कम करके सर्वश्रेष्ठ व्यक्तिगत मॉडल के प्रदर्शन से मेल खा सकता है। मैंने एक छोटा एजेंट बनाया जिसका मैं कॉल दर कॉल निरीक्षण कर सकता था। यह एक किराएदार की आवश्यकताओं के विरुद्ध अपार्टमेंट लिस्टिंग की जाँच करता है, जैसे ऑस्टिन में $1,500 से कम का दो बेडरूम जो कुत्तों की अनुमति देता है। मेरे पहले संस्करण ने हर लिस्टिंग को एक मजबूत मॉडल को भेजा, भले ही शहर का नाम या किराए का आंकड़ा पहले ही लिस्टिंग को खारिज कर चुका हो। इसका मतलब था 101 वास्तविक मैच खोजने के लिए 2,500 मॉडल कॉल।

यह लेख एक के बजाय तीन शुरुआती बिंदुओं को मापता है। पहला हर जोड़ी को मॉडल को भेजता है। दूसरा एक एजेंट है जो पहले से ही शहर द्वारा खोज करता है। तीसरा किसी भी मॉडल के लिस्टिंग देखने से पहले शहर, बेडरूम और किराए पर डेटाबेस क्वेरी चलाता है। मैंने 2019 के संयुक्त राज्य अमेरिका के किराए के विज्ञापनों के एक सार्वजनिक डेटासेट से 500 लिस्टिंग का एक निश्चित नमूना लिया। मैंने पाँच किराएदार आवश्यकताएँ लिखीं और समान उत्तरों के विरुद्ध एजेंट के हर संस्करण को स्कोर किया। मजबूत मॉडल Open AI का gpt-6-sol था, जिसे मैं Sol कहता हूँ, और सस्ता मॉडल gpt-6-luna था, जिसे मैं Luna कहता हूँ। मैंने Weights & Biases (W&B) Weave के साथ हर कॉल को ट्रेस किया।

डेटाबेस क्वेरी शुरुआती बिंदु की तुलना में, अंतिम संस्करण की लागत लगभग 25 गुना कम थी। अनुमानित लागत समान 2,500 जाँचों के लिए $0.20 के मुकाबले $0.008 थी, और अंतिम संस्करण ने बिना किसी गलती के सभी 101 मैच लौटाए। कोड को पालतू जानवरों के फ़ील्ड को तय करने देने से उस गिरावट का लगभग 44 प्रतिशत हिस्सा बना, और मजबूत बैकअप के साथ सस्ते मॉडल का उपयोग करने से लगभग 39 प्रतिशत हिस्सा बना। एक छोटा प्रॉम्प्ट और पुन: उपयोग किए गए उत्तरों ने बाकी हिस्सा बनाया।

तीन निष्कर्षों ने मुझे आश्चर्यचकित किया। Weave के लागत कॉलम ने हर कॉल के लिए $0.0000 दिखाया। Sol पूरी लिस्टिंग के साथ 10 में से 10 बार एक मैच चूक गया, और केवल शीर्षक और बॉडी के साथ 10 में से 10 बार उसे मिल गया। कम टेक्स्ट भेजने से बेहतर उत्तर मिला। दोनों मॉडलों ने लगभग हर उत्तर पर 5 का आत्मविश्वास बताया। एक नियम जो 5 से नीचे बढ़ता है, लगभग कभी फायर नहीं होता, इसलिए यह ज़्यादा काम नहीं कर सकता। लेख यह भी बताता है कि परीक्षण कहाँ कमज़ोर है। 101 मैचों में से केवल एक टेक्स्ट पढ़ने पर निर्भर करता है, इसलिए परीक्षण समझ को मापने की तुलना में लागत को बहुत बेहतर मापता है।

स्रोत: Towards Data Science · HeadlinesBriefing द्वारा सारांशित