HeadlinesBriefing HeadlinesBriefing.com

وكيل بحث: استدعاءات أقل، نتائج جيدة

Towards Data Science •
×

في ورقتهم البحثية Frugal GPT، يصف Lingjiao Chen وMatei Zaharia وJames Zou ثلاث طرق لخفض تكلفة استدعاء نموذج لغة كبير (LLM): تكييف المطالبة، وتقريب LLM، وتسلسل LLM. أفاد المؤلفون أن التسلسل الخاص بهم يجرب النماذج الأرخص أولاً ويمكنه مطابقة أداء أفضل نموذج فردي مع خفض في التكلفة يصل إلى 98 بالمائة. لقد بنيت وكيلًا صغيرًا يمكنني فحصه استدعاءً تلو الآخر. يتحقق من قوائم الشقق مقابل متطلبات المستأجر، مثل غرفة نوم مزدوجة في أوستن بأقل من 1500 دولار تسمح بالكلاب. أرسل إصداي الأول كل قائمة إلى نموذج قوي، حتى عندما كان اسم المدينة أو رقم الإيجار قد استبعد القائمة بالفعل. هذا يعني 2,500 استدعاء نموذج للعثور على 101 تطابق حقيقي.

تقيس هذه المقالة ثلاث نقاط بداية بدلاً من نقطة واحدة. الأول يرسل كل زوج إلى النموذج. الثاني هو وكيل يبحث بالفعل حسب المدينة. الثالث ينفذ استعلام قاعدة بيانات عن المدينة وغرف النوم والإيجار قبل أن يرى أي نموذج قائمة. أخذت عينة ثابتة من 500 قائمة من مجموعة بيانات عامة لإعلانات الإيجار في الولايات المتحدة لعام 2019. كتبت خمسة متطلبات للمستأجر وسجلت كل إصدار من الوكيل مقابل نفس الإجابات. كان النموذج القوي هو gpt-6-sol من Open AI، والذي أسميه Sol، والنموذج الأرخص كان gpt-6-luna، والذي أسميه Luna. تتبعت كل استدعاء باستخدام Weights & Biases (W&B) Weave.

مقارنة بنقطة بداية استعلام قاعدة البيانات، كلف الإصدار النهائي حوالي 25 مرة أقل. كانت التكلفة المقدرة 0.008 دولار مقابل 0.20 دولار لنفس الشيكات البالغ عددها 2,500، وأعاد الإصدار النهائي جميع المطابقات الـ101 دون أي أخطاء. شكل ترك الكود لتسوية حقل الحيوانات الأليفة حوالي 44 بالمائة من ذلك الانخفاض، وشكل استخدام النموذج الأرخص مع نسخة احتياطية قوية حوالي 39 بالمائة. شكلت المطالبة الأقصر والإجابات المعاد استخدامها الباقي.

ثلاث نتائج فاجأتني. أظهر عمود التكلفة في Weave $0.0000 لكل استدعاء. أخطأ Sol في تطابق 10 مرات من أصل 10 مع القائمة الكاملة، ووجده 10 مرات من أصل 10 مع العنوان والنص فقط. إرسال نص أقل أعطى إجابة أفضل. أبلغ كلا النموذجين عن ثقة بمقدار 5 في كل إجابة تقريبًا. قاعدة تتصاعد عند أقل من 5 لا يتم تفعيلها أبدًا تقريبًا، لذا لا يمكنها القيام بالكثير من العمل. تقول المقالة أيضًا أين يكون الاختبار ضعيفًا. يعتمد واحد فقط من المطابقات الـ101 على قراءة النص، لذا فإن الاختبار يقيس التكلفة بشكل أفضل بكثير مما يقيس الفهم.

المصدر: Towards Data Science · لخّصه HeadlinesBriefing