إليك سؤال يستحق أن تطرحه على فريقك المالي: كم تبقى من ميزانية الذكاء الاصطناعي لهذا العام؟ بالنسبة لعدد مذهل من الشركات، الإجابة الصادقة هي "ليس كثيرًا". بعضها ينفد بحلول أبريل. الميزانية السنوية، تختفي في ربع سنة. السبب الأكبر هو كيف نستخدمها. لقد انتقلنا من طرح الأسئلة على روبوتات الدردشة إلى تشغيل الوكلاء. والوكلاء لا يجيبون فقط. إنهم يستدعون الأدوات، ويقرؤون الملفات، ويتحققون من النتائج ويستدعون المزيد من الأدوات. كل خطوة من تلك الخطوات تحرق الرموز. يمكن أن يكلف طلب وكيل واحد أضعاف ما تكلفه رسالة دردشة عادية. لا يساعد أن التسعير نفسه يستمر في التحرك. هناك اشتراكات. هناك وصول API للدفع حسب الاستخدام. هناك عروض ترويجية تظهر لبضعة أشهر لمنع الناس من التبديل، ونماذج جديدة من الدرجة الأولى تصل كل بضعة أشهر بنقاط سعرها الخاصة. لذا قبل أن ندخل في كيفية خفض الفاتورة، دعنا نتأكد من أننا جميعًا نفهم ما ندفع مقابله بالفعل. لأنه بمجرد أن ترى كيف يعمل العداد، تصبح المدخرات واضحة. LLM يتنبأ برمز واحد في كل مرة. لكل رمز، يقوم بتشغيل مجموعة من العمليات الحسابية. للتنبؤ بالرمز التالي، يحتاج إلى العمليات الحسابية لكل رمز قبله. مرارًا وتكرارًا، حتى ينتج رمزًا خاصًا "انتهيت". تخيل كل استدعاء API كطريق برسوم مرور. تدفع للدخول (رموز الإدخال)، وتدفع للخروج (رموز الإخراج). الإخراج هو المسار الأغلى. خذ تشكيلة Anthropic كمثال. Claude Fable 5 بسعر 10 دولارات لكل مليون رمز دخول و50 دولارًا لكل مليون خروج. هذا فرق 10x بين أرخص وأغلى نموذج من نفس الشركة. الآن ابحث عن أصغر سطر في ورقة الأسعار تلك. الرموز المخزنة مؤقتًا تكلف عُشر الرموز العادية. احتفظ بهذا الرقم في جيبك. إنه يساوي أكثر من كل شيء آخر في هذه المقالة مجتمعة. بدون التخزين المؤقت، يحتاج النموذج إلى المحادثة بأكملها في كل مرة. ترسل الرسالة الأولى. يعيد إرسال الرسالة الأولى بالإضافة إلى رده. ترسل المجموعة بأكملها بالإضافة إلى الرسالة الثالثة. يعيد إرسال كل ذلك بالإضافة إلى الرد الثاني.
المصدر: Towards Data Science · لخّصه HeadlinesBriefing