HeadlinesBriefing favicon HeadlinesBriefing.com

النماذج الصغيرة: حدود جديدة في الذكاء الاصطناعي

Hacker News •
×

خلال الأسابيع القليلة الماضية، كنت ألعب مع gpt-5.6-luna. إنه قادر بشكل مذهل، وسريع، وذكي. أراه بانتظام يعمل بحوالي 100 رمز في الثانية، ويتنقل في قاعدة الأكواد والبريد الإلكتروني وقاعدة المعرفة الخاصة بي. بالطبع، أكبر شيء مع luna هو التكلفة. لقد حاولت تشغيل بعض سلاسل البحث المعقدة إلى حد ما، ومن الصعب جدًا تكبد فاتورة كبيرة. حتى مع جعله يبحث في آلاف رسائل البريد الإلكتروني، أنتهي بتكلفة API تبلغ عشرات السنتات. مع GLM 5.3، لدينا حتى خيار جديد على حدود باريتو.

عند القيام بأعمال البرمجة، ألجأ دائمًا تقريبًا إلى النماذج الأغلى والأكثر قدرة (Fable 5، 5.6 Sol). لذلك كان من السهل تفويت التقدم الذي أحرزته النماذج الصغيرة السريعة. شيء ذكره بعض المستثمرين الذين تحدثت معهم: "من الغريب أننا لا نرى المزيد من شركات الذكاء الاصطناعي الاستهلاكية. لماذا؟" هناك إجابة مباشرة: تكاليف الرموز.

في الأوقات التي سبقت الذكاء الاصطناعي، كانت خطة التطبيقات الاستهلاكية الكبيرة تبدو هكذا: إنشاء موقع ويب مقنع يكون تشغيله رخيصًا إلى حد ما، جذب مجموعة من المستخدمين (عادةً مع بعض الانتشار الفيروسي)، جمع الأموال، التوسع إلى المزيد من المستخدمين، إنشاء سوق إعلانات. هذا يصف تقريبًا معظم الشركات الاستهلاكية الكبيرة (Google، Facebook، Snapchat، إلخ). ولكن ماذا لو كنت تريد إضافة الذكاء الاصطناعي إلى منتجك؟ حسنًا، الآن لديك تكاليف استدلال حقيقية على كل طلب! فجأة، تزداد كمية رأس المال المطلوبة بشكل كبير.

تقييمي المفضل هو بناء موقع أخبار يومي، مخصص لي: البحث عن @calvinfo على الإنترنت، معرفة الأخبار التي قد تعجبه، بناء موقع مصغر بأهم القصص اليوم، مخصص له، البحث في hn، reddit، twitter، إلخ. مع الجيل السابق من النماذج (فئة Sonnet)، كنت ستنفق حوالي 1 دولار للوصول إلى أي مكان. فرض 30 دولارًا شهريًا غير مستدام لتطبيق استهلاكي. هناك الكثير الذي يمكننا تحسينه هنا، ولكن إذا كنت تفرض ما تفرضه WSJ أو The Economist، فمن الأفضل أن تقدم قيمة مماثلة. ولكن بالنظر إلى luna، النتائج جيدة جدًا، ومتوسط التكلفة حوالي 0.10 دولار. الآن نحن نتحدث!

حيث أعتقد أن هذا يصبح أكثر إثارة للاهتمام هو في عالم الأعمال. أنا وشريكي المؤسس لـ Segment، Peter، قارنا مؤخرًا الملاحظات في نزهة. عبر شركاته الناشئة المختلفة، رأى Peter نوعين من العمل: عمل "IQ 180" (نوع من العبقرية العلمية المجنونة يأتي بحل مجنون لم تفكر فيه أبدًا) وعمل "بصاق الرموز" (كونك سريع الاستجابة للغاية، دفع الكرة للأمام عبر عشرات الجبهات المختلفة). يدير Peter شركات متعددة. إلى جانب Segment، جمع أكثر من 100 مليون دولار لـ Charm Industrial، وأغلق مؤخرًا جولة تمويل من الفئة A لـ Revoy. إنه منظم بشكل لا يصدق وفعال بوقته. ومع ذلك، ذكر Peter أن حوالي 95% من العمل الذي يقوم به يقع في الفئة 2. إنه القفز على المكالمات، ودفع الناس، والصد والهجوم. للتوضيح، يقول Peter إن شركاته ستكون ميتة في الماء اليوم بدون عقل تقني بـ IQ 180 يحل المشكلات العميقة. فقط أن معظم عمله يقع في الفئة 2.

أعتقد أن الطلب على نماذج "المستوى الحدودي" سيستمر في التضاعف، خاصة للمجالات التي تتطلب اختراقات أو اكتشافات جديدة (الهندسة، العلوم الصعبة، تدريب النماذج). لكنني أعتقد أيضًا أن الطلب على نماذج "سريعة/رخيصة/جيدة بما يكفي" على وشك الانطلاق. فكر في الأشخاص الذين تتفاعل معهم يوميًا: الزملاء والموردين والعملاء. تسع مرات من كل عشر، تريد شخصًا سريع الاستجابة للغاية ويتولى الأمور نيابة عنك. معظم "الرموز البشرية" في الشركات اليوم تُنفق بهذه الطريقة — التوظيف يميل بشدة نحو النموذج السريع/الرخيص/الجيد بما يكفي. هناك الكثير من العمل الذي يجب القيام به لجعل النماذج السريعة/الرخيصة/الجيدة بما يكفي حقيقة للأعمال: أدوات جديدة، أمان حقن المطالبات، الأدوار والأذونات. لكنني واثق من أننا سنكتشف ذلك. إذا كنت أيضًا تجرب جعل النماذج الصغيرة مفيدة، فيرجى مراسلتي. Amazon و Netflix هما الاستثناءان الملحوظان. Peter متواضع أيضًا هنا؛ إنه حاد للغاية.