HeadlinesBriefing favicon HeadlinesBriefing.com

لماذا لا أزال متشائمًا بشأن LLM بعد Navier-Stokes

Hacker News •
×

شكرًا لـ Claude Fable 5.1 وHolden Saberhagen وGabriel Kammer وAndres Erbsen وAlice McKean وTristan Wylde-Larue على التعليقات.

يُقيَّم مختبرو الحدود على أساس سردية بديل تلقائي كامل لعمال المعرفة، لكن النماذج الحالية تحتاج إلى إشراف شاق حتى في المهام البسيطة. العروض الرئيسية مثل Navier-Stokes وثغرات FreeBSD RCE وحادثة HuggingFace مضللة. النماذج تعمم فقط بالقرب من مهام التدريب، مع تحذيرات شديدة. يحتاج اختراق المكافآت إلى مواصفات صارمة من خبراء المجال، الذين يكون وقتهم مكلفًا. المواصفات مهارة بحد ذاتها؛ قليل من خبراء المجال يمتلكونها. يمكن أن تتجاوز تكاليف العمالة التنفيذ المباشر. تُظهر الأجهزة نسب مواصفات إلى تصميم 3:1 أو 5:1. تتطلب العديد من المهام مواصفات متطورة. المواصفات عالية المستوى مكلفة للتحقق. Navier-Stokes هو أفضل حالة: Lean مدقق، لكن توجد أخطاء في السلامة. المراجعة البشرية لا تتوسع وهي عرضة للاختراقات مثل باب خلفي xz.

الكيانات الرئيسية: الشركات: HuggingFace | الأشخاص: Claude Fable 5.1، Holden Saberhagen، Gabriel Kammer، Andres Erbsen، Alice McKean، Tristan Wylde-Larue

الأسئلة الشائعة: لماذا يُبالغ في تقييم مختبرات الحدود وفقًا للمؤلف؟

يُقيَّمون على أساس سردية الأتمتة الكاملة، لكن النماذج الحالية تتطلب إشرافًا مكلفًا وتفشل في الاضطرابات الصغيرة.

سؤال شائع: لماذا يُبالغ في تقييم مختبرات الحدود وفقًا للمؤلف؟

جواب شائع: يُقيَّمون على أساس سردية الأتمتة الكاملة، لكن النماذج الحالية تتطلب إشرافًا مكلفًا وتفشل في الاضطرابات الصغيرة.