HeadlinesBriefing HeadlinesBriefing.com

إعادة تعلم نماذج اللغة الكبيرة للتلغراف لعام 1866 لتحقيق توفير 40% في الرموز

Hacker News •
×

يُظهر معيار قابل للتكرار على GitHub أن مطالبة نماذج اللغة الكبيرة بالكتابة بالأسلوب cablese—الأسلوب المختصر والحروف الصغيرة لرسائل التلغراف في القرن التاسع عشر—يحقق توفيرًا في الرموز بنسبة 40–49% دون فقدان الفهم downstream. باستخدام معيار من 50 مقطعًا وحوالي 1300 سؤال، وجدت الدراسة أن النماذج مثل gemma-4-31b، qwen3.8-27b، وGLM-5.3-Flash تحقق جميعها نسب استرداد تتراوح بين 0.99 و1.10 عند قراءة السجلات المضغوطة مقارنة بالنص العادي. المفتاح هو تعليمات lowercase واحدة: بدونها، تعود النماذج إلى الأحرف الكبيرة全部، مما يكلفها 14–19 نقطة دقة. Notably، لا يمكن لـ gpt-5-mini تعطيل الاستدلال، مما يضاعف فاتورته. تعمل هذه التقنية عبر أربع عائلات من النماذج، بما في ذلك تلك التي لم تُدرَّب أبدًا على cablese، مما يثبت أن القدرة موجودة بالفعل في أوزانها. يكون الضغط أكثر فعالية عندما يُطبق بعد استقرار المحتوى، وليس أثناء التأليف، مما يتجنب "ضريبة التسجيل". النتيجة هي تحسين مُتحقق منه وبتكلفة صفرية يضاعف تقريبًا السياق الفعال أو يقلل فواتير الإخراج إلى النصف.

المصدر: Hacker News · لخّصه HeadlinesBriefing