HeadlinesBriefing HeadlinesBriefing.com

LLMs ১৮৬৬-এর টেলিগ্রাফ শৈলী পুনরায় শিখে ৪০% টোকেন বাঁচায়

Hacker News •
×

GitHub-এ একটি পুনরাবৃত্তিযোগ্য বেঞ্চমার্ক দেখায় যে LLMs-কে cablese—১৯শতকের টেলিগ্রামের সংক্ষিপ্ত, lowercase শৈলী—এ লেখার জন্য প্ররোচিত করলে ৪০–৪৯% টোকেন বাঁচা হয় downstream বোঝার কোনো ক্ষতি না হলে। ৫০-অংশ, ~১,৩০০-প্রশ্ন বেঞ্চমার্ক ব্যবহার করে, अध्ययन পाया যে gemma-4-31b, qwen3.8-27b, এবং GLM-5.3-Flash जैसे মডেলস সংকুচিত রেকর্ড পড়লে PLAINTEXT এর তুলনায় ০.৯৯ এবং ১.১০ মধ্যে রিকভারি অনুপাত অর্জন করে। মূলটি একটি ছোট lowercase নির্দেশ: এর ausenciaে, মডেলস ডিফল্টভাবে ALL CAPS-এ চলে যায়, যার ফলে ১৪–১৯ অंक শুধুতাই ক্ষতি হয়। উল্লেখযোগ্যভাবে, gpt-5-mini তর্ককে নিষ্ক্রিয় করতে পারে না, ফলে এর বিল দ্বিগুণ হয়। এই কৌশলটি চারটি মডেল পরিবারে কাজ করে, যেগুলে কখনো cablese-এ প্রশিক্ষিত হয়নি, যা सिद्ध করে যে ক্ষমতা ইতিমধ্যে তাদের ওজনে বিদ্যমান আছে। সংকুচন সবচেয়ে কার্যকর হয় যখন এটি কন্টেন্ট স্থিতিশীল হওয়ার পর প্রয়োগ করা হয়, রচনার সময় না, ফলে একটি "রেজিস্টার ট্যাক্স" থেকে বাঁচা যায়। ফলাফল একটি যাচাইকৃত, শূন্য-খরচের অপ্টিমাইজেশন যা কার্যকর কনটেক্সটকে تقریباً দ্বিগুণ করে বা আউটপুট বিলকে অর্ধ করে।

উৎস: Hacker News · সারাংশ: HeadlinesBriefing