লেখক: Rulin Shao, Shannon Zejiang Shen, Junjie Oscar Yin, Yuetai Li, Minheng Wang, Hamish Ivison, Radha Poovendran, Nathan Lambert, Teng Xiao, Mike Lewis, Wen-tau Yih, Luke Zettlemoyer, Pang Wei Koh। আমরা প্রসঙ্গ ভাষা মডেল (CLMs) প্রবর্তন করছি, ভাষা মডেল যা তাদের নিজস্ব প্রসঙ্গ নেটিভভাবে পরিচালনা করে। আমরা প্রসঙ্গকে একটি ফাইল হিসাবে বিবেচনা করে এবং মডেলটিকে এই ফাইলে সীমাহীন আপডেট করার অনুমতি দিয়ে এটি বাস্তবায়ন করি। এটি মডেলটিকে শিখতে দেয় যে প্রসঙ্গে কী বজায় রাখা সবচেয়ে গুরুত্বপূর্ণ, এবং স্বাভাবিকভাবেই মাল্টি-এজেন্ট সিস্টেমে প্রসারিত হয় যেখানে একাধিক এজেন্টের প্রসঙ্গ ফাইল হিসাবে সহাবস্থান করে।
বিদ্যমান মডেলগুলির সাথে জিরো-শট CLMs তৈরি করা বিভিন্ন কাজে SOTA প্রসঙ্গ ব্যবস্থাপনা কৌশলগুলিকে ছাড়িয়ে যায়: Browse Comp-Plus-এ 11.4% বেশি নির্ভুলতা 21.5% কম FLOPs সহ, 12-ঘন্টা Edge Bench-এ 5% বেশি স্কোর 59% কম FLOPs সহ, এবং 24-ঘন্টা মাল্টি-রিপোজিটরি এজেন্ট-সোয়ার্ম কাজে একই কম্পিউটে 65% বেশি উন্নতি। তদুপরি, প্রসঙ্গ ব্যবস্থাপনাকে বাহ্যিক নিয়ন্ত্রণ থেকে অভ্যন্তরীণ মডেল আচরণে স্থানান্তরিত করে, CLMs স্বাভাবিকভাবেই প্রসঙ্গ-ব্যবস্থাপনা কৌশলগুলির ইন-কনটেক্সট এবং প্যারামেট্রিক লার্নিং উভয়ই সক্ষম করে।
আমরা দেখাই যে CLMs একটি মানক দক্ষতা-অপ্টিমাইজেশন লুপের মাধ্যমে বিবর্তিত প্রাকৃতিক-ভাষা নির্দেশাবলী দ্বারা পরিচালিত হতে পারে, যা কম্পিউট হ্রাস করার সময় একটি প্রসঙ্গ-ব্যবস্থাপনা কাজে হোল্ড-আউট নির্ভুলতা 35.9 পয়েন্ট পর্যন্ত উন্নত করে। আমরা CLMs-এর জন্য একটি অনলাইন রিইনফোর্সমেন্ট লার্নিং পদ্ধতিও প্রবর্তন করছি, যা 12% কম FLOPs ব্যবহার করে Browse Comp-Plus-এ Qwen3.5-9B কর্মক্ষমতা 47.6% উন্নত করে। অবশেষে, আমরা CLM সার্ভিসিংয়ের জন্য Suffix Cache Reuse সহ-ডিজাইন করি, যা মিলিত কর্মক্ষমতায় স্ট্যান্ডার্ড SGLang-এর তুলনায় সার্ভার-সাইড কম্পিউট আরও 35% হ্রাস করে।
মূল সত্তা: ব্যক্তি: Rulin Shao, Shannon Zejiang Shen, Junjie Oscar Yin, Yuetai Li, Minheng Wang, Hamish Ivison, Radha Poovendran, Nathan Lambert, Teng Xiao, Mike Lewis, Wen-tau Yih, Luke Zettlemoyer, Pang Wei Koh
উৎস: Hacker News · সারাংশ: HeadlinesBriefing