তাদের গবেষণাপত্র Frugal GPT-এ, Lingjiao Chen, Matei Zaharia এবং James Zou একটি বড় ভাষা মডেল (LLM) কল করার খরচ কমানোর তিনটি উপায় বর্ণনা করেছেন: প্রম্পট অভিযোজন, LLM অনুমান এবং LLM ক্যাসকেড। লেখকরা রিপোর্ট করেছেন যে তাদের ক্যাসকেড প্রথমে সস্তা মডেল চেষ্টা করে এবং 98 শতাংশ পর্যন্ত খরচ হ্রাস করে সেরা পৃথক মডেলের কর্মক্ষমতার সাথে মেলে। আমি একটি ছোট এজেন্ট তৈরি করেছি যা আমি কল ধরে কল পরিদর্শন করতে পারি। এটি একজন ভাড়াটিয়ার প্রয়োজনীয়তার বিপরীতে অ্যাপার্টমেন্ট তালিকা পরীক্ষা করে, যেমন অস্টিনে $1,500-এর নিচে একটি দুই বেডরুম যা কুকুরের অনুমতি দেয়। আমার প্রথম সংস্করণ প্রতিটি তালিকা একটি শক্তিশালী মডেলে পাঠিয়েছে, এমনকি যখন একটি শহরের নাম বা ভাড়ার অঙ্ক ইতিমধ্যেই তালিকাটি বাতিল করে দিয়েছে। এর অর্থ ছিল 101টি প্রকৃত মিল খুঁজে পেতে 2,500টি মডেল কল।
এই নিবন্ধটি একটির পরিবর্তে তিনটি শুরুর পয়েন্ট পরিমাপ করে। প্রথমটি প্রতিটি জোড়া মডেলে পাঠায়। দ্বিতীয়টি একটি এজেন্ট যা ইতিমধ্যেই শহর অনুসারে অনুসন্ধান করে। তৃতীয়টি কোনো মডেল তালিকা দেখার আগে শহর, বেডরুম এবং ভাড়ার উপর একটি ডাটাবেস কোয়েরি চালায়। আমি 2019 সালের মার্কিন যুক্তরাষ্ট্রের ভাড়া বিজ্ঞাপনের একটি পাবলিক ডেটাসেট থেকে 500টি তালিকার একটি নির্দিষ্ট নমুনা নিয়েছি। আমি পাঁচটি ভাড়াটিয়া প্রয়োজনীয়তা লিখেছি এবং একই উত্তরগুলির বিপরীতে এজেন্টের প্রতিটি সংস্করণ স্কোর করেছি। শক্তিশালী মডেলটি ছিল Open AI-এর gpt-6-sol, যাকে আমি Sol বলি, এবং সস্তা মডেলটি ছিল gpt-6-luna, যাকে আমি Luna বলি। আমি Weights & Biases (W&B) Weave দিয়ে প্রতিটি কল ট্রেস করেছি।
ডাটাবেস কোয়েরি শুরুর পয়েন্টের তুলনায়, চূড়ান্ত সংস্করণটির খরচ প্রায় 25 গুণ কম ছিল। আনুমানিক খরচ ছিল একই 2,500টি চেকের জন্য $0.20-এর বিপরীতে $0.008, এবং চূড়ান্ত সংস্করণটি কোনো ভুল ছাড়াই সমস্ত 101টি মিল ফেরত দিয়েছে। কোডকে পোষা প্রাণীর ক্ষেত্রটি নিষ্পত্তি করতে দেওয়া সেই পতনের প্রায় 44 শতাংশ তৈরি করেছে, এবং একটি শক্তিশালী ব্যাকআপের সাথে সস্তা মডেলটি ব্যবহার করা প্রায় 39 শতাংশ তৈরি করেছে। একটি ছোট প্রম্পট এবং পুনরায় ব্যবহৃত উত্তরগুলি বাকি অংশ তৈরি করেছে।
তিনটি ফলাফল আমাকে অবাক করেছে। Weave-এর খরচ কলাম প্রতিটি কলের জন্য $0.0000 দেখিয়েছে। Sol সম্পূর্ণ তালিকার সাথে 10টির মধ্যে 10 বার একটি মিল মিস করেছে, এবং শুধুমাত্র শিরোনাম এবং বডি সহ 10টির মধ্যে 10 বার এটি খুঁজে পেয়েছে। কম টেক্সট পাঠানো একটি ভাল উত্তর দিয়েছে। উভয় মডেলই প্রায় প্রতিটি উত্তরে 5-এর আত্মবিশ্বাস জানিয়েছে। একটি নিয়ম যা 5-এর নিচে বাড়ে প্রায় কখনই ফায়ার হয় না, তাই এটি বেশি কাজ করতে পারে না। নিবন্ধটি আরও বলে যে পরীক্ষাটি কোথায় দুর্বল। 101টি মিলের মধ্যে শুধুমাত্র একটি টেক্সট পড়ার উপর নির্ভর করে, তাই পরীক্ষাটি বোঝার পরিমাপের চেয়ে খরচ অনেক ভালো পরিমাপ করে।
উৎস: Towards Data Science · সারাংশ: HeadlinesBriefing