HeadlinesBriefing favicon HeadlinesBriefing.com

কোডিং সমাধান হলে, এরপর কী? অসতর্কতা পরিমাপ

Hacker News •
×

LLM কোড তৈরি করতে প্রায় নিখুঁত হয়ে উঠেছে, কিন্তু এটি গল্পের শেষ নয়। কোড আনুষ্ঠানিকভাবে সঠিক হলেও এর মানে এই নয় যে এটি অপ্রয়োজনীয় বিমূর্ততা প্রবর্তন করছে না, ডুপ্লিকেট তৈরি করছে না, বা সামগ্রিকভাবে খারাপ সিদ্ধান্ত নিচ্ছে না। এটি কোনও যুগান্তকারী পর্যবেক্ষণ নয়, যারা কোনও প্রকল্পে ভাইব-কোডিং করেছেন তারা বুঝতে পেরেছেন যে প্রতিটি অতিরিক্ত বৈশিষ্ট্য কখনও কখনও কোডের লাইনের (LOC) বিস্ফোরণ ঘটাতে পারে। এর ফলে মানব এজেন্সির ক্ষতি হয়, কারণ মাসে লক্ষ লক্ষ LOC যোগ করা প্রকল্পগুলিতে, মানুষের পক্ষে তাল মেলানো কঠিন। কেউ কেউ বলতে পারেন যে এটি কোনও সমস্যাই নয়, কারণ তারা তাদের এজেন্টদের উপর আস্থা রাখেন যে তারা এটি সামলাবে। আপনার জন্য আমার কাছে খারাপ খবর আছে, এজেন্টরাও আসলে স্লপ সামলাতে পারে না।

পদার্থবিজ্ঞানের পটভূমি থেকে আসার কারণে, সমস্যা সমাধানের জন্য আমার সর্বদা একটি পরীক্ষামূলক/পরিমাণগত দৃষ্টিভঙ্গি ছিল। যখন আমি Earendil-এ শুরু করি, কোড স্লপিনেস পরিমাপের উপায় বের করার কাজ নিয়ে, আমার স্বাভাবিক প্রবৃত্তি ছিল প্রথমে সাহিত্যে গভীরভাবে ডুব দেওয়া এবং তারপর অন্য কোম্পানিগুলি কী করছে তা দেখা। সোজা কথা বলতে গেলে, কয়েকটি অন্তর্দৃষ্টিপূর্ণ গবেষণাপত্র ছাড়া, এই মুহূর্তে শিল্পটি কতটা "ভাইবস ভিত্তিক" বলে মনে হচ্ছে তাতে আমি হতাশ হয়েছিলাম। আমার গবেষণায় এবং X-এ, আমি ক্রমাগত "এন্ড-টু-এন্ড কোডিং এজেন্ট", "AI যা শুধু কোডের পরামর্শ দেয় না—এটি শিপ করে" বা "মানব-স্তরের মূল্যায়ন ছাড়াই মানব-স্তরের খরচ" এর মতো বার্তাগুলির দ্বারা বোমাবর্ষণ করছিলাম। যা সমস্ত ভাল গল্পের মতো, তাদের মধ্যে সত্যের একটি দানা রয়েছে। LLM প্রায় নিখুঁতভাবে সঠিক কোড লিখতে সক্ষম। এটি কোডের স্কেলেবিলিটি এবং যাচাইযোগ্যতার কারণে। LLM-কে কোড তৈরি করতে দেওয়া এবং তারপর সেই কোডটি লুকানো পরীক্ষা দ্বারা যাচাই করা bastante সহজ, যার ফলে একটি স্পষ্ট পুরস্কার সংকেত পাওয়া যায়। এর সম্পূর্ণ বিপরীতে, এই কোডের 'স্লপিনেস' পরীক্ষা করতে প্রায়শই মানব অন্তর্দৃষ্টি এবং রুচির প্রয়োজন হয়, এবং সাধারণভাবে এটি একটি অত্যন্ত কঠিন কাজ।

আমি মনে করি কেন এমন হয় তা বোঝানোর সর্বোত্তম উপায় হল স্লপ পরিমাপের সম্ভাব্য উপায়গুলি পর্যালোচনা করা। বিচারক হিসেবে AI: এটি সম্ভবত শিল্পে কোডের গুণমান মূল্যায়নের সবচেয়ে সাধারণ উপায় এবং আমার পর্যবেক্ষণ থেকে এটি খুব কমই কাজ করে। এটি করার সবচেয়ে সহজ উপায়, অর্থাৎ মডেলগুলিকে জিজ্ঞাসা করা যে কোডটি 1-10 স্কেলে কতটা ভাল, মূলত একটি র্যান্ডম নম্বর জেনারেটরের সমতুল্য। আরও পরিশীলিত পদ্ধতি, অর্থাৎ বিচারক মডেলকে দুটি সমাধান A এবং B দেওয়ার চেষ্টা করা, এবং তারপর এটি কোনটি পছন্দ করে তা সিদ্ধান্ত নিতে দেওয়া, এর অসুবিধা হল আপনি যখন সমাধানগুলির নাম পরিবর্তন করেন তখন মডেল তার পছন্দ পরিবর্তন করে। আমি এখানে একটু রসিকতা করছি এবং বড় মডেলগুলির সাথে প্রভাবটি এতটা স্পষ্ট নয়, তবে মূল বিষয়টি এখনও প্রযোজ্য। LLM-কে তাদের লেখা কোড বিচার করতে বলা সঠিক মূল্যায়নের বিকল্প নয়। যদিও রুব্রিক্স বা LLM পরীক্ষা লেখার সাথে কিছু আকর্ষণীয় পদ্ধতি রয়েছে, তারা এখনও আসলে স্লপ থেকে মুক্তি পাওয়া থেকে অনেক দূরে।

মানুষ AI-কে বিচার করে: যদি আমরা এই সত্যটি উপেক্ষা করি যে সফ্টওয়্যার-ইঞ্জিনিয়ারদের গুণমানে বিশাল বৈচিত্র্য রয়েছে, তবে কোডটি মানব-পাঠযোগ্য থাকা নিশ্চিত করার জন্য এটি সর্বোত্তম সমাধান হবে। অসুবিধা হল এটি AI প্রশিক্ষণের জন্য বা একাধিক মডেল সরবরাহকারী এবং হার্নেস সহ বড় বেঞ্চমার্ক রাখার জন্য স্কেলেবল নয়। সবচেয়ে সহজ পদ্ধতি: আমার গবেষণা এবং পরীক্ষায়, কেবল LOC-এর সংখ্যার পরিবর্তন নেওয়া স্লপিনেসের জন্য আশ্চর্যজনকভাবে কার্যকর মেট্রিক হয়েছে, এই বিদ্রূপাত্মক সতর্কতার সাথে যে আমরা যদি এটির জন্য অপ্টিমাইজ করা শুরু করি, তবে এটি একটি অর্থপূর্ণ পরিমাপ হওয়া বন্ধ করে দেবে। পরবর্তী দুটি পরিমাপ আমাকে Slop Code Bench পেপার দ্বারা পরিচয় করিয়ে দেওয়া হয়েছিল, এবং সম্ভাবনাময় বলে মনে হয়েছিল কারণ তারা লিগ্যাসি কোড বেসগুলিকে LLM-স্লপ থেকে বেশ ভালভাবে আলাদা করতে সক্ষম হয়েছিল। ভার্বোসিটি: ডুপ্লিকেট এবং অপ্রয়োজনীয় ভার্বোজ লাইনের পরিমাণ পরিমাপ করার চেষ্টা করে। ইরোশন: একটি কোডবেসের ভরের কতটা কয়েকটি বড় এবং জটিল ফাংশনে কেন্দ্রীভূত তা পরিমাপ করার চেষ্টা করে।

মূল সত্তা: কোম্পানি: Earendil