HeadlinesBriefing favicon HeadlinesBriefing.com

AI বিকাসে অস্পষ্ট বিফলতার সাধারণীকরণ

Hacker News •
×

সাম্নিক একটি পর্বে প্রেসিডেন্ট কার্টিস, প্রেসিডেন্ট দুটি আলাদা অবসরে একটি দরজা খোলার সংঘর্ষ করেন। এই দরগুলো কাজ করে না কারণ পथে বাধা আছে: প্রথমে একটি দেহ, তারপর প্রায় এক কোটি ডলার মূল্যের স্বর্ণ। দুইটি ক্ষেত্রেই, হতাশার উত্তরে, চরিত্রটি বলে 'বোকা জিনিস খারাপ।' এটি দরজার একটি যুক্তিসঙ্গত মডেল নয়! দরজাগুলো অস্পষ্টভাবে 'খারাপ' হওয়া উচিত নয়! আমি এই মুহূর্তগুলো আমার অত্যন্ত হাসির প্রকাশ পেয়েছি¹ কিন্তু হয়তো আমার বোকা মস্তিষ্ক শুধু খারাপ।

Jev: আরও দরজা তৈরি করা যা খারাপ ইন্টারনেট Jev সম্পর্কে আলোচনা করছে, যা Type Safe AI দ্বারা তৈরি একটি AI মডেল, যা সম্ভাব্যতা অনুমানের সাথে টাইপ করা মান ফেরত দেয়। যেসব বিষয় গুরুত্বপূর্ণ Jev, যতদূর আমি বলতে পারি: এটি দ্রুত এবং সস্তা, আপনি দ্রুত এটির উপর তৈরি করতে পারেন, এটি দ্রুত, এবং এটি সস্তা। আমি কোন প্রযুক্তি গ্রহণ করা হবে তা বোঝাতে ভালো নয়। আমি এখনো বুঝতে পারছি² Slack। অপেক্ষা করুন। আপনার এখনো কঠিন অংশ করতে হবে? হয়তো আমার সমস্যা হলো প্রযোজনীয়তা আশা করা। কেউ এটি কিনছে এটি চালাচালি করছে না। তারা সরল অস্পষ্ট প্রশ্ন Jev দিচ্ছে এবং অস্পষ্ট উত্তর পাচ্ছে।

দয়ালুতার সাথে, এটি তাদের অনুমতি দেয় 'AI-চালিত' বক্স চেক করতে এবং শুক্রবারের আগে পাঠাতে, এবং যখন এটি নিচের যুক্তি ভাঙ্গে, তারা ঘাড় উঠিয়ে বলতে পারে 'হ্যাঁ, AI ভুল করে।' ত্রুটি বাজেট? বিফলতা মোড? পরীক্ষা সেট? এগুলো পরে সমাধান করা যায়। ব্যবহারকারী বিফলতার হার আবিষ্কার করতে পারে! আপনি ইতিমধ্যে পাঠিয়েছেন!

মিথ্যা আত্মবিশ্বাস 'ওহ,' আমার পোস্টের উত্তর দেয়া স্ট্রোম্যান বলছে, 'আপনি Jev আপনাকে আত্মবিশ্বাস স্কোর দেয়ার বিষয়টি চিন্তা করেননি!' আপনি এগুলো দিয়ে কি করবেন? আত্মবিশ্বাস স্কোর দিয়ে কোনো যুক্তিসঙ্গত কাজ করার জন্য আপনার একটি বোঝা প্রয়োজন আত্মবিশ্বাস স্কোরের calibration এবং অনিশ্চিততার খরচের একটি মডেল।

Calibration পক্ষে: Jev-এর শীর্ষ বিজ্ঞাপন প্রায়শই বিভিন্ন benchmarks এ কতটুকু স্কোর করে তার উপর কেন্দ্রিত, কিন্তু কতটুকু calibration তাদের আত্মবিশ্বাস স্কোর আছে তার উপর নয়। একটি রেসিপি বই আছে আত্মবিশ্বাস স্কোর ব্যবহার করে classification গাছে ওঠার কথা, কিন্তু এটি মূলত কতটুকু ভালো আত্মবিশ্বাস স্কোর তা নিয়ে নয়। সর্বোত্তম ক্ষেত্রে, লোগ আত্মবিশ্বাস স্কোর একটি cargo cult পদ্ধতিতে ব্যবহার করে। সর্বোনিম্ন ক্ষেত্রে, লোগ এগুলো API কল বিফলতার জন্য একটি অজুহাত হিসেবে ব্যবহার করে। মডেলটি কেবল 73% confident ছিল! এর অর্থ হলো আমার ত্রুটি বাজেট 27%!

Accountability যখন একটি বোতান ওয়েবসাইটে ভাঙ্গে, আমার একটি মডেল আছে কি হওয়া উচিত। কোনো চুক্তি ভাঙ্গে। আমার DNS ভাঙ্গে। কেউ একটি slop পাঠিয়েছে যার কেবল কিছু পथে Java Script syntax ত্রুটি আছে। একটি handler একটি exception ছুঁড়েছে যা আশা করা হয়নি। আমি হয়তো access নাই একটি HTTP 500 debug করতে, কিন্তু আমি প্রত্যাশা করি একটি ব্যক্তি থাকবেন যার কাজ হবো বুঝতে কেন endpoint 500 হচ্ছে। মালিকানা well-defined অপ্রকাশ্য³।

অনেক ব্যবহারকারীর জন্য, প্রকৃত অভিজ্ঞতা প্রায়শই 'বোকা জিনিস খারাপ'। সফ্টওয়ার ইতিমধ্যে capricious অনুভূতি আছে; আরও বিফলতা শুধু হতাশার হার পালটায়। মনে হয় একটি concrete cause অনুসরণ করার সম্ভাব্যতা সরাতে বেশি কিছু হারানো নয়। কখনো-কখনো জিনিসগুলো শুধু খারাপ। এটি অস্পষ্টতার সাধারণীকরण নিয়ে আসে।

আমার ভয় হলো না যে আরও অনেক জিনিস বিফল হবে যখন জিনিসগুলো LLM-চালিত বিকাস দ্বারা ত্বরিত হবে। হবে। হয়েছে। এটি নতুন উপায়ে জিনিস তৈরির মূল্যের অংশ। আমার ভয় হলো 'কখনো-কখনো শুধু খারাপ' হবে আরও আরও গবেষণার স্বীকৃত শেষ পরিণাম। এটি দুঃখজনক কারণ LLM-ত্বরিত বিকাস সত্যিই আমাদের এই সমস্যাগুলো সমাধান করতে সহায়তা করতে পারে। অনেক অটোমেটেড QA ওয়র্কফ্লো আছে যা প্রকৌশলীয় সময়ের অভাবে লেখা হয়নি। সেই মূল্যায়নটি যেটি আপনাকে Jev প্রতিস্থাপন (বা এর ব্যবহার যুক্তিসঙ্গত করা) করার প্রায় প্রায় প্রস্তুত করবে সেটি কয়েকটি প্রশ্নের দূরত্বে থাকতে পারে।

আজকের সফ্টওয়ার প্রকৌশলের ত্রাসদ হলো আমরা সক্রিয়ভাবে সিস্টেম প্রকাশ করছি যেখানে ন তো ব্যবহারকারী ন তো নির্মাতা দেখতে চাচ্ছেন যে দরজার পেছনে একটি দেহ আছে কি না। আমরা শুধু...