HeadlinesBriefing favicon HeadlinesBriefing.com

Manticore Search-এ ভেক্টর চাঙ্কিং যোগ করা হয়েছে

Hacker News •
×

ধরুন আপনি আপনার টিমের অভ্যন্তরীণ ডকুমেন্টেশন — গাইড, রানবুক, পোস্টমর্টেম — এর ওপর সার্চ তৈরি করছেন। আপনার কাছে অটো এম্বেডিংসহ একটি টেবিল আছে: আপনি টেক্সট ইনসার্ট করেন, Manticore মডেলটি চালায় এবং আপনার জন্য ভেক্টর কলামটি পূরণ করে দেয়। আপনি ৪,০০০ শব্দের একটি ডকুমেন্ট লোড করেন। ইনসার্ট সফল হয়। সার্চ কাজ করে। সिवায় মডেলটির ৫১২-টোকেন ইনপুট উইন্ডো আছে, আর সেই ডকুমেন্টটি প্রায় ৫,০০০ টোকেন লম্বা। মডেলটি প্রথম ৩৮০ শব্দ পড়ে বাকি ৩,৬০০ শব্দ ফেলে দিয়েছে।

Manticore এখন টেবিল ডেফিনিশনে এটাকে হ্যান্ডেল করে: CREATE TABLE-এ ভেক্টর কলামে chunk_strategy যোগ করুন, এবং Manticore প্রতিটি ডকুমেন্টকে চাঙ্কে ভাগ করে, প্রতিটি চাঙ্ককে এম্বেড করে, এবং সকলটিকে সার্চ করে। পাঁচটি কৌশল: truncate, mean, fixed, recursive, sentence। একটি ডকুমেন্ট এখনও একটি সার্চ ফলাফল। চাঙ্কগুলো পৃথকভাবে প্রতিযোগিতা করে, এবং Manticore ডকুমেন্টটি একবার রিটার্ন করে, knn_dist() এর সাথে এর নিকটতম চাঙ্কের দূরত্ব রিপোর্ট করে। k ডকুমেন্ট গণনা করে, চাঙ্ক নয়।

Manticore ম্যানুয়ালে (১৮৯ পৃষ্ঠা, ~২৯৮k শব্দ) পরিমাপ করা হয়েছে: recall@5 ৫৫.১% থেকে ৮৩.৩% এ ও MRR ০.৪৪ থেকে ০.৭০ এ পৌঁছেছে, ~২.৫× RAM এবং ~৪× ইনজেস্ট টাইমে। কোয়েরি কখনো চাঙ্ক করা হয় না। একটি কোয়েরি পুরো এম্বেড হওয়ার জন্য যথেষ্ট ছোট; শুধু সংরক্ষিত ডকুমেন্টগুলো ভাগ করা হয়।