Ming Ying দ্বারা 1 অক্টোবর 2026 দুই সপ্তাহ আগে, Planet Scale TIN উন্মোচন করেছে, যা Postgres-এর জন্য একটি পূর্ণ-পাঠ্য অনুসন্ধান এক্সটেনশন। তাদের লঞ্চ পোস্টটি Parade DB-এর টেক্সট সার্চ কার্যকারিতার একটি উপসেটের উপর চিত্তাকর্ষক কর্মক্ষমতা লাভের কথা জানিয়েছে, বিশেষ করে BM25-র্যাঙ্কযুক্ত টেক্সট সার্চ এবং ডকুমেন্ট গণনা। আমরা Planet Scale টিমকে অভিনন্দন জানাতে চাই। আরেকটি Postgres প্ল্যাটফর্মকে সার্চে বিনিয়োগ করতে দেখা দারুণ, এবং এটা স্পষ্ট যে TIN-এ অনেক চিন্তাশীল ইঞ্জিনিয়ারিং গেছে।
আসুন একটি বিষয়ে খুব স্পষ্ট হই: TIN দ্রুত (প্রতিটি Planet Scale বেঞ্চমার্কে Parade DB 0.25-এর থেকে কমপক্ষে 8x দ্রুত)। এত দ্রুত যে একমাত্র বোধগম্য প্রতিক্রিয়া ছিল চুপ থাকা এবং আমাদের পারফরম্যান্স অপ্টিমাইজেশন টুপি পরা। দুই সপ্তাহ পরে, এখানে BM25-র্যাঙ্কযুক্ত আগে এবং পরে, একই Stack Exchange বেঞ্চমার্ক ডেটাসেট, হার্নেস এবং মেশিন টাইপ ব্যবহার করে।
মজার বিষয় হল আমরা দ্রুত ব্যবধান বন্ধ করেছি তা নয়, বরং আমরা কীভাবে এটি বন্ধ করেছি। TIN-এর পোস্ট দাবি করে যে তাদের কর্মক্ষমতা একটি মৌলিক আর্কিটেকচারাল পার্থক্যের কারণে যা Postgres-এর অভ্যন্তরীণ ctid ফিল্ডকে ডকুমেন্ট আইডেন্টিফায়ার হিসেবে ব্যবহার করে। তবে, আমরা কিছু অপ্টিমাইজেশন পাসের মাধ্যমে এই ব্যবধান বন্ধ করেছি যার সাথে ডকুমেন্টগুলি কীভাবে চিহ্নিত করা হয় তার খুব কম সম্পর্ক ছিল।
যেকোনো টেক্সট সার্চ ইনডেক্সের হৃদয় হল একটি পোস্টিং তালিকা। Parade DB-এর পিছনের সার্চ লাইব্রেরি Tantivy, তার পোস্টিংয়ের জন্য অনুক্রমিক u32 ডকুমেন্ট আইডি ব্যবহার করে। Postgres তার সারিগুলিকে ctid মান দ্বারা চিহ্নিত করে। TIN-এর পোস্টের মূল বিষয় হল ctid মানগুলিকে সরাসরি ডকুমেন্ট আইডেন্টিফায়ার হিসেবে ব্যবহার করা এই মানচিত্রটি দূর করে এবং কার্যকর বিটম্যাপ অপারেশন এবং দৃশ্যমানতা পরীক্ষা সক্ষম করে। BM25 Top K ক্যোয়ারীর জন্য, আমরা সন্দিহান ছিলাম।
উৎস: Hacker News · সারাংশ: HeadlinesBriefing