HeadlinesBriefing favicon HeadlinesBriefing.com

انقراض Pandas: بدائل مكتبة بايثون للبيانات

Hacker News •
×

لقد قرأت ذلك بشكل صحيح، يجب أن تنقرض Pandas. ليس تلك الكائنات اللطيفة المكسوة بالفراء المستخدمة في الدبلوماسية الدولية، بل مكتبة Python Data Frame. لماذا؟ لأن أوجه قصور Pandas تجبرك على تبني أنظمة الاستعلام الموزعة قبل أن تبرر أعباء العمل الخاصة بك التعقيد الإضافي. أنا أزعم أن معظم أعباء العمل لن تبرر تلك الأنظمة أبدًا، إنها مجرد 'رصاصات فضية' مسوقة جيدًا.

لفهم ما أتحدث عنه، يجب أن نفهم أولاً مسار التبني النموذجي لـ Pandas. باتباعه من اليسار إلى اليمين، ترى أيضًا مسار التبني النموذجي لأدوات تحليل البيانات، والهاوية التي يواجهها مستخدمو Pandas بعد حجم معين من البيانات. عادة ما يبدأ الناس مع Excel ويتخرجون إلى Pandas في نطاق الجيجابايت. تخدمهم Pandas جيدًا في نطاق عشرات الجيجابايت، ثم يبدأون في مواجهة مشاكل الذاكرة، أو الحساب البطيء، أو الإحباط من واجهة برمجة التطبيقات (API) المعقدة لـ Pandas. الإجابة التقليدية في هذه المرحلة هي التخرج إلى أداة 'حقيقية' (اقرأ: مكلفة) مثل Spark، Databricks، Snowflake، أو Dask المصممة للـ Big Data™.

البدائل التي أقترحها، كما أشرت سابقًا، هي DuckDB و Polars. بشكل عام، Polars هي مكتبة Data Frame قائمة على Rust تبدو مألوفة لـ Pandas، لكنها تختلف في عدة جوانب مهمة...