HeadlinesBriefing favicon HeadlinesBriefing.com

Pandas Devrait Disparaître : Alternatives à la Librairie Python

Hacker News •
×

Vous avez bien lu, Pandas devrait disparaître. Pas les adorables boules de poils utilisées pour la diplomatie internationale, mais la bibliothèque Python Data Frame. Pourquoi ? Parce que les inefficacités de Pandas vous obligent à adopter des systèmes de requête distribués avant que vos charges de travail ne justifient la complexité ajoutée. Je soutiens que la plupart des charges de travail ne justifieront jamais ces systèmes, ce ne sont que des 'balles d'argent' bien marketing.

Pour comprendre de quoi je parle, nous devons d'abord comprendre le parcours d'adoption typique de Pandas. En le suivant de gauche à droite, vous voyez aussi le parcours d'adoption typique des outils d'analyse de données, et la falaise que les utilisateurs de Pandas rencontrent au-delà d'une certaine taille de données. Les gens commencent généralement par Excel et passent à Pandas quelque part dans la plage des Go. Pandas les sert bien dans la plage des dizaines de Go, puis ils commencent à rencontrer des problèmes de mémoire, des calculs lents, ou à être frustrés par l'API baroque de Pandas. La réponse traditionnelle à ce stade est de passer à un outil 'vrai' (lisez : cher) comme Spark, Databricks, Snowflake, ou Dask conçus pour le Big Data™.

Les alternatives que je propose, comme mentionné précédemment, sont DuckDB et Polars. En gros, Polars est une bibliothèque Data Frame basée sur Rust qui ressemble à Pandas, mais diffère sur plusieurs points importants...