Lorsque je demande à un scientifique des données d'expliquer une analyse, on me remet souvent une demande de tirage et on m'envoie comprendre l'implémentation. Vingt minutes plus tard, je peux comprendre comment le code est organisé et ne toujours pas savoir ce que les données ont montré. Je veux comprendre la question, ce que nous avons trouvé, et si les preuves soutiennent la conclusion. Des agents de codage comme Claude Code, OpenAI Codex et Databricks Genie Code peuvent écrire, exécuter et réviser du code, réduisant l'effort entre avoir une idée et l'essayer contre des données. Cela nous donne l'opportunité de reconsidérer où l'attention d'un scientifique des données devrait se porter.
La science des données a toujours été centrée sur la découverte de ce que nous pouvons apprendre des données. Alors que l'effort d'écrire du code diminue, nous devrions consacrer plus d'attention à l'enquête et rendre cette enquête plus facile à examiner pour un collègue. Le code est un outil pour le travail scientifique, une extension d'une planche à dessin où une hypothèse prend une forme que nous pouvons examiner et réviser. Une analyse dans Microsoft Excel peut produire un aperçu scientifique utile, et sa crédibilité dépend des mêmes considérations qu'une analyse écrite en Python.
Pour les agents de codage, la comparaison avec la calculatrice est instructive : comprendre l'arithmétique et formuler le problème restent importants même lorsque nous déléguons le calcul. Les fondamentaux de la programmation nous aident à comprendre comment le code transforme les données et à déterminer si une implémentation fait ce que l'analyse exige. La contribution scientifique nécessite une expertise supplémentaire pour formuler des questions utiles et tirer des conclusions défendables à partir d'observations incomplètes.
Ma préoccupation est que le code peut interrompre l'exploration nécessaire pour déterminer ce que l'application devrait faire, en particulier lorsque le code reçoit plus de scrutin que l'analyse ou qu'un ajustement exploratoire doit passer par une révision avant que nous puissions enquêter sur son mérite. Dans mon expérience, les équipes de science des données plus grandes ont souvent du mal à préserver le processus de découverte lorsque la révision du code domine.