Wenn ich einen Datenwissenschaftler bitte, eine Analyse zu erklären, bekomme ich oft einen Pull-Request und werde geschickt, um die Implementierung zu verstehen. Zwanzig Minuten später verstehe ich vielleicht, wie der Code organisiert ist, und weiß immer noch nicht, was die Daten gezeigt haben. Ich möchte die Frage verstehen, was wir gefunden haben und ob die Beweise die Schlussfolgerung stützen. Codierungsagenten wie Claude Code, OpenAI Codex und Databricks Genie Code können Code schreiben, ausführen und überarbeiten, wodurch der Aufwand zwischen einer Idee und dem Ausprobieren gegen Daten reduziert wird. Das gibt uns die Gelegenheit, zu überdenken, wo die Aufmerksamkeit eines Datenwissenschaftlers liegen sollte.
Datenwissenschaft hat sich immer darauf konzentriert, zu entdecken, was wir aus Daten lernen können. Da der Aufwand des Schreibens von Code abnimmt, sollten wir der Untersuchung mehr Aufmerksamkeit widmen und diese Untersuchung für einen Kollegen leichter zu prüfen machen. Code ist ein Werkzeug für die wissenschaftliche Arbeit, eine Erweiterung eines Zeichenbretts, wo eine Hypothese eine Form annimmt, die wir prüfen und überarbeiten können. Eine Analyse in Microsoft Excel kann nützliche wissenschaftliche Einsicht erzeugen, und ihre Glaubwürdigkeit hängt von denselben Überlegungen ab wie eine Analyse, die in Python geschrieben ist.
Für Codierungsagenten ist der Taschenrechner-Vergleich lehrreich: Arithmetik zu verstehen und das Problem zu formulieren, bleibt wichtig, selbst wenn wir die Berechnung delegieren. Programmiergrundlagen helfen uns zu verstehen, wie Code Daten transformiert und ob eine Implementierung das tut, was die Analyse erfordert. Der wissenschaftliche Beitrag erfordert zusätzliche Expertise, um nützliche Fragen zu formulieren und verteidigbare Schlussfolgerungen aus unvollständigen Beobachtungen zu ziehen.
Meine Sorge ist, dass Code die Erkundung unterbrechen kann, die notwendig ist, um zu bestimmen, was die Anwendung tun sollte, insbesondere wenn Code mehr Prüfung erhält als die Analyse oder eine explorative Anpassung eine Überprüfung durchlaufen muss, bevor wir ihre Verdienste untersuchen können. Meiner Erfahrung nach haben größere Datenwissenschaftsteams oft Schwierigkeiten, den Entdeckungsprozess zu bewahren, wenn Code-Review dominiert.