HeadlinesBriefing favicon HeadlinesBriefing.com

El conocimiento sigue siendo la moneda de la ciencia de datos

Towards Data Science •
×

Cuando pido a un científico de datos que explique un análisis, a menudo me entregan una solicitud de extracción y me envían a entender la implementación. Veinte minutos después, puedo entender cómo está organizado el código y aún no saber qué mostraron los datos. Quiero entender la pregunta, qué encontramos y si la evidencia respalda la conclusión. Agentes de codificación como Claude Code, OpenAI Codex y Databricks Genie Code pueden escribir, ejecutar y revisar código, reduciendo el esfuerzo entre tener una idea y probarla contra datos. Esto nos da la oportunidad de reconsiderar dónde debe estar la atención de un científico de datos.

La ciencia de datos siempre se ha centrado en descubrir qué podemos aprender de los datos. A medida que disminuye el esfuerzo de escribir código, debemos dedicar más atención a la investigación y hacer que esa investigación sea más fácil de examinar para un colega. El código es una herramienta para el trabajo científico, una extensión de un tablero de dibujo donde una hipótesis toma forma que podemos examinar y revisar. Un análisis en Microsoft Excel puede producir conocimiento científico útil, y su credibilidad depende de las mismas consideraciones que un análisis escrito en Python.

Para los agentes de codificación, la comparación con la calculadora es instructiva: entender la aritmética y formular el problema siguen siendo importantes incluso cuando delegamos el cálculo. Los fundamentos de programación nos ayudan a entender cómo el código transforma los datos y a determinar si una implementación hace lo que requiere el análisis. La contribución científica requiere experiencia adicional para formular preguntas útiles y sacar conclusiones defendibles de observaciones incompletas.

Mi preocupación es que el código puede interrumpir la exploración necesaria para determinar qué debería hacer la aplicación, particularmente cuando el código recibe más escrutinio que el análisis o un ajuste exploratorio debe pasar por revisión antes de que podamos investigar su mérito. En mi experiencia, los equipos de ciencia de datos más grandes a menudo luchan por preservar el proceso de descubrimiento cuando la revisión de código domina.