Ketika saya meminta seorang ilmuwan data untuk menjelaskan analisis, saya sering diberi permintaan tarik dan disuruh memahami implementasinya. Dua puluh menit kemudian, saya mungkin memahami bagaimana kode diatur dan masih tidak tahu apa yang ditunjukkan data. Saya ingin memahami pertanyaan, apa yang kami temukan, dan apakah bukti mendukung kesimpulan. Agen pengkodean seperti Claude Code, OpenAI Codex, dan Databricks Genie Code dapat menulis, mengeksekusi, dan merevisi kode, mengurangi upaya antara memiliki ide dan mencobanya terhadap data. Itu memberi kita kesempatan untuk mempertimbangkan kembali di mana perhatian seorang ilmuwan data seharusnya berada.
Ilmu data selalu berpusat pada menemukan apa yang bisa kita pelajari dari data. Seiring menurunnya upaya menulis kode, kita harus mencurahkan lebih banyak perhatian pada penyelidikan dan membuat penyelidikan itu lebih mudah diperiksa oleh rekan kerja. Kode adalah alat untuk pekerjaan ilmiah, perpanjangan papan gambar di mana hipotesis mengambil bentuk yang bisa kita periksa dan revisi. Analisis di Microsoft Excel dapat menghasilkan wawasan ilmiah yang berguna, dan kredibilitasnya bergantung pada pertimbangan yang sama dengan analisis yang ditulis dalam Python.
Untuk agen pengkodean, perbandingan kalkulator bersifat instruktif: memahami aritmatika dan merumuskan masalah tetap penting bahkan ketika kita mendelegasikan perhitungan. Dasar-dasar pemrograman membantu kita memahami bagaimana kode mengubah data dan menentukan apakah implementasi melakukan apa yang dibutuhkan analisis. Kontribusi ilmiah membutuhkan keahlian tambahan untuk merumuskan pertanyaan yang berguna dan menarik kesimpulan yang dapat dipertahankan dari pengamatan yang tidak lengkap.
Kekhawatiran saya adalah bahwa kode dapat mengganggu eksplorasi yang diperlukan untuk menentukan apa yang harus dilakukan aplikasi, terutama ketika kode menerima lebih banyak pengawasan daripada analisis atau penyesuaian eksploratif harus melewati tinjauan sebelum kita dapat menyelidiki manfaatnya. Dalam pengalaman saya, tim ilmu data yang lebih besar sering kesulitan mempertahankan proses penemuan ketika tinjauan kode mendominasi.