HeadlinesBriefing HeadlinesBriefing 12 languages

AI Engineers, Applied Scientists, Forward Deployed Engineers: Let's Unpack.

Towards Data Science ·

🇬🇧 English

The rise of Large Language Models has made it hard to predict how AI will reshape the world, and the job market is already changing. Rather than listing data science job titles, this piece looks at what changed in the field, why new roles are emerging, and how professionals can prepare for them.

Before the transformer era, data science was largely split in two. Data Scientists sat closer to the product side, focusing on statistics, experimentation, data analysis and insight extraction, with Python and SQL as core tools. Machine Learning Engineers worked nearer the model itself, handling training pipelines, optimization, neural networks, performance and deployment, typically with libraries such as TensorFlow and PyTorch. Data Analysts and Data Engineers had clearer boundaries.

The Applied Scientist title, popularized by companies such as Amazon and Microsoft, filled a middle ground. Applied Scientists experimented with new models and algorithms but also had to ensure their code could operate inside a production system. The lines between roles held because prototyping demanded weeks of manual coding, testing and debugging, with no coding assistants to help.

Everything shifted with the 2017 Google paper "Attention Is All You Need," which introduced the transformer architecture underlying LLMs such as GPT. People in the field began paying serious attention after GPT-3, but GPT-4 was the real turning point, as companies began to rethink how models were built and deployed. That shift is what has given rise to the newer roles examined in the rest of the article.

View original article →


🇸🇦 العربية

مهندسو الذكاء الاصطناعي وعلماء التطبيقات والمهندسون المنتشرون ميدانيًا

جعل صعود النماذج اللغوية الكبيرة من الصعب التنبؤ بكيفية إعادة تشكيل الذكاء الاصطناعي للعالم، ويتغير سوق العمل بالفعل. وبدلًا من سرد مسميات وظائف علم البيانات، يتناول هذا المقال ما تغيّر في المجال، ولماذا تظهر أدوار جديدة، وكيف يمكن للمختصين الاستعداد لها.

قبل عصر المحولات، كان علم البيانات منقسمًا عمليًا إلى قسمين. كان علماء البيانات أقرب إلى جانب المنتج، ويركزون على الإحصاء والتجريب وتحليل البيانات واستخلاص الرؤى، مع اعتماد Python وSQL كأدوات أساسية. أما مهندسو تعلم الآلة فكانوا يعملون بالقرب من النموذج نفسه، ويتولون خطوط التدريب والتحسين والشبكات العصبونية والأداء والنشر، عادةً باستخدام مكتبات مثل TensorFlow وPyTorch. وكانت حدود محللي البيانات ومهندسي البيانات أوضح.

أما مسمى عالم التطبيقات، الذي عممته شركات مثل Amazon وMicrosoft، فقد شغل منطقة وسطى. كان علماء التطبيقات يجربون نماذج وخوارزميات جديدة، لكنهم كانوا مطالبين أيضًا بضمان أن يعمل شيفرتهم داخل نظام إنتاج. وقد استمرت الفواصل بين الأدوار لأن إنشاء النماذج الأولية كان يتطلب أسابيع من البرمجة والاختبار والتصحيح اليدوي، دون مساعدين برمجيين.

تغيّر كل شيء مع ورقة Google لعام 2017 بعنوان "Attention Is All You Need"، التي قدمت بنية المحولات التي تقوم عليها النماذج اللغوية الكبيرة مثل GPT. بدأ المجال يولي اهتمامًا جديًا بعد GPT-3، لكن GPT-4 كان نقطة التحول الحقيقية، إذ بدأت الشركات تعيد التفكير في كيفية بناء النماذج ونشرها. وهذا التحول هو ما أدى إلى ظهور الأدوار الأحدث التي يتناولها باقي المقال.

ما الفرق بين عالم التطبيقات وعالم البيانات؟

الدوران متشابهان، لكن عالم التطبيقات يكون عادةً أقرب إلى الهندسة. فإلى جانب تجربة النماذج والخوارزميات الجديدة، يُتوقع منه ضمان أن يعمل شيفرته فعليًا داخل نظام إنتاج.

العربية version →


🇧🇩 বাংলা

AI ইঞ্জিনিয়ার, অ্যাপ্লাইড সায়েন্টিস্ট ও ফরওয়ার্ড ডিপ্লয়ড ইঞ্জিনিয়ার

লার্জ ল্যাঙ্গুয়েজ মডেলের উত্থান AI কীভাবে পৃথিবীকে নতুনভাবে গড়বে তা আগেভাগে বলা কঠিন করে তুলেছে, আর চাকরির বাজার ইতোমধ্যেই বদলাচ্ছে। ডেটা সায়েন্সের চাকরির তালিকা না দিয়ে, এই লেখাটি দেখে এই ক্ষেত্রে কী বদলেছে, কেন নতুন ভূমিকা তৈরি হচ্ছে এবং পেশাজীবীরা কীভাবে এর জন্য প্রস্তুতি নিতে পারেন।

ট্রান্সফর্মার যুগের আগে, ডেটা সায়েন্স মূলত দুই ভাগে বিভক্ত ছিল। ডেটা সায়েন্টিস্টরা প্রোডাক্ট দিকের কাছাকাছি থাকতেন, পরিসংখ্যান, পরীক্ষানিরীক্ষা, ডেটা বিশ্লেষণ ও অন্তর্দৃষ্টি বের করার ওপর মনোযোগ দিতেন, যেখানে Python ও SQL ছিল মূল হাতিয়ার। মেশিন লার্নিং ইঞ্জিনিয়াররা মডেলের আরও কাছে কাজ করতেন, ট্রেনিং পাইপলাইন, অপ্টিমাইজেশন, নিউরাল নেটওয়ার্ক, পারফরম্যান্স ও ডিপ্লয়মেন্ট সামলাতেন, সাধারণত TensorFlow ও PyTorch-এর মতো লাইব্রেরি দিয়ে। ডেটা অ্যানালিস্ট ও ডেটা ইঞ্জিনিয়ারদের সীমারেখা ছিল আরও স্পষ্ট।

অ্যাপ্লাইড সায়েন্টিস্ট পদবিটি, যা Amazon ও Microsoft-এর মতো কোম্পানির মাধ্যমে জনপ্রিয় হয়, এই দুইয়ের মাঝখানের জায়গা পূরণ করত। অ্যাপ্লাইড সায়েন্টিস্টরা নতুন মডেল ও অ্যালগরিদম নিয়ে পরীক্ষা করতেন, কিন্তু তাদের কোড যেন প্রোডাকশন সিস্টেমে চলতে পারে তাও নিশ্চিত করতে হতো। ভূমিকাগুলোর মধ্যে রেখা টিকে ছিল, কারণ প্রোটোটাইপিংয়ে সপ্তাহের পর সপ্তাহ ম্যানুয়াল কোডিং, পরীক্ষা ও ডিবাগিং লাগত, আর সাহায্যের জন্য কোনো কোডিং অ্যাসিস্ট্যান্ট ছিল না।

২০১৭ সালে Google-এর "Attention Is All You Need" পেপারের মাধ্যমে সবকিছু বদলে যায়, যা GPT-এর মতো LLM-এর ভিত্তি ট্রান্সফর্মার আর্কিটেকচার চালু করে। GPT-3-এর পর এই ক্ষেত্রের মানুষ গুরুত্ব দিয়ে মনোযোগ দিতে শুরু করে, কিন্তু GPT-4 ছিল প্রকৃত মোড়, কারণ কোম্পানিগুলো মডেল কীভাবে তৈরি ও ডিপ্লয় হবে তা নতুন করে ভাবতে শুরু করে। এই পরিবর্তনই লেখার বাকি অংশে আলোচিত নতুন ভূমিকাগুলোর জন্ম দিয়েছে।

অ্যাপ্লাইড সায়েন্টিস্ট ও ডেটা সায়েন্টিস্টের মধ্যে পার্থক্য কী?

দুটি ভূমিকা অনেকটা একই রকম, তবে অ্যাপ্লাইড সায়েন্টিস্ট সাধারণত ইঞ্জিনিয়ারিংয়ের আরও কাছাকাছি থাকেন। নতুন মডেল ও অ্যালগরিদম নিয়ে পরীক্ষা করার পাশাপাশি, তাদের কোড যাতে প্রকৃত প্রোডাকশন সিস্টেমে চলতে পারে তা নিশ্চিত করার প্রত্যাশা থাকে।

বাংলা version →


🇩🇪 Deutsch

KI-Ingenieure, Applied Scientists und Forward Deployed Engineers

Der Aufstieg großer Sprachmodelle macht es schwer vorherzusagen, wie KI die Welt umgestalten wird, und der Arbeitsmarkt verändert sich bereits. Anstatt Berufsbezeichnungen aus dem Data-Science-Bereich aufzulisten, untersucht dieser Beitrag, was sich im Fachgebiet verändert hat, warum neue Rollen entstehen und wie sich Fachleute darauf vorbereiten können.

Vor der Ära der Transformer war Data Science im Wesentlichen zweigeteilt. Data Scientists arbeiteten näher an der Produktseite und konzentrierten sich auf Statistik, Experimente, Datenanalyse und die Gewinnung von Erkenntnissen, wobei Python und SQL die Kernwerkzeuge waren. Machine-Learning-Ingenieure arbeiteten näher am Modell selbst und kümmerten sich um Trainingspipelines, Optimierung, neuronale Netze, Leistung und Deployment, meist mit Bibliotheken wie TensorFlow und PyTorch. Data Analysts und Data Engineers hatten klarere Abgrenzungen.

Die Bezeichnung Applied Scientist, populär gemacht durch Unternehmen wie Amazon und Microsoft, füllte eine Mittelposition aus. Applied Scientists experimentierten mit neuen Modellen und Algorithmen, mussten aber auch sicherstellen, dass ihr Code in einem Produktivsystem funktionieren kann. Die Grenzen zwischen den Rollen blieben bestehen, weil Prototyping wochenlange manuelle Programmierung, Tests und Fehlersuche erforderte, ohne Coding-Assistenten als Unterstützung.

Alles änderte sich mit dem Google-Paper "Attention Is All You Need" aus dem Jahr 2017, das die Transformer-Architektur einführte, auf der LLMs wie GPT basieren. Das Feld begann nach GPT-3 ernsthaft aufmerksam zu werden, doch GPT-4 war der eigentliche Wendepunkt, da Unternehmen begannen, zu überdenken, wie Modelle gebaut und eingesetzt werden. Genau dieser Wandel brachte die neueren Rollen hervor, die im weiteren Verlauf des Artikels betrachtet werden.

Was ist der Unterschied zwischen einem Applied Scientist und einem Data Scientist?

Beide Rollen ähneln sich, doch der Applied Scientist steht typischerweise näher an der Ingenieurarbeit. Neben dem Experimentieren mit neuen Modellen und Algorithmen wird von ihm erwartet, dass sein Code tatsächlich in einem Produktivsystem lauffähig ist.

Deutsch version →


🇪🇸 Español

Ingenieros de IA, científicos aplicados e ingenieros de despliegue en campo

El auge de los grandes modelos de lenguaje ha hecho difícil predecir cómo la IA remodelará el mundo, y el mercado laboral ya está cambiando. En lugar de enumerar títulos de puestos en ciencia de datos, este artículo analiza qué ha cambiado en el campo, por qué surgen nuevos roles y cómo pueden prepararse los profesionales para ellos.

Antes de la era de los transformers, la ciencia de datos se dividía básicamente en dos. Los científicos de datos estaban más cerca del lado del producto, centrados en la estadística, la experimentación, el análisis de datos y la extracción de conclusiones, con Python y SQL como herramientas principales. Los ingenieros de machine learning trabajaban más cerca del propio modelo, encargándose de los pipelines de entrenamiento, la optimización, las redes neuronales, el rendimiento y el despliegue, normalmente con bibliotecas como TensorFlow y PyTorch. Los analistas de datos y los ingenieros de datos tenían límites más claros.

El título de científico aplicado, popularizado por empresas como Amazon y Microsoft, ocupaba un terreno intermedio. Los científicos aplicados experimentaban con nuevos modelos y algoritmos, pero también debían asegurarse de que su código pudiera funcionar dentro de un sistema de producción. Las fronteras entre roles se mantuvieron porque la creación de prototipos exigía semanas de codificación, pruebas y depuración manuales, sin asistentes de programación que ayudaran.

Todo cambió con el artículo de Google de 2017 "Attention Is All You Need", que introdujo la arquitectura transformer en la que se basan los LLM como GPT. El sector empezó a prestar atención seria después de GPT-3, pero GPT-4 fue el verdadero punto de inflexión, ya que las empresas comenzaron a replantearse cómo se construyen y despliegan los modelos. Ese cambio es el que ha dado lugar a los nuevos roles que se examinan en el resto del artículo.

¿Cuál es la diferencia entre un científico aplicado y un científico de datos?

Ambos roles son similares, pero el científico aplicado suele estar más cerca de la ingeniería. Además de experimentar con nuevos modelos y algoritmos, debe asegurarse de que su código pueda ejecutarse realmente dentro de un sistema de producción.

Español version →


🇫🇷 Français

Ingénieurs IA, scientifiques appliqués et ingénieurs déployés sur le terrain

L'essor des grands modèles de langage rend difficile la prévision de la manière dont l'IA remodèlera le monde, et le marché de l'emploi évolue déjà. Plutôt que de dresser la liste des intitulés de postes en science des données, cet article examine ce qui a changé dans le domaine, pourquoi de nouveaux rôles émergent et comment les professionnels peuvent s'y préparer.

Avant l'ère des transformers, la science des données était globalement scindée en deux. Les data scientists étaient plus proches du côté produit, centrés sur la statistique, l'expérimentation, l'analyse de données et l'extraction d'informations, avec Python et SQL comme outils principaux. Les ingénieurs en machine learning travaillaient plus près du modèle lui-même, en prenant en charge les pipelines d'entraînement, l'optimisation, les réseaux de neurones, les performances et le déploiement, généralement avec des bibliothèques telles que TensorFlow et PyTorch. Les analystes de données et les ingénieurs data avaient des frontières plus nettes.

Le titre de scientifique appliqué, popularisé par des entreprises comme Amazon et Microsoft, occupait un entre-deux. Les scientifiques appliqués expérimentaient de nouveaux modèles et algorithmes, mais devaient aussi s'assurer que leur code pouvait fonctionner dans un système de production. Les frontières entre les rôles tenaient parce que le prototypage exigeait des semaines de codage, de tests et de débogage manuels, sans assistants de programmation pour aider.

Tout a basculé avec l'article de Google de 2017, « Attention Is All You Need », qui a introduit l'architecture transformer sur laquelle reposent les LLM comme GPT. Le domaine a commencé à y prêter une attention sérieuse après GPT-3, mais GPT-4 a été le véritable tournant, les entreprises ayant commencé à repenser la façon dont les modèles sont construits et déployés. C'est ce changement qui a fait émerger les nouveaux rôles examinés dans la suite de l'article.

Quelle est la différence entre un scientifique appliqué et un data scientist ?

Les deux rôles se ressemblent, mais le scientifique appliqué se situe généralement plus près de l'ingénierie. Au-delà de l'expérimentation de nouveaux modèles et algorithmes, il doit s'assurer que son code peut effectivement fonctionner dans un système de production.

Français version →


🇮🇳 हिन्दी

AI इंजीनियर, एप्लाइड साइंटिस्ट और फ़ॉरवर्ड डिप्लॉयड इंजीनियर

लार्ज लैंग्वेज मॉडल के उदय ने यह अनुमान लगाना कठिन बना दिया है कि AI दुनिया को कैसे नया रूप देगा, और नौकरी बाज़ार पहले से ही बदल रहा है। डेटा साइंस की नौकरियों की सूची देने के बजाय, यह लेख देखता है कि इस क्षेत्र में क्या बदला है, नई भूमिकाएँ क्यों उभर रही हैं, और पेशेवर उनके लिए खुद को कैसे तैयार कर सकते हैं।

ट्रांसफ़ॉर्मर युग से पहले, डेटा साइंस मोटे तौर पर दो हिस्सों में बँटा था। डेटा साइंटिस्ट उत्पाद पक्ष के अधिक करीब होते थे, और सांख्यिकी, प्रयोग, डेटा विश्लेषण और अंतर्दृष्टि निकालने पर ध्यान देते थे, जिसमें Python और SQL मुख्य उपकरण थे। मशीन लर्निंग इंजीनियर मॉडल के अधिक नज़दीक काम करते थे, जिनका काम प्रशिक्षण पाइपलाइन, ऑप्टिमाइज़ेशन, न्यूरल नेटवर्क, प्रदर्शन और डिप्लॉयमेंट संभालना था, आमतौर पर TensorFlow और PyTorch जैसी लाइब्रेरी के साथ। डेटा एनालिस्ट और डेटा इंजीनियरों की सीमाएँ अधिक स्पष्ट थीं।

एप्लाइड साइंटिस्ट का पद, जिसे Amazon और Microsoft जैसी कंपनियों ने लोकप्रिय बनाया, इन दोनों के बीच की भूमिका भरता था। एप्लाइड साइंटिस्ट नए मॉडल और एल्गोरिदम के साथ प्रयोग करते थे, लेकिन यह भी सुनिश्चित करते थे कि उनका कोड प्रोडक्शन सिस्टम में चल सके। भूमिकाओं के बीच की रेखाएँ इसलिए बनी रहीं क्योंकि प्रोटोटाइपिंग में हफ़्तों की मैन्युअल कोडिंग, परीक्षण और डीबगिंग लगती थी, और उस समय मदद के लिए कोडिंग असिस्टेंट नहीं थे।

2017 में Google के पेपर "Attention Is All You Need" से सब कुछ बदल गया, जिसने GPT जैसे LLM की नींव बनी ट्रांसफ़ॉर्मर आर्किटेक्चर पेश किया। इस क्षेत्र में लोगों ने GPT-3 के बाद गंभीरता से ध्यान देना शुरू किया, लेकिन GPT-4 असली मोड़ साबित हुआ, क्योंकि कंपनियों ने मॉडल बनाने और तैनात करने के तरीके पर फिर से सोचना शुरू कर दिया। यही बदलाव उन नई भूमिकाओं के उभरने का कारण बना, जिनकी चर्चा लेख के आगे के हिस्से में की गई है।

एप्लाइड साइंटिस्ट और डेटा साइंटिस्ट में क्या अंतर है?

दोनों भूमिकाएँ मिलती-जुलती हैं, लेकिन एप्लाइड साइंटिस्ट आमतौर पर इंजीनियरिंग के अधिक करीब होता है। नए मॉडल और एल्गोरिदम के साथ प्रयोग करने के अलावा, उनसे यह सुनिश्चित करने की अपेक्षा की जाती है कि उनका कोड वास्तव में प्रोडक्शन सिस्टम में चल सके।

हिन्दी version →


🇮🇩 Bahasa Indonesia

Insinyur AI, Ilmuwan Terapan & Insinyur Penerapan Lapangan

Munculnya model bahasa besar membuat sulit memprediksi bagaimana AI akan membentuk ulang dunia, dan pasar kerja sudah mulai berubah. Alih-alih mendaftar judul pekerjaan data science, tulisan ini melihat apa yang berubah di bidang tersebut, mengapa peran-peran baru bermunculan, dan bagaimana para profesional dapat mempersiapkan diri.

Sebelum era transformer, data science pada dasarnya terbagi dua. Data Scientist lebih dekat dengan sisi produk, berfokus pada statistik, eksperimen, analisis data, dan penggalian wawasan, dengan Python dan SQL sebagai alat utama. Machine Learning Engineer bekerja lebih dekat dengan model itu sendiri, menangani pipeline pelatihan, optimisasi, jaringan saraf, performa, dan deployment, biasanya menggunakan pustaka seperti TensorFlow dan PyTorch. Data Analyst dan Data Engineer memiliki batasan yang lebih jelas.

Jabatan Applied Scientist, yang dipopulerkan oleh perusahaan seperti Amazon dan Microsoft, mengisi wilayah tengah. Applied Scientist bereksperimen dengan model dan algoritma baru, tetapi juga harus memastikan kode mereka dapat berjalan dalam sistem produksi. Batas antar peran ini bertahan karena pembuatan prototipe membutuhkan berminggu-minggu pengodean, pengujian, dan debugging manual, tanpa asisten pengodean untuk membantu.

Segalanya berubah dengan makalah Google tahun 2017 "Attention Is All You Need", yang memperkenalkan arsitektur transformer yang menjadi dasar LLM seperti GPT. Bidang ini mulai memberi perhatian serius setelah GPT-3, tetapi GPT-4 adalah titik balik yang sesungguhnya, ketika perusahaan mulai memikirkan ulang cara membangun dan menerapkan model. Pergeseran inilah yang memunculkan peran-peran baru yang dibahas di sisa artikel.

Apa perbedaan antara Applied Scientist dan Data Scientist?

Kedua peran ini mirip, tetapi Applied Scientist biasanya berada lebih dekat dengan bidang rekayasa. Selain bereksperimen dengan model dan algoritma baru, mereka diharapkan memastikan bahwa kode mereka benar-benar dapat berjalan di dalam sistem produksi.

Bahasa Indonesia version →


🇯🇵 日本語

AIエンジニア、応用科学者、フォワードデプロイドエンジニア

大規模言語モデルの台頭により、AIが世界をどのように作り変えるのかを予測することは難しくなっており、労働市場はすでに変わり始めています。データサイエンスの職種一覧を挙げるのではなく、本記事ではこの分野で何が変わったのか、なぜ新しい役割が生まれているのか、そして専門家がそれにどう備えるべきかを考察します。

トランスフォーマーの時代以前、データサイエンスは大きく二つに分かれていました。データサイエンティストはプロダクト側に近く、統計学、実験、データ分析、インサイトの抽出に注力し、Pythonと SQL が主要なツールでした。機械学習エンジニアはモデルそのものに近い位置で働き、学習パイプライン、最適化、ニューラルネットワーク、性能、デプロイを担当し、通常は TensorFlow や PyTorch などのライブラリを使用していました。データアナリストやデータエンジニアの役割の境界は、より明確でした。

応用科学者(Applied Scientist)という肩書きは、Amazon や Microsoft などの企業によって広まりました。応用科学者は両者の中間に位置し、新しいモデルやアルゴリズムを実験する一方で、そのコードが本番システム上で確実に動作するよう保証する必要がありました。役割の境界が保たれていたのは、プロトタイピングに数週間にわたる手作業のコーディング、テスト、デバッグが必要で、それを支援するコーディングアシスタントが存在しなかったからです。

状況を一変させたのは、2017年にGoogleが発表した論文「Attention Is All You Need」でした。この論文は、GPTのようなLLMの基盤となるトランスフォーマーアーキテクチャを提示しました。業界がこれに本格的に注目し始めたのは GPT-3 以降ですが、真の転換点となったのは GPT-4 でした。企業がモデルの構築とデプロイの方法を見直し始めたのです。この変化こそが、本記事の後半で取り上げる新しい役割の誕生につながりました。

応用科学者とデータサイエンティストの違いは何ですか?

両者の役割は似ていますが、応用科学者は一般にエンジニアリングにより近い位置にいます。新しいモデルやアルゴリズムの実験に加えて、そのコードが実際に本番システム内で動作することを保証することが求められます。

日本語 version →


🇧🇷 Português

Engenheiros de IA, cientistas aplicados e engenheiros de implantação em campo

A ascensão dos grandes modelos de linguagem tornou difícil prever como a IA remodelará o mundo, e o mercado de trabalho já está mudando. Em vez de listar títulos de cargos em ciência de dados, este artigo analisa o que mudou na área, por que surgem novos papéis e como os profissionais podem se preparar para eles.

Antes da era dos transformers, a ciência de dados estava basicamente dividida em duas. Os cientistas de dados ficavam mais próximos do lado do produto, focados em estatística, experimentação, análise de dados e extração de insights, com Python e SQL como ferramentas principais. Os engenheiros de machine learning trabalhavam mais perto do próprio modelo, cuidando de pipelines de treinamento, otimização, redes neurais, desempenho e implantação, normalmente com bibliotecas como TensorFlow e PyTorch. Analistas de dados e engenheiros de dados tinham limites mais claros.

O título de cientista aplicado, popularizado por empresas como Amazon e Microsoft, ocupava um meio-termo. Os cientistas aplicados experimentavam novos modelos e algoritmos, mas também precisavam garantir que seu código pudesse funcionar dentro de um sistema de produção. As fronteiras entre os papéis se mantinham porque a prototipagem exigia semanas de codificação, testes e depuração manuais, sem assistentes de programação para ajudar.

Tudo mudou com o artigo do Google de 2017, "Attention Is All You Need", que introduziu a arquitetura transformer na qual se baseiam LLMs como o GPT. A área passou a prestar atenção séria após o GPT-3, mas o GPT-4 foi o verdadeiro divisor de águas, pois as empresas começaram a repensar como os modelos são construídos e implantados. Essa mudança é o que deu origem aos novos papéis examinados no restante do artigo.

Qual é a diferença entre um cientista aplicado e um cientista de dados?

Os dois papéis são semelhantes, mas o cientista aplicado normalmente fica mais próximo da engenharia. Além de experimentar novos modelos e algoritmos, espera-se que ele garanta que seu código consiga realmente rodar dentro de um sistema de produção.

Português version →


🇷🇺 Русский

AI-инженеры, прикладные учёные и инженеры-развёртыватели на местах

Рост больших языковых моделей затрудняет прогноз того, как ИИ изменит мир, и рынок труда уже меняется. Вместо перечисления должностей в области data science в этой статье рассматривается, что изменилось в отрасли, почему появляются новые роли и как специалистам подготовиться к ним.

До эпохи трансформеров data science в основном делилась на два направления. Data Scientists были ближе к продуктовой стороне: они занимались статистикой, экспериментами, анализом данных и извлечением инсайтов, а основными инструментами были Python и SQL. Инженеры машинного обучения работали ближе к самой модели, отвечая за конвейеры обучения, оптимизацию, нейронные сети, производительность и развёртывание, обычно с использованием библиотек вроде TensorFlow и PyTorch. Роли аналитиков данных и инженеров данных были определены чётче.

Должность Applied Scientist, популяризированная такими компаниями, как Amazon и Microsoft, занимала промежуточное положение. Прикладные учёные экспериментировали с новыми моделями и алгоритмами, но также должны были гарантировать, что их код сможет работать в производственной системе. Границы между ролями сохранялись, потому что создание прототипов требовало недель ручного написания кода, тестирования и отладки без помощников по программированию.

Всё изменилось с выходом статьи Google 2017 года «Attention Is All You Need», которая представила архитектуру трансформера, лежащую в основе LLM вроде GPT. Отрасль начала серьёзно обращать на это внимание после GPT-3, но настоящим переломным моментом стал GPT-4, поскольку компании начали пересматривать способы создания и развёртывания моделей. Именно этот сдвиг породил новые роли, которые рассматриваются в остальной части статьи.

В чём разница между прикладным учёным и Data Scientist?

Обе роли похожи, но прикладной учёный обычно находится ближе к инженерии. Помимо экспериментов с новыми моделями и алгоритмами, от него ожидается, что он обеспечит работоспособность своего кода в реальной производственной системе.

Русский version →


🇨🇳 简体中文

AI工程师、应用科学家与前线部署工程师

大语言模型的兴起让人难以预测AI将如何重塑世界,而就业市场已经在发生变化。本文不列举数据科学职位名称,而是探讨该领域发生了哪些变化、为什么会涌现新角色,以及专业人士如何为此做好准备。

在Transformer时代之前,数据科学基本分为两类。数据科学家更靠近产品端,专注于统计学、实验、数据分析和洞察提取,Python和SQL是核心工具。机器学习工程师则更贴近模型本身,负责训练流程、优化、神经网络、性能和部署,通常使用TensorFlow和PyTorch等库。数据分析师和数据工程师的职责边界则较为清晰。

应用科学家这一头衔由Amazon和Microsoft等公司推广开来,填补了两者之间的空白。应用科学家既要试验新的模型和算法,还要确保其代码能够在生产系统中运行。角色之间的界限之所以得以维持,是因为原型开发需要数周的人工编码、测试和调试,而当时没有编码助手可用。

2017年Google发表的论文《Attention Is All You Need》改变了一切,该论文提出了支撑GPT等LLM的Transformer架构。业界在GPT-3之后才开始认真关注,但GPT-4才是真正的转折点,企业开始重新思考模型的构建和部署方式。正是这一转变催生了本文后续探讨的新角色。

应用科学家与数据科学家有什么区别?

两者角色相似,但应用科学家通常更贴近工程端。除了试验新的模型和算法外,他们还需要确保自己的代码能够真正在生产系统中运行。

简体中文 version →