Рост больших языковых моделей затрудняет прогноз того, как ИИ изменит мир, и рынок труда уже меняется. Вместо перечисления должностей в области data science в этой статье рассматривается, что изменилось в отрасли, почему появляются новые роли и как специалистам подготовиться к ним.
До эпохи трансформеров data science в основном делилась на два направления. Data Scientists были ближе к продуктовой стороне: они занимались статистикой, экспериментами, анализом данных и извлечением инсайтов, а основными инструментами были Python и SQL. Инженеры машинного обучения работали ближе к самой модели, отвечая за конвейеры обучения, оптимизацию, нейронные сети, производительность и развёртывание, обычно с использованием библиотек вроде TensorFlow и PyTorch. Роли аналитиков данных и инженеров данных были определены чётче.
Должность Applied Scientist, популяризированная такими компаниями, как Amazon и Microsoft, занимала промежуточное положение. Прикладные учёные экспериментировали с новыми моделями и алгоритмами, но также должны были гарантировать, что их код сможет работать в производственной системе. Границы между ролями сохранялись, потому что создание прототипов требовало недель ручного написания кода, тестирования и отладки без помощников по программированию.
Всё изменилось с выходом статьи Google 2017 года «Attention Is All You Need», которая представила архитектуру трансформера, лежащую в основе LLM вроде GPT. Отрасль начала серьёзно обращать на это внимание после GPT-3, но настоящим переломным моментом стал GPT-4, поскольку компании начали пересматривать способы создания и развёртывания моделей. Именно этот сдвиг породил новые роли, которые рассматриваются в остальной части статьи.
Источник: Towards Data Science · Сводку подготовил HeadlinesBriefing