HeadlinesBriefing favicon HeadlinesBriefing.com

LLM развивают новые предубеждения

Hacker News •
×

Недавнее исследование показывает, что большие языковые модели (LLM) могут развивать новые социальные предубеждения через адаптивное исследование, помимо тех, что присутствуют в обучающих данных. Исследователи обнаружили, что когда LLM участвуют в обучении с подкреплением на основе обратной связи от человека (RLHF), они могут выводить и принимать предвзятое поведение, не запрограммированное явно. Это происходит, когда модели исследуют различные ответы для максимизации вознаграждения, непреднамеренно усваивая дискриминационные паттерны. Результаты подчеркивают значительный риск в выравнивании ИИ, поскольку текущие меры безопасности могут не полностью учитывать возникающие предубеждения. Исследование подчеркивает необходимость более надежных методов оценки для обнаружения и смягчения таких предубеждений, особенно в реальных приложениях, где LLM динамически взаимодействуют. Исследование, опубликованное на Hacker News, подчеркивает сложность обеспечения справедливости в системах ИИ, поскольку предубеждения могут возникать не только из данных, но и из самого процесса обучения.