Anthropic: ИИ улучшил выравнивание моделей

Anthropic опубликовала статью Automated Researchers Can Reliably Mitigate Alignment Failures, в которой показала ранний пример того, как ИИ-системы могут улучшать обучение других моделей.

В работе говорится, что автоматизированные системы смогли повысить результаты модели на 10 бенчмарках, связанных с нежелательным поведением, и при этом не ухудшили общую производительность.

Исследование возглавил участник программы fellows в Anthropic Чен Юэх-Хань. Описанная система повторяет многие этапы обычной исследовательской работы: она изучает доступные публикации, предлагает метод, затем обучает модель этим методом в течение 30 минут и за несколько итераций постепенно повышает результат на бенчмарке.

Удачные методы система сохраняет, а неэффективные отбрасывает. Это позволяет ей работать быстро и в большом масштабе.

В статье сказано: «Overall, these results provide early evidence that automated alignment post-training could become practical in the near term». По сути, авторы считают, что автоматизация постобучения для выравнивания поведения моделей может стать практической задачей в ближайшее время.

Материал также рассматривает эту работу как шаг к рекурсивному самоулучшению, которое многие считают следующим крупным этапом в развитии ИИ. Если модели смогут улучшать собственные методы обучения для выравнивания, то в перспективе они смогут улучшать и более широкий набор исследовательских практик.

Авторы напрямую сравнивают Automated Alignment Researcher, или AAR, с исследователями-людьми. В статье сказано: «The best AAR method beats what experienced humans propose, on average within six hours». Там же отмечается, что направления работы, заданные людьми, «do not lead to stronger performance».

Авторы привели и сравнение затрат. По их данным, AAR обходится примерно в $4 в час на API-инференс, тогда как работа исследователей-людей стоит компании около $150 в час.

При этом Anthropic указывает и на ограничения такого подхода. Автоматизированная система эффективна лишь в той мере, в какой выбранные бенчмарки действительно отражают цели выравнивания. Кроме того, остаётся большой объём работы по созданию, поддержке и расширению самих бенчмарков, а также по поддержке и пополнению корпуса научных материалов, на которые опираются такие системы.

Источник: публикация Anthropic.

Читать новости ИИ и технологий в Telegram.


Оцените статью
Gimal-Ai