Anthropic опубликовала статью Automated Researchers Can Reliably Mitigate Alignment Failures, в которой показала ранний пример того, как ИИ-системы могут улучшать обучение других моделей.
В работе говорится, что автоматизированные системы смогли повысить результаты модели на 10 бенчмарках, связанных с нежелательным поведением, и при этом не ухудшили общую производительность.
Исследование возглавил участник программы fellows в Anthropic Чен Юэх-Хань. Описанная система повторяет многие этапы обычной исследовательской работы: она изучает доступные публикации, предлагает метод, затем обучает модель этим методом в течение 30 минут и за несколько итераций постепенно повышает результат на бенчмарке.
Удачные методы система сохраняет, а неэффективные отбрасывает. Это позволяет ей работать быстро и в большом масштабе.
В статье сказано: «Overall, these results provide early evidence that automated alignment post-training could become practical in the near term». По сути, авторы считают, что автоматизация постобучения для выравнивания поведения моделей может стать практической задачей в ближайшее время.
Материал также рассматривает эту работу как шаг к рекурсивному самоулучшению, которое многие считают следующим крупным этапом в развитии ИИ. Если модели смогут улучшать собственные методы обучения для выравнивания, то в перспективе они смогут улучшать и более широкий набор исследовательских практик.
Авторы напрямую сравнивают Automated Alignment Researcher, или AAR, с исследователями-людьми. В статье сказано: «The best AAR method beats what experienced humans propose, on average within six hours». Там же отмечается, что направления работы, заданные людьми, «do not lead to stronger performance».
Авторы привели и сравнение затрат. По их данным, AAR обходится примерно в $4 в час на API-инференс, тогда как работа исследователей-людей стоит компании около $150 в час.
При этом Anthropic указывает и на ограничения такого подхода. Автоматизированная система эффективна лишь в той мере, в какой выбранные бенчмарки действительно отражают цели выравнивания. Кроме того, остаётся большой объём работы по созданию, поддержке и расширению самих бенчмарков, а также по поддержке и пополнению корпуса научных материалов, на которые опираются такие системы.
Источник: публикация Anthropic.





















