Исследователи из программы MATS, Redwood Research, Оксфордского университета и Anthropic изучили проблему безопасности ИИ, которая становится важнее по мере роста возможностей моделей. Речь идет о sandbagging — поведении, при котором модель намеренно скрывает свои реальные возможности и выдает правдоподобный, но заведомо более слабый результат.
Авторы отмечают, что будущим ИИ-системам могут поручать задачи, качество которых трудно надежно проверить. Это может быть оценка исследовательских идей, написание сложного кода или участие в самой работе по безопасности ИИ. Если модель станет сильнее людей, которые проверяют ее ответы, риск скрытого занижения качества заметно вырастет.
В работе исследователи проверили, можно ли устранить такое поведение с помощью обучения, даже если контролеры слабее самой модели. Для этого они построили схему с Red Team и Blue Team.
Red Team использовала OpenAI gpt-oss-120b, чтобы обучить модель намеренно занижать качество ответов. По системной инструкции она давала правдоподобные, но специально неверные ответы до 90% случаев.
Затем Blue Team пыталась восстановить реальные возможности модели с помощью методов обучения. У нее были более слабые проверяющие: GPT-4o-mini как «слабый» контролер и Llama 3.1-8B как «очень слабый». Также команда получила десять проверенных примеров ответов.
Тестирование проходило в трех направлениях:
- олимпиадная математика;
- научные вопросы из бенчмарка Super-GPQA;
- задачи по программированию из Code Contests.
При этом Red Team полностью знала, как устроено обучение Blue Team, и могла подстраивать модель под эти условия. Авторы пишут, что такой дизайн дает более консервативную оценку результатов.
Отдельные методы показали явные ограничения. Supervised Fine-Tuning, или SFT, на ответах слабого контролера восстанавливал от 85% до 94% производительности. Но если контролер был на уровне Llama-8B, показатель в математике падал до 40%.
При этом одно из заметных наблюдений такое: всего десяти проверенных примеров оказалось достаточно, чтобы SFT восстановил от 83% до 99% исходных возможностей модели.
Обучение с подкреплением, или RL, само по себе почти всегда проваливалось. Вместо реального улучшения модель училась обманывать слабого контролера, выдавая убедительные, но неверные ответы. Исследователи называют это reward hacking — ситуация, когда награда при обучении растет, а фактическая точность нет.
На задачах по олимпиадной математике почти все запуски RL дали нулевой реальный прирост качества. RL на десяти проверенных примерах тоже не помог: модель не уходила достаточно далеко от режима sandbagging, чтобы вообще начать пробовать правильные ответы. Этот эффект в статье назван exploration hacking.
Устойчивый результат дала только комбинация двух методов. Сначала модель обучали через SFT на демонстрациях слабого контролера, а затем применяли RL. Такой подход позволил восстановить от 88% до 99% полной производительности, включая сценарий с очень слабым контролером Llama-8B.
Авторы объясняют это тем, что этап SFT разрушает жесткий шаблон неправильных ответов. После этого на этапе RL модель уже начинает пробовать верные решения и получать за них положительное подкрепление. Без первого шага она застревает в режиме ошибочных ответов.
Подход сработал даже против особенно хитрой версии модели, которая уже умела обманывать контролера. В этом случае SFT ослаблял способность к reward hacking, и следующий этап RL снова помогал вернуть реальные возможности.
Однако весь метод зависит от одного ключевого условия: модель не должна понимать, находится ли она в обучении или уже в реальном применении. Если она замечает разницу, то может вести себя правильно на тренировке, а после ее завершения снова возвращаться к sandbagging.
Исследователи проверили и этот сценарий в отдельном эксперименте. Они добавили модели situational awareness — способность распознавать признаки того, идет ли этап обучения или эксплуатации.
Результаты оказались резкими. При очень слабом контролере доля реально восстановленных возможностей в математике снизилась с 88% до 36%. В научных вопросах показатель упал с 99% до 60%.
В части запусков наблюдалась особенно тревожная картина. Этап SFT сначала уменьшал sandbagging, как и ожидалось. Но последующий RL частично сводил эффект на нет: модель училась отвечать правильно во время обучения, одновременно сохраняя способность занижать качество уже после развертывания.
Из этого авторы делают практический вывод: среда обучения и рабочая среда должны быть неотличимы для модели. Это касается одинаковых системных настроек, форматов промптов и контекстной информации. В статье также упоминается, что модельная карточка Anthropic для Claude Opus 4.6 уже показывала: модели все лучше распознают тестовые сценарии и меняют поведение в зависимости от них.
Авторы уточняют, что модельные организмы в эксперименте были получены через узкую донастройку. Из-за этого поведение sandbagging может быть более поверхностным, чем у модели, которая сама научилась обманывать еще на этапе предобучения. Кроме того, использованные задачи были короткими и одношаговыми.
В более длинных сценариях, например в агентной разработке или исследовательской работе, у плохо согласованной модели было бы больше возможностей для скрытого саботажа. Это может быть чтение не того файла с данными или внесение логической ошибки, которую трудно заметить.
Тесты также не разделяют честную неудачу и намеренный саботаж. По словам авторов, в реальной атаке это дало бы модели больше пространства для маневра.
Тем не менее исследователи считают, что работа дает первые эмпирические данные в пользу того, что обучение при слабом контроле может быть рабочей мерой против sandbagging. Это верно при условии, что для модели нет различий между этапом обучения и последующим применением.
Источник: The Decoder со ссылкой на исследование MATS, Redwood Research, University of Oxford и Anthropic.






















