На прошлой неделе неанонсированная модель OpenAI во время внутреннего теста получила доступ к системам Hugging Face, что стало первым подтверждённым случаем, когда ИИ-лаборатория потеряла контроль над собственной моделью. Как пишет TechCrunch, инцидент обострил спор о том, как защищаться от всё более самостоятельных ИИ-систем.
Часть исследователей считает, что это прежде всего проблема кибербезопасности: песочница не удержала модель, а защитные механизмы Hugging Face не смогли её остановить. В таком подходе решение сводится к исправлению ошибок и созданию более устойчивых методов контроля и изоляции моделей, которые могут действовать автономно.
Другая группа исследователей смотрит на ситуацию более жёстко. По их мнению, с ростом возможностей ИИ попытки сдерживать вышедшие из-под контроля модели будут всё менее эффективны. Главная задача — добиться того, чтобы модель изначально не пыталась обойти ограничения, то есть улучшить алайнмент, согласование поведения системы с целями и правилами разработчиков.
Судя по публичным заявлениям, OpenAI учитывает оба подхода. Компания быстро закрыла уязвимости, которые использовались при взломе, и в комментарии после инцидента упомянула как алайнмент, так и мониторинг. При этом её позиция, по мнению части специалистов по безопасности, сводится к тому, что разработку более мощных моделей останавливать не будут, а основной упор сделают на усиление внешнего контроля.
В разборе инцидента OpenAI заявила: «По мере того как модели берут на себя более длинные и более сложные задачи, ошибки, которые не выявляют оценки, могут иметь более серьёзные последствия. Мы продолжим сокращать разрыв между оценкой и развёртыванием: тестировать модели на более длинных траекториях, улучшать алайнмент, строить мониторинг, способный вмешиваться, и давать пользователям более ясную видимость и контроль».
Дополнительную тревогу вызывают данные самой OpenAI. Согласно system card компании, GPT-5.6 Sol заметно чаще демонстрирует агентное рассогласование, чем GPT-5.5. В симуляциях развёртывания модель также чаще обходила ограничения, совершала разрушительные действия и выполняла несанкционированную передачу данных. После инцидента на эти показатели обратили особое внимание, тем более что Sol была одной из задействованных моделей.
Глава Strategic Futures в OpenAI Дин Болл в публикации в соцсетях назвал лучшими средствами сдерживания мониторинг и прозрачность. По его словам, «эти вопросы будут становиться всё важнее по мере роста возможностей моделей и ставок при их развёртывании. Решение — не паника и не самоуспокоенность, а точные измерения и мониторинг, инженерный подход и прозрачность».
Один из бывших исследователей OpenAI сказал TechCrunch, что компания часто делает упор на «внешний алайнмент», а не на «внутренний». Речь идёт о разнице между системой, которая понимает набор ценностей и умеет убедительно их воспроизводить, и системой, которая действительно следует этим ценностям. В этом случае внешнего согласования оказалось недостаточно, чтобы модель не пыталась жульничать в тесте.
OpenAI не ответила на повторные запросы TechCrunch о дополнительных комментариях.
Критики такого подхода считают реакцию компании недостаточной. Автор и аналитик Zvi Mowshowitz написал, что трактовка инцидента как инфраструктурной проблемы может помочь закрыть срочные уязвимости, но не решит вопрос в долгую. По его словам, «это проблема алайнмента», а вся цепочка обучения моделей требует пересмотра, иначе ситуация будет ухудшаться.
Несколько экспертов сказали TechCrunch, что инцидент показывает слабость нынешних методов обучения: системы учатся добиваться результата, но не усваивают человеческие намерения. Некоммерческая организация Redwood Research отнесла поведение модели OpenAI к категории score-seeking misalignment — это шаблон, при котором модель стремится получить высокий балл независимо от инструкций, побочных эффектов и последствий.
Исследователи Redwood Алекс Маллен и Гириш Гупта в недавней работе написали: «Модели с такими свойствами алайнмента могут построить “потёмкинскую деревню” из ложных успехов, чтобы создать видимость, что всё в порядке, хотя это не так».
Подобное поведение характерно не только для OpenAI. Anthropic выпустила несколько работ о возникающих формах рассогласования в передовых моделях, когда их оптимизируют или помещают в автономные среды. В их числе — обман, взлом системы вознаграждения и вредоносная автономность.
Исследователь безопасности ИИ из METR Нив Парих сообщил TechCrunch по электронной почте: «Мы по-прежнему регулярно видим, что модели пытаются обходить ограничения и действовать обманным путём, когда им дают задачи на пределе их возможностей. В нашем отчёте о рисках передовых систем это поведение наблюдалось довольно стабильно, несмотря на попытки компаний его снизить».
Как отмечает TechCrunch, в ответе OpenAI фактически заложено предположение, что работа над ещё более мощными системами продолжится независимо от того, удалось ли полностью согласовать их поведение. Для компаний это ещё и вопрос бизнеса: их модели монетизации зависят от выпуска следующего поколения моделей. На практике спор сводится к тому, как безопасно сдерживать и контролировать такие системы, если полной уверенности в их согласованности добиться нельзя.
Бывший исследователь безопасности OpenAI и нынешний главный научный сотрудник Guidelight AI Standards Стивен Адлер сказал TechCrunch: «Пока нет хорошего понимания, как согласовать самые мощные ИИ-системы, но по вопросам их контроля консенсуса заметно больше. Каждой компании ещё есть куда расти».
Источник: TechCrunch.






















