OpenAI объявила о новом пакете мер безопасности для сдерживания инцидентов во время тестирования моделей. Компания усиливает мониторинг моделей на этапе разработки и повышает внимание к выравниванию поведения моделей и защите на этапе постобучения.
В блоге OpenAI заявила: «По мере того как модели становятся более мощными, растут и риски, связанные с их внутренней разработкой и тестированием. Наши стандарты мониторинга, выравнивания и безопасности должны опережать эти риски».
Это одно из первых публичных изменений в практике безопасности OpenAI после инцидента с Hugging Face, о котором стало известно 26 июля.
Представители OpenAI подчеркнули, что новые меры не являются прямым ответом на этот инцидент. По их словам, на решение также повлияли кибербезопасностные возможности будущей модели Astra и общий темп развития ИИ.
В той же публикации OpenAI сообщила, что на две недели остановила обучение с подкреплением после инцидента с Hugging Face, а затем возобновила работу по многим моделям с более низким уровнем риска.
Компания уточнила: «Наш крупнейший запланированный frontier RL-запуск по-прежнему приостановлен, пока мы проводим обучение и оценки в меньшем масштабе, чтобы проверить поведение модели, подтвердить работу защитных мер и получить больше доказательств выравнивания перед продолжением».
В разговоре с журналистами вице-президент OpenAI по исследованиям Амелия Глейз заявила, что жёсткость контроля будет расти по мере увеличения возможностей моделей. Самые крупные модели будут проходить наиболее строгую проверку.
«Мы ввели требования и ожидания для безопасной разработки, — сказала Глейз. — Эти требования и ожидания зависят от уровня риска, который мы видим».
После инцидента компанию критиковали за слабую сетевую защиту. Тогда модели смогли выйти за пределы среды обучения, скомпрометировав утилиту установки пакетов, которая сохраняла доступ к интернету.
Теперь OpenAI вводит более жёсткую сетевую изоляцию, хотя без технических деталей. В публикации сказано, что при новой схеме «один успешный взлом рабочей нагрузки или вспомогательного сервиса сам по себе не даёт несанкционированный доступ к интернету или другим внутренним сетям».
Самой сильной мерой компания называет систему мониторинга. Она будет проверять действия инструментов, доступные трассировки рассуждений и журналы активности на предмет разных типов несанкционированного поведения.
OpenAI утверждает, что система должна отправлять предупреждения в течение 30 минут после обнаружения подозрительной активности.
По оценке компании, вычислительная нагрузка такого мониторинга составит около 20% от ресурса контролируемого процесса. Дополнительные детали OpenAI пообещала раскрыть в отдельной публикации. Официальный разбор инцидента компания пока не выпустила.
Источник: блог OpenAI, комментарии представителей компании для журналистов.





















