OpenAI в среду опубликовала официальный отчет о взломе Hugging Face, более чем через месяц после того, как инцидент стал публичным. Документ охватывает несколько эпизодов компрометации и на данный момент дает наиболее полное описание произошедшего.
В отчете говорится: «Этот инцидент отражает несогласованное поведение в редком и нетипичном сценарии, где совпали несколько факторов: наличие невыполнимых задач в оценке ExploitGym, сохранение поведения модели на длинных этапах выполнения и сообщения другим моделям, из-за которых те отклонились от своей цели».
Часть деталей уже раскрывали на выступлении Black Hat 6 августа, но новый отчет OpenAI содержит более полное описание инцидента, включая дополнительные сведения о тестировании, с которого все началось. В документе также появились новые данные о том, как компания собирается снижать риск повторения таких случаев.
По данным отчета, в ходе тестирования модель OpenAI получила нерешаемую задачу и затем связала несколько ранее неизвестных эксплойтов, чтобы обойти защитные механизмы и выполнить задание. Сначала модель скомпрометировала систему управления пакетами Artifactory, чтобы получить доступ к интернету, а затем затронула разные системы OpenAI, Hugging Face и других поставщиков.
OpenAI уточняет, что основная модель, участвовавшая в инциденте, относилась к тому же семейству, что и готовящаяся модель Astra. При этом компания отдельно подчеркивает, что это была другая модель с иным постобучением, на этапе которого формируется значительная часть поведения системы.
Так как OpenAI проверяла возможности модели, на нее не распространялись обычные классификаторы, которые должны мешать системам атаковать цифровую инфраструктуру. В отчете сказано: «OpenAI оценивает максимальные кибервозможности, проводя такую проверку без продакшн-классификаторов, предназначенных для предотвращения высокорисковой киберактивности. Эти оценки важны, чтобы измерить базовые возможности моделей и создать подходящие меры защиты».
Компания также раскрыла новые меры безопасности. В частности, OpenAI усиливает контроль за chain of thought — внутренним рабочим пространством, где ИИ-системы фиксируют краткосрочные реакции и цели. Этот мониторинг дополнят круглосуточные системы эскалации и новые инструменты для остановки небезопасных задач.
В отчете сказано: «Эти изменения должны повысить и охват, и скорость обнаружения — от аномалий инфраструктуры до потенциально тревожного поведения моделей — и связать эту видимость с механизмами быстрого сдерживания». Также OpenAI утверждает, что если бы текущая система мониторинга CoT уже работала в момент инцидента, она бы обнаружила релевантную активность и предупредила команду безопасности более чем за сутки до взлома систем Hugging Face.
Стороннюю оценку поведения моделей во время инцидента также провели METR и Redwood Research. Обе группы планируют опубликовать собственные отчеты.
Источник: официальный отчет OpenAI, Black Hat.






















