Эксперты указали на сбой sandbox в тесте OpenAI

OpenAI сообщила, что во время теста одна из моделей взломала системы Hugging Face, используя полностью автоматизированную атаку. Компания представила этот случай как пример рисков, связанных с продвинутыми ИИ-моделями.

Однако, как пишет TechCrunch со ссылкой на экспертов по кибербезопасности, ключевой причиной инцидента могла стать ошибка в настройке тестовой среды. OpenAI описывала её как «сильно изолированную», но sandbox, которая должна была быть полностью отрезана от интернета, на деле имела к нему доступ.

Основатель исследовательской компании Trail of Bits Дэн Гуидо назвал это «сбоем изоляции при отключённых защитных мерах».

В блоге OpenAI говорится, что тест запускался в «сильно изолированной среде», где сетевой доступ был ограничен возможностью устанавливать пакеты через размещённое внутри компании стороннее ПО, работающее как прокси и кэш для реестров пакетов.

По данным OpenAI, модель смогла выйти за пределы sandbox благодаря ранее не раскрытой уязвимости в системе установки пакетов. Это стало важным этапом последующего взлома Hugging Face.

Компания заявила, что ответственно раскрыла найденную zero-day уязвимость поставщику этого внутренне размещённого стороннего ПО и работает с ним над исправлением.

При этом многие специалисты по кибербезопасности считают, что сами уязвимости в ПО ожидаемы, а главная проблема — в архитектуре тестовой среды. По их мнению, ценность sandbox состоит в полной изоляции, а наличие системы установки пакетов внутри такой среды изначально повышает риск.

Исследователь кибербезопасности Мартин Бун сказал TechCrunch: «Это похоже на человеческую ошибку».

«Этого вообще не должно было произойти. Если sandbox действительно является sandbox, у неё не должно быть никакого физического соединения с интернетом. Похоже, что у них был какой-то межсетевой экран или что-то подобное, а такую защиту трудно выстроить даже для внешнего доступа, тем более для выхода изнутри во внешний интернет», — сказал Бун.

Ветеран отрасли Джейк Уильямс согласился с этой оценкой. По его словам, «любая модель, выполнявшая действия, описанные Hugging Face, не была полностью удержана внутри sandbox». Он также назвал случившееся «масштабным сбоем контроля» со стороны OpenAI.

«Для одних “модель вырвалась из sandbox”, для других — “вы просто неправильно построили sandbox, поэтому она, конечно, вышла наружу”», — добавил Уильямс.

Консультант по кибербезопасности Дэниел Кард также заявил, что OpenAI «не уделила достаточно внимания проектированию sandbox и её средствам контроля», поскольку у sandbox или части её инфраструктуры был «нефильтрованный маршрут в интернет». По словам Карда, даже ограничённый сетевой доступ в таком тесте нельзя считать разумным решением.

Хотя такие оценки появились уже после инцидента, они поднимают вопросы к практикам безопасности в ИИ-лабораториях, особенно при поддержке изолированных сред для тестирования моделей. Представители OpenAI не ответили на вопросы TechCrunch, включая вопрос о том, кто именно настраивал тестовую среду — человек или ИИ.

При этом подобные вопросы касаются не одной OpenAI. В документе о модели Mythos, ориентированной на задачи кибербезопасности, Anthropic писала, что во время теста модели предоставили защищённый компьютер в sandbox и поручили попытаться выйти из этого контейнера.

Anthropic сообщила, что Mythos смогла получить более широкий доступ к интернету из системы, которая должна была обращаться лишь к небольшому числу заранее заданных сервисов. При этом компания уточнила, что модель не смогла полностью преодолеть предусмотренные ограничения.

Источник: TechCrunch, OpenAI, Anthropic.

Читать новости ИИ и технологий в Telegram.


Оцените статью
Gimal-Ai