AISI: GPT-5.5 достигла уровня Claude Mythos

Институт безопасности ИИ Великобритании сравнил GPT-5.5 с Claude Mythos Preview в кибериспытаниях и пришёл к выводу, что модель OpenAI показывает сопоставимый уровень. Ведомство считает, что это подтверждает более широкий рост возможностей ИИ для проведения атак.

AISI протестировал GPT-5.5 на серии сценариев кибератак. По итогам проверки модель OpenAI стала второй после Claude Mythos Preview, которая полностью прошла многоэтапную симуляцию атаки на корпоративную сеть. В отдельных задачах экспертного уровня GPT-5.5 даже немного опередила модель Anthropic.

По оценке института, результаты указывают, что возможности, впервые замеченные у Claude Mythos в апреле, не были разовым случаем. AISI связывает это с общим ростом автономности, качества рассуждений и навыков программирования у новых моделей.

Для оценки AISI использует набор из 95 заданий формата capture-the-flag с четырьмя уровнями трудности. Продвинутые задания, созданные вместе с компаниями Crystal Peak Security и Irregular, включают реверс-инжиниринг, разработку эксплойтов для разных типов ошибок памяти, криптографические атаки и анализ запутанного вредоносного ПО.

На максимальном уровне Expert GPT-5.5 показала средний уровень успеха 71,4%. У Claude Mythos Preview этот показатель составил 68,6%. В AISI отмечают, что разрыв укладывается в статистическую погрешность, но GPT-5.5 может быть самой сильной моделью из протестированных на данный момент.

Для сравнения, GPT-5.4 набрала 52,4%, а Claude Opus 4.7 — 48,6%. Все актуальные передовые модели полностью решают базовые задания как минимум с февраля 2026 года.

Отдельные задания проверяют конкретные навыки, но реальные атаки требуют длинной цепочки действий. Поэтому AISI также использует cyber ranges — симулированные сетевые среды с несколькими узлами, сервисами и уязвимостями.

Сценарий The Last Ones включает 32 шага в четырёх подсетях и примерно на 20 хостах. Агент начинает без учётных данных, затем должен найти уязвимости, получить доступ, перемещаться по сети и в итоге добраться до защищённой базы данных. По оценке AISI, у человека-эксперта на это ушло бы около 20 часов.

GPT-5.5 полностью решила The Last Ones в 2 из 10 попыток. Claude Mythos Preview достигла того же результата в 3 из 10 попыток. По данным AISI, качество продолжает расти вместе с увеличением вычислений на этапе вывода, и потолка у текущих моделей пока не видно.

Институт также отмечает, что чем больше токенов модель тратит на «размышление», тем выше вероятность успешной атаки. При этом испытания проходили без активной защиты, без мониторинга безопасности и без последствий за действия, которые в реальной сети вызвали бы тревогу.

Поэтому вопрос о том, насколько GPT-5.5 и Claude Mythos справились бы с хорошо защищёнными системами, остаётся открытым. Однако для слабо защищённых сетей нужные возможности у моделей уже есть, считают в AISI.

Вторая симуляция, Cooling Tower, моделирует атаку на промышленную систему управления. Этот сценарий из 7 шагов пока не прошла ни одна модель, включая GPT-5.5. По данным AISI, GPT-5.5, как и Mythos, ошибалась на ранних шагах в IT-контуре, а не на уровне самой системы управления.

Помимо уровня возможностей, AISI проверил и защитные меры GPT-5.5 для публичного использования. Исследователи сообщили, что нашли универсальный jailbreak, который срабатывал на всех вредоносных киберзапросах, отмеченных OpenAI, включая многошаговые агентные сценарии. На его создание ушло шесть часов.

После этого OpenAI выпустила несколько обновлений системы защиты. Однако AISI не смог подтвердить, насколько хорошо работала финальная конфигурация, из-за ошибки в конфигурации развёрнутой версии. В институте считают это ещё одним подтверждением того, что jailbreak-атаки остаются серьёзной проблемой для больших языковых моделей.

Отдельно AISI указывает на важное отличие от ситуации с Mythos: GPT-5.5 уже доступна в ChatGPT и через API, тогда как Anthropic пока даёт доступ к Claude Mythos только ограниченному кругу пользователей. Результаты проверки, как пишет The Decoder, могут усилить спор о том, была ли такая осторожность оправданной.

Источник: The Decoder, данные UK AI Security Institute.

Читать новости ИИ и технологий в Telegram.


Оцените статью
Gimal-Ai