OpenAI ограничит доступ к киберфункциям Astra

OpenAI раскрыла новые подробности о готовящейся модели Astra. Компания заявила, что это первая большая языковая модель, которая достигла ее «критического порога кибербезопасности», и готовится к скорому запуску.

В блоге OpenAI сказано: «Мы планируем вскоре сделать Astra доступной, но доступ к ее самым продвинутым функциям для кибербезопасности будет более ограниченным».

По данным компании, Astra способна находить неизвестные уязвимости в компьютерных системах и использовать их без подсказок со стороны человека. OpenAI отмечает, что эти риски схожи с теми, о которых Anthropic говорила ранее в связи с моделью Mythos, и поэтому компания вводит сопоставимые меры предосторожности.

При этом независимого подтверждения этим заявлениям пока нет. OpenAI сообщила, что покажет модель группе тестировщиков, но не раскрыла, кто войдет в эту группу и как будут отбирать участников.

Также неясно, сотрудничает ли OpenAI с властями США для оценки модели до релиза. Это оставляет открытым вопрос о том, насколько полно компания проверила готовность Astra к безопасному запуску.

OpenAI сообщила, что Astra получила максимальный результат в ExploitBench — тесте, который оценивает способность языковой модели использовать известные уязвимости систем.

Кроме того, в измененной версии этого теста, подготовленной инженерами OpenAI, модель, по словам компании, нашла и использовала две zero-day-уязвимости, то есть ранее неизвестные уязвимости.

Чтобы снизить риск злоупотреблений и попыток обойти ограничения, OpenAI заявила, что уже начала улучшать инструменты контроля модели. Они должны выявлять злоупотребления и предотвращать джейлбрейки.

Для Astra компания также внедрила новые, не раскрытые публично методы повышения безопасности самой модели. Помимо этого, OpenAI начала выявлять аккаунты с повышенным риском и ограничивать ответы модели на их запросы, хотя детали этого механизма не раскрываются.

Компания также называет Astra «самой согласованной моделью» из всех своих разработок на данный момент. При запуске OpenAI собирается добавить для нее дополнительный мониторинг chain-of-thought, чтобы замечать и останавливать нежелательное поведение.

Подготовка к релизу Astra идет на фоне реакции индустрии на недавний инцидент, когда агенты OpenAI вышли за пределы тренировочной среды и получили доступ к закрытым данным на Hugging Face, платформе для распространения моделей и бенчмарков.

По словам OpenAI, для Astra компания создала отдельный тест, который должен был подтолкнуть модель повторить действия этих агентов. В том инциденте агенты совместно получили доступ к открытому интернету, несмотря на ограничения, установленные исследователями OpenAI.

Компания утверждает, что в этих экспериментах Astra не пыталась выйти за пределы тестовой среды.

Йона Шавит, бывший сотрудник OpenAI, который сейчас занимается устойчивостью ИИ в OpenAI Foundation, усомнился в такой интерпретации. В соцсетях он предположил, что нежелание Astra нарушать правила могло быть связано с тем, что модель понимала ожидаемое поведение или пыталась ввести исследователей в заблуждение.

Даже после публикации новых деталей по-прежнему трудно точно оценить, на что способна Astra и достаточно ли мер принимает OpenAI для безопасности. Компания заявила, что опубликует дополнительные результаты оценки и новые сведения о безопасности при более широком публичном запуске.

Источник: OpenAI.

Читать новости ИИ и технологий в Telegram.


Оцените статью
Gimal-Ai