OpenAI ограниченно внедрит Astra с opaque recurrence

Новая модель OpenAI Astra будет использовать метод рассуждения recurrent depth, также известный как opaque recurrence, сообщает The Information. Этот подход позволяет модели работать вне привычной последовательной схемы рассуждений, характерной для большинства reasoning-моделей, и уже вызвал тревогу у части экспертов по безопасности ИИ.

По данным издания, OpenAI применяет эту технику в Astra ограниченно. Тем не менее само появление такого подхода вызвало вопросы, поскольку он может ухудшить наблюдаемость chain of thought — промежуточных шагов, по которым обычно отслеживают, как модель приходит к ответу.

Глава Redwood Research Бак Шлегерис написал, что его «крайне беспокоит» информация о применении opaque recurrence в Astra. По его словам, пока неясно, насколько Astra хуже поддаётся мониторингу по chain of thought, чем прежние модели OpenAI, но если компания усилит использование этого метода, она сможет «резко увеличить recurrence и полностью разрушить возможность мониторинга chain of thought».

Исследователь и давний сторонник мер по безопасности ИИ Зви Мовшовиц также отреагировал на публикацию. Он заявил, что могут понадобиться законы, чтобы не допустить «гонки ко дну» между лабораториями ИИ.

«Эта техника — игра с огнём. Она ставит под риск важный принцип, который OpenAI и Anthropic пытались закрепить: сохранять достоверность и наблюдаемость chain of thought так долго, как это возможно», — написал Мовшовиц. По его оценке, более широкое применение таких методов, вероятно, ухудшит возможности мониторинга.

Обычно chain of thought reasoning-модели показывает последовательные шаги, которые она выполняет при решении задачи. Хотя такая запись не считается точным отражением всех внутренних процессов модели, она остаётся важным инструментом контроля за ошибочным поведением или отклонением от заданных целей. В недавнем случае с нештатной активностью агентов OpenAI такие записи помогали понять причины их поведения.

При opaque recurrence модель использует менее линейный подход и обрабатывает один и тот же запрос несколько раз по циклу. В итоге остаётся меньше читаемых следов, а привычная запись chain of thought становится менее полезной.

OpenAI, однако, отвергла предположения о переходе к «neuralese» — полностью нечитаемым внутренним представлениям. Ожидается, что chain of thought у Astra всё ещё останется читаемым, а сама компания уже объявляла о планах развернуть расширенные системы мониторинга chain of thought в рамках своей программы безопасности.

Главный научный сотрудник OpenAI Якуб Пахоцки в публикации в X подчеркнул приверженность компании читаемым цепочкам рассуждений. «OpenAI работает над сохранением и использованием мониторинга chain of thought с самых первых reasoning-моделей. Это одна из ключевых целей нашей текущей исследовательской программы», — написал он.

При этом исследователи отмечают, что любой ИИ в какой-то степени использует непрозрачные внутренние вычисления, а логи chain of thought редко считают буквальным отражением реального хода рассуждений модели. Но эти оговорки не снимают опасений, что opaque recurrence усложнит мониторинг, особенно если метод начнут шире применять в разных моделях.

В дополнительной публикации утром в среду The Information сообщило, что Anthropic и Google DeepMind уже обсуждают этот подход.

Главный научный сотрудник Redwood Research Райан Гринблатт написал, что непрозрачное рассуждение может масштабироваться быстрее, чем обычное chain-of-thought reasoning, и фактически убрать процесс рассуждения из видимых каналов. «Больше всего меня беспокоит, что следующим естественным шагом станет увеличение непрозрачного рассуждения до уровня, когда модель будет рассуждать полностью или почти полностью в латентном пространстве. Надеюсь, ещё не поздно избежать самых рискованных архитектур и OpenAI остановится на этом этапе», — заявил он.

Источник: The Information.

Читать новости ИИ и технологий в Telegram.


Оцените статью
Gimal-Ai