ARC Prize выявил три сбоя GPT-5.5 и Opus

Фонд ARC Prize Foundation проанализировал 160 игровых прогонов моделей OpenAI GPT-5.5 и Anthropic Opus 4.7 на бенчмарке ARC-AGI-3 и выделил три системных типа ошибок, из-за которых обе модели остаются ниже 1% по точности.

Команда изучила повторы запусков и цепочки рассуждений моделей в интерактивных средах ARC-AGI-3. Этот тест, выпущенный в конце марта 2026 года, проверяет, как ИИ-системы действуют в пошаговых игровых задачах без инструкций, где нужно самостоятельно исследовать среду, строить гипотезы и выполнять план действий.

Все передовые модели, протестированные на ARC-AGI-3, пока набирают менее 1%. По данным фонда, GPT-5.5 показала 0,43% при затратах около $10 000, а Opus 4.7 — 0,18%. При этом люди решали те же задачи без предварительной подготовки.

Авторы анализа считают, что важнее итогового балла причины провала. Записанные reasoning traces, то есть текстовые следы рассуждений модели, позволяют увидеть, в какой момент система выдвинула гипотезу, когда отвергла верную идею и где зафиксировалась на ошибочной.

Первый тип ошибок связан с тем, что модели замечают локальные эффекты, но не собирают их в целостную модель среды. Например, система может понять, что определённое действие поворачивает объект, но не вывести из этого, как поворот влияет на следующую операцию и как нужно заранее выровнять объект.

По данным ARC Prize Foundation, в игре cd82 модель Opus 4.7 уже к четвёртому ходу поняла, что ACTION3 поворачивает контейнер. К шестому ходу она распознала, что ACTION5 наливает краску. Но модель так и не связала эти наблюдения в правильную последовательность действий, нужную для воспроизведения целевого изображения в левом верхнем углу.

Похожая ситуация возникла в cn04. Opus на 23-м ходе нашла правильное взаимодействие «повернуть, затем разместить», но затем переключилась на неверную цель и начала отслеживать несуществующую шкалу прогресса.

Второй тип ошибок состоит в том, что модели принимают незнакомую среду за известную игру из обучающих данных. В разных прогонах системы ошибочно принимали новые механики за Tetris, Frogger, Sokoban, Breakout, Pong или Boulder Dash.

Из-за внешнего сходства модель строит неверную теорию и тратит ходы на несуществующие механики. Например, GPT-5.5 приняла среду ls20 за Breakout, хотя на деле задача была связана с комбинациями клавиш.

В следах рассуждений модель написала: «Then again, it could be more like ‘Breakout,’ with bricks at the top and a paddle. The central object might be the ball». По оценке авторов, это предположение не имело оснований и сразу лишило систему шансов на прогресс.

Третий тип ошибок касается ситуаций, когда модель проходит уровень, но не понимает, почему именно стратегия сработала. Из-за этого случайный успех не переходит в более глубокое понимание задачи.

В ka59 модель Opus прошла первый уровень за 37 действий, опираясь на ложную теорию: она считала, что клик телепортирует активного персонажа. На самом деле игра требовала сопоставления фигур и толкания объектов. Уровень оказался пройден лишь потому, что простая структура случайно привела к цели даже при неверном понимании механики.

После этого система восприняла успех как подтверждение своей версии. На втором уровне ложное правило закрепилось в виде идеи «кликать по каждой цели, чтобы заполнить её», и модель уже не смогла исправить ошибку.

Схожий сценарий авторы увидели и в ar25. Opus прошла первый уровень, правильно заметив зеркальное движение, а на втором даже распознала новую механику с подвижной осью. Но затем вместо развития верной идеи модель перешла к вымышленным правилам и пыталась «пробивать отверстия» или зеркалить объекты.

Анализ также показывает разницу в поведении моделей. По данным фонда, Opus 4.7 быстрее замечает механики на ранних шагах, но склонна жёстко фиксироваться на неверном правиле. В cn04, к примеру, модель придумала теорию прогресса и конверсии и затем хаотично кликала в её рамках.

У GPT-5.5 противоположная проблема. Её набор гипотез шире, поэтому она чаще выходит на верную идею, но не может превратить её в чёткий план действий. В ar25 модель распознала зеркальный эффект, однако вместо последовательного решения начала перебирать версии с Tetris, Frogger, Pong и Tower of Hanoi.

Грег Камрадт из ARC Prize Foundation пишет: «The difference comes down to compression. Opus compressed its observations into a confident but wrong theory. GPT-5.5 had difficulty compressing at all».

Фонд считает, что эти типы ошибок важны и для практических ИИ-агентов. Каждый из 135 игровых сценариев смогли решить как минимум два человека без специальной подготовки. По мнению авторов, для моделей трудность здесь та же, что и в рабочих системах: столкновение с неизвестной средой, построение теории, её проверка и корректировка, если факты ей противоречат.

Камрадт также пишет: «Scores tell you what a model achieved. Replays tell you whether or not the reasoning is likely to generalize». Фонд планирует и дальше проверять все крупные новые релизы моделей с помощью ARC-AGI-3.

Авторы материала отмечают, что выводы анализа поддерживают давнюю критику больших языковых моделей как систем, которые хорошо сопоставляют шаблоны, но не формируют полноценного понимания. В тексте также приводятся другие работы с похожими выводами: исследование Apple о падении качества рассуждений при росте трудности задач, крупный когнитивный анализ более чем 171 000 цепочек рассуждений и медицинское исследование, где модели ошибались на слегка переформулированных вопросах.

Источник: The Decoder со ссылкой на анализ ARC Prize Foundation.

Читать новости ИИ и технологий в Telegram.


Оцените статью
Gimal-Ai