Исследователи из Университета Иллинойса в Урбана-Шампейн, Meta и Стэнфорда выпустили обзорную работу о том, как стоит оценивать ИИ-агентов. Главный тезис статьи: ключевое ограничение автономных систем находится не в самой модели, а в программном слое вокруг неё.
Авторы называют этот слой harness. В него входят инструменты и интерфейсы, изолированные среды выполнения, память, тестирование, границы прав доступа, циклы исполнения и каналы обратной связи. По их версии, без этого слоя языковая модель остаётся системой без состояния, а с ним превращается в рабочего агента, способного долго выполнять задачи.
Исследователи пишут, что код нужно рассматривать как действующую часть поведения агента. Код можно исполнять, проверять и сохранять между шагами, поэтому он делает действия модели наблюдаемыми и воспроизводимыми.
В статье долгие агентные процессы делят на три части:
- возможности самой модели, включая рассуждение и планирование;
- инфраструктуру, которую даёт система;
- код, который агент пишет по ходу работы: тесты, вспомогательные инструменты, повторно используемые навыки и исполняемые сценарии.
Авторы отдельно отмечают, что самостоятельно созданные агентом программные артефакты изучены хуже, чем другие части таких систем.
На первом уровне код связывает модель с внешней средой. В качестве примеров приводятся Program-of-Thoughts и Chain of Code, где вычисления передаются исполняемым программам, а также Code as Policies, где инструкции на естественном языке переводятся прямо в код управления роботами.
Второй уровень отвечает за стабильную работу агента на длинной дистанции. Сюда входят планирование, память, использование инструментов и повторяющийся цикл «спланировать — выполнить — проверить». По статье, такой подход заменяет разовые попытки исправления системной проверкой: план задаёт ожидаемые изменения, выполнение идёт в изолированной среде с заданными правами, а затем система решает, принять результат, доработать его или передать человеку.
Третий уровень описывает совместную работу нескольких агентов. Коллекции кода, тесты и журналы выполнения становятся общим рабочим пространством, где роли менеджеров, планировщиков, разработчиков, ревьюеров и тестировщиков разделяют задачи.
Авторы ссылаются на системы ChatDev и MetaGPT и утверждают, что такой подход уже используется в коммерческих продуктах. В качестве примера они приводят Claude Code, который может распределять проверку pull request между несколькими ИИ-агентами, параллельно ищущими баги, уязвимости и регрессии, но без права самостоятельно одобрять изменения.
В статье также перечислены коммерческие решения. Claude Code от Anthropic объединяет локальный терминал, среду разработки и браузер в единый процесс, где агент редактирует файлы, запускает команды и соблюдает правила доступа. OpenAI Codex и кодовые агенты GitHub Copilot решают похожие задачи в управляемых облачных средах и оформляют изменения через отслеживаемые pull request.
Значение программного слоя стало особенно заметно после утечки примерно 500 тысяч строк исходного кода Claude Code. По данным авторов, в нём нашли функцию dreaming для консолидации задач и другие механизмы управления моделью как кодовым агентом. Позже Anthropic добилась удаления с GitHub более 8 тысяч копий и форков по жалобе о нарушении авторских прав.
Другие лаборатории тоже усиливают работу над этим направлением. Deepseek, как сказано в материале, готовит собственный продукт Deepseek Code для конкуренции с Claude Code и Codex и формирует в Пекине отдельную команду Harness, которая будет отвечать за всё, что выходит за рамки модели: от работы с инструментами до планирования и хранения данных.
Авторы отмечают, что такие производственные системы уже становятся данными для обучения новых моделей. Cursor Composer обучают с непрерывным подкреплением на реальных следах использования, а OpenAI Codex-1, GPT-5-Codex и GPT-5.1-Codex-Max, по их словам, специально обучаются на длинных многошаговых сессиях программирования, близких к процессу Codex.
Несколько исследовательских систем пытаются улучшать сам harness. AutoHarness автоматически создаёт код, который отсеивает несанкционированные действия. Meta-Harness ищет более удачные варианты такого слоя, используя прошлые версии, их оценки и журналы выполнения как пространство поиска. В статье также упомянуты hyperagents от Meta, где решение задач и сам модифицирующийся код объединены в редактируемую программу, улучшающую собственный цикл доработки.
При этом авторы перечисляют и нерешённые вопросы. Среди них — более содержательные методы оценки вместо грубого показателя успешности, проверка качества результата там, где одних тестов мало, самоулучшение без регрессий, общее состояние для нескольких агентов, контроль со стороны человека и перенос такого подхода на интерфейсы с изображениями и сенсорными данными, включая GUI-агентов и роботов.
Исследователи отдельно критикуют текущие критерии проверки. Они пишут, что тесты могут быть неполными, сценарии для графических интерфейсов пропускают ошибочные промежуточные шаги, а симуляторы скрывают физические риски. По их мнению, зелёная отметка о прохождении теста ещё не означает, что код безопасен. Поэтому для каждого принятого действия они предлагают добавлять документацию с перечнем реально выполненных тестов, непросмотренных частей и оставшихся рисков.
Итоговый вывод статьи такой: надёжность автономных кодовых агентов определяется не более удачными подсказками для исправления ошибок, а жёстко контролируемыми переходами состояния внутри управляемого цикла вокруг модели.
Источник: обзорная статья исследователей University of Illinois Urbana-Champaign, Stanford и Meta, а также материал The Decoder.
*Организация Meta (владелец Facebook и Instagram) признана экстремистской организацией и ее деятельность запрещена на территории России.






















