Nvidia: harness важнее модели для ИИ-агентов

Nvidia опубликовала исследование, в котором утверждает: при выполнении длинных многошаговых задач для ИИ важнее не сама модель, а harness — набор компонентов, управляющих работой агента.

По данным компании, Claude Opus 5 получил 100% на интерактивном бенчмарке ARC-AGI-3, если использовать специально настроенный harness с улучшенной работой памяти и отдельным «supervisor»-компонентом. Без этой надстройки модель набрала 30%, что тоже оказалось лучшим результатом среди протестированных моделей.

В Nvidia объясняют, что harness делает модель агентом: он отвечает за память, контекст и обратную связь. Вице-президент продуктового подразделения Nvidia в AI-направлении Адель Эль Халлак сказал TechCrunch: «Обычно агента воспринимают почти как API модели». По его словам, на практике агент — это сама модель плюс окружение вокруг неё, включая инструменты, runtime, навыки и библиотеки, к которым ей дают доступ.

Под длинными многошаговыми задачами Nvidia понимает работу, где системе нужно последовательно принимать много решений, иногда в течение нескольких дней, чтобы получить завершённый результат. Это отличается от обычного ответа на один запрос. Для разработчиков агентов одна из ключевых задач — добиться, чтобы ИИ выполнял такие цепочки действий без потери фокуса и ошибок.

В апреле Microsoft опубликовала исследование, где проверила 19 больших языковых моделей на длинных задачах, связанных с редактированием документов. Компания обнаружила, что все модели, включая самые сильные, заполняли документы ошибками.

Подобные системы также замечали в нежелательных действиях: они удаляли файлы пользователей, базы данных и пытались добиваться целей недопустимыми методами, включая сговор и взлом.

Выбор ARC-AGI-3 для тестов Nvidia тоже показателен. Это бенчмарк с набором двумерных игр без инструкций, где модель должна сама понять правила и выиграть. Результат 100% означает, что система проходит эти задания на уровне человека.

TechCrunch отмечает, что OpenAI была недовольна низкими результатами своих моделей на ARC-AGI-3 — менее 10%. В прошлом месяце компания провела собственное исследование и, как и Nvidia, выяснила, что изменение двух параметров harness заметно повышает результат и утроило баллы моделей.

Однако даже после этого OpenAI не приблизилась к 100%, о которых сообщает Nvidia. По версии исследователей компании, решающую роль сыграл дополнительный supervising agent, который направляет основного агента, если тот застревает.

«Самая интересная часть заключалась в добавлении supervising agent в дополнение к основному агенту, который выполняет работу», — сказал Эль Халлак. По его словам, такой компонент «почти действует как CEO», подталкивая агента, если тот уходит не туда, заходит в тупик или снова идёт по уже проверенному пути.

Сама идея supervising agent не нова, но сейчас многие пользователи ограничиваются однослойным harness в инструментах вроде Claude Code, Codex и Hermes. В Nvidia для эксперимента создали собственный усиленный harness под названием Agentic Variation Operators, или AVO.

Компания отдельно подчёркивает, что AVO — это не новый коммерческий продукт Nvidia. Вместо этого Nvidia выпускает наборы технологий для создания таких систем под брендом NeMo. Часть этих инструментов платная, часть доступна открыто.

Результаты Nvidia дополняют растущий массив данных о том, что выбор модели — лишь один из факторов качества агентных систем. В июле Databricks выпустила исследование, где показала, что harness может сильно влиять на стоимость работы ИИ, иногда больше, чем сама модель.

Гендиректор Databricks Али Годси сказал TechCrunch: «Вы можете взять одну и ту же модель, но разные harness, и получить значительно более высокую стоимость, если выберете не тот harness». Он добавил: «Можно думать, что одна модель дорогая, а другая дешёвая. Но какой harness вы используете? Сам по себе он может увеличить стоимость в два раза».

Главный вывод Nvidia в том, что открытые harness, как и открытые модели, дают пользователям больше контроля, чем принято считать. Эль Халлак сказал: «Мы считаем и показываем вместе с экосистемой, что открытые harness позволяют настраивать гораздо больше параметров, чтобы повышать точность».

Он также связал этот подход с тем, что OpenAI замедлила обучение своих моделей из-за рисков, связанных с нарушениями безопасности. По словам Эль Халлака, открытый стек агентных систем, где пользователь контролирует harness, инфраструктуру и runtime, нужен для безопасного развития экосистемы.

Источник: TechCrunch, Nvidia, Databricks, Microsoft.

Читать новости ИИ и технологий в Telegram.


Оцените статью
Gimal-Ai