GitHub показала бенчмарки agentic harness Copilot

GitHub представила данные о работе agentic harness GitHub Copilot — общего компонента в составе GitHub Copilot SDK, который управляет инструментами, контекстом и рабочими процессами в продуктах компании и сервисах Microsoft.

Один и тот же harness используется в GitHub Copilot CLI, приложении GitHub Copilot, инструменте для ревью кода и других функциях. По данным компании, улучшения в harness автоматически повышают качество всех этих сценариев.

В GitHub отмечают, что harness должен быть быстрым, экономно расходовать токены и вести себя предсказуемо для разработчика. В публикации представлены результаты тестирования эффективности и качества GitHub Copilot agentic harness на широком наборе задач в сфере инженерии программного обеспечения.

GitHub регулярно оценивает возможности и эффективность harness на основе сочетания публичных и внутренних бенчмарков, а также метрик из реального использования и онлайн-экспериментов. Внутренние бенчмарки строятся, в том числе, на крупных кодовых базах GitHub и Microsoft.

Для сравнения с решениями поставщиков моделей GitHub использует одинаковые условия: один и тот же модельный стек, идентичные задачи, выровненные окна контекста, уровень рассуждений, набор инструментов и MCP-серверов.

В статье приведены свежие результаты по ряду бенчмарков для четырех моделей: Claude Sonnet 4.6, Claude Opus 4.7, GPT‑5.4 и GPT‑5.5. GitHub Copilot CLI сравнивается с «родными» harness от поставщиков этих моделей: Claude Code для Sonnet и Opus и Codex CLI для GPT‑5.4 и GPT‑5.5.

По заявлению GitHub, при фиксированных модели и задаче GitHub Copilot agentic harness показывает сопоставимые с harness поставщиков моделей показатели успешного завершения задач, при этом во многих конфигурациях использует меньше токенов.

Компания подчеркивает, что эффективность по токенам важна только при сохранении высокого уровня решаемости задач. По данным бенчмарков, разница в показателях между harness укладывается в статистическое отклонение из‑за стохастической природы моделей, что GitHub интерпретирует как практическое равенство по качеству.

Для постоянного улучшения task completion и экономии токенов GitHub проводит детальный анализ на различных наборах задач. В качестве примера приводится анализ дисперсии на TerminalBench 2.0, который демонстрирует сильные стороны GitHub Copilot по завершению задач и стоимости на задачу, а также разброс результатов между прогоном к прогону.

Каждая точка на графике TerminalBench 2.0 соответствует конкретной конфигурации агента и модели. По вертикали откладывается доля решенных задач, по горизонтали — долларовая стоимость одной задачи. Эллипс вокруг точки показывает разброс результатов на уровне ±1σ.

GitHub Copilot agentic harness поддерживает более 20 современных моделей из семейств GPT, Claude, Gemini и MAI, а также режим подключения собственных ключей для открытых и локальных моделей. Разработчик может сам выбрать модель под задачи и бюджет или доверить выбор функции Auto model selection, которая учитывает тип задачи и состояние модели для повышения эффективности по токенам.

Многомодельная архитектура даёт возможности, недоступные harness от одного поставщика. В пример приводится Rubber Duck, где используется перекрестная проверка: одна модель оценивает и корректирует результат другой, что помогает получить более качественный итоговый ответ.

GitHub отмечает, что бенчмарки — это только один источник сигналов. Команда продолжает улучшать качество по трем направлениям: результаты бенчмарков, метрики реального использования и онлайн‑эксперименты, при этом внимание уделяется рациональному использованию каждого токена.

По итогам проведенных сравнений GitHub заявляет, что GitHub Copilot обеспечивает уровень решаемости задач на уровне ведущих harness поставщиков моделей, при этом во многих случаях расходует меньше токенов и не ограничивает пользователей одной моделью.

Пользователям предлагают попробовать GitHub Copilot с различными моделями, сравнить подходы на собственных рабочих задачах и оценить, как разные модели и стратегии агентов работают в реальной среде.

Для обеспечения сопоставимости результатов все агенты в тестах запускались с одинаковыми настройками по моделям, задачам и окружению. Каждому прогону давался таймаут в две часа, агенты работали в однократном неинтерактивном режиме, без веб‑инструментов, с полным доступом ко всем инструментам.

В анализе TerminalBench2 агенты запускались с настройкой среднего уровня рассуждений; для Claude Code и Codex использовались прямые endpoint Anthropic и OpenAI. Все 89 задач TerminalBench2 были доведены до результата: инфраструктурные сбои перезапускались, а ошибки, которые генерировали сами модели, сохранялись в выборке. Каждая модель проходила по пять независимых прогонов, Copilot тестировался в двух партиях для сопоставления с Claude Code и Codex.

В сводных бенчмарках пары «агент‑модель» были выровнены по размеру окна контекста, лимитам prompt‑токенов и уровню рассуждений, без использования инструментов поиска и MCP‑серверов, только со стандартным набором встроенных средств. Инфраструктурные аномалии и сетевые эффекты исключались из финальных данных. Для небольших бенчмарков с числом задач менее 100 проводилось по пять прогонов, в отчет попадал лучший результат, а метрики давались в формате pass@1.

Дополнительно GitHub рассказывает о других инициативах на базе Copilot, включая Qubot — внутреннего агента аналитики на основе Copilot, который позволяет сотрудникам задавать вопросы к данным на обычном языке, и GitHub Security Lab Taskflow Agent, который показывает высокую эффективность при поиске уязвимостей уровня обхода аутентификации, IDOR, утечек токенов и других критичных проблем.

Источник: материалы GitHub.

Читать новости ИИ и технологий в Telegram.


Оцените статью
Gimal-Ai