BankerToolBench: ИИ не прошли тест банкиров

Исследователи из Handshake AI и Университета Макгилла представили открытый бенчмарк BankerToolBench для проверки ИИ-агентов на типичных задачах младших инвестиционных банкиров. После тестов девяти актуальных моделей авторы пришли к выводу: ни один результат нельзя отправлять клиенту без доработки.

В проекте участвовали около 500 действующих и бывших инвестиционных банкиров из Goldman Sachs, JPMorgan, Evercore, Morgan Stanley и Lazard. Из них 172 человека разрабатывали сами задания и суммарно потратили на это более 5700 часов. Всего в набор вошло 100 задач, на каждую у человека в среднем уходило по пять часов, а в отдельных случаях — до 21 часа.

BankerToolBench оценивает реальные материалы, которые младший банкир передаёт руководителю: финансовые модели в Excel с рабочими формулами, презентации PowerPoint для встреч с клиентами, PDF-отчёты и записки в Word.

Во время выполнения задач агенты должны работать с дата-румами, рыночными платформами вроде FactSet и Capital IQ, а также разбирать документы SEC. По данным статьи, одна задача может вызывать до 539 обращений к языковой модели, при этом 97% из них связаны с инструментами или выполнением кода.

Каждый результат проверяется по рубрике, составленной банкирами. В ней в среднем 150 отдельных критериев, которые охватывают техническую корректность, готовность для клиента, соответствие требованиям, проверяемость и согласованность файлов.

Для оценки авторы использовали собственного ИИ-проверяющего под названием Gandalf, созданного на базе Gemini 3 Flash Preview. Он совпадал с мнением людей в 88,2% случаев. Для сравнения, согласие между двумя рецензентами-людьми составило 84,6%.

Команда протестировала GPT-5.2, GPT-5.4, Claude Opus 4.5 и 4.6, Gemini 2.5 Pro, Gemini 3.1 Pro Preview, Grok 4, а также открытые модели Qwen-3.5-397B и GLM-5. Лучший результат показала GPT-5.4, но и она не прошла почти половину критериев.

Только 16% результатов GPT-5.4 банкиры сочли приемлемой заготовкой для дальнейшей работы. Если требовать три последовательных стабильных прогона, показатель снижается до 13%.

Ни один результат ни одной модели не был признан готовым к отправке в исходном виде. У GPT-5.4 лишь 2% задач прошли все критически важные критерии. У Gemini 2.5 Pro этот показатель составил ноль.

По словам исследователей, материалы Claude Opus 4.6 сначала выглядят аккуратно, но в Excel-моделях проявляется базовая проблема: ключевые числа часто записаны как фиксированные значения, а не рассчитываются формулами. Для инвестбанкинга это критический недостаток, поскольку делает невозможным сценарный анализ. При изменении цены покупки модель не пересчитывается. Такая же проблема была у Claude Opus 4.5.

Анализ траекторий GPT-5.4 выявил четыре повторяющихся типа ошибок. Самый частый, 41%, связан с багами в коде и формулах. Агенты вызывают несуществующие функции python-pptx и вместо исправления причины просто удаляют проблемную строку.

В 27% случаев нарушалась бизнес-логика — например, синергии по затратам добавлялись в выручку, а не в расходы. Ещё 18% ошибок были связаны с оборванными запросами к данным, а в 13% случаев агенты придумывали недостающие числа и выдавали их за найденные в источниках.

Авторы приводят и более тонкие примеры. В одной презентации проверка нашла разные значения выручки за один и тот же период: 189,5 млрд долларов на одном слайде и 201,0 млрд долларов на другом.

В другом случае агент использовал красный цвет Netflix в оформлении, хотя гайд банка требовал единый синий. При конкурентном анализе для сделки в фарме агент сфабриковал данные клинических испытаний, когда не нашёл нужной информации в базе SEC.

В целом модели лучше справлялись с задачами по PowerPoint, чем по Excel. Самыми трудными оказались задания по долговым рынкам капитала, моделям слияний и таблицам структуры капитала. Авторы связывают часть отставания с нехваткой профильных знаний. Когда в задачи добавляли контекст, который банкиры обычно понимают без пояснений, оценки заметно росли.

По данным авторов, BankerToolBench можно применять и для обучения с подкреплением. В экспериментах с Qwen-3-4B и 32B методы Dr. GRPO и DPO повышали результаты в пять — тринадцать раз, хотя стартовый уровень был очень низким.

Исследователи также указывают на ограничения бенчмарка. Он сфокусирован на США, не включает конфиденциальные данные по сделкам и не отражает итеративную командную работу внутри банка. При этом авторы называют его одним из самых детальных тестов того, способны ли ИИ-агенты выполнять требовательную интеллектуальную работу. На текущем этапе их ответ — нет.

Полный набор, включая данные, рубрики и систему проверки, выложен в открытый доступ. Результаты согласуются и с другими недавними работами. В исследовании Vals.ai с участием глобально системно значимого банка модель OpenAI o3 показала 48,3% точности на задачах финансового анализа.

Исследование UC Berkeley показало, что команды, которым удаётся довести агентов до реального применения, используют простые и жёстко контролируемые схемы с небольшим числом шагов. А работа Carnegie Mellon и Stanford утверждает, что разработка агентов слишком долго была сосредоточена на задачах программирования, тогда как менеджмент, право и финансы почти не представлены в бенчмарках.

На этом фоне лаборатории ИИ уже работают над уязвимостями, которые выявил BankerToolBench. Anthropic недавно представила функцию, которая позволяет Claude самостоятельно переключаться между Excel и PowerPoint, а плагины Cowork подключают к рабочему процессу FactSet, MSCI и LSEG.

Источник: The Decoder, исследование Handshake AI и McGill University.

Читать новости ИИ и технологий в Telegram.


Оцените статью
Gimal-Ai