ProactiveBench выявил слабость мультимодальных ИИ

Новый бенчмарк ProactiveBench проверяет, умеют ли мультимодальные языковые модели просить у пользователя дополнительную информацию, если в изображении не хватает данных для ответа.

Авторы работы показывают, что почти все протестированные модели в таких случаях либо выдают неверный ответ, либо отказываются отвечать, вместо того чтобы запросить нужные данные.

ProactiveBench собран на базе семи существующих датасетов. Исследователи превратили их в сценарии, которые нельзя решить без участия человека: модели должны распознавать скрытые объекты, разбирать шумные изображения, интерпретировать грубые наброски или запрашивать другой ракурс камеры.

Всего в набор вошло более 108 000 изображений, объединённых в 18 000 примеров. Встроенный фильтр исключает задачи, которые модель может решить с первой попытки, поэтому успешное прохождение требует именно запроса дополнительной информации.

Исследователи протестировали 22 мультимодальные модели, включая LLaVA-OV, Qwen2.5-VL, InternVL3, GPT-4.1, GPT-5.2 и o4-mini.

В контрольных условиях, где объекты хорошо видны, средняя точность моделей составляет 79,8%. На ProactiveBench этот показатель падает более чем на 60%.

Самый резкий спад зафиксирован в датасете ROD. Если объект закрыт блоками, точность снижается с 98,3% до 8,2%. То есть модели способны распознавать предметы, когда те видны напрямую, но почти не просят убрать препятствие.

Размер модели сам по себе не помогает. InternVL3-1B показала 27,1% против 12,7% у InternVL3-8B, а LLaVA-1.5-7B обошла более новую LLaVA-OV-72B с результатом 24,8% против 13%.

Имеет значение и базовая языковая модель. LLaVA-NeXT с Vicuna набрала 19,3%, тогда как та же конфигурация с Mistral — 4,5%.

Закрытые модели, включая GPT-4.1, показали лучшие результаты по точности, но авторы отметили необычно высокие баллы на COCO и допустили возможное загрязнение данными обучения.

На первый взгляд часть моделей кажется более проактивной. Но при дополнительной проверке исследователи заменили корректные варианты действий бессмысленными подсказками вроде «перемотайте видео» для задачи с рисунком, и модели выбирали их так же охотно.

Например, LLaVA-NeXT Vicuna увеличила долю выбора таких вариантов с 37% до 49%. По выводу авторов, это говорит не о понимании ситуации, а о более низком пороге для случайного выбора.

Явные подсказки в промптах и истории диалога также почти не помогают. Они повышают частоту проактивных запросов и поднимают точность до 25,8%, но этого всё равно недостаточно даже для стабильного результата на уровне случайного выбора.

В 16% случаев модели просто многократно предлагают запросить дополнительные действия до предельного числа шагов. История диалога даже ухудшает результат: модели начинают механически повторять действия из предыдущих примеров.

При этом исследователи показали, что такое поведение можно обучить. Они дообучили LLaVA-NeXT-Mistral-7B и Qwen2.5-VL-3B с помощью метода Group-Relative Policy Optimization, или GRPO, примерно на 27 000 примеров.

Ключевой элемент здесь — функция награды: правильный ответ оценивается выше, чем запрос помощи. Поэтому модель обращается за дополнительной информацией только в тех случаях, когда действительно не может продолжить.

После обучения обе модели превзошли все 22 ранее протестированные системы, включая o4-mini: 37,4% и 38,6% против 34,0%.

Этот эффект сохранился и за пределами обучающего набора. В тесте ChangeIt точность Qwen2.5-VL-3B выросла с 12,4% до 55,6%.

Авторы также показали, что неверная настройка награды быстро ломает поведение модели. Если запрос помощи оценивается так же, как правильный ответ, система начинает бесконечно просить подсказки, а точность падает до 5,4%.

Даже после улучшения разрыв с контрольным сценарием остаётся большим: 40,7% против 75,1%. Авторы открыли ProactiveBench в формате open source и называют его первым шагом к системам, которые умеют замечать нехватку данных и спрашивать о ней, а не выдумывать ответ.

Работа вписывается в более широкий вывод последних исследований: мультимодальные модели плохо справляются с неопределённостью. Бенчмарк WorldVQA от Moonshot AI ранее показал, что даже сильные модели достигают около 50% в задачах визуального распознавания объектов.

Похожий вывод содержится в исследовании Стэнфорда об эффекте Mirage. В нём мультимодальные модели вроде GPT-5 и Gemini 3 Pro уверенно описывали детали изображения и даже предлагали медицинские выводы, хотя само изображение им не передавали.

На стандартных бенчмарках такие модели сохраняли 70–80% от обычной производительности, опираясь только на текстовые шаблоны и предыдущие знания. По сути, они имитировали визуальное понимание, не замечая отсутствия входных данных.

Другие работы показывают похожую картину. Одно исследование по экзаменационным задачам пришло к выводу, что языковые модели не умеют стабильно оценивать пределы своих возможностей. А учёные из Sapienza University of Rome с методом Spilled Energy показали, что галлюцинации оставляют измеримые следы во внутренних вычислениях модели.

Источник: The Decoder.

Читать новости ИИ и технологий в Telegram.


Оцените статью
Gimal-Ai