Anthropic представила BioMysteryBench — новый бенчмарк для оценки того, насколько Claude справляется с реальными задачами биоинформатики на уровне экспертов. По данным компании, результаты выглядят обнадеживающе, но требуют осторожной интерпретации.
Anthropic отмечает, что существующие тесты плохо измеряют практическую работу ИИ в биологических исследованиях. Проверки знаний вроде MMLU-Pro и GPQA оценивают факты, но не исследовательские навыки. Бенчмарки с реальными датасетами, например BixBench, зависят от выводов отдельных ученых, а такие выводы могут различаться из-за выбора методов. Симулированные лабораторные среды вроде SciGym дают однозначные ответы, но плохо передают работу с шумными биологическими данными.
В ответ на это компания создала набор из 99 вопросов по нескольким разделам биоинформатики. Их подготовили профильные специалисты на основе реальных и шумных датасетов. Ответы привязаны не к научным интерпретациям, а к проверяемым свойствам данных или независимо подтвержденным метаданным. Автор каждого задания должен был приложить validation notebook, который подтверждает, что нужный сигнал действительно есть в данных.
Такой подход позволяет задавать вопросы, которые могут быть трудными даже для людей. В качестве примеров Anthropic приводит определение органа по датасету single-cell RNA и поиск гена, который был выключен в экспериментальных образцах.
Во время теста Claude получает контейнер с инструментами для биоинформатики, доступ к базам данных вроде NCBI и Ensembl и право самостоятельно выбирать методы анализа. Оценивается только итоговый ответ, а не ход решения.
Anthropic разделила задания на две группы. В 76 задачах правильный ответ нашел хотя бы один эксперт из группы до пяти человек, поэтому их отнесли к решаемым для человека. Еще 23 задания не смог решить ни один эксперт. Четыре изначально запланированных вопроса компания исключила из-за ошибок в формулировках.
Для оставшихся 23 задач Anthropic прямо указывает, что пока неясно, принципиально ли они нерешаемы для человека или просто очень трудны. Открытым остается и вопрос о том, смогла бы другая группа экспертов с иным составом найти ответы.
По данным Anthropic, на задачах, которые люди могли решить, Claude уже показывает уровень человеческих экспертов.
На более трудных заданиях, с которыми не справился ни один из отобранных специалистов, Claude Mythos Preview показала 30% успешных ответов.
При этом дополнительная проверка согласованности, которую Anthropic провела с помощью самой Claude Mythos Preview, дала более сдержанную картину. Каждую задачу модель решала пять раз. На решаемых задачах Claude обычно либо дает пять правильных ответов из пяти, либо не дает ни одного. На трудных задачах успех чаще всего появляется лишь в одной или двух попытках из пяти.
Это говорит о том, что на части трудных заданий модель скорее находит удачный путь случайно, чем использует стабильно воспроизводимую стратегию.
Anthropic выделяет две особенности, которые отличают Claude от людей в этом тесте. Модель использует широкий запас знаний и сразу связывает его с текущим анализом. Если уверенности мало, Claude применяет несколько методов параллельно и выбирает тот ответ, к которому сходятся разные подходы.
Похожее подтверждение компания видит в CompBioBench — близком по устройству бенчмарке, который Genentech и Roche разработали параллельно. По словам Anthropic, он показывает сопоставимые результаты. BioMysteryBench опубликован на Hugging Face.
Источник: Anthropic, The Decoder.






















