13 мая на arXiv появился MMMU-Pro — расширение оригинального MMMU (Massive Multi-discipline Multimodal Understanding), запущенного в 2024 году. Авторы закрыли три известных изъяна предшественника, и результаты оказались неутешительными для всех участников leaderboard: точность упала на 15–25 пунктов у каждой модели.

Оригинальный MMMU содержал 11 500 вопросов по 30 академическим дисциплинам. Проблема вскрылась к началу 2026 года: часть вопросов решалась на основе одного текста без обращения к картинке. Дистракторы в multiple-choice были слишком легко отсекаемы. Тест проверял распознавание контента изображения, но не рассуждение по нему. Всё это вместе делало MMMU мягче реальных требований к мультимодальным моделям. Для публичного leaderboard это значило следующее: позиции в нём описывали не реальные мультимодальные возможности моделей, а умение извлекать подсказки из текстовых формулировок.

Три изменения методологии

MMMU-Pro вводит vision-only режим: в части задач вопрос встроен прямо в изображение как текст. Модель не может «срезать» через языковые подсказки из текстового промпта — вся информация только визуальная. Это убирает возможность решить задачу без реальной работы с картинкой. На практике оказалось, что именно этот режим сильнее всего «обрушил» результаты: модели, которые выглядели хорошо на смешанном формате, потеряли 10–15 пунктов дополнительно.

Число вариантов ответа расширено с 4 до 10. Дистракторы подобраны так, чтобы максимально снизить вероятность угадывания: они правдоподобны, тематически близки и отличаются от правильного ответа ровно настолько, чтобы потребовать внимательного анализа изображения. При четырёх вариантах случайное угадывание даёт 25% базовых очков. При десяти — только 10%. Это фундаментально меняет статистическую «нижнюю планку», ниже которой результат уже неотличим от случайности.

Третье изменение — multi-step visual reasoning. Задачи, где нужно последовательно рассуждать по нескольким изображениям или по разным частям одного сложного изображения — схемы, медицинские снимки, технические чертежи. Ни один из этих шагов нельзя пропустить без потери правильного ответа. Для схемы электрической цепи это означает, например: найти компонент → определить тип → по типу вычислить значение → применить закон Кирхгофа к участку. Четыре зависимых шага, каждый из которых опирается на изображение.

Текущий leaderboard

GPT-5o занимает первое место с 64,2%. Gemini 2.5 Pro — 62,8%, Claude Opus 4.7 — 60,1%, Qwen2.5-VL-72B — 53,4%, Llama 4 400B — 51,2%. Человеческий baseline — 88,6%.

Разрыв между лучшей моделью и человеком составляет около 24 пунктов. На текстовых бенчмарках этот разрыв за последние два года практически закрылся. На визуальных — нет. Это говорит о том, что мультимодальное понимание и рассуждение остаётся областью с незакрытым фундаментальным дефицитом, а не вопросом масштабирования.

Среди open-weight-моделей Qwen2.5-VL с 53,4% опережает Llama 4 400B, несмотря на в разы меньший размер. Alibaba последовательно инвестировала в мультимодальное направление последние два года, тогда как Meta до недавнего времени концентрировалась на чисто текстовых задачах. Разница в результатах отражает эту разницу в приоритетах. Показательно, что Llama 4 400B — огромная модель по меркам open-weight — уступает 72B-параметрическому Qwen на специализированном тесте.

Три типа систематических ошибок

Анализ ошибок в препринте выделяет neglected detail: модель схватывает общую картину, но пропускает мелкую деталь, критичную для правильного ответа. Особенно заметно на медицинских изображениях, технических схемах, графиках с мелкими подписями. Это не проблема зрения — изображение передаётся в полном разрешении. Это проблема приоритезации внимания: модель «решает», что важно на картинке, и этот выбор не всегда совпадает с тем, что задача реально требует. Человек при решении специализированных задач опирается на предметные знания, чтобы знать, куда смотреть. Модель такого контекста лишена.

Второй тип — incorrect spatial reasoning. Модель неверно интерпретирует пространственные отношения: «за», «над», «перед точкой наблюдения». 3D-пространственные задачи, которые человек решает интуитивно благодаря воплощённому опыту восприятия пространства, для модели остаются нетривиальными даже при правильном распознавании отдельных объектов. Тест на пространственное рассуждение по техническому чертежу — типичный пример: детали можно распознать верно, но их взаимное расположение интерпретировать неправильно.

Третий — false visual confidence. Модель уверенно выбирает одну из нескольких возможных трактовок размытого или неоднозначного изображения, не отмечая неопределённость. Это не сенсорный дефект, а следствие tuning-стратегии: за выражение неуверенности модель платила оптимизационной ценой, поэтому научилась уверенно отвечать даже тогда, когда уверенности нет. В задачах с 10 дистракторами это особенно деструктивно: уверенная неправильная ставка лишает шанса воспользоваться дополнительными подсказками в других частях задачи.

Сравнение с текстовыми бенчмарками

На чисто текстовых задачах разрыв между топ-моделями и человеком на MMLU и аналогичных наборах минимален или уже закрыт. Это повлекло нарратив о том, что текстовые LLM «превзошли человека». MMMU-Pro отрезвляет: стоит добавить визуальный компонент — и 24 пункта разрыва возвращаются. Мультимодальность — другая задача, требующая другого набора навыков. Прогресс в ней идёт медленнее, и сжатый leaderboard с разницей в 3–5 пунктов между первым и пятым местом не должен создавать иллюзию, что проблема почти решена.

Практический вывод для команд

Для тех, кто строит продукты на мультимодальных моделях — анализ медицинских изображений, чтение технической документации, обработка скриншотов в агентных пайплайнах — агрегированный score MMMU-Pro полезен как общий ориентир, но недостаточен для выбора модели. Все три типа ошибок (пропуск деталей, пространственное рассуждение, ложная уверенность) имеют разный вес в зависимости от конкретного сценария.

Для медицинской диагностики пропуск деталей критичен, ложная уверенность опасна, пространственное рассуждение менее важно. Для анализа архитектурных чертежей пространственное рассуждение выходит на первый план. Для обработки скриншотов интерфейсов — детали и точная локализация элементов. Прогонять репрезентативную выборку своих задач через нескольких кандидатов и сравнивать поведение на конкретных провальных кейсах — единственный способ сделать осмысленный выбор. Агрегированные цифры в этом помогают мало.

По мотивам: arXiv — MMMU-Pro paper