1 июня MiniMax выложила M3 — модель, которую сама называет первой открытой системой, где в одном месте собраны фронтирный кодовый агент, контекст на миллион токенов и работа с изображениями, видео и экраном. API заработал в день анонса, в том числе через сторонние роутеры. Веса и технический отчёт компания обещала позже — в течение десяти дней, на Hugging Face и GitHub.
MiniMax — китайская лаборатория, основанная в 2021 году. До этого релиза она была известна главным образом приложением Talkie и голосовыми моделями. M3 — заявка на переход в высшую весовую категорию: фронтирные мультимодальные агенты, где конкурируют Claude и GPT.
Цифры есть, но пока только от автора
MiniMax приводит результаты на четырёх тестах: 59,0% на SWE-Bench Pro, 66,0% на Terminal-Bench 2.1, 34,8% на SWE-fficiency и 83,5 на BrowseComp. По этим замерам M3 обходит GPT-5.5 и уступает Claude Opus 4.8.
Оговорка серьёзная: все цифры получены самой MiniMax на её же стенде, независимых прогонов к запуску не было. Бенчмарки кодовых агентов чувствительны к деталям — какой каркас построен вокруг модели, сколько даётся попыток, как засчитывается успех. До сторонних проверок такие таблицы стоит читать как заявку, а не как результат: последние пару лет полны релизов, где самооценка расходилась с замерами сообщества на 5–15 процентных пунктов.
Сами тесты к тому же про разное. SWE-Bench Pro проверяет, закроет ли модель реальную задачу в большом репозитории; Terminal-Bench — как она справляется в терминале через серию команд; BrowseComp измеряет навигацию по вебу. Высокий балл в одном не обещает сильного результата в другом, и для конкретного сценария профильная метрика важнее усреднённого первого места в сводной таблице.
Что внутри: миллион токенов и computer-use
Главное обещание M3 — универсальность в одной модели. Миллион токенов контекста — это возможность держать в запросе крупный репозиторий или длинную переписку целиком. Для сравнения: стандартный контекст в 128K токенов вмещает примерно 100 тысяч слов, или около 300 страниц текста. Миллион токенов умещает весь средний кодовый проект с документацией, историей коммитов и тестами.
Мультимодальность заявлена как нативная: модель работает не только с текстом и картинками, но и с видео, и умеет управлять интерфейсом. Computer-use — это сценарии, где агент кликает, прокручивает страницы, заполняет формы, вместо того чтобы обращаться к явному API. Это полезно, когда нужного API нет, а задача подразумевает работу с браузером или настольным приложением.
Открытость весов: ключевое отличие
На старте ни весов, ни отчёта ещё не было; MiniMax назвала срок в десять дней и площадки — Hugging Face и GitHub. Это принципиально отличает M3 от GPT и Claude: выложенную модель можно развернуть локально, дообучить на своих данных, проверить на собственных задачах.
Для команд с требованиями к приватности — медицина, финансы, государственный сектор — возможность развернуть модель в своём контуре часто стоит дороже, чем разрыв в качестве с облачным флагманом. Открытые веса снимают и вопрос доверия к бенчмаркам: выложенную модель можно прогнать самому на том наборе задач, который важен именно вам, а не на том, что выбрал автор.
Цена как аргумент
Стоимость MiniMax выставила низкую: $0,60 за миллион входных токенов и $2,40 за миллион выходных, плюс промо-скидки. Для контраста: GPT-5 стоит $15/$75, Claude Opus 4.8 — в том же ценовом диапазоне. На задачах с длинным контекстом разница набегает быстро: запрос в 100K токенов у M3 обходится в $0,06, у топовых проприетарных — в $1,50 и выше. В продакшене, где запросы идут тысячами в день, это уже принципиальная разница в юнит-экономике сервиса.
M3 укладывается в устойчивый тренд: открытые китайские модели догоняют закрытые там, где крутятся деньги — в коде и агентах. Для DeepSeek это сработало раньше, и конкурентное давление на маржу проприетарных поставщиков тогда оказалось ощутимым. Подтвердится ли заявка MiniMax, станет ясно с выходом весов и независимых замеров; пока M3 — сильная по цифрам, но ещё не проверенная на практике.