Mistral опубликовала веса Codestral 2 19 мая. Модель весит 22 миллиарда параметров, лицензирована под Apache 2.0 и поддерживает 86 языков программирования. Контекстное окно — 256K токенов, вдвое больше первой версии. Это первый open-weight-релиз компании в 2026 году и продолжение стратегии «открытое ядро, платные интеграции», которую Mistral последовательно держит с 2024 года.

Веса доступны на HuggingFace, там же в течение нескольких часов после публикации появились сторонние конвертации в форматы GGUF, MLX и AWQ от комьюнити-мейнтейнеров. Это стандартный паттерн для popular open-weight-релизов: экосистема реагирует быстро, и пользователи llama.cpp или MLX на Mac получают поддержку раньше, чем выйдет официальная инструкция.

Бенчмарки: где модель сильна и где нет

Mistral опубликовала результаты на семи бенчмарках: HumanEval, MBPP, MultiPL-E, RepoBench, CRUXEval, SWE-bench Lite и собственном внутреннем тесте на рефакторинг.

На HumanEval — pass@1 89,4%. DeepSeek-Coder-V2 набирает 89,7%, Qwen-2.5-Coder-32B — 87,1%. Разрыв с лидером в 0,3 процентных пункта при том, что Codestral 2 имеет вдвое меньше параметров, чем DeepSeek-Coder-V2 — убедительный аргумент в пользу эффективности обучения. Менее параметрная модель с сопоставимым качеством означает меньшую стоимость инференса: при равной точности Codestral 2 обходится дешевле в производстве.

На RepoBench, проверяющем способность работать с многофайловыми репозиториями, Codestral 2 заметно улучшился по сравнению с первой версией благодаря целевому дообучению. RepoBench моделирует реальный сценарий code completion: модель видит несколько связанных файлов и должна предсказать нужный фрагмент с учётом зависимостей между ними — именно так работает cursor в IDE при навигации между модулями.

SWE-bench Lite — 38,6%. Прямое сравнение с SWE-bench Verified у Claude Opus 4.7 (78,4%) некорректно: Lite и Verified — разные наборы задач разной сложности. По Lite среди open-weight-моделей своего размера Codestral 2 конкурентоспособна.

Состав тренировочного датасета компания не раскрывает — в технической карточке только «открытые репозитории, отфильтрованные по лицензии». Для enterprise-клиентов с compliance-требованиями к происхождению обучающих данных это остаётся открытым вопросом.

Что изменилось в архитектуре

Первое изменение — переработанный токенизатор. В словарь добавлены низкочастотные языки программирования, прежде всего Erlang, OCaml и Verilog. Токенизатор имеет прямой эффект на качество code completion: плохая токенизация редкого языка означает, что типовые паттерны не кодируются как единые токены. Модель видит отдельные фрагменты там, где должна видеть структуру — и это ухудшает предсказания. Для команд в этих экосистемах улучшение токенизатора значимее, чем прирост на HumanEval.

Второе — fill-in-the-middle (FIM) обучение. Модель видит маскированный фрагмент кода и предсказывает его содержание на основе контекста до и после. Без FIM-обучения нейросеть умеет только «продолжать» с заданного места — что полезно при написании нового кода, но не при редактировании существующего. IDE-сценарий почти всегда — это курсор в середине существующей функции, а не в конце файла. FIM-обучение делает именно этот случай первоклассным.

Третье — дообучение на корпусе многофайловых задач. Именно это и даёт прирост на RepoBench: модель учится удерживать структуру зависимостей между файлами, а не только предсказывать следующий токен в рамках одного файла.

Практические сценарии применения

Codestral 2 в формате 4-бит квантизации занимает около 12 ГБ VRAM. Это укладывается в RTX 4080 и большинство профессиональных GPU рабочих станций, а также в Mac с 16+ ГБ унифицированной памяти через MLX. Для команд с compliance-требованиями, запрещающими отправку кода во внешние API, это фактически единственная модель уровня лидеров рынка, которую можно запустить локально.

Три чётких сценария, где выбор в пользу Codestral 2 рационален: локальный code completion в IDE без исходящего трафика, self-hosted эндпоинты для корпораций с жёсткой политикой безопасности, и базовая модель для файн-тюнинга под специфический внутренний DSL или фреймворк. Apache 2.0 позволяет коммерческое использование без роялти и без переговоров с вендором.

Где Codestral 2 уступает: агентные coding-сценарии с многошаговым tool use — Cursor, Aider и аналоги по-прежнему дают лучший результат с Claude Opus 4.7 или GPT-5o. Mistral не позиционирует модель как агентного кодера — это высококачественный код-completion движок для интеграции в IDE, а не агент, планирующий многошаговые изменения.

Европейская open-core-стратегия в действии

В более широком контексте релиз подтверждает бизнес-логику Mistral: базовые модели открыты под Apache 2.0, монетизация идёт через La Plateforme, enterprise-поддержку и кастомные деплои. Компания не пытается удержать технологическое преимущество через закрытость весов — она делает ставку на доверие к инфраструктуре и на то, что enterprise-клиентам нужна поддержка и гарантии, а не только сама модель.

На фоне давления EU AI Act это позиционирование выгодно отличает Mistral от американских вендоров, удерживающих архитектуру и веса закрытыми. Для европейских и российских команд, которым важна независимость от единственного облачного поставщика, open-weight-политика снижает риск vendor lock-in — даже если сегодня они используют Mistral через API.