Полгода назад разговор о фронтирных моделях сводился к трём именам: Claude, GPT, Gemini. К июню 2026-го в верхней части таблиц появились новые участники, старые игроки провели по два-три обновления, а ценовая конкуренция в среднем сегменте обрушила стоимость инференса вдвое. Ландшафт стал плотнее и интереснее — и составить объективную картину без сводной карты уже затруднительно.

Ключевые факты

  • Claude Fable 5 возглавляет Artificial Analysis Intelligence Index с результатом 65, но модель глобально отключена с 12 июня по экспортной директиве правительства США после обнаружения метода джейлбрейка.
  • Средний ценовой сегмент ($0.50–4 за миллион входных токенов) стал главной ареной конкуренции: Qwen 3.7 Max, Gemini 3.5 Flash и NVIDIA Nemotron 3 Ultra предлагают качество уровня Gemini 3.1 Pro при кратно меньшей стоимости.
  • Open-weight модель DeepSeek-V4-Pro-Max достигает 80.6% на SWE-bench Verified — наивысший результат среди моделей с открытыми весами, при стоимости в десятки раз ниже проприетарных конкурентов.
  • Мультимодельная архитектура с fallback между провайдерами становится базовой инженерной практикой, поскольку регуляторные риски и ценовая волатильность делают привязку к одному провайдеру всё менее оправданной.

Верхний ярус: Fable 5, GPT-5.5 и Opus 4.8

По данным Artificial Analysis Intelligence Index v4.0 — агрегации десяти оценок по reasoning, coding, агентным задачам, науке и длинному контексту — тройка лидеров на середину июня выглядит так: Claude Fable 5 с индексом 65, Claude Opus 4.8 с индексом 61.4 и GPT-5.5 с индексом 60.2. Разрыв между первым и третьим местом — менее 5 пунктов, но стоимость доступа различается радикально.

Модель Intelligence Index Вход / Выход ($/1M токенов) Контекст Макс. выход
Claude Fable 5 65 $10 / $50 1M 128K
Claude Opus 4.8 61.4 $5 / $25 1M 128K
GPT-5.5 60.2 $5 / $30 1M 128K
GPT-5.4 $2.50 / $15 1M 128K
Gemini 3.1 Pro Preview 57 $2 / $12 1M 65K

Fable 5 — формально самая умная модель по агрегированному бенчмарку, но и самая дорогая: $50 за миллион выходных токенов делают её нишевым инструментом для задач, где качество критично, а объём запросов невелик. Разрыв в кодинге особенно выразителен: на FrontierCode Diamond Fable 5 набирает 29.3%, тогда как Opus 4.8 — 13.4%, а GPT-5.5 — 5.7%. На SWE-bench Verified Fable 5 достигает 95.0%, опережая Opus 4.8 на 11 пунктов и GPT-5.5 на 21.7 пункта.

Однако практическая ценность Fable 5 на данный момент нулевая. 12 июня правительство США выпустило экспортную директиву, обязав Anthropic заблокировать доступ для всех иностранных пользователей. Поскольку компания не смогла в реальном времени разделить иностранных и американских пользователей, модель была отключена глобально. Поводом стало обнаружение Amazon метода джейлбрейка, позволяющего извлекать из Fable 5 данные для кибератак, — информацию передали Белому дому. Остальные модели Anthropic продолжают работать.

Opus 4.8 (релиз 28 мая 2026) остаётся рабочей лошадкой для сложных агентных сценариев: SWE-bench Pro 69.2% и Online-Mind2Web 84% для компьютерных агентов. GPT-5.5 от OpenAI держится на уровне Opus 4.8 по общему индексу, но выходные токены обходятся на 20% дороже ($30 против $25). OpenAI компенсирует это более доступной ступенькой — GPT-5.4 за $2.50/$15, что ставит его в прямую конкуренцию с Gemini 3.1 Pro.

Средний сегмент: главная арена конкуренции

Самое интересное происходит в диапазоне $0.50–4 за миллион входных токенов. Здесь плотность конкурентов максимальна, и именно этот сегмент обслуживает большинство продакшен-сценариев.

Модель Intelligence Index Вход / Выход ($/1M) Контекст Скорость (ток/с)
Qwen 3.7 Max 57 $2.50 / $7.50 1M 196
Gemini 3.5 Flash 55 $1.50 / $9 1M 164
Claude Sonnet 4.6 $3 / $15 1M
NVIDIA Nemotron 3 Ultra $0.50 / $2.50 1M 173

Qwen 3.7 Max от Alibaba (релиз 20 мая 2026) набирает тот же Intelligence Index 57, что и Gemini 3.1 Pro Preview, но стоит заметно дешевле и генерирует 196 токенов в секунду — быстрее любой конкурирующей модели в этом ценовом диапазоне. Модель поддерживает миллионный контекст и нативный режим extended thinking. По кодовым бенчмаркам Qwen 3.7 Max показывает 60.6% на SWE-Pro, 69.7% на Terminal-Bench 2.0 и 92.4% на GPQA Diamond — числа, которые ещё полгода назад ассоциировались только с проприетарными лидерами.

Gemini 3.5 Flash от Google сочетает миллионное контекстное окно с ценой $1.50 за миллион входных токенов — самый доступный вход в клуб миллионного контекста. Google последовательно давит на ценовой рычаг: Gemini 3 Flash Preview опустился до $0.50/$3, что делает его прямым конкурентом бюджетных open-weight моделей.

NVIDIA Nemotron 3 Ultra (релиз 4 июня 2026) — неожиданный участник средней полки. Гибридная архитектура Transformer-Mamba MoE с 55 млрд активных параметров из 550 млрд общих, миллионный контекст и цена $0.50 за миллион входных токенов. На BenchLM модель занимает 22-е место из 123 по кодовым задачам со средним баллом 80.4. Для компаний, работающих на собственном GPU-парке NVIDIA, Nemotron 3 Ultra представляет привлекательную альтернативу API-зависимым решениям.

Бюджетный сегмент и open-weight модели

Open-weight модели продолжают отставать от проприетарных лидеров по абсолютному качеству, но ценовой разрыв между ними и средним сегментом сжимается быстрее всего.

DeepSeek V4 Pro набирает Intelligence Index 52 в режиме Max Effort — второй результат среди всех open-weight reasoning-моделей после Kimi K2.6 (54). При этом blended-стоимость составляет $0.435/$0.87 за миллион токенов для Pro-версии и $0.14/$0.28 для Flash-версии. DeepSeek-V4-Pro-Max достигает 80.6% на SWE-bench Verified — наивысший результат среди open-weight моделей, совпадающий с показателем Gemini 3.1 Pro. Соотношение цены и качества в бюджетном сегменте приблизилось к точке, где для многих задач разница с проприетарными моделями перестаёт оправдывать наценку.

Llama 4 Scout от Meta предлагает уникальную комбинацию: 10 миллионов токенов контекстного окна при 17 млрд активных параметров из 109 млрд общих (MoE-архитектура). Модель помещается на одном H100 с INT4-квантизацией и стоит $0.22 за миллион токенов через API-провайдеров. Intelligence Index составляет 14 — Scout позиционирован как дешёвый агент с длинным контекстом, а не как фронтирный рассуждатель. Для задач поиска по большим кодовым базам или суммаризации объёмных документов это пока самое экономичное предложение на рынке.

Отдельного внимания заслуживает скоростной подсегмент. Mercury 2 выдаёт 873 токена в секунду — это на порядок быстрее большинства фронтирных моделей и открывает сценарии реального времени, где латентность критичнее качества рассуждений. Для сравнения: Qwen 3.7 Max, один из самых быстрых в среднем сегменте, генерирует 196 токенов в секунду — в 4.5 раза медленнее.

Тенденции второго полугодия 2026

Четыре тенденции определят развитие рынка до конца года. Во-первых, ценовая война в среднем сегменте далека от завершения: Google последовательно снижает цены с каждым обновлением Flash-линейки, а китайские модели — DeepSeek, Qwen, MiniMax — давят снизу. Во-вторых, контекстное окно перестаёт быть дифференциатором: миллион токенов уже есть у шести моделей из разных ценовых категорий, а Llama 4 Scout довёл планку до десяти миллионов. В-третьих, регуляторные риски перестали быть абстрактными — отзыв Fable 5 показал, что доступ к самой мощной модели может исчезнуть за один вечер по решению правительства.

Четвёртая тенденция — конвергенция open-weight и проприетарных моделей по качеству кодовых задач. DeepSeek-V4-Pro-Max, набирающий 80.6% на SWE-bench Verified, стоит в десятки раз дешевле Opus 4.8, а разрыв на этом конкретном бенчмарке составляет менее 10 процентных пунктов. Если эта динамика сохранится, к концу года выбор проприетарной модели будет оправдан только для задач уровня Fable 5 — если к тому моменту доступ к моделям такого класса будет восстановлен.

Для продакшен-команд главный практический вывод: привязка к одному провайдеру становится всё более рискованной стратегией. Мультимодельная архитектура с fallback между провайдерами — уже не перестраховка, а базовая инженерная гигиена. При этом выбор конкретных моделей для fallback-цепочки зависит от профиля задач: для кодогенерации оптимальна связка Opus 4.8 → Qwen 3.7 Max → DeepSeek V4 Pro, для длинного контекста — Gemini 3.5 Flash → Llama 4 Scout, для скоростных сценариев — Mercury 2 с повышением до более умной модели при низкой confidence.

Частые вопросы

Какая модель ИИ самая умная в июне 2026 года?

По Artificial Analysis Intelligence Index v4.0 первое место занимает Claude Fable 5 с индексом 65, однако модель глобально отключена с 12 июня 2026. Из доступных моделей лидирует Claude Opus 4.8 с индексом 61.4, за ним следует GPT-5.5 от OpenAI с индексом 60.2.

Какая модель ИИ предлагает лучшее соотношение цены и качества для продакшена?

Для большинства продакшен-сценариев оптимальный баланс предлагают Qwen 3.7 Max (Intelligence Index 57 при стоимости $2.50/$7.50 за миллион токенов) и Gemini 3.5 Flash ($1.50/$9 с миллионным контекстом). В бюджетном сегменте DeepSeek V4 Pro обеспечивает качество уровня Intelligence Index 52 при стоимости менее $1 за миллион токенов.

Почему Anthropic отключила Claude Fable 5?

12 июня 2026 правительство США выпустило экспортную директиву, обязавшую Anthropic заблокировать доступ к Fable 5 и Mythos 5 для иностранных пользователей. Поводом стало обнаружение компанией Amazon метода джейлбрейка, позволяющего извлекать из модели информацию для кибератак. Поскольку Anthropic не смогла оперативно разделить пользователей по гражданству, модель была отключена глобально.

У каких моделей контекстное окно в миллион токенов и более?

На июнь 2026 контекст в миллион токенов поддерживают Claude Fable 5, Claude Opus 4.8, GPT-5.5, GPT-5.4, Gemini 3.1 Pro Preview, Gemini 3.5 Flash, Qwen 3.7 Max и NVIDIA Nemotron 3 Ultra. Llama 4 Scout от Meta предлагает рекордное контекстное окно в 10 миллионов токенов, хотя по качеству рассуждений значительно уступает фронтирным моделям.