Llama 4 вышла в апреле 2026-го, и её появление закрыло вопрос о случайности DeepSeek: mixture-of-experts стал стандартной архитектурой открытых весов, а не экзотикой одной китайской лаборатории. Обе модели — Llama 4 и DeepSeek-V3 — следуют одной идее: вместо роста плотной сети знания распределяются по большому набору специализированных подсетей, из которых на каждом токене активируется только часть. Но на этом сходство заканчивается.

Llama 4 предлагает два варианта: 109B суммарных параметров с 17B активными и 400B суммарных с теми же 17B активными. DeepSeek-V3 — 671B суммарных, 37B активных. Ключевое число здесь — активные параметры: именно от них зависят требования к памяти во время инференса, а не от суммарного объёма весов. Кратко: вы платите деньгами за суммарный объём при загрузке, но платите вычислениями за активные параметры при каждом токене.

Как устроена маршрутизация у обеих моделей

Llama 4 использует 128 экспертов с активацией двух на каждый токен. DeepSeek-V3 — 256 экспертов с активацией восьми. На первый взгляд, большее число активных экспертов означает более тонкую специализацию и лучшее качество — каждый токен обрабатывается с учётом большего числа «точек зрения» модели. На практике это создаёт заметную нагрузку на all-to-all-коммуникацию между GPU при тензорном параллелизме.

Чтобы понять проблему, достаточно представить, что происходит: при маршрутизации токена к восьми экспертам из 256 каждый эксперт может физически жить на другой карте. Активации нужно передать туда, получить результат и агрегировать обратно. На одиночном узле с четырьмя-восемью ускорителями это ощутимо: межкарточный bandwidth становится узким местом, особенно на длинных последовательностях.

Llama 4 в этом отношении проще: меньше экспертных переключений, меньше inter-GPU-трафика, предсказуемее задержки. На практике это означает, что инференс-фреймворки — vLLM, TGI, SGLang — получили стабильную поддержку Llama 4 быстрее, чем DeepSeek-V3 с её более сложной топологией маршрутизации. В конце 2025-го DeepSeek-V3 в vLLM требовала нетривиальных патчей; Llama 4 встала из коробки на тех же версиях.

Реальный порог входа по железу

Llama 4 109B в FP16 умещается на двух H100 SXM при стандартном тензорном параллелизме. С квантизацией до 8 бит достаточно двух A100 80G. Llama 4 400B — минимум четыре H100, или шесть A100 с int8. DeepSeek-V3 стартует с четырёх H100 без квантизации; в int4 теоретически можно обойтись двумя H200 или восемью L40S, но стабильная поддержка этих конфигураций в публичных фреймворках появилась только весной 2026-го.

Для команды с уже готовым узлом из двух H100 выбор очевиден: Llama 4 109B без компромиссов. Для тех, кто только планирует инфраструктуру, арифметика усложняется. Разница в качестве между Llama 4 400B и DeepSeek-V3 на большинстве production-задач составляет 2–3 пункта по бенчмаркам, и эти пункты не оправдывают удвоения числа карт для большинства workloads.

Есть нюанс с квантизацией: агрессивное уменьшение размерности бит больнее бьёт по MoE, чем по плотным моделям. При переходе с FP16 на int4 плотная модель теряет в среднем 2–4 пункта на бенчмарках; у MoE деградация на routing-решениях может быть выше, потому что маршрутизатор чувствителен к точности активаций. Это стоит учитывать при выборе режима квантизации для production-деплоя.

Бенчмарки: где расходятся и где сходятся

На MMLU-Pro Llama 4 400B набирает 71,4% против 73,2% у DeepSeek-V3. На HumanEval разрыв 89,1% против 90,3%. На SWE-bench Lite — 33,6% против 38,9%. DeepSeek-V3 системно выигрывает на задачах с reasoning и code; Llama 4 ближе на instruction following и работе с длинным неструктурированным текстом.

Контекстное окно у Llama 4 формально больше — 256K против 128K у DeepSeek-V3. Но на RULER-128K обе укладываются в 80–85% точности, а за пределами этой отметки Llama 4 деградирует быстрее. Большее окно не конвертируется в лучший эффективный контекст. Для задач, где нужно стабильно работать с документами в 50–80K токенов, разница минимальна; для сценариев за 128K лучше проверять обе модели на своих данных, а не доверять формальному лимиту.

Есть ещё один практический момент, который редко попадает в сравнения: скорость дообучения. Llama 4 109B с 17B активными параметрами обходится заметно дешевле в supervised fine-tuning, чем DeepSeek-V3 с её 37B активными. Для команд, которым нужна доменная адаптация, а не только инференс, это существенная строка в бюджете. Разница в стоимости обучающего прогона на одном и том же датасете — порядка 2× по GPU-часам. На объёме из нескольких миллионов токенов это может составить разницу между однодневным и двухдневным обучением на том же кластере.

Лицензии и ограничения на использование

Оба проекта открыты, но по-разному. Llama 4 распространяется под Meta Llama 4 Community License — коммерческое использование разрешено, но для сервисов с более чем 700 миллионами активных пользователей в месяц требуется отдельная лицензия. Для подавляющего большинства команд это несущественное ограничение. DeepSeek-V3 выпущена под MIT, что даёт несколько большую свободу с точки зрения юридических формальностей.

Практически значимее другое: DeepSeek — китайская компания. Для команд в некоторых корпоративных и государственных контекстах это может создавать compliance-вопросы, которые не решаются через лицензию, а требуют отдельного юридического анализа. Llama 4 от американской Meta в этом смысле нейтральнее.

Каскадная архитектура как рабочая стратегия

Индустрия 2026 года движется не к одной универсальной модели, а к каскадным архитектурам: запрос маршрутизируется к модели нужной мощности исходя из сложности задачи. В этой схеме Llama 4 109B логично занимает позицию основной рабочей лошадки с широким покрытием; DeepSeek-V3 — позицию тяжёлого tier для специфических reasoning- и coding-задач, где разница в качестве реально ощутима пользователем; SmolLM3 или Qwen3-7B — tier для извлечения, классификации и фильтрации на больших объёмах, где стоимость токена критична.

Команды, застрявшие на выборе единственной модели для всего, скорее всего, переплачивают где-то в одном месте и недополучают качество в другом. Архитектура с маршрутизацией сложнее в инженерном отношении, но на горизонте шести месяцев окупается и по стоимости, и по итоговому качеству. Самый простой первый шаг — выделить 10–15% самых ресурсоёмких запросов и направить их на тяжёлую модель, оставив остальное лёгкому tier. Разница в стоимости ощущается сразу; разница в качестве пользователь замечает крайне редко.