20 мая HuggingFace опубликовала SmolLM3 — open-weight-модель на 3 миллиарда параметров под Apache 2.0. По заявлению команды, на восьми из десяти задач бенчмарка MMLU-Pro модель опережает Mistral 7B, выпущенный годом ранее, и вплотную подходит к Llama 3.1 8B при втрое меньшем числе параметров. Это третья итерация линейки: SmolLM в 2024 году был образовательным проектом, SmolLM2 — попыткой показать пределы curated-корпуса. SmolLM3 — уже инфраструктурный релиз, рассчитанный на коммерческое производство.

Почему 3B стало возможным там, где год назад требовалось 7B

Размер модели — это число параметров, а не уровень интеллекта. Параметры — это коэффициенты матриц внутри сети, которые определяют, как она преобразует входной текст в предсказание следующего токена. Больше параметров означает больше «памяти» о паттернах в данных, но также больше вычислений и памяти при инференсе. Сдвиг последних двух лет — в том, что правильно обученная компактная модель может воспроизводить поведение крупной, если получает нужные сигналы при обучении.

SmolLM3 использует два таких сигнала одновременно.

Два фактора, давших прирост качества

Первый — knowledge distillation от учительской модели Qwen2.5-72B. Студент обучается воспроизводить распределение вероятностей учителя по всему словарю, а не только правильные финальные ответы. Разница принципиальная. В стандартном supervised fine-tuning модель получает сигнал «это правильно, это неправильно». В дистилляции она видит, насколько учитель уверен в каждом из тысяч возможных продолжений — плотный обучающий сигнал, который несёт намного больше информации о «форме знания», чем просто правильный ответ.

Второй фактор команда выделяет как более значимый — полная пересборка претрейн-корпуса. Новый датасет SmolLM-Mix-3 включает академические тексты, код, мультиязычный веб-скрапинг и инструктивные данные в пропорции, подобранной по результатам контролируемых экспериментов на уменьшенных масштабах. По данным HuggingFace, замена корпуса при прочих равных дала более +4 пунктов на MMLU-Pro — больше, чем все архитектурные изменения вместе взятые. Для исследовательского сообщества это сильный сигнал: значительная часть ресурсов уходит на архитектурные эксперименты, тогда как эффект состава данных систематически недооценивается.

Третий элемент, упомянутый менее явно: около 8% претрейн-токенов составляют синтетические цепочки рассуждений, сгенерированные крупными моделями и отфильтрованные верификатором. Техника аналогична подходу DeepSeek-R1, адаптированному под малую модель — синтетические reasoning-traces дают 3B-параметрной сети обучающий сигнал, который она не могла бы извлечь из «сырого» веб-текста. Для небольших моделей это особенно ценно: они не могут сами «изобрести» многошаговое рассуждение из неструктурированного корпуса.

Где 3B-модель достаточна для продакшена

SmolLM3 в 4-бит квантизации занимает около 2 ГБ оперативной памяти. Это уровень, при котором модель помещается не только на ноутбуки, но и на мобильные устройства с 4 ГБ RAM при правильной реализации runtime. Для сравнения: Llama 3.1 8B в той же квантизации требует около 5 ГБ, Mistral 7B — порядка 4,5 ГБ.

Три сценария, где SmolLM3 закрывает задачу лучше, чем API-модели. Первый — классификация и извлечение структурированных данных из текста при большом объёме: стоимость API-вызовов накапливается линейно с числом запросов, и для задач, которые решаются детерминированно на 3B, платить за GPT-5o экономически нерационально. Второй — локальные edge-приложения с требованиями к работе без сети. Третий — первый уровень в каскадной архитектуре, где SmolLM3 обрабатывает входные запросы и передаёт сложные случаи тяжёлой модели. Если только 30% запросов требуют полной модели, стоимость инференса падает кратно.

Контекстное окно — 32K токенов. Это заметно меньше текущего индустриального стандарта в 128K–500K и ограничивает применимость на задачах с длинными документами. Суммаризация длинных договоров или анализ объёмных переписок — не область применения SmolLM3.

Воспроизводимость как редкость в индустрии

HuggingFace опубликовала вместе с весами полный тренировочный пайплайн: код, конфигурацию, скрипты подготовки данных и описание процедуры фильтрации корпуса. Это редкость даже среди open-weight-релизов — большинство компаний публикуют веса и общую документацию, но не воспроизводимый рецепт обучения. Это разница между «вы можете использовать модель» и «вы можете понять, как она получилась».

Для исследовательского сообщества это означает, что SmolLM3 можно воспроизвести и модифицировать на другом корпусе, дообучить под специфический домен с той же процедурой или масштабировать до 1B, если задача не требует 3B. Для коммерческих команд знание о составе корпуса снимает часть вопросов по compliance — хотя прозрачности по правам на конкретные источники данных тут всё равно меньше, чем у Mistral.

На фоне тренда на сжатие, который начали Phi-3 и SmolLM-2, SmolLM3 подтверждает: разрыв между моделями на 2–4 миллиарда параметров и 7–13-миллиардными сокращается быстрее, чем разрыв между топовыми закрытыми моделями. Следующий рубеж — 1B-класс с качеством сегодняшних 3B — по такому темпу выглядит достижимым в горизонте года.

По мотивам: HuggingFace blog — SmolLM3