Нейросеть — это математическая модель, которая учится решать задачи на примерах, а не по заранее прописанным правилам. Внутри она представляет собой слои простых вычислительных узлов («нейронов»), соединённых связями с числовыми весами; обучение сводится к подбору этих весов так, чтобы модель давала правильные ответы. Название и общая идея заимствованы у биологического мозга, но сходство поверхностное: искусственный нейрон — это всего лишь функция, которая складывает входные сигналы с весами и пропускает результат через нелинейное преобразование.

Из чего состоит нейросеть

Базовый строительный блок — искусственный нейрон. Он получает на вход несколько чисел, умножает каждое на свой вес, суммирует, добавляет смещение и пропускает результат через функцию активации (например, ReLU), которая отсекает или сглаживает значение. Один нейрон почти ничего не умеет; сила появляется при объединении тысяч и миллионов нейронов в слои.

Слои выстраиваются последовательно:

  • Входной слой: принимает данные — пиксели изображения, числа, закодированный текст.
  • Скрытые слои: преобразуют сигнал, выделяя всё более абстрактные признаки; в глубоких сетях таких слоёв десятки и сотни (отсюда термин deep learning).
  • Выходной слой: выдаёт результат — вероятность класса, число, следующее слово.

Глубина и есть «глубокое обучение»: чем больше слоёв, тем более сложные закономерности сеть способна уловить, но тем больше данных и вычислений требуется для обучения.

Как нейросеть обучается

Обучение — это подбор весов под данные. Сначала веса задаются случайно, и сеть выдаёт бессмысленный ответ. Затем её прогоняют через размеченные примеры и измеряют ошибку — расхождение между ответом сети и правильным значением, выраженное функцией потерь. Алгоритм обратного распространения ошибки (backpropagation) вычисляет, как изменить каждый вес, чтобы ошибка уменьшилась, а градиентный спуск делает маленький шаг в эту сторону. Цикл повторяется миллионы раз.

На больших датасетах процесс требует огромных вычислительных мощностей: современные модели обучаются на тысячах GPU неделями. Результат обучения — фиксированный набор весов, который и есть «знание» модели. После обучения веса не меняются при каждом запросе; модель применяет уже выученные закономерности к новым данным (этот этап называют инференсом).

Важное свойство: нейросеть не хранит примеры и не ищет ответ в базе. Она кодирует статистические закономерности данных в весах. Поэтому она способна обобщать — отвечать на то, чего не видела дословно, — но по той же причине может уверенно ошибаться, выдавая правдоподобный, но неверный результат.

Какие бывают нейросети

Архитектура сети подбирается под тип данных, и за десятилетия сложилось несколько основных семейств:

  • Полносвязные сети (MLP): простейший вариант, где каждый нейрон слоя связан с каждым нейроном следующего. Подходят для табличных данных и как блок внутри более сложных архитектур.
  • Свёрточные сети (CNN): заточены под изображения. Они выделяют локальные признаки — края, текстуры, формы — и собирают из них всё более сложные образы. Долгое время были стандартом компьютерного зрения.
  • Рекуррентные сети (RNN, LSTM): обрабатывают последовательности — текст, речь, временные ряды, — передавая состояние от шага к шагу. До 2017 года доминировали в обработке языка.
  • Трансформеры: сегодняшний стандарт для языка и всё чаще для изображений и звука. Вытеснили рекуррентные сети за счёт механизма внимания и параллельной обработки.

Семейства не исключают друг друга: современные системы комбинируют подходы, а трансформеры постепенно проникают в области, где раньше господствовали свёрточные и рекуррентные сети. Но именно трансформеры стоят за бумом генеративного ИИ, поэтому их стоит рассмотреть отдельно.

Почему языковые модели — это нейросети

ChatGPT, Claude, Gemini, YandexGPT и GigaChat — это нейросети особого типа, трансформеры. Архитектуру Transformer представили исследователи Google в статье Attention Is All You Need в 2017 году, и она вытеснила более ранние рекуррентные сети. Ключевой механизм — внимание (attention): модель при обработке каждого слова взвешивает, насколько важны остальные слова в тексте, и за счёт этого улавливает связи на большом расстоянии.

Большая языковая модель (LLM, large language model) обучается на одной простой задаче — предсказать следующий токен (кусочек слова) по предыдущим. Прогнав через себя триллионы слов из книг, сайтов и кода, модель выучивает грамматику, факты и стиль как побочный продукт этого предсказания. Когда модель отвечает на вопрос, она не «понимает» его в человеческом смысле, а последовательно генерирует наиболее вероятное продолжение текста токен за токеном. Подробнее о токенах и о том, как измеряется объём текста, который модель удерживает за раз, — в материалах про токены и контекстное окно.

Масштаб — отдельный фактор, который превратил трансформеры в то, чем они стали. Исследователи обнаружили закономерности (scaling laws): качество модели предсказуемо растёт с увеличением числа параметров, объёма данных и вычислений. Это наблюдение и запустило гонку всё более крупных моделей — от сотен миллионов параметров у первых версий до сотен миллиардов и больше у современных. До определённого момента простое увеличение размера давало новые способности, которых не было у меньших моделей. Позже к чистому масштабу добавились дообучение на инструкциях и обратная связь от людей — без них модель предсказывала бы текст, но не следовала бы запросам пользователя так, как это делают сегодняшние ассистенты.

Из этого механизма вытекают и сильные стороны, и ограничения. Модель блестяще работает с языком и обобщает, но не имеет доступа к истине: если в обучающих данных факт встречался редко или противоречиво, она может сгенерировать убедительную выдумку — это называют галлюцинацией. Нейросеть не считает и не проверяет, а предсказывает вероятное продолжение, и держать это в голове полезно каждому, кто полагается на её ответы.