OpenAI выпустила обновление GPT-5o 22 мая без смены поколения и без нового отчёта по бенчмаркам. Компания прямо написала в анонсе, что задача итерации другая: снизить задержку мультимодального ввода до уровня, при котором голосовой ассистент становится коммерчески пригодным. Это честная расстановка приоритетов — benchmark-гонка уже дала рынку точку насыщения, и дальнейшее улучшение качества текстового вывода на доли процента MMLU больше не меняет бизнес-решения клиентов.

По данным компании, медианная задержка от окончания реплики пользователя до начала ответа составила 320 мс при работе через streaming-API. Это ниже психологического барьера в 500 мс, после которого пользователи начинают воспринимать паузу как техническую задержку, а не как обдумывание. Для контекста: у аналогов на рынке год назад этот показатель был в диапазоне 700–900 мс. Продуктовые последствия очевидны — ассистент с такой задержкой перестаёт ощущаться как «машина, которую ждёшь», и становится возможным создать разговорный интерфейс без ощущения технических пауз.

Единый токенизатор и что он меняет

Главное архитектурное изменение — переход от параллельных энкодеров к единому токенизатору для всех трёх модальностей. В прошлой версии GPT-5o аудио и изображения обрабатывались отдельными энкодерами, результаты которых конкатенировались перед подачей в трансформер. Синхронизация этих потоков добавляла overhead и снижала скорость реакции: система должна была ждать, пока все энкодеры завершат работу, прежде чем начать генерацию.

Теперь аудио, видео и текст поступают в трансформер единой последовательностью токенов. Это даёт несколько практических следствий. Voice Activity Detection — детекция момента, когда пользователь закончил говорить — теперь работает внутри модели, а не в отдельном модуле. Это позволяет модели реагировать на перебивание без срыва генерации: VAD и генерация ответа синхронизированы на уровне единого вычислительного графа. Пользователь может прервать ответ на полуслове, и система перестроится без задержки переинициализации.

Дополнительно модель стала учитывать интонацию и эмоциональный тон как часть контекста при подборе формулировок: реагировать не только на слова, но и на способ, которым они произнесены. Видеопоток в реальном времени поддерживается на частоте до 15 fps без отдельной квоты — ранее это было в dev-превью.

Документация по интеграции через WebRTC и WebSocket опубликована на платформе OpenAI. Бета-доступ открыт для аккаунтов с расходом выше $5.

Новый тир и пересмотр кэш-цен

GPT-5o Mid появился между Mini и стандартной моделью. Стоимость — $1,5 за миллион input-токенов и $6 за миллион output. Базовая GPT-5o стоит примерно $4,5 за миллион input — в три раза дороже Mid. Mini оценена в $0,75 — вдвое дешевле Mid. Целевой сценарий, который OpenAI обозначает явно — массовые real-time-интеграции, где Mini не справляется по качеству понимания сложных запросов, а полная модель экономически не оправдывает затраты. Для колл-центрового сценария с тысячами одновременных разговоров разница между $1,5 и $4,5 за миллион токенов превращается в очень существенный операционный выбор.

Параллельно компания снизила стоимость кэшированных input-токенов на 35% во всей линейке. Для систем с длинными системными промтами — колл-центровые сценарии, образовательные продукты, RAG-приложения с постоянным контекстом — это снижение общей стоимости владения без каких-либо изменений в архитектуре. Если системный промт занимает 10K токенов и к нему обращаются миллионы раз в день, 35% скидка на кэш даёт значимую экономию.

Где голосовой AI работает, а где ещё нет

320 мс — это медианное значение. Хвосты распределения задержки имеют значение для продуктового опыта: если 5% запросов дают задержку выше 800 мс, пользователи заметят это как нестабильность. OpenAI не публикует данные о процентилях p95 и p99 задержки, что затрудняет SLA-оценку для enterprise-деплоев.

Другой практический барьер — языковое качество. Голосовой режим по-прежнему оптимизирован для английского. На других языках качество понимания и синтеза речи заметно хуже — особенно на языках с небольшим объёмом тренировочных данных. Для русскоязычного рынка это ограничение актуально.

Позиция на рынке real-time-голоса

Ни Anthropic, ни Google не предлагают публичного real-time-voice-API сопоставимого уровня. Anthropic фокусирует приоритеты на агентных сценариях с extended thinking, Google — на длинном контексте и мультимодальном рассуждении. OpenAI занимает нишу реактивного ассистента: колл-центры, поддержка, образование, встроенные интерфейсы устройств. При 320 мс задержки и доступности через WebRTC это уже полноценный конкурент специализированных ASR+TTS пайплайнов — с преимуществом единой модели, которая понимает контекст разговора, а не только распознаёт и синтезирует речь.

Для российских команд прямой API-доступ по-прежнему ограничен санкционным режимом. Однако задержка в 320 мс становится техническим ориентиром, по которому теперь будут оцениваться следующие версии Yandex GPT и GigaChat. Текущие русскоязычные модели в голосовом режиме дают задержку в два-три раза выше — это разрыв, который рынок заметил.

По мотивам: OpenAI blog — GPT-5o updates