ContextWindow
Тег

#multimodal

Модели

GPT-5o обновился: задержка голоса 320 мс, единый токенизатор и новый ценовой тир

22 мая OpenAI снизила медианную задержку голосового ввода GPT-5o до 320 миллисекунд и ввела промежуточный тир GPT-5o Mid за $1,5 за миллион input-токенов. Ключевое изменение — единый токенизатор для аудио, видео и текста, убравший отдельные энкодеры прошлой версии.

Исследования

MMMU-Pro: обновлённый мультимодальный бенчмарк и текущие результаты моделей

Расширенная версия MMMU добавила vision-only режим, увеличила число дистракторов и ввела задачи на многошаговое визуальное рассуждение. Точность всех моделей упала на 15–25 пунктов — и это хорошо: оригинальный бенчмарк был слишком лёгким. Разрыв между лучшими моделями и человеком по-прежнему около 24 пунктов.