ContextWindow
Рубрика

Исследования

Научные работы и бенчмарки в области ИИ: методология, результаты и их практическое значение. Reasoning, длинный контекст, мультимодальность и оценка моделей — на понятном языке и со ссылками на первоисточники.
Исследования

Что такое токены в языковых моделях и почему их количество определяет стоимость и возможности GPT

Токен — минимальная единица текста, которую языковая модель обрабатывает за один шаг: не символ и не слово, а фрагмент, получаемый алгоритмом токенизации. От числа токенов зависит цена запроса к API, размер контекстного окна и скорость генерации.

Исследования

Контекстное окно в языковых моделях: что это такое и почему его размер имеет значение

Контекстное окно — максимальный объём текста в токенах, который языковая модель обрабатывает за один вызов; всё за его пределами модель не видит. Размер окна определяет, сколько документа, кода или диалога умещается в один запрос.

Исследования

Верность цепочек рассуждений: когда chain-of-thought не объясняет ответ модели

Новые препринты ставят под сомнение ключевое допущение о reasoning-моделях: видимая цепочка рассуждений может не отражать реальные вычисления, а лишь имитировать их — что подрывает мониторинг агентных систем как метод контроля.

Исследования

Мультиагентные рассуждения: исследователи переходят к управляемой оркестрации

Свежие препринты смещают фокус с одиночных рассуждающих моделей на координацию нескольких агентов. Авторы формулируют оркестрацию как задачу обучения с подкреплением и предлагают контролируемые бенчмарки. Главным узким местом остаётся надёжность взаимодействия.

Исследования

Terminal-Bench: как оценивают агентов в реальной рабочей среде

Новый класс бенчмарков проверяет агентов не на изолированных задачах, а в полноценной среде с терминалом и файловой системой. Такой подход ближе к реальной работе, но и обнажает слабые места моделей. Результаты показывают, что разрыв между демо и продакшеном всё ещё велик.

Исследования

RULER-2M: новый бенчмарк длинного контекста и что он показывает о реальных пределах моделей

Авторы расширенной версии RULER опубликовали бенчмарк на контексте до 2 миллионов токенов. Главный результат — даже модели с формально поддерживаемым окном 1M+ систематически проваливаются на задачах, требующих связной аргументации по дальним фрагментам.

Исследования

Process Reward Models: новый уровень стабильности в RLHF-обучении

Награды по шагам рассуждения вместо итогового результата позволяют существенно сократить нестабильность RLHF-обучения. Разбираем технические детали подхода и публикации последних месяцев, фиксирующих его как новую норму.

Исследования

MMMU-Pro: что измеряет новый мультимодальный бенчмарк и где сейчас лидеры

Расширенная версия MMMU добавляет задачи с фильтрацией визуальных дистракторов и многошаговое визуальное рассуждение. Разбираем, чем отличается от предшественника и какие модели сейчас лидируют.

Исследования

Совместная работа Сколтеха и Яндекса по эффективной токенизации русского языка

Исследователи опубликовали методологию построения токенизатора для русскоязычных корпусов с учётом морфологии. Заявленное снижение средней длины последовательности — до 18%, что напрямую влияет на стоимость инференса.