ContextWindow
Тег

#evaluation

Исследования

Terminal-Bench: как интерактивные среды меняют оценку AI-агентов

Новый класс бенчмарков проверяет агентов не на изолированных вопросах, а в полноценной среде с терминалом и файловой системой — задача засчитывается только при проверяемом результате. Разрыв между хорошим score на классических тестах и реальной полезностью в продакшене оказывается значительным.

Исследования

RULER-2M: бенчмарк длинного контекста до двух миллионов токенов

Исследователи из NVIDIA, Princeton и DeepMind расширили методологию RULER до контекстов в 2 млн токенов и получили неприятный результат: даже модели с формально поддерживаемым окном 1M+ проваливаются на задачах, где нужно связать факты, разнесённые на 500K–1M токенов. Первый бенчмарк, проверяющий именно reasoning на длинных дистанциях, а не банальный поиск «иголки в стоге».

Исследования

MMMU-Pro: обновлённый мультимодальный бенчмарк и текущие результаты моделей

Расширенная версия MMMU добавила vision-only режим, увеличила число дистракторов и ввела задачи на многошаговое визуальное рассуждение. Точность всех моделей упала на 15–25 пунктов — и это хорошо: оригинальный бенчмарк был слишком лёгким. Разрыв между лучшими моделями и человеком по-прежнему около 24 пунктов.