Исследования
Новый класс бенчмарков проверяет агентов не на изолированных вопросах, а в полноценной среде с терминалом и файловой системой — задача засчитывается только при проверяемом результате. Разрыв между хорошим score на классических тестах и реальной полезностью в продакшене оказывается значительным.
29 мая
5 мин
Исследования
Исследователи из NVIDIA, Princeton и DeepMind расширили методологию RULER до контекстов в 2 млн токенов и получили неприятный результат: даже модели с формально поддерживаемым окном 1M+ проваливаются на задачах, где нужно связать факты, разнесённые на 500K–1M токенов. Первый бенчмарк, проверяющий именно reasoning на длинных дистанциях, а не банальный поиск «иголки в стоге».
24 мая
5 мин
Исследования
Расширенная версия MMMU добавила vision-only режим, увеличила число дистракторов и ввела задачи на многошаговое визуальное рассуждение. Точность всех моделей упала на 15–25 пунктов — и это хорошо: оригинальный бенчмарк был слишком лёгким. Разрыв между лучшими моделями и человеком по-прежнему около 24 пунктов.
13 мая
5 мин