ContextWindow
Тег

#benchmark

Исследования

Terminal-Bench: как интерактивные среды меняют оценку AI-агентов

Новый класс бенчмарков проверяет агентов не на изолированных вопросах, а в полноценной среде с терминалом и файловой системой — задача засчитывается только при проверяемом результате. Разрыв между хорошим score на классических тестах и реальной полезностью в продакшене оказывается значительным.

Исследования

RULER-2M: бенчмарк длинного контекста до двух миллионов токенов

Исследователи из NVIDIA, Princeton и DeepMind расширили методологию RULER до контекстов в 2 млн токенов и получили неприятный результат: даже модели с формально поддерживаемым окном 1M+ проваливаются на задачах, где нужно связать факты, разнесённые на 500K–1M токенов. Первый бенчмарк, проверяющий именно reasoning на длинных дистанциях, а не банальный поиск «иголки в стоге».

Модели

Gemini 2.5 Pro занял первое место на RULER-2M с результатом 71,8%

21 мая Google DeepMind опубликовала результаты Gemini 2.5 Pro на бенчмарке длинного контекста RULER-2M: 71,8% по агрегированной метрике — против 62,4% у Claude Opus 4.7 и 58,1% у GPT-5o. Отрыв объясняется специализированным дообучением, а не только размером окна контекста.

Инструменты

Vector DB на 100M+ векторах: где сейчас Pinecone, Weaviate и Qdrant

На корпусе из 120 миллионов векторов разница между Pinecone, Weaviate и Qdrant перестаёт быть теоретической — она влияет на бюджет, архитектуру и операционную нагрузку команды. Latency p95, recall и совокупная стоимость владения на реальной нагрузке.

Исследования

MMMU-Pro: обновлённый мультимодальный бенчмарк и текущие результаты моделей

Расширенная версия MMMU добавила vision-only режим, увеличила число дистракторов и ввела задачи на многошаговое визуальное рассуждение. Точность всех моделей упала на 15–25 пунктов — и это хорошо: оригинальный бенчмарк был слишком лёгким. Разрыв между лучшими моделями и человеком по-прежнему около 24 пунктов.