Исследования
Новый класс бенчмарков проверяет агентов не на изолированных вопросах, а в полноценной среде с терминалом и файловой системой — задача засчитывается только при проверяемом результате. Разрыв между хорошим score на классических тестах и реальной полезностью в продакшене оказывается значительным.
29 мая
5 мин
Исследования
Исследователи из NVIDIA, Princeton и DeepMind расширили методологию RULER до контекстов в 2 млн токенов и получили неприятный результат: даже модели с формально поддерживаемым окном 1M+ проваливаются на задачах, где нужно связать факты, разнесённые на 500K–1M токенов. Первый бенчмарк, проверяющий именно reasoning на длинных дистанциях, а не банальный поиск «иголки в стоге».
24 мая
5 мин
Модели
21 мая Google DeepMind опубликовала результаты Gemini 2.5 Pro на бенчмарке длинного контекста RULER-2M: 71,8% по агрегированной метрике — против 62,4% у Claude Opus 4.7 и 58,1% у GPT-5o. Отрыв объясняется специализированным дообучением, а не только размером окна контекста.
21 мая
4 мин
Инструменты
На корпусе из 120 миллионов векторов разница между Pinecone, Weaviate и Qdrant перестаёт быть теоретической — она влияет на бюджет, архитектуру и операционную нагрузку команды. Latency p95, recall и совокупная стоимость владения на реальной нагрузке.
13 мая
5 мин
Исследования
Расширенная версия MMMU добавила vision-only режим, увеличила число дистракторов и ввела задачи на многошаговое визуальное рассуждение. Точность всех моделей упала на 15–25 пунктов — и это хорошо: оригинальный бенчмарк был слишком лёгким. Разрыв между лучшими моделями и человеком по-прежнему около 24 пунктов.
13 мая
5 мин