ContextWindow
Тег

#research

Исследования

Terminal-Bench: как интерактивные среды меняют оценку AI-агентов

Новый класс бенчмарков проверяет агентов не на изолированных вопросах, а в полноценной среде с терминалом и файловой системой — задача засчитывается только при проверяемом результате. Разрыв между хорошим score на классических тестах и реальной полезностью в продакшене оказывается значительным.

Исследования

Сколтех и Яндекс опубликовали методологию токенизатора для русского языка

7 мая Сколтех и Yandex Research опубликовали препринт с методологией токенизатора, оптимизированного под русскоязычные корпуса. Заявленное снижение средней длины последовательности — 14–18% по сравнению с tiktoken cl100k. При больших объёмах запросов это напрямую конвертируется в деньги.