ContextWindow
Тег

#terminal-bench

Исследования

Terminal-Bench: как интерактивные среды меняют оценку AI-агентов

Новый класс бенчмарков проверяет агентов не на изолированных вопросах, а в полноценной среде с терминалом и файловой системой — задача засчитывается только при проверяемом результате. Разрыв между хорошим score на классических тестах и реальной полезностью в продакшене оказывается значительным.