Terminal-Bench: как интерактивные среды меняют оценку AI-агентов
Новый класс бенчмарков проверяет агентов не на изолированных вопросах, а в полноценной среде с терминалом и файловой системой — задача засчитывается только при проверяемом результате. Разрыв между хорошим score на классических тестах и реальной полезностью в продакшене оказывается значительным.