ContextWindow
Тег

#swe-bench

Исследования

Terminal-Bench: как интерактивные среды меняют оценку AI-агентов

Новый класс бенчмарков проверяет агентов не на изолированных вопросах, а в полноценной среде с терминалом и файловой системой — задача засчитывается только при проверяемом результате. Разрыв между хорошим score на классических тестах и реальной полезностью в продакшене оказывается значительным.

Модели

Claude Opus 4.7: 500K токенов, tool use в режиме reasoning и SWE-bench 78,4%

Anthropic выпустила Claude Opus 4.7 с расширенным до 500K токенов контекстным окном и поддержкой вызова инструментов внутри цепочки рассуждения — без повышения цены API. На SWE-bench Verified модель набрала 78,4% против 74,9% у предыдущей версии. Релиз ориентирован на команды, уже использующие Claude в продакшене.

Инструменты

Cursor 1.0 против Copilot и Windsurf: что изменилось в IDE-агентах

Cursor вышел из беты в мае 2026-го — первый стабильный релиз после двух лет конкурентного давления со стороны GitHub Copilot и активного роста Windsurf. За версией 1.0 стоит набор архитектурных решений, которые объясняют, почему часть команд переходит на него от Copilot даже без видимых причин.