Исследования
Новый класс бенчмарков проверяет агентов не на изолированных вопросах, а в полноценной среде с терминалом и файловой системой — задача засчитывается только при проверяемом результате. Разрыв между хорошим score на классических тестах и реальной полезностью в продакшене оказывается значительным.
29 мая
5 мин
Модели
Anthropic выпустила Claude Opus 4.7 с расширенным до 500K токенов контекстным окном и поддержкой вызова инструментов внутри цепочки рассуждения — без повышения цены API. На SWE-bench Verified модель набрала 78,4% против 74,9% у предыдущей версии. Релиз ориентирован на команды, уже использующие Claude в продакшене.
24 мая
4 мин
Инструменты
Cursor вышел из беты в мае 2026-го — первый стабильный релиз после двух лет конкурентного давления со стороны GitHub Copilot и активного роста Windsurf. За версией 1.0 стоит набор архитектурных решений, которые объясняют, почему часть команд переходит на него от Copilot даже без видимых причин.
21 мая
5 мин