Модели
GPT-5.6 Sol получил два новых режима вычислений: «max reasoning effort» для точности и Sol Ultra с субагентами для длинных задач. На Terminal-Bench 2.1 Ultra берёт 91,9%. System card присвоил всем трём моделям уровень High по кибербезопасности и биорискам.
29 июня
4 мин
Инструменты
OpenAI выпустила стабильный релиз Agents SDK 1.0 — инструментария для оркестрации многошаговых агентов. Библиотека вышла из беты с поддержкой MCP, guardrails и eval-харнессом. Для команд на сыром API появился готовый рантайм с хостингом прогонов.
6 июня
5 мин
Инструменты
Модели, управляющие браузером и интерфейсом как человек, перешли из демонстраций в рабочие инструменты. Они кликают, заполняют формы и проходят многошаговые сценарии, но надёжность остаётся главным ограничением. Разбираемся, где computer-use уже полезен, а где пока буксует.
31 мая
2 мин
Исследования
Новый класс бенчмарков проверяет агентов не на изолированных задачах, а в полноценной среде с терминалом и файловой системой. Такой подход ближе к реальной работе, но и обнажает слабые места моделей. Результаты показывают, что разрыв между демо и продакшеном всё ещё велик.
29 мая
3 мин
Инструменты
Команда LangChain переписала ядро вокруг StateGraph API, отказавшись от Chain-абстракции образца 2023 года. Что это значит для существующих проектов и стоит ли мигрировать сейчас.
25 мая
3 мин
Инструменты
Model Context Protocol от Anthropic получил статус общей доступности. К моменту релиза опубликовано более 1400 server-имплементаций. Разбираем, что значит этот стандарт для команд, строящих агентные интеграции.
18 мая
3 мин
Регулирование
Подготовленный законопроект распространяет требования о маркировке рекламы на сценарии, в которых решения о таргетировании принимает AI-агент. Что это значит для платформ, рекламодателей и инфраструктуры ОРД, и какие технические сложности предстоит решить.
6 мая
3 мин