ContextWindow
Тег

#agents

Модели

GPT-5.6 Sol: два режима вычислений, рекорд Terminal-Bench и профиль безопасности

GPT-5.6 Sol получил два новых режима вычислений: «max reasoning effort» для точности и Sol Ultra с субагентами для длинных задач. На Terminal-Bench 2.1 Ultra берёт 91,9%. System card присвоил всем трём моделям уровень High по кибербезопасности и биорискам.

Инструменты

OpenAI переводит Agents SDK в стабильную версию 1.0

OpenAI выпустила стабильный релиз Agents SDK 1.0 — инструментария для оркестрации многошаговых агентов. Библиотека вышла из беты с поддержкой MCP, guardrails и eval-харнессом. Для команд на сыром API появился готовый рантайм с хостингом прогонов.

Инструменты

Агентные браузеры повзрослели: что умеют computer-use модели

Модели, управляющие браузером и интерфейсом как человек, перешли из демонстраций в рабочие инструменты. Они кликают, заполняют формы и проходят многошаговые сценарии, но надёжность остаётся главным ограничением. Разбираемся, где computer-use уже полезен, а где пока буксует.

Исследования

Terminal-Bench: как оценивают агентов в реальной рабочей среде

Новый класс бенчмарков проверяет агентов не на изолированных задачах, а в полноценной среде с терминалом и файловой системой. Такой подход ближе к реальной работе, но и обнажает слабые места моделей. Результаты показывают, что разрыв между демо и продакшеном всё ещё велик.

Инструменты

MCP-протокол вышел из беты: что это меняет для интеграций с агентами

Model Context Protocol от Anthropic получил статус общей доступности. К моменту релиза опубликовано более 1400 server-имплементаций. Разбираем, что значит этот стандарт для команд, строящих агентные интеграции.

Регулирование

Расширение ERID на агентскую рекламу: что предлагает российский законопроект

Подготовленный законопроект распространяет требования о маркировке рекламы на сценарии, в которых решения о таргетировании принимает AI-агент. Что это значит для платформ, рекламодателей и инфраструктуры ОРД, и какие технические сложности предстоит решить.