ИИ-агент — это программная система, которая использует языковую модель для самостоятельного планирования и выполнения многошаговых задач, вызывая внешние инструменты и корректируя действия по ходу работы. Граница между обычным чат-ботом и агентом проходит не по мощности модели, а по архитектуре: чат-бот генерирует один ответ на один запрос и останавливается. Агент продолжает работу — запрашивает данные, запускает код, открывает браузер, проверяет результат и возвращается к модели с новым контекстом.
Агентный цикл: четыре шага, которые повторяются
Базовая структура агента описывается петлёй из четырёх фаз. Она воспроизводится в большинстве существующих фреймворков — от LangGraph до кастомных реализаций поверх tool use API Anthropic.
- Планирование: модель получает задачу и формирует план — список шагов или непосредственно следующее действие. В зависимости от архитектуры план может быть явным (записанным в контекст) или неявным (модель просто выбирает первый инструмент).
- Вызов инструментов (tool use): модель генерирует структурированный вызов — имя инструмента и параметры. Среда исполняет его: читает файл, делает HTTP-запрос, запускает терминальную команду, обращается к базе данных.
- Наблюдение: результат выполнения инструмента возвращается в контекст модели как новое сообщение. Модель «видит» вывод и решает, что делать дальше.
- Следующий шаг: модель либо вызывает следующий инструмент, либо признаёт задачу выполненной и возвращает финальный ответ пользователю.
Этот цикл принципиально отличает агента от «голой» LLM. Языковая модель сама по себе — это функция преобразования токенов: на вход подаётся промпт, на выходе — следующий токен. Никакого состояния между вызовами, никакого доступа к внешним системам. Агентная обёртка добавляет персистентный контекст, среду исполнения и управляющую петлю, которая удерживает работу до завершения задачи.
Протокол Model Context Protocol (MCP), выпущенный Anthropic в конце 2024 года и получивший статус GA в 2025-м, стандартизирует способ подключения инструментов к агентам. MCP-сервер экспортирует набор функций (tools), ресурсов (resources) и подсказок (prompts); агент подключается к нему как к внешнему источнику возможностей. Это позволяет одному и тому же агенту работать с разными наборами инструментов без изменения кода самого агента.
Примеры: кодинг-агенты, computer-use и ресёрч-агенты
Кодинг-агенты — наиболее зрелый и практически проверенный класс. Cursor, GitHub Copilot Workspace, Devin и аналогичные системы получают задачу на изменение кодовой базы, самостоятельно читают файлы, пишут патчи, запускают тесты и итерируют до прохождения тест-сьюта. SWE-bench Verified — стандартный бенчмарк для этого класса задач: агент получает GitHub-issue и должен самостоятельно написать патч, который проходит автоматические тесты. По состоянию на начало 2026 года лучшие агенты закрывают около 50–65% задач из выборки, что сравнимо с результатом опытного инженера на незнакомом репозитории за ограниченное время.
Computer-use агенты управляют реальным рабочим столом или браузером через скриншоты и синтетические события мыши/клавиатуры. Anthropic представила computer-use как экспериментальную возможность Claude 3.5 Sonnet в октябре 2024 года. Агент видит экран как изображение, решает, куда кликнуть или что напечатать, и получает обновлённый скриншот как наблюдение. Применения — автоматизация задач в legacy-системах без API, заполнение форм, сбор данных с сайтов с защитой от парсинга.
Ресёрч-агенты выполняют информационный поиск с синтезом. Они формулируют поисковые запросы, читают страницы, извлекают релевантные фрагменты, при необходимости углубляются в ссылки и на выходе собирают структурированный отчёт. OpenAI Deep Research и аналогичные продукты показали, что на задачах типа «собери конкурентный анализ» или «найди все публичные данные о компании» агент способен заменить несколько часов ручной работы аналитика.
Многоагентные системы — следующий уровень: несколько специализированных агентов работают параллельно, а оркестратор координирует их и собирает результаты. Такая архитектура особенно эффективна для задач, которые естественно разбиваются на независимые подзадачи: один агент пишет код, другой пишет тесты, третий проверяет документацию.
Что ограничивает надёжность агентов на длинных задачах
Агенты заметно деградируют по мере увеличения числа шагов. Несколько механизмов объясняют эту закономерность.
Накопление ошибок: каждое неточное действие добавляет «шум» в контекст. Модель видит результат предыдущего шага как факт и строит следующий шаг на его основе. Ошибка на шаге 3 искажает шаги 4–10. В коротком чат-обмене неточность изолирована; в агентном цикле она размножается.
Деградация внимания на длинном контексте: исследования на задачах типа «needle in a haystack» показали, что модели хуже извлекают информацию из середины длинного контекста. По мере роста истории агентных шагов ранние инструкции и результаты «тонут» — модель может перестать следовать исходному плану или повторить уже выполненные шаги.
Галлюцинации в вызовах инструментов: модель может сгенерировать синтаксически корректный вызов с семантически неправильными параметрами — несуществующее имя файла, некорректный SQL, неверный API-метод. Среда возвращает ошибку, и агент должен её интерпретировать и исправить. Если агент неверно читает сообщение об ошибке, он может войти в цикл повторяющихся неудачных попыток.
Неограниченные побочные эффекты: агент с доступом к файловой системе, почте или внешним API способен совершать необратимые действия. Удалённый файл, отправленное письмо, задеплоенный код — всё это нельзя откатить простым «отменить». Именно поэтому production-деплойменты агентов обычно включают явные точки подтверждения для действий с высоким риском.
Отдельная проблема — prompt injection: вредоносный текст в обрабатываемых агентом документах или веб-страницах может перехватить управление и заставить агента выполнить нежелательные действия. Исследования 2023–2025 годов показали, что существующие модели уязвимы к этому вектору атаки, а надёжных технических решений пока не существует.
Где граница между агентом и автоматизацией
Термин «агент» в индустрии применяется нестрого. Маркетинговые материалы называют агентами системы, которые по сути являются детерминированными конвейерами с одним LLM-вызовом внутри. Практически значимый критерий: агент — это система, которая принимает нетривиальные решения о том, что делать дальше, на основе наблюдений из среды, и способна отклониться от заранее прописанного сценария при изменении условий. Если граф исполнения жёстко задан в коде и LLM только заполняет шаблоны на каждом узле — это не агент, а автоматизированный конвейер.
По мере того как фреймворки (LangGraph, AutoGen, CrewAI) и протоколы (MCP) стандартизируются, порог входа для построения агентных систем снижается. Главным ограничителем остаётся не инструментальная база, а надёжность самой модели на длинных горизонтах планирования — задача, которую исследовательские группы Anthropic и OpenAI относят к числу центральных для следующего поколения систем.
Практически это означает, что сегодняшние агенты лучше всего справляются с задачами, которые можно разбить на чёткие, проверяемые шаги с детерминированным критерием успеха. Написать и запустить тест — проверяемо. Провести ресёрч по открытым источникам — проверяемо. Принять стратегическое бизнес-решение с неполной информацией — нет. Граница применимости определяется не мощностью модели, а наличием объективной обратной связи на каждом шаге цикла: если агент не может проверить, правильно ли он действовал, он не может и скорректировать курс.