Что такое ИИ-агент и что вокруг модели
Языковая модель сама по себе умеет одно: получить текст и выдать ответ. Она не помнит, что было вчера, не умеет открыть файл, не может сама позвонить в другую программу.
ИИ-агентом называют конструкцию, где вокруг модели построена обвязка. В неё входят память — что уже сделано и что выяснено; инструменты — доступ к почте, базе, календарю, поиску; среда выполнения — место, где агент может запускать действия; и надзор — правила, которые останавливают его, когда он пошёл не туда.
Разница между «моделью» и «агентом» примерно как между сотрудником и рабочим местом. Можно нанять сильного человека и посадить в пустую комнату без доступов, инструкций и обратной связи — результат будет средний. Что именно входит в такое рабочее место, мы разбирали в материале про ИИ-агентов, нейросотрудников и ассистентов.
Спор о том, что важнее — сама модель или обвязка, идёт давно, и до сих пор в нём было мало цифр. Исследование Nvidia как раз про цифры.
Что произошло
Nvidia опубликовала исследование о том, как ИИ-агенты справляются с длинными задачами. Главный вывод авторов: качество результата в первую очередь определяет программная оболочка, а не базовая модель.
Проверяли на тесте ARC-AGI-3. Название расшифровывается как Abstraction and Reasoning Corpus for Artificial General Intelligence — «набор задач на абстракцию и рассуждение для общего искусственного интеллекта». Это двумерные игры, к которым не прилагается инструкция: модель должна сама разобраться в правилах, понять цель и выиграть. Такой формат проверяет способность действовать шаг за шагом и учиться по ходу; эрудиция тут почти не помогает.
Саму оболочку в Nvidia назвали AVO — Agentic Variation Operators. Это программная обвязка, которая превращает модель в самостоятельно действующего агента.
Что показали замеры
Claude Opus 5 внутри AVO набрала 100% баллов теста. Та же модель сама по себе — 30%, и это был лучший результат среди всех протестированных моделей без оболочки. Разница ровно втрое, притом что модель не менялась.
Важная оговорка про эти 100%: они получены на открытой части бенчмарка — 183 уровня в 25 средах. Закрытые наборы заданий, которые ARC Prize держит в секрете как раз для честной проверки, не тестировались. Так что «прошла весь бенчмарк» здесь сказать нельзя.
За счёт чего достигнут результат, видно по расходу действий: AVO закрыла все уровни за 6 624 хода против 7 542 у прежнего лидера — системы VISTA. Это на 12% экономнее.
Модели OpenAI в этом же тесте показали менее 10%. Показательна деталь: настройка всего двух параметров оболочки утроила их результат — модель при этом осталась прежней. Речь про формат ARC-AGI-3: на других задачах расклад между компаниями бывает обратным.
Из чего состоит оболочка
Первая часть — постоянная память. Агент переносит между попытками то, что уже пробовал, что сработало и какие выводы сделал, и опирается на это в следующих шагах.
Вторая часть — цикл надзора. Авторы описывают его роль как «генеральный директор»: он замечает, что агент застрял, ушёл в сторону от задачи или повторяет одни и те же действия, и возвращает его к цели. Именно зацикливание — типичная причина, по которой длинные автоматические сценарии заканчиваются ничем.
Третья часть — рабочий цикл самого агента: осмотреть обстановку, составить план, выполнить, оценить результат — и снова по кругу.
Общий вывод исследования сформулирован коротко: модель — это лишь часть агента, а по-настоящему важна система управления с инструментами, средой выполнения, навыками и библиотеками.
Что это значит для бизнеса
Интерес к теме заметен по поиску: «claude ai» набирает около 74 тысяч показов в месяц, вместе с уточнениями — свыше 193 тысяч, а «ии агент» с уточнениями — более 26 тысяч. Компании уже ищут, как встроить это в работу.
Практический вывод для внедрения: гонка за «самой умной моделью» отвечает за меньшую часть результата. Компания, которая потратила месяц на выбор модели и неделю на процесс, обычно получает результат хуже, чем та, что сделала наоборот.
Что в переводе на бизнес-язык означает оболочка. Память — это база знаний компании и история переписки, к которым у агента есть доступ. Инструменты — интеграции с CRM, почтой, складом. Среда выполнения — права, в которых он действует. Надзор — правила остановки и передача человеку, когда что-то идёт не так.
Отсюда и смета внедрения. Основные расходы приходятся на подключение данных, описание правил и наладку, а подписка модели оказывается меньшей частью сметы. Это скучная часть проекта, и именно её обычно недооценивают — как раз про неё пошаговая инструкция по запуску ИИ-продавца.
Есть и обратная сторона: результат в игровом тесте не переносится напрямую на работу с клиентами. ARC-AGI-3 показывает способность действовать в незнакомой среде, а в бизнесе среда обычно известна и описана.
Что это значит для специалиста
- Владельцу бизнеса. Прежде чем менять модель, проверьте, есть ли у вашего ИИ доступ к нужным данным и понятные правила остановки. Чаще всего проблема там.
- Руководителю проекта внедрения. Заложите в план работу над памятью и надзором отдельными задачами: это не «настройка», а половина продукта.
- Разработчику. Зацикливание и уход от задачи — главные причины провала длинных сценариев; надзорный слой стоит проектировать сразу, а не после первых сбоев.
- Тому, кто пишет промпты. Инструкция — часть той же обвязки: чем точнее описана задача и границы, тем меньше нагрузки на надзор. Основы собраны в разборе что такое промпт и как его писать.
- Аналитику. Сравнивая поставщиков ИИ-решений, спрашивайте не про модель, а про память, интеграции и правила эскалации — чем отличаются ИИ-сотрудники и агенты, разбирали отдельно.
Что делать уже сейчас
- Посмотрите, где ваш ИИ ошибается. Если он путается в фактах о компании — дело в доступе к данным, а не в модели.
- Опишите правила остановки. В каких случаях агент передаёт диалог человеку и что считается тупиком.
- Проверьте память. Помнит ли ассистент прошлые обращения клиента и результаты своих действий.
- Соберите список инструментов. К каким системам агент обращается и каких доступов ему не хватает.
- Заведите журнал зацикливаний. Повторяющиеся действия без результата — сигнал, что нужен надзорный слой.
- Прежде чем менять модель, проведите тест. Один и тот же сценарий на текущей и другой модели, при одинаковой обвязке.
- Считайте расходы по частям. Подписка, интеграции, поддержка правил — это разные строки, и вторая обычно больше первой.
Чего ждать дальше
Ближайшее — рост интереса к обвязке как к продукту. Если результат определяется системой управления, то и продавать будут именно её: готовые каркасы агентов с памятью, надзором и наборами инструментов.
Второе — новые способы измерения. Тесты вроде ARC-AGI-3 проверяют модель в незнакомой среде, а бизнесу нужны замеры на своих сценариях. Это подталкивает компании заводить собственные наборы проверок.
Третье — смещение расходов. Чем сильнее обвязка влияет на результат, тем меньше смысла переплачивать за самую дорогую модель на рынке, если её преимущество теряется на плохой архитектуре процесса.
Частые вопросы
Что именно показало исследование Nvidia?
Что на длинных задачах результат в первую очередь определяет программная оболочка вокруг модели: управление памятью и надзорный компонент.
Какие цифры?
Claude Opus 5 внутри оболочки AVO — 100% в тесте ARC-AGI-3, сама по себе — 30%. Модели OpenAI показали менее 10%, но настройка двух параметров оболочки утроила их результат. Все 100% относятся к открытой части теста: 183 уровня в 25 средах, закрытые наборы не проверялись.
Что такое ARC-AGI-3?
Abstraction and Reasoning Corpus for Artificial General Intelligence, третья версия — набор двумерных игр без инструкций: модель должна сама понять правила и выиграть. Результат 100% означает, что агент проходит игры так же эффективно, как человек.
Что такое надзорный компонент?
Часть оболочки, которая следит, чтобы агент не отклонялся от задачи и не зацикливался на повторяющихся действиях. Авторы сравнивают его роль с генеральным директором.
Значит ли это, что модель не важна?
Нет. Вывод исследования в том, что модель — лишь часть агента, а система управления вокруг неё влияет на результат сильнее, чем принято считать.
Переносится ли это на бизнес-задачи?
С оговоркой: тест проверяет работу в незнакомой среде, а в бизнесе среда обычно описана. Но требования к памяти, инструментам и правилам остановки те же.
