#ИИ и нейросети7 мин

Оболочка важнее модели: Claude выдал 100% вместо 30% в том же тесте

Nvidia опубликовала исследование, из которого следует простая вещь: на длинных задачах результат определяет обвязка вокруг модели. Одна и та же Claude Opus 5 в тесте ARC-AGI-3 набрала 30% сама по себе и 100% внутри оболочки AVO — разница втрое, притом что модель не менялась. Оговорка важная: 100% получены на открытой части теста, закрытые наборы заданий не проверялись. Для компаний, которые внедряют ИИ, это про то, куда девать деньги и время: в выбор модели или в устройство процесса вокруг неё.

Оболочка важнее модели: Claude выдал 100% вместо 30% в том же тесте
Коротко
  • Исследование Nvidia показало: на долгих задачах решающую роль играет программная оболочка вокруг модели.
  • Claude Opus 5 внутри оболочки AVO (Agentic Variation Operators) набрала 100% в тесте ARC-AGI-3, сама по себе — 30%; это был лучший результат среди протестированных моделей без оболочки.
  • Модели OpenAI в том же тесте показали менее 10%, но настройка всего двух параметров оболочки утроила их результат.
  • Результат 100% получен на открытом наборе: 183 уровня в 25 средах. Закрытые наборы заданий ARC Prize при этом не проверялись.
  • AVO прошла все уровни за 6 624 действия — на 12% меньше, чем прежний лидер VISTA с 7 542 действиями.
  • ARC-AGI-3 (Abstraction and Reasoning Corpus for Artificial General Intelligence — «набор задач на абстракцию и рассуждение для общего искусственного интеллекта», третья версия) — это набор двумерных игр без инструкций: модель должна сама понять правила и выиграть. Результат 100% здесь означает, что агент проходит все игры так же эффективно, как человек.
  • Оболочка состоит из трёх частей: постоянной памяти между попытками, цикла надзора, который замечает застревание, и рабочего цикла «осмотреть — спланировать — сделать — оценить».
  • Задача надзорного слоя — не давать агенту уходить в сторону и зацикливаться на повторах.
  • Вывод авторов: модель — лишь часть агента, а важна система управления с инструментами, средой выполнения, навыками и библиотеками.

Что такое ИИ-агент и что вокруг модели

Языковая модель сама по себе умеет одно: получить текст и выдать ответ. Она не помнит, что было вчера, не умеет открыть файл, не может сама позвонить в другую программу.

ИИ-агентом называют конструкцию, где вокруг модели построена обвязка. В неё входят память — что уже сделано и что выяснено; инструменты — доступ к почте, базе, календарю, поиску; среда выполнения — место, где агент может запускать действия; и надзор — правила, которые останавливают его, когда он пошёл не туда.

Разница между «моделью» и «агентом» примерно как между сотрудником и рабочим местом. Можно нанять сильного человека и посадить в пустую комнату без доступов, инструкций и обратной связи — результат будет средний. Что именно входит в такое рабочее место, мы разбирали в материале про ИИ-агентов, нейросотрудников и ассистентов.

Спор о том, что важнее — сама модель или обвязка, идёт давно, и до сих пор в нём было мало цифр. Исследование Nvidia как раз про цифры.

Что произошло

Nvidia опубликовала исследование о том, как ИИ-агенты справляются с длинными задачами. Главный вывод авторов: качество результата в первую очередь определяет программная оболочка, а не базовая модель.

Проверяли на тесте ARC-AGI-3. Название расшифровывается как Abstraction and Reasoning Corpus for Artificial General Intelligence — «набор задач на абстракцию и рассуждение для общего искусственного интеллекта». Это двумерные игры, к которым не прилагается инструкция: модель должна сама разобраться в правилах, понять цель и выиграть. Такой формат проверяет способность действовать шаг за шагом и учиться по ходу; эрудиция тут почти не помогает.

Саму оболочку в Nvidia назвали AVO — Agentic Variation Operators. Это программная обвязка, которая превращает модель в самостоятельно действующего агента.

Что показали замеры

Claude Opus 5 внутри AVO набрала 100% баллов теста. Та же модель сама по себе — 30%, и это был лучший результат среди всех протестированных моделей без оболочки. Разница ровно втрое, притом что модель не менялась.

Важная оговорка про эти 100%: они получены на открытой части бенчмарка — 183 уровня в 25 средах. Закрытые наборы заданий, которые ARC Prize держит в секрете как раз для честной проверки, не тестировались. Так что «прошла весь бенчмарк» здесь сказать нельзя.

За счёт чего достигнут результат, видно по расходу действий: AVO закрыла все уровни за 6 624 хода против 7 542 у прежнего лидера — системы VISTA. Это на 12% экономнее.

Модели OpenAI в этом же тесте показали менее 10%. Показательна деталь: настройка всего двух параметров оболочки утроила их результат — модель при этом осталась прежней. Речь про формат ARC-AGI-3: на других задачах расклад между компаниями бывает обратным.

Из чего состоит оболочка

Первая часть — постоянная память. Агент переносит между попытками то, что уже пробовал, что сработало и какие выводы сделал, и опирается на это в следующих шагах.

Вторая часть — цикл надзора. Авторы описывают его роль как «генеральный директор»: он замечает, что агент застрял, ушёл в сторону от задачи или повторяет одни и те же действия, и возвращает его к цели. Именно зацикливание — типичная причина, по которой длинные автоматические сценарии заканчиваются ничем.

Третья часть — рабочий цикл самого агента: осмотреть обстановку, составить план, выполнить, оценить результат — и снова по кругу.

Общий вывод исследования сформулирован коротко: модель — это лишь часть агента, а по-настоящему важна система управления с инструментами, средой выполнения, навыками и библиотеками.

Что это значит для бизнеса

Интерес к теме заметен по поиску: «claude ai» набирает около 74 тысяч показов в месяц, вместе с уточнениями — свыше 193 тысяч, а «ии агент» с уточнениями — более 26 тысяч. Компании уже ищут, как встроить это в работу.

Практический вывод для внедрения: гонка за «самой умной моделью» отвечает за меньшую часть результата. Компания, которая потратила месяц на выбор модели и неделю на процесс, обычно получает результат хуже, чем та, что сделала наоборот.

Что в переводе на бизнес-язык означает оболочка. Память — это база знаний компании и история переписки, к которым у агента есть доступ. Инструменты — интеграции с CRM, почтой, складом. Среда выполнения — права, в которых он действует. Надзор — правила остановки и передача человеку, когда что-то идёт не так.

Отсюда и смета внедрения. Основные расходы приходятся на подключение данных, описание правил и наладку, а подписка модели оказывается меньшей частью сметы. Это скучная часть проекта, и именно её обычно недооценивают — как раз про неё пошаговая инструкция по запуску ИИ-продавца.

Есть и обратная сторона: результат в игровом тесте не переносится напрямую на работу с клиентами. ARC-AGI-3 показывает способность действовать в незнакомой среде, а в бизнесе среда обычно известна и описана.

Что это значит для специалиста

  • Владельцу бизнеса. Прежде чем менять модель, проверьте, есть ли у вашего ИИ доступ к нужным данным и понятные правила остановки. Чаще всего проблема там.
  • Руководителю проекта внедрения. Заложите в план работу над памятью и надзором отдельными задачами: это не «настройка», а половина продукта.
  • Разработчику. Зацикливание и уход от задачи — главные причины провала длинных сценариев; надзорный слой стоит проектировать сразу, а не после первых сбоев.
  • Тому, кто пишет промпты. Инструкция — часть той же обвязки: чем точнее описана задача и границы, тем меньше нагрузки на надзор. Основы собраны в разборе что такое промпт и как его писать.
  • Аналитику. Сравнивая поставщиков ИИ-решений, спрашивайте не про модель, а про память, интеграции и правила эскалации — чем отличаются ИИ-сотрудники и агенты, разбирали отдельно.

Что делать уже сейчас

  1. Посмотрите, где ваш ИИ ошибается. Если он путается в фактах о компании — дело в доступе к данным, а не в модели.
  2. Опишите правила остановки. В каких случаях агент передаёт диалог человеку и что считается тупиком.
  3. Проверьте память. Помнит ли ассистент прошлые обращения клиента и результаты своих действий.
  4. Соберите список инструментов. К каким системам агент обращается и каких доступов ему не хватает.
  5. Заведите журнал зацикливаний. Повторяющиеся действия без результата — сигнал, что нужен надзорный слой.
  6. Прежде чем менять модель, проведите тест. Один и тот же сценарий на текущей и другой модели, при одинаковой обвязке.
  7. Считайте расходы по частям. Подписка, интеграции, поддержка правил — это разные строки, и вторая обычно больше первой.

Чего ждать дальше

Ближайшее — рост интереса к обвязке как к продукту. Если результат определяется системой управления, то и продавать будут именно её: готовые каркасы агентов с памятью, надзором и наборами инструментов.

Второе — новые способы измерения. Тесты вроде ARC-AGI-3 проверяют модель в незнакомой среде, а бизнесу нужны замеры на своих сценариях. Это подталкивает компании заводить собственные наборы проверок.

Третье — смещение расходов. Чем сильнее обвязка влияет на результат, тем меньше смысла переплачивать за самую дорогую модель на рынке, если её преимущество теряется на плохой архитектуре процесса.

Частые вопросы

Что именно показало исследование Nvidia?
Что на длинных задачах результат в первую очередь определяет программная оболочка вокруг модели: управление памятью и надзорный компонент.

Какие цифры?
Claude Opus 5 внутри оболочки AVO — 100% в тесте ARC-AGI-3, сама по себе — 30%. Модели OpenAI показали менее 10%, но настройка двух параметров оболочки утроила их результат. Все 100% относятся к открытой части теста: 183 уровня в 25 средах, закрытые наборы не проверялись.

Что такое ARC-AGI-3?
Abstraction and Reasoning Corpus for Artificial General Intelligence, третья версия — набор двумерных игр без инструкций: модель должна сама понять правила и выиграть. Результат 100% означает, что агент проходит игры так же эффективно, как человек.

Что такое надзорный компонент?
Часть оболочки, которая следит, чтобы агент не отклонялся от задачи и не зацикливался на повторяющихся действиях. Авторы сравнивают его роль с генеральным директором.

Значит ли это, что модель не важна?
Нет. Вывод исследования в том, что модель — лишь часть агента, а система управления вокруг неё влияет на результат сильнее, чем принято считать.

Переносится ли это на бизнес-задачи?
С оговоркой: тест проверяет работу в незнакомой среде, а в бизнесе среда обычно описана. Но требования к памяти, инструментам и правилам остановки те же.

Промпт: аудит обвязки вашего ИИ-помощника

Опишите ассистенту, как устроен ваш ИИ-помощник, — он найдёт дыры в памяти, инструментах и правилах остановки и составит план доработки по приоритету.

Промпт
Ты — архитектор ИИ-решений с опытом внедрения агентов в компаниях. Отвечаешь за то, чтобы помощник работал на реальных данных компании, не уходил от задачи и вовремя передавал дело человеку.

ЗАДАЧА
Провести аудит обвязки вокруг моей модели: память, инструменты, среда выполнения, надзор и правила эскалации. На выходе — список дыр по приоритету и план доработки, который можно отдать в работу.

ЧТО Я ДАЮ
— что делает помощник: [задача, канал, кто с ним общается]
— какая модель используется: [название и тариф]
— к каким данным есть доступ: [база знаний, CRM, склад, почта, ничего]
— что он умеет запускать: [отправка письма, создание заявки, запись, ничего]
— типичные жалобы: [что идёт не так]
— как сейчас передаётся человеку: [правила, если есть]

ЧТО ТЫ УЧИТЫВАЕШЬ ОБ УСЛОВИЯХ
— по исследованию Nvidia, на длинных задачах результат определяет оболочка: одна и та же Claude Opus 5 набрала 100% в тесте ARC-AGI-3 с управляющей системой и 30% без неё, модели OpenAI в том же тесте — менее 10%;
— оболочка состоит из управления памятью и надзорного компонента, который не даёт агенту отклоняться от задачи и зацикливаться;
— зацикливание и потеря цели — типичные причины провала длинных автоматических сценариев;
— в бизнесе среда обычно описана, поэтому дыры чаще всего не в модели, а в доступах к данным и в правилах остановки;
— смена модели без изменения обвязки редко даёт заметный прирост;
— основные расходы внедрения приходятся на интеграции и правила, а не на подписку.

С ЧЕГО НАЧИНАЕШЬ
Недостающие данные спрашивай ПО ОДНОМУ ВОПРОСУ ЗА РАЗ. Ответы «отвечает на вопросы клиентов», «доступ есть», «иногда ошибается» не принимай — проси примеры диалогов, перечень систем и описание конкретной ошибки. Если жалоб нет в явном виде, попроси три последних неудачных диалога.

ПРОТОКОЛ
1. Разложи работу помощника на шаги и отметь, на каком шаге он берёт данные, а на каком действует.
2. Проверь память: что помнит внутри диалога, что между диалогами, где теряется контекст.
3. Проверь инструменты: к каким системам есть доступ, каких не хватает для заявленной задачи.
4. Проверь границы: что помощнику запрещено делать и как это ограничение реализовано.
5. Проверь надзор: как обнаруживается уход от задачи и зацикливание, что происходит дальше.
6. Опиши правила эскалации на человека: триггеры, канал, что передаётся вместе с диалогом.
7. Отсортируй найденные дыры по влиянию на результат и стоимости исправления.
8. Составь план доработки на две недели: задачи, ответственные роли, критерий готовности.
9. Предложи, как замерить эффект: какие показатели снять до и после.

ФОРМАТ ОТВЕТА
Начни с трёх строк: главная дыра, что она стоит компании, первое действие. Дальше таблица аудита: строки — элементы обвязки (память, инструменты, среда, надзор, эскалация), столбцы «как сейчас», «что не так», «приоритет». Отдельным блоком — план на две недели. В конце — набор показателей для замера до и после.

ПРАВИЛА
— не предлагаешь сменить модель как первый шаг: сначала обвязка;
— каждую дыру подтверждаешь примером из моих данных, а не общими словами;
— правила эскалации формулируешь так, чтобы их можно было проверить в логах;
— обещаний по качеству без замера не даёшь.
Способ зарабатывать на ИИ
Зарабатывайте на создании сайтов и ИИ-агентов
  • Собираете клиенту сайт и ИИ-продавца за вечер вместо недель разработки
  • Конструктор сайтов и ИИ-сотрудники — в одном российском сервисе
  • Бонус 1 000 ₽ при регистрации по этой ссылке вместо обычных 500 ₽
Начать бесплатно
Регистрация занимает минуту, без VPN и иностранных карт
Источники

📚Разбираем тему подробно

Все статьи
ИИ-агенты, нейросотрудники и ИИ-ассистенты: руководство для бизнеса 2026
31.01.2026#Термины ИИ и маркетинга
ИИ-агенты, нейросотрудники и ИИ-ассистенты: руководство для бизнеса 2026
ИИ-агенты, нейросотрудники и ИИ-ассистенты — три категории искусственного интеллекта, которые закрывают разные участки бизнес-процессов.
ИИ-сотрудники для бизнеса: полный гайд 2026 — что умеют, чем отличаются от автономных ИИ-агентов и как внедрить с нуля
29.05.2026#ИИ-сотрудники для бизнеса
ИИ-сотрудники для бизнеса: полный гайд 2026 — что умеют, чем отличаются от автономных ИИ-агентов и как внедрить с нуля
Рынок ИИ-инструментов для бизнеса в 2026 году взорвался. И вместе с возможностями пришла путаница: одни говорят «ИИ-сотрудник», другие — «ИИ-агент», третьи — «автономный агент».
Что такое промпт для нейросети и как написать запрос, который работает с первого раза — полный гайд 2026
22.05.2026#Промпты для нейросетей
Что такое промпт для нейросети и как написать запрос, который работает с первого раза — полный гайд 2026
Промпт — это инструкция, которую вы даёте нейросети. От того, насколько точно вы её сформулируете, зависит 80% качества ответа. Плохой промпт — размытый результат и потраченное время. Грамотный промпт — готовая работа за минуты.
Пошаговая инструкция по запуску ИИ-продавца на Ноя в 2026 году
06.03.2026#ИИ-сотрудники для бизнеса
Пошаговая инструкция по запуску ИИ-продавца на Ноя в 2026 году
ИИ-продавец — это агент, который сам отвечает клиентам в мессенджерах, отрабатывает возражения и доводит до оплаты. Собрать его можно за вечер и без программиста: разбираем каждый шаг — от настройки до проверки на живых диалогах.

🗞Другие новости

Все новости