#ИИ и нейросети7 мин

Оболочка важнее модели: Claude выдал 100% вместо 30% в том же тесте

Nvidia опубликовала исследование, из которого следует простая вещь: на длинных задачах результат определяет обвязка вокруг модели. Одна и та же Claude Opus 5 в тесте ARC-AGI-3 набрала 30% сама по себе и 100% внутри оболочки AVO — разница втрое, притом что модель не менялась. Оговорка важная: 100% получены на открытой части теста, закрытые наборы заданий не проверялись. Для компаний, которые внедряют ИИ, это про то, куда девать деньги и время: в выбор модели или в устройство процесса вокруг неё.

Оболочка важнее модели: Claude выдал 100% вместо 30% в том же тесте
Коротко
  • Исследование Nvidia показало: на долгих задачах решающую роль играет программная оболочка вокруг модели.
  • Claude Opus 5 внутри оболочки AVO (Agentic Variation Operators) набрала 100% в тесте ARC-AGI-3, сама по себе — 30%; это был лучший результат среди протестированных моделей без оболочки.
  • Модели OpenAI в том же тесте показали менее 10%, но настройка всего двух параметров оболочки утроила их результат.
  • Результат 100% получен на открытом наборе: 183 уровня в 25 средах. Закрытые наборы заданий ARC Prize при этом не проверялись.
  • AVO прошла все уровни за 6 624 действия — на 12% меньше, чем прежний лидер VISTA с 7 542 действиями.
  • ARC-AGI-3 (Abstraction and Reasoning Corpus for Artificial General Intelligence — «набор задач на абстракцию и рассуждение для общего искусственного интеллекта», третья версия) — это набор двумерных игр без инструкций: модель должна сама понять правила и выиграть. Результат 100% здесь означает, что агент проходит все игры так же эффективно, как человек.
  • Оболочка состоит из трёх частей: постоянной памяти между попытками, цикла надзора, который замечает застревание, и рабочего цикла «осмотреть — спланировать — сделать — оценить».
  • Задача надзорного слоя — не давать агенту уходить в сторону и зацикливаться на повторах.
  • Вывод авторов: модель — лишь часть агента, а важна система управления с инструментами, средой выполнения, навыками и библиотеками.

Что такое ИИ-агент и что вокруг модели

Языковая модель сама по себе умеет одно: получить текст и выдать ответ. Она не помнит, что было вчера, не умеет открыть файл, не может сама позвонить в другую программу.

ИИ-агентом называют конструкцию, где вокруг модели построена обвязка. В неё входят память — что уже сделано и что выяснено; инструменты — доступ к почте, базе, календарю, поиску; среда выполнения — место, где агент может запускать действия; и надзор — правила, которые останавливают его, когда он пошёл не туда.

Разница между «моделью» и «агентом» примерно как между сотрудником и рабочим местом. Можно нанять сильного человека и посадить в пустую комнату без доступов, инструкций и обратной связи — результат будет средний. Что именно входит в такое рабочее место, мы разбирали в материале про ИИ-агентов, нейросотрудников и ассистентов.

Спор о том, что важнее — сама модель или обвязка, идёт давно, и до сих пор в нём было мало цифр. Исследование Nvidia как раз про цифры.

Что произошло

Nvidia опубликовала исследование о том, как ИИ-агенты справляются с длинными задачами. Главный вывод авторов: качество результата в первую очередь определяет программная оболочка, а не базовая модель.

Проверяли на тесте ARC-AGI-3. Название расшифровывается как Abstraction and Reasoning Corpus for Artificial General Intelligence — «набор задач на абстракцию и рассуждение для общего искусственного интеллекта». Это двумерные игры, к которым не прилагается инструкция: модель должна сама разобраться в правилах, понять цель и выиграть. Такой формат проверяет способность действовать шаг за шагом и учиться по ходу; эрудиция тут почти не помогает.

Саму оболочку в Nvidia назвали AVO — Agentic Variation Operators. Это программная обвязка, которая превращает модель в самостоятельно действующего агента.

Что показали замеры

Claude Opus 5 внутри AVO набрала 100% баллов теста. Та же модель сама по себе — 30%, и это был лучший результат среди всех протестированных моделей без оболочки. Разница ровно втрое, притом что модель не менялась.

Важная оговорка про эти 100%: они получены на открытой части бенчмарка — 183 уровня в 25 средах. Закрытые наборы заданий, которые ARC Prize держит в секрете как раз для честной проверки, не тестировались. Так что «прошла весь бенчмарк» здесь сказать нельзя.

За счёт чего достигнут результат, видно по расходу действий: AVO закрыла все уровни за 6 624 хода против 7 542 у прежнего лидера — системы VISTA. Это на 12% экономнее.

Модели OpenAI в этом же тесте показали менее 10%. Показательна деталь: настройка всего двух параметров оболочки утроила их результат — модель при этом осталась прежней. Речь про формат ARC-AGI-3: на других задачах расклад между компаниями бывает обратным.

Из чего состоит оболочка

Первая часть — постоянная память. Агент переносит между попытками то, что уже пробовал, что сработало и какие выводы сделал, и опирается на это в следующих шагах.

Вторая часть — цикл надзора. Авторы описывают его роль как «генеральный директор»: он замечает, что агент застрял, ушёл в сторону от задачи или повторяет одни и те же действия, и возвращает его к цели. Именно зацикливание — типичная причина, по которой длинные автоматические сценарии заканчиваются ничем.

Третья часть — рабочий цикл самого агента: осмотреть обстановку, составить план, выполнить, оценить результат — и снова по кругу.

Общий вывод исследования сформулирован коротко: модель — это лишь часть агента, а по-настоящему важна система управления с инструментами, средой выполнения, навыками и библиотеками.

Что это значит для бизнеса

Интерес к теме заметен по поиску: «claude ai» набирает около 74 тысяч показов в месяц, вместе с уточнениями — свыше 193 тысяч, а «ии агент» с уточнениями — более 26 тысяч. Компании уже ищут, как встроить это в работу.

Практический вывод для внедрения: гонка за «самой умной моделью» отвечает за меньшую часть результата. Компания, которая потратила месяц на выбор модели и неделю на процесс, обычно получает результат хуже, чем та, что сделала наоборот.

Что в переводе на бизнес-язык означает оболочка. Память — это база знаний компании и история переписки, к которым у агента есть доступ. Инструменты — интеграции с CRM, почтой, складом. Среда выполнения — права, в которых он действует. Надзор — правила остановки и передача человеку, когда что-то идёт не так.

Отсюда и смета внедрения. Основные расходы приходятся на подключение данных, описание правил и наладку, а подписка модели оказывается меньшей частью сметы. Это скучная часть проекта, и именно её обычно недооценивают — как раз про неё пошаговая инструкция по запуску ИИ-продавца.

Есть и обратная сторона: результат в игровом тесте не переносится напрямую на работу с клиентами. ARC-AGI-3 показывает способность действовать в незнакомой среде, а в бизнесе среда обычно известна и описана.

Что это значит для специалиста

  • Владельцу бизнеса. Прежде чем менять модель, проверьте, есть ли у вашего ИИ доступ к нужным данным и понятные правила остановки. Чаще всего проблема там.
  • Руководителю проекта внедрения. Заложите в план работу над памятью и надзором отдельными задачами: это не «настройка», а половина продукта.
  • Разработчику. Зацикливание и уход от задачи — главные причины провала длинных сценариев; надзорный слой стоит проектировать сразу, а не после первых сбоев.
  • Тому, кто пишет промпты. Инструкция — часть той же обвязки: чем точнее описана задача и границы, тем меньше нагрузки на надзор. Основы собраны в разборе что такое промпт и как его писать.
  • Аналитику. Сравнивая поставщиков ИИ-решений, спрашивайте не про модель, а про память, интеграции и правила эскалации — чем отличаются ИИ-сотрудники и агенты, разбирали отдельно.

Что делать уже сейчас

  1. Посмотрите, где ваш ИИ ошибается. Если он путается в фактах о компании — дело в доступе к данным, а не в модели.
  2. Опишите правила остановки. В каких случаях агент передаёт диалог человеку и что считается тупиком.
  3. Проверьте память. Помнит ли ассистент прошлые обращения клиента и результаты своих действий.
  4. Соберите список инструментов. К каким системам агент обращается и каких доступов ему не хватает.
  5. Заведите журнал зацикливаний. Повторяющиеся действия без результата — сигнал, что нужен надзорный слой.
  6. Прежде чем менять модель, проведите тест. Один и тот же сценарий на текущей и другой модели, при одинаковой обвязке.
  7. Считайте расходы по частям. Подписка, интеграции, поддержка правил — это разные строки, и вторая обычно больше первой.

Чего ждать дальше

Ближайшее — рост интереса к обвязке как к продукту. Если результат определяется системой управления, то и продавать будут именно её: готовые каркасы агентов с памятью, надзором и наборами инструментов.

Второе — новые способы измерения. Тесты вроде ARC-AGI-3 проверяют модель в незнакомой среде, а бизнесу нужны замеры на своих сценариях. Это подталкивает компании заводить собственные наборы проверок.

Третье — смещение расходов. Чем сильнее обвязка влияет на результат, тем меньше смысла переплачивать за самую дорогую модель на рынке, если её преимущество теряется на плохой архитектуре процесса.

Частые вопросы

Что именно показало исследование Nvidia?
Что на длинных задачах результат в первую очередь определяет программная оболочка вокруг модели: управление памятью и надзорный компонент.

Какие цифры?
Claude Opus 5 внутри оболочки AVO — 100% в тесте ARC-AGI-3, сама по себе — 30%. Модели OpenAI показали менее 10%, но настройка двух параметров оболочки утроила их результат. Все 100% относятся к открытой части теста: 183 уровня в 25 средах, закрытые наборы не проверялись.

Что такое ARC-AGI-3?
Abstraction and Reasoning Corpus for Artificial General Intelligence, третья версия — набор двумерных игр без инструкций: модель должна сама понять правила и выиграть. Результат 100% означает, что агент проходит игры так же эффективно, как человек.

Что такое надзорный компонент?
Часть оболочки, которая следит, чтобы агент не отклонялся от задачи и не зацикливался на повторяющихся действиях. Авторы сравнивают его роль с генеральным директором.

Значит ли это, что модель не важна?
Нет. Вывод исследования в том, что модель — лишь часть агента, а система управления вокруг неё влияет на результат сильнее, чем принято считать.

Переносится ли это на бизнес-задачи?
С оговоркой: тест проверяет работу в незнакомой среде, а в бизнесе среда обычно описана. Но требования к памяти, инструментам и правилам остановки те же.

Промпт: аудит обвязки вашего ИИ-помощника

Опишите ассистенту, как устроен ваш ИИ-помощник, — он найдёт дыры в памяти, инструментах и правилах остановки и составит план доработки по приоритету.

Промпт
Ты — архитектор ИИ-решений с опытом внедрения агентов в компаниях. Отвечаешь за то, чтобы помощник работал на реальных данных компании, не уходил от задачи и вовремя передавал дело человеку.

ЗАДАЧА
Провести аудит обвязки вокруг моей модели: память, инструменты, среда выполнения, надзор и правила эскалации. На выходе — список дыр по приоритету и план доработки, который можно отдать в работу.

ЧТО Я ДАЮ
— что делает помощник: [задача, канал, кто с ним общается]
— какая модель используется: [название и тариф]
— к каким данным есть доступ: [база знаний, CRM, склад, почта, ничего]
— что он умеет запускать: [отправка письма, создание заявки, запись, ничего]
— типичные жалобы: [что идёт не так]
— как сейчас передаётся человеку: [правила, если есть]

ЧТО ТЫ УЧИТЫВАЕШЬ ОБ УСЛОВИЯХ
— по исследованию Nvidia, на длинных задачах результат определяет оболочка: одна и та же Claude Opus 5 набрала 100% в тесте ARC-AGI-3 с управляющей системой и 30% без неё, модели OpenAI в том же тесте — менее 10%;
— оболочка состоит из управления памятью и надзорного компонента, который не даёт агенту отклоняться от задачи и зацикливаться;
— зацикливание и потеря цели — типичные причины провала длинных автоматических сценариев;
— в бизнесе среда обычно описана, поэтому дыры чаще всего не в модели, а в доступах к данным и в правилах остановки;
— смена модели без изменения обвязки редко даёт заметный прирост;
— основные расходы внедрения приходятся на интеграции и правила, а не на подписку.

С ЧЕГО НАЧИНАЕШЬ
Недостающие данные спрашивай ПО ОДНОМУ ВОПРОСУ ЗА РАЗ. Ответы «отвечает на вопросы клиентов», «доступ есть», «иногда ошибается» не принимай — проси примеры диалогов, перечень систем и описание конкретной ошибки. Если жалоб нет в явном виде, попроси три последних неудачных диалога.

ПРОТОКОЛ
1. Разложи работу помощника на шаги и отметь, на каком шаге он берёт данные, а на каком действует.
2. Проверь память: что помнит внутри диалога, что между диалогами, где теряется контекст.
3. Проверь инструменты: к каким системам есть доступ, каких не хватает для заявленной задачи.
4. Проверь границы: что помощнику запрещено делать и как это ограничение реализовано.
5. Проверь надзор: как обнаруживается уход от задачи и зацикливание, что происходит дальше.
6. Опиши правила эскалации на человека: триггеры, канал, что передаётся вместе с диалогом.
7. Отсортируй найденные дыры по влиянию на результат и стоимости исправления.
8. Составь план доработки на две недели: задачи, ответственные роли, критерий готовности.
9. Предложи, как замерить эффект: какие показатели снять до и после.

ФОРМАТ ОТВЕТА
Начни с трёх строк: главная дыра, что она стоит компании, первое действие. Дальше таблица аудита: строки — элементы обвязки (память, инструменты, среда, надзор, эскалация), столбцы «как сейчас», «что не так», «приоритет». Отдельным блоком — план на две недели. В конце — набор показателей для замера до и после.

ПРАВИЛА
— не предлагаешь сменить модель как первый шаг: сначала обвязка;
— каждую дыру подтверждаешь примером из моих данных, а не общими словами;
— правила эскалации формулируешь так, чтобы их можно было проверить в логах;
— обещаний по качеству без замера не даёшь.

Следующий шаг: поручите ии-архитектору находить дыры в обвязке вашего ии-помощника

Промпт выше вставляется в Ною как инструкция ИИ-сотрудника без правок. В Телеграме вы присылаете описание помощника — какие данные он видит, что умеет запускать, три последних неудачных диалога — и получаете список дыр по приоритету с планом доработки на две недели. После правок достаточно прислать обновлённое описание и свежие жалобы клиентов, чтобы проверить обвязку заново.

  • Архитектура помощника и правила эскалации вписываются в инструкцию один раз: перед каждой новой проверкой заново их объяснять не нужно.
  • Регламенты и примеры провальных диалогов загружаются в базу знаний сотрудника, и план доработки строится на них, а не на общих схемах.
  • Российский сервис, оплата в рублях, 7 дней бесплатно и без карты. По ссылке из новости на ответы начисляется 1 000 ₽ вместо 500 ₽.

Собрать ИИ-архитектора в Ное →

Источники

💬 Комментарии

Пока никто не написал. Будьте первым: расскажите, что оказалось полезным, а чего не хватило.
Ссылки в комментариях не публикуются.

📚Разбираем тему подробно

Все статьи
ИИ-агенты, нейросотрудники и ИИ-ассистенты: что это, чем отличаются, как создать и сколько стоит в 2026 году
31.01.2026#Термины ИИ и маркетинга
ИИ-агенты, нейросотрудники и ИИ-ассистенты: что это, чем отличаются, как создать и сколько стоит в 2026 году
ИИ-ассистент помогает сотруднику внутри нейросети, нейросотрудник отвечает клиентам в мессенджерах и передаёт человеку по триггерам, ИИ-агент сам выбирает инструменты и доводит процесс до документа или сделки. Разница в одном: сколько процесса закрывается без человека.
ИИ-сотрудники для бизнеса в 2026: цены, тест на 6 моделях и данные 151 тысячи диалогов
29.05.2026#ИИ-сотрудники для бизнеса
ИИ-сотрудники для бизнеса в 2026: цены, тест на 6 моделях и данные 151 тысячи диалогов
ИИ-сотрудник это программа на языковой модели, которая отвечает клиентам по вашей базе знаний. За 30 дней до 7 октября 2026 года на платформе Ноя у 437 компаний начались 151 666 диалогов, диалог в среднем стоил 8,60 ₽. Мы сверили цены сервисов и проверили 6 моделей на диалоге из 8 реплик с ловушками: без правил 17 диалогов из 18 дали категоричный отказ, которого нет в базе знаний.
Что такое промпт для нейросети и как написать запрос, который работает с первого раза — полный гайд 2026
22.05.2026#Промпты для нейросетей
Что такое промпт для нейросети и как написать запрос, который работает с первого раза — полный гайд 2026
Промпт — это инструкция, которую вы даёте нейросети. От того, насколько точно вы её сформулируете, зависит 80% качества ответа. Плохой промпт — размытый результат и потраченное время. Грамотный промпт — готовая работа за минуты.
Пошаговая инструкция по запуску ИИ-продавца на Ноя в 2026 году
06.03.2026#ИИ-сотрудники для бизнеса
Пошаговая инструкция по запуску ИИ-продавца на Ноя в 2026 году
ИИ-продавец — это агент, который сам отвечает клиентам в мессенджерах, отрабатывает возражения и доводит до оплаты. Собрать его можно за вечер и без программиста: разбираем каждый шаг — от настройки до проверки на живых диалогах.

🗞Другие новости

Все новости
Реклама на Ozon с 20 октября: «Оплата за заказ» до 28%, расчёт
7 октября, 06:50#Маркетплейсы
Реклама на Ozon с 20 октября: «Оплата за заказ» до 28%, расчёт
Telegram-канал Marketplace_biz сообщил, что с 20 октября Ozon повысит ставки в нескольких рекламных инструментах. «Оплата за заказ» для отдельных товаров вырастет с 23% до 28% от стоимости заказа, продвижение всего ассортимента подорожает с 5%, 7% и 9% до 6%, 8% и 10%, а минимальный CPC (цена клика) в поиске поднимется в среднем на 19%. Новость 6 октября пересказал «Оборот». Официальных условий Ozon на 7 октября мы в открытых источниках не нашли, поэтому изменения даны по сообщению канала. Текущие ставки 23% и 5–9% подтверждаются отдельным разбором Selsup. Ниже наш расчёт: что это значит на заказе в 1 000 ₽ и как проверить свой товар промптом.
Poizon для продавцов из России: комиссия до 29% и два сайта-двойника
7 октября, 06:42#Маркетплейсы
Poizon для продавцов из России: комиссия до 29% и два сайта-двойника
Китайский маркетплейс Poizon рассказал «Коммерсанту», какие условия предлагает российским продавцам: комиссия не выше 29%, а у «премиум»-продавцов от 19%. По данным Союза продавцов маркетплейсов, на российских площадках ставки доходят до 55%. Выплаты через 7 дней после продажи, а склад может быть и у площадки, и у продавца. В России работают два сайта с названием Poizon, и компании судятся из-за бренда. Мы посчитали, сколько остаётся с куртки за 15 000 ₽ при ставках 45%, 29% и 19%: 728, 3 128 и 4 628 ₽ с единицы до налогов. Ниже условия, как отличить настоящий сайт, и промпт для расчёта по вашему товару.
Алиса AI в коммерческой выдаче: быстрые ответы выросли с 0,1% до 15%
7 октября, 06:36#ИИ и нейросети
Алиса AI в коммерческой выдаче: быстрые ответы выросли с 0,1% до 15%
Алиса AI всё чаще отвечает на коммерческие запросы. В апреле 2026 быстрый ответ показывался только на 1 запрос из 1 000, а в июле примерно на 15% запросов выборки по интернет-торговле, сообщили 6 октября «Ашманов и партнёры». Источниками служат страницы из топ-10 Яндекса: по пять на запрос, больше половины из топ-5. Мы сняли топ-10 по 12 коммерческим запросам магазинов. На 122 места пришлось 82 домена, но 7 крупнейших держат 34% мест, а 70 доменов встретились по одному разу. Ниже разбор отчёта, наш замер и промпт, который проверяет страницу магазина по 6 признакам.