#Исследования и наука7 мин

Исследование: база знаний помогает ИИ только на своих данных

21 сентября 2026 года вышла новая версия работы двух исследователей, Мадхулатхи Мандарапу и Сандипа Кункунуру, которые проверили простую вещь: помогает ли ИИ-модели подключённая база знаний. Ответ получился неудобный для тех, кто продаёт «подключим вашу базу и всё заработает». На публичных медицинских фактах, которые модель и так видела при обучении, подключение базы знаний не дало ничего: разница в точности во всех проверках оказалась не больше 3,4 процентных пункта. Зато на фактах, которых в модели не было, тот же самый механизм поднял точность с уровня угадывания почти до 100%, то есть на 68–79 процентных пунктов. Вывод авторов звучит так: подключение внешних знаний помогает ровно настолько, насколько решающий факт лежит за пределами обучения модели. Публичные факты избыточны, окупаются приватные и новые данные: ваша собственная база цен, условий и правил, которой в интернете нет.

Исследование: база знаний помогает ИИ только на своих данных
Коротко
  • Что проверяли: помогает ли ИИ-модели доступ к структурированной базе знаний (графу) при ответах на медицинские вопросы — на публичной базе PrimeKG.
  • На известных фактах — ноль: ни простое извлечение фактов, ни агент, который сам пишет запросы к базе (82% запросов отрабатывали успешно), не улучшили результат. Разброс во всех парах проверок не превысил 3,4 процентных пункта.
  • На неизвестных фактах — решающая разница: на синтетической базе с выдуманными связями и на смешанном наборе точность выросла с уровня случайного угадывания почти до 100%.
  • Попутная находка: громкий результат другого исследования (около 88 баллов на HealthBench) оказался оценкой по облегчённому варианту набора; на полном наборе и топовые модели, и эталонные ответы врача набирают 46–47.
  • 🔎 Что это значит для бизнеса: базу знаний в ИИ-агента имеет смысл заводить не «для общей эрудиции», а под то, чего модель знать не может — ваши цены, условия, сроки, регламенты и историю клиента.

Что произошло

На arXiv обновилась работа «Knowledge-Graph Grounding Helps LLMs Only for Out-of-Training Knowledge». Это контролируемое исследование о том, когда подключение внешней базы знаний реально улучшает ответы языковой модели. Первая версия вышла в июне 2026 года, третья 21 сентября.

Это препринт: работа выложена авторами и ещё не прошла рецензирование в журнале. Читать её надо как «авторы заявляют и показывают код», а не как установленный факт. Код эксперимента авторы выложили открыто, и это заметно повышает доверие: результат можно перепроверить.

Как устроен эксперимент

Исследователи взяли медицинские вопросы (набор MedQA) и подключали к моделям публичную биомедицинскую базу знаний PrimeKG двумя способами:

  1. Простое извлечение. Из базы достаются подходящие факты и кладутся в запрос.
  2. Агентный цикл. Модель сама формулирует запрос к базе на языке запросов Cypher, получает ответ, при необходимости переспрашивает. Успешно отрабатывали 82% таких запросов.

Дальше то же самое повторили на двух других наборах: на искусственной базе, где связи специально выдуманы (модель точно не могла их видеть при обучении), и на смешанном наборе, где часть фактов известна, а часть — нет.

Где проверялиЧто знает модель заранееЧто дало подключение базы
Публичная база PrimeKG, вопросы MedQAпочти всёразница в пределах 3,4 п. п., то есть ничего
Искусственная база с выдуманными связяминичегос уровня угадывания почти до 100%
Смешанный набор: известное + новоечастично+68–79 п. п. на новой части, ноль на известной

Отдельная деталь: на искусственной базе правильный ответ выдавала даже связка без языковой модели вообще. То есть там, где факт лежит в базе, работу делает не «интеллект» модели, а обычный поиск по данным.

Почему это важно тем, кто внедряет ИИ-агентов

Самая частая идея при запуске ИИ-сотрудника звучит так: «загрузим в него всё, что есть, — и он станет умнее». Работа показывает, что от загрузки общеизвестного в ответах не меняется ничего, зато растёт счёт за токены: каждый лишний факт в запросе оплачивается.

Полезны оказываются ровно те данные, которых в интернете нет:

  • ваш прайс и актуальные акции;
  • условия доставки, сроки, гарантии и правила возврата именно вашей компании;
  • регламенты: что отвечать, когда товара нет, и когда звать человека;
  • история конкретного клиента и его заказов.

Мы разбирали это на практике в материале про ИИ-агентов и нейросотрудников: агент, который отвечает по своей базе, и агент, которому «загрузили интернет», ведут себя по-разному именно на вопросах о цене и условиях.

Вторая находка: как читаются громкие цифры

По дороге авторы перепроверили результат другой работы, о которой писали как о доказательстве превосходства универсальных моделей над специализированными медицинскими инструментами. Заявленные около 88 баллов на наборе HealthBench оказались оценкой по его облегчённому варианту (Consensus). На полном наборе с проверкой по шкале, откалиброванной врачами, и передовые модели, и эталонные ответы набирают 46–47 баллов.

Это ровно та ситуация, про которую мы писали в разборе галлюцинаций нейросетей: цифра сама по себе ничего не значит, пока не известно, на каком наборе и по какой шкале она получена.

Что делать уже сейчас

  1. Разделить базу знаний агента на две части: общеизвестное (модель это и так знает, можно выкинуть) и своё (оставить и держать в актуальном состоянии).
  2. Посчитать, сколько знаков уходит в каждый запрос: длинная база это не только качество, но и деньги за токены при каждом ответе.
  3. Проверить агента на двадцати реальных вопросах клиентов дважды — с базой и без неё. Если ответы не различаются, база подключена зря.
  4. Сначала свериться с тем, как модель вообще удерживает большой объём данных — мы разбирали это в материале про контекстное окно.
  5. Любую громкую цифру из отчёта о качестве ИИ проверять по методике: какой набор, какая шкала, кто оценивал.

Частые вопросы

Это значит, что база знаний не нужна? Наоборот: нужна, но только со своими данными. Работа показывает, что публичные факты дублируют то, что модель уже знает.

Работа медицинская — при чём тут продажи? Механика одинаковая: вопрос «какая дозировка у препарата» и вопрос «какая у вас цена на доставку в Казань» отличаются для модели только одним: есть ли ответ в её обучении. Цен вашей компании там нет.

Что такое препринт? Статья, которую авторы выложили сами, до проверки другими учёными. Её ценность в открытых данных и коде: результат можно воспроизвести.

Можно ли верить цифре +68–79 пунктов? Это прирост на специально сконструированных данных, где модель заведомо не знала ответа. Он показывает верхнюю границу пользы от базы, а не типичный результат внедрения.

Промпт: вычистить базу знаний ИИ-агента от того, что модель и так знает

Вставьте содержимое своей базы знаний (или её оглавление) и список реальных вопросов клиентов. На выходе получите разделение на «своё — оставить» и «общеизвестное — выкинуть», оценку экономии на токенах и список пробелов, которые надо дописать.

Промпт
Ты — инженер по базам знаний для ИИ-агентов поддержки и продаж. Твоя компетенция — отделять данные, которых нет в обучении модели, от общеизвестных сведений, и собирать из первых компактную базу.

ЗАДАЧА
Разобрать текущую базу знаний агента и оставить в ней только то, что реально меняет ответ: собственные данные компании. Общеизвестное пометить на удаление, пробелы — на заполнение.

ЧТО Я ДАЮ
— содержимое базы знаний или её оглавление: [вставить текст или список разделов]
— сфера и продукт: [что продаёте или обслуживаете]
— 15–20 реальных вопросов клиентов за последний месяц: [список]
— чем отвечает агент сейчас: [модель, примерный объём базы в знаках]

ПРОТОКОЛ РАБОТЫ
1. Раздели содержимое базы на три группы: «только наше» (цены, условия, сроки, регламенты, история клиента), «общеизвестное» (определения, описания технологий, общие советы), «спорное» (отраслевые нормы, которые модель может знать неточно).
2. Для каждого реального вопроса клиента укажи, откуда берётся ответ: из группы «только наше», из знаний модели или ниоткуда — это пробел.
3. Выдели вопросы, где ошибка стоит денег (цена, сроки, гарантия, возврат, юридические условия), и пометь их как обязательные для базы.
4. Оцени объём в знаках по каждой группе и посчитай, какая доля запроса уходит на общеизвестное.
5. Составь список пробелов: вопросы клиентов, на которые в базе нет ответа, с формулировкой, какие данные нужно собрать и у кого.
6. Предложи структуру сокращённой базы: разделы, порядок, что вынести в отдельные карточки, а что — в регламент «когда звать человека».
7. Опиши проверку: по каким пяти вопросам сравнить ответы агента до и после сокращения базы и какой результат считать успешным.

ФОРМАТ ОТВЕТА
Сначала таблица «Раздел базы — группа — оставить или убрать — почему». Затем таблица «Вопрос клиента — источник ответа — риск ошибки». Затем список пробелов. Затем структура новой базы. В конце — план проверки из пяти пунктов.

ЕСЛИ ДАННЫХ НЕ ХВАТАЕТ
Не придумывай цены, условия и сроки: спрашивай. Если не указано, какие вопросы приходят от клиентов, задай три уточняющих вопроса и только потом предлагай структуру. Любое предположение помечай словом «предположение».
Способ зарабатывать на ИИ
Зарабатывайте на создании сайтов и ИИ-агентов
  • Собираете клиенту сайт и ИИ-продавца за вечер вместо недель разработки
  • Конструктор сайтов и ИИ-сотрудники — в одном российском сервисе
  • Бонус 1 000 ₽ при регистрации по этой ссылке вместо обычных 500 ₽
Начать бесплатно
Регистрация занимает минуту, без VPN и иностранных карт
Источники

💬 Комментарии

Пока никто не написал. Будьте первым: расскажите, что оказалось полезным, а чего не хватило.
Ссылки в комментариях не публикуются.

📚Разбираем тему подробно

Все статьи
ИИ-агенты, нейросотрудники и ИИ-ассистенты: что это, чем отличаются, как создать и сколько стоит в 2026 году
31.01.2026#Термины ИИ и маркетинга
ИИ-агенты, нейросотрудники и ИИ-ассистенты: что это, чем отличаются, как создать и сколько стоит в 2026 году
ИИ-ассистент помогает сотруднику внутри нейросети, нейросотрудник отвечает клиентам в мессенджерах и передаёт человеку по триггерам, ИИ-агент сам выбирает инструменты и доводит процесс до документа или сделки. Разница в одном: сколько процесса закрывается без человека.
Галлюцинации нейросети: что это, почему модель выдумывает и мой замер на 464 ответах восьми моделей
16.09.2026#Термины ИИ и маркетинга
Галлюцинации нейросети: что это, почему модель выдумывает и мой замер на 464 ответах восьми моделей
Галлюцинация нейросети это уверенный ответ, в котором факт выдуман: несуществующий закон, неверная цифра, книга, которой не было. Я задал 8 моделям 19 проверяемых вопросов и 10 ловушек про несуществующее, дважды, и получил 464 ответа: 5 моделей из 8 уверенно назвали ЛитРес чужой ИНН.
LLM: что это такое простыми словами, как работает и сколько стоит ответ
15.09.2026#Термины ИИ и маркетинга
LLM: что это такое простыми словами, как работает и сколько стоит ответ
LLM это программа, которая прочитала триллионы слов и продолжает любой текст как человек. Я измерил, во сколько токенов обходится русский текст у 8 моделей и сколько стоит один ответ клиенту: от 0,8 до 38 копеек, причём самая дешёвая модель потеряла половину условий доставки.
Контекстное окно нейросети: что это, сколько влезает и почему модель забывает начало
15.09.2026#Термины ИИ и маркетинга
Контекстное окно нейросети: что это, сколько влезает и почему модель забывает начало
Контекстное окно это предел объёма текста, который нейросеть учитывает при ответе: инструкция, документы, история и сам ответ. Что не поместилось, модели не существует. Я измерил, сколько токенов весит страница по-русски, проверил 4 модели на факт из начала длинного текста и получил 2 отказа сервера на границе окна.

🗞Другие новости

Все новости
Весь рост видеопросмотров в России дал YouTube: 99 минут в день
22 сентября, 17:03#Маркетинг и реклама
Весь рост видеопросмотров в России дал YouTube: 99 минут в день
22 сентября 2026 года стали известны данные Future Lab (группа компаний Starlink) по видеопотреблению в России за первое полугодие. Среднее время просмотра на крупнейших видеоплощадках выросло на 6% и составило 87,7 минуты в день на пользователя. Но если вычесть YouTube, показатель падает на 5%: весь рост рынку обеспечил именно он. Сам YouTube, несмотря на ограничения скорости, прибавил 24% и вышел на 99 минут в день на пользователя. Для сравнения: годом ранее он терял 28,6%, а российские площадки тогда росли на 32%. Маркетологу здесь важны две вещи сразу: аудитория вернулась туда, где ограничен доступ, а реклама на этой площадке с марта 2026 года признана ФАС незаконной, хотя запрет отложен до конца года.
Рост трат на офлайн-рекламу замедлился в 2,5 раза, лидер сменился
22 сентября, 17:03#Отчёты и цифры
Рост трат на офлайн-рекламу замедлился в 2,5 раза, лидер сменился
21 сентября 2026 года появились данные группы Twiga CG, основанные на замерах Mediascope: инвестиции 20 крупнейших рекламодателей России в офлайн-рекламу (телевидение, радио, пресса и наружная реклама) за первое полугодие 2026 года выросли на 24% год к году. Само по себе это рост, но темпы замедлились более чем в 2,5 раза по сравнению с прошлым годом. Сменился и лидер: после многолетнего первого места «Сбера» вперёд вышла RWB (Wildberries и Russ) с бюджетом 27 млрд рублей и ростом на 64%. «Сбер» второй с 20,6 млрд рублей. Участники рынка объясняют перестановки перетоком бюджетов в интернет и общей экономической ситуацией. Для небольшого бизнеса вывод простой: крупные игроки стали осторожнее с каналами, где эффект трудно посчитать.
Гуманоидов продали 7 тысяч, промышленных роботов 542 тысячи
22 сентября, 17:02#Технологии
Гуманоидов продали 7 тысяч, промышленных роботов 542 тысячи
21 сентября 2026 года появились данные Международной федерации робототехники (IFR), которые приводит Reuters: за 2025 год во всём мире продали около 7 тысяч человекоподобных роботов. Для сравнения: промышленных роботов только за 2024 год установили 542 тысячи, а сервисных ещё 199 тысяч. По правилам IFR к гуманоидным относят устройства с человекоподобным видом, способные работать автономно в среде, рассчитанной на людей; ноги при этом необязательны. Глава IFR Сюзанна Биллер отмечает: несмотря на высокие продажи, доля человекоподобных роботов остаётся небольшой на фоне общего числа. Разрыв в масштабе доходит до 77 раз только по промышленным машинам. Полные данные за 2025 год IFR обещала опубликовать 24 сентября.