Что произошло
На arXiv обновилась работа «Knowledge-Graph Grounding Helps LLMs Only for Out-of-Training Knowledge». Это контролируемое исследование о том, когда подключение внешней базы знаний реально улучшает ответы языковой модели. Первая версия вышла в июне 2026 года, третья 21 сентября.
Это препринт: работа выложена авторами и ещё не прошла рецензирование в журнале. Читать её надо как «авторы заявляют и показывают код», а не как установленный факт. Код эксперимента авторы выложили открыто, и это заметно повышает доверие: результат можно перепроверить.
Как устроен эксперимент
Исследователи взяли медицинские вопросы (набор MedQA) и подключали к моделям публичную биомедицинскую базу знаний PrimeKG двумя способами:
- Простое извлечение. Из базы достаются подходящие факты и кладутся в запрос.
- Агентный цикл. Модель сама формулирует запрос к базе на языке запросов Cypher, получает ответ, при необходимости переспрашивает. Успешно отрабатывали 82% таких запросов.
Дальше то же самое повторили на двух других наборах: на искусственной базе, где связи специально выдуманы (модель точно не могла их видеть при обучении), и на смешанном наборе, где часть фактов известна, а часть — нет.
| Где проверяли | Что знает модель заранее | Что дало подключение базы |
|---|---|---|
| Публичная база PrimeKG, вопросы MedQA | почти всё | разница в пределах 3,4 п. п., то есть ничего |
| Искусственная база с выдуманными связями | ничего | с уровня угадывания почти до 100% |
| Смешанный набор: известное + новое | частично | +68–79 п. п. на новой части, ноль на известной |
Отдельная деталь: на искусственной базе правильный ответ выдавала даже связка без языковой модели вообще. То есть там, где факт лежит в базе, работу делает не «интеллект» модели, а обычный поиск по данным.
Почему это важно тем, кто внедряет ИИ-агентов
Самая частая идея при запуске ИИ-сотрудника звучит так: «загрузим в него всё, что есть, — и он станет умнее». Работа показывает, что от загрузки общеизвестного в ответах не меняется ничего, зато растёт счёт за токены: каждый лишний факт в запросе оплачивается.
Полезны оказываются ровно те данные, которых в интернете нет:
- ваш прайс и актуальные акции;
- условия доставки, сроки, гарантии и правила возврата именно вашей компании;
- регламенты: что отвечать, когда товара нет, и когда звать человека;
- история конкретного клиента и его заказов.
Мы разбирали это на практике в материале про ИИ-агентов и нейросотрудников: агент, который отвечает по своей базе, и агент, которому «загрузили интернет», ведут себя по-разному именно на вопросах о цене и условиях.
Вторая находка: как читаются громкие цифры
По дороге авторы перепроверили результат другой работы, о которой писали как о доказательстве превосходства универсальных моделей над специализированными медицинскими инструментами. Заявленные около 88 баллов на наборе HealthBench оказались оценкой по его облегчённому варианту (Consensus). На полном наборе с проверкой по шкале, откалиброванной врачами, и передовые модели, и эталонные ответы набирают 46–47 баллов.
Это ровно та ситуация, про которую мы писали в разборе галлюцинаций нейросетей: цифра сама по себе ничего не значит, пока не известно, на каком наборе и по какой шкале она получена.
Что делать уже сейчас
- Разделить базу знаний агента на две части: общеизвестное (модель это и так знает, можно выкинуть) и своё (оставить и держать в актуальном состоянии).
- Посчитать, сколько знаков уходит в каждый запрос: длинная база это не только качество, но и деньги за токены при каждом ответе.
- Проверить агента на двадцати реальных вопросах клиентов дважды — с базой и без неё. Если ответы не различаются, база подключена зря.
- Сначала свериться с тем, как модель вообще удерживает большой объём данных — мы разбирали это в материале про контекстное окно.
- Любую громкую цифру из отчёта о качестве ИИ проверять по методике: какой набор, какая шкала, кто оценивал.
Частые вопросы
Это значит, что база знаний не нужна? Наоборот: нужна, но только со своими данными. Работа показывает, что публичные факты дублируют то, что модель уже знает.
Работа медицинская — при чём тут продажи? Механика одинаковая: вопрос «какая дозировка у препарата» и вопрос «какая у вас цена на доставку в Казань» отличаются для модели только одним: есть ли ответ в её обучении. Цен вашей компании там нет.
Что такое препринт? Статья, которую авторы выложили сами, до проверки другими учёными. Её ценность в открытых данных и коде: результат можно воспроизвести.
Можно ли верить цифре +68–79 пунктов? Это прирост на специально сконструированных данных, где модель заведомо не знала ответа. Он показывает верхнюю границу пользы от базы, а не типичный результат внедрения.
