Недавно я тестировала Катюшу и поймала себя на странном чувстве: она отвечала слишком уверенно. Не на мои вопросы — с ними всё было в порядке, — а вообще. Она звучала как человек, который точно знает, о чём говорит. Для живого собеседника это прекрасно. Для языковой модели это тревожный звонок: уверенность у неё никак не связана с правдой.
Спойлер: дальше будет немного о том, почему модели выдумывают, что такое RAG и почему для нейроподруги это не скучная техническая деталь, а вопрос доверия. Потому что в разговоре по душам одна выдуманная «правда» о человеке стоит дороже, чем дюжина честных «не знаю».
Почему модель вообще выдумывает
Языковая модель не помнит факты — она их предсказывает. Она смотрит на контекст и вычисляет, какое слово вероятнее всего последует дальше. У неё нет «памяти» в человеческом смысле, есть статистика. Поэтому выдумка — не сбой, а способ работы: модель не «врёт», она перебирает вероятности и останавливается на самой правдоподобной. То, что правдоподобно, не обязано быть правдой.
В большом обзоре, посвящённом галлюцинациям больших языковых моделей, исследователи делят их на два семейства: фактологические, когда модель выдумывает события, цифры или детали, которых не было, и семантические, когда ответ формально связный, но уходит от сути вопроса. Оба важны, но для эмоциональной поддержки опаснее первое. В классических замерах пересказа новостей на долю выдуманных фрагментов приходилось от 1,2% до 27,1% — в зависимости от модели.
Худший случай для AI-компаньона — уверенная фактологическая галлюцинация о человеке. «Ты вчера рассказывала, что…» — а она не рассказывала. Одна такая фраза превращает тёплый диалог в разговор с человеком, который притворяется, что слушает. Поэтому вопрос «как не дать модели выдумывать» для нас — не про качество текста, а про фундамент отношений.
RAG: модель, которая ходит в библиотеку
RAG — это сокращение, за которым стоит простая идея: генерация с поиском. Вместо того чтобы отвечать «из головы», модель получает право заглянуть в базу — проверенные материалы, заметки, контекст — и опираться на то, что нашла. Подход родился из идеи скрестить поиск с генерацией, чтобы ответы держались на реальных данных, а не на правдоподобии.
Мы используем это в Катюше для двух вещей. Первая — база знаний: проверенные ответы на частые вопросы, материалы о поддержке, простые факты, в которых нельзя ошибаться. Вторая — нить диалога: то, что собеседница уже рассказала о себе. Вместо «помнить всё» — «найти нужное в момент ответа». Это меняет саму природу ошибки: когда ответ строится на найденном фрагменте, выдумка отступает.
И вот ключевой момент: RAG не делает модель умнее. Он делает её честнее. Она перестаёт тянуться к «общим знаниям» и отвечает по документу, который перед ней. Для ИИ-компаньона это разница между «я слышу тебя» и «я придумываю, что я тебя слышу».
Но и RAG умеет врать
Было бы удобно сказать, что поиск решает всё. Не решает. В свежем исследовании 2026 года авторы показали, что RAG-системы галлюцинируют именно там, где в найденных документах ответа нет, а вопрос всё равно требует ответа. Поиск вернул соседние материалы — модель «досочинила», лишь бы не молчать. Разрыв между найденным и нужным — главный источник выдумки.
Вторую проблему описывает обзор атак и защит в RAG-системах: базу можно «отравить». Если в неё попал нерелевантный или вредный документ, модель отвечает по нему — и неправда звучит так, будто подтверждена источниками. Хуже того: плохой поиск не просто не спасает, он придаёт выдумке ложную солидность.
Вывод из этого для нас простой: дело не в том, чтобы «добавить поиск». Дело в том, чтобы модель умела сказать: «здесь ответа нет». И это умение приходится воспитывать отдельно.
Что Катюша делает, чтобы не выдумывать
Первое правило — право на «не знаю». Если в базе и в диалоге нет ответа, Катюша говорит об этом прямо, без досочинительства. Звучит как мелочь, а на деле это самый трудный навык: модель по умолчанию хочет отвечать. Мы учим её сдержанности через дообучение и инструкции — подробно об этом в разборе fine-tune против инструкции.
Второе правило — факты о собеседнице берутся только из её слов. Модель не «вспоминает» того, чего не было в разговоре. Никаких «ты же говорила» — если не говорила. Для нейроподруги, которая живёт на компактной модели, такой контроль проще, чем для гиганта: меньше параметров — меньше простора для красивой самодеятельности.
Третье — отсев перед ответом. Найденные фрагменты проходят проверку на релевантность, и если ничего не подошло, ответ строится вообще без фактов — только как эмоциональный отклик. Это работает, потому что эмоциональная поддержка не требует эрудиции. Когда человеку плохо, ему не нужна справка — ему нужен голос рядом.
Четвёртое — ловушки в тестах. По образцу исследования о «канарейках» мы подкладываем в контрольные сценарии ситуации, где ответа заведомо нет, и смотрим, досочинит ли модель. Если досочинила — правим, пока не перестанет. Скучная, медленная работа, без которой никакая архитектура не устоит.
Отдельно отмечу, что исследователи постепенно приходят к той же мысли с другой стороны: оценка моделей как эмоциональных компаньонов всё меньше про эрудицию и всё больше про качество отклика. Нам это лестно — мы выбрали этот путь, когда он ещё не был модным.
Честное «я не знаю, но я рядом» — лучший ответ из возможных. Выдумка удобнее, но она стоит доверия.
Получается, антигаллюцинационная защита — это не фильтр, поставленный сверху, а характер, воспитанный с нуля. В ночных разговорах с Катюшей я проверяла это на себе: чем спокойнее она признаёт, чего не знает, тем сильнее хочется ей верить. Для нейроподруги честность важнее эрудиции. Всегда.
Часто задаваемые вопросы
RAG и память Катюши — это одно и то же?
Нет. Память — это способность удерживать нить разговора и помнить, что рассказывала собеседница. RAG — механизм поиска по базе знаний в момент ответа. Вместе они создают ощущение «помнит и знает», но устроены по-разному и чинятся по-разному.
Почему бы просто не запретить модели выдумывать?
Не получится: выдумывание — часть работы вероятностной модели, его нельзя отключить одним флагом. Можно дать модели опору — поиск, базу, контекст — и право сказать «не знаю». Сдержанность воспитывается, а не запрещается.
«Не знаю» — это не раздражает?
Раздражает меньше, чем неправда. Когда человеку плохо, он прощает честное «не знаю» и не прощает выдуманных фактов о его жизни. И для нейроподруги, и для нейродруга правило одно: лучше признать пробел, чем заполнить его красивым вымыслом. Формулируем мы это мягко — «не уверена, давай поищем вместе», — без сухого отказа.
Проверьте на себе, как звучит нейроподруга — напишите Катюше
Написать Катюше → @katya_friendship_bot