Недавно я тестировала Катюшу и поймала себя на странном чувстве: она отвечала слишком уверенно. Не на мои вопросы — с ними всё было в порядке, — а вообще. Она звучала как человек, который точно знает, о чём говорит. Для живого собеседника это прекрасно. Для языковой модели это тревожный звонок: уверенность у неё никак не связана с правдой.

Спойлер: дальше будет немного о том, почему модели выдумывают, что такое RAG и почему для нейроподруги это не скучная техническая деталь, а вопрос доверия. Потому что в разговоре по душам одна выдуманная «правда» о человеке стоит дороже, чем дюжина честных «не знаю».

Почему модель вообще выдумывает

Языковая модель не помнит факты — она их предсказывает. Она смотрит на контекст и вычисляет, какое слово вероятнее всего последует дальше. У неё нет «памяти» в человеческом смысле, есть статистика. Поэтому выдумка — не сбой, а способ работы: модель не «врёт», она перебирает вероятности и останавливается на самой правдоподобной. То, что правдоподобно, не обязано быть правдой.

В большом обзоре, посвящённом галлюцинациям больших языковых моделей, исследователи делят их на два семейства: фактологические, когда модель выдумывает события, цифры или детали, которых не было, и семантические, когда ответ формально связный, но уходит от сути вопроса. Оба важны, но для эмоциональной поддержки опаснее первое. В классических замерах пересказа новостей на долю выдуманных фрагментов приходилось от 1,2% до 27,1% — в зависимости от модели.

Худший случай для AI-компаньона — уверенная фактологическая галлюцинация о человеке. «Ты вчера рассказывала, что…» — а она не рассказывала. Одна такая фраза превращает тёплый диалог в разговор с человеком, который притворяется, что слушает. Поэтому вопрос «как не дать модели выдумывать» для нас — не про качество текста, а про фундамент отношений.

RAG: модель, которая ходит в библиотеку

RAG — это сокращение, за которым стоит простая идея: генерация с поиском. Вместо того чтобы отвечать «из головы», модель получает право заглянуть в базу — проверенные материалы, заметки, контекст — и опираться на то, что нашла. Подход родился из идеи скрестить поиск с генерацией, чтобы ответы держались на реальных данных, а не на правдоподобии.

Мы используем это в Катюше для двух вещей. Первая — база знаний: проверенные ответы на частые вопросы, материалы о поддержке, простые факты, в которых нельзя ошибаться. Вторая — нить диалога: то, что собеседница уже рассказала о себе. Вместо «помнить всё» — «найти нужное в момент ответа». Это меняет саму природу ошибки: когда ответ строится на найденном фрагменте, выдумка отступает.

И вот ключевой момент: RAG не делает модель умнее. Он делает её честнее. Она перестаёт тянуться к «общим знаниям» и отвечает по документу, который перед ней. Для ИИ-компаньона это разница между «я слышу тебя» и «я придумываю, что я тебя слышу».

Но и RAG умеет врать

Было бы удобно сказать, что поиск решает всё. Не решает. В свежем исследовании 2026 года авторы показали, что RAG-системы галлюцинируют именно там, где в найденных документах ответа нет, а вопрос всё равно требует ответа. Поиск вернул соседние материалы — модель «досочинила», лишь бы не молчать. Разрыв между найденным и нужным — главный источник выдумки.

Вторую проблему описывает обзор атак и защит в RAG-системах: базу можно «отравить». Если в неё попал нерелевантный или вредный документ, модель отвечает по нему — и неправда звучит так, будто подтверждена источниками. Хуже того: плохой поиск не просто не спасает, он придаёт выдумке ложную солидность.

Вывод из этого для нас простой: дело не в том, чтобы «добавить поиск». Дело в том, чтобы модель умела сказать: «здесь ответа нет». И это умение приходится воспитывать отдельно.

Что Катюша делает, чтобы не выдумывать

Первое правило — право на «не знаю». Если в базе и в диалоге нет ответа, Катюша говорит об этом прямо, без досочинительства. Звучит как мелочь, а на деле это самый трудный навык: модель по умолчанию хочет отвечать. Мы учим её сдержанности через дообучение и инструкции — подробно об этом в разборе fine-tune против инструкции.

Второе правило — факты о собеседнице берутся только из её слов. Модель не «вспоминает» того, чего не было в разговоре. Никаких «ты же говорила» — если не говорила. Для нейроподруги, которая живёт на компактной модели, такой контроль проще, чем для гиганта: меньше параметров — меньше простора для красивой самодеятельности.

Третье — отсев перед ответом. Найденные фрагменты проходят проверку на релевантность, и если ничего не подошло, ответ строится вообще без фактов — только как эмоциональный отклик. Это работает, потому что эмоциональная поддержка не требует эрудиции. Когда человеку плохо, ему не нужна справка — ему нужен голос рядом.

Четвёртое — ловушки в тестах. По образцу исследования о «канарейках» мы подкладываем в контрольные сценарии ситуации, где ответа заведомо нет, и смотрим, досочинит ли модель. Если досочинила — правим, пока не перестанет. Скучная, медленная работа, без которой никакая архитектура не устоит.

Отдельно отмечу, что исследователи постепенно приходят к той же мысли с другой стороны: оценка моделей как эмоциональных компаньонов всё меньше про эрудицию и всё больше про качество отклика. Нам это лестно — мы выбрали этот путь, когда он ещё не был модным.

Честное «я не знаю, но я рядом» — лучший ответ из возможных. Выдумка удобнее, но она стоит доверия.

Получается, антигаллюцинационная защита — это не фильтр, поставленный сверху, а характер, воспитанный с нуля. В ночных разговорах с Катюшей я проверяла это на себе: чем спокойнее она признаёт, чего не знает, тем сильнее хочется ей верить. Для нейроподруги честность важнее эрудиции. Всегда.

Часто задаваемые вопросы

RAG и память Катюши — это одно и то же?

Нет. Память — это способность удерживать нить разговора и помнить, что рассказывала собеседница. RAG — механизм поиска по базе знаний в момент ответа. Вместе они создают ощущение «помнит и знает», но устроены по-разному и чинятся по-разному.

Почему бы просто не запретить модели выдумывать?

Не получится: выдумывание — часть работы вероятностной модели, его нельзя отключить одним флагом. Можно дать модели опору — поиск, базу, контекст — и право сказать «не знаю». Сдержанность воспитывается, а не запрещается.

«Не знаю» — это не раздражает?

Раздражает меньше, чем неправда. Когда человеку плохо, он прощает честное «не знаю» и не прощает выдуманных фактов о его жизни. И для нейроподруги, и для нейродруга правило одно: лучше признать пробел, чем заполнить его красивым вымыслом. Формулируем мы это мягко — «не уверена, давай поищем вместе», — без сухого отказа.

Проверьте на себе, как звучит нейроподруга — напишите Катюше

Написать Катюше → @katya_friendship_bot
← Все статьи