Что стоит за аббревиатурой
RAG — retrieval-augmented generation, в русских текстах «генерация с дополненной выборкой» или «генерация с опорой на найденное». Термин ввела работа «Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks» — Patrick Lewis и соавторы, 2020 год, arXiv:2005.11401.
В абстракте авторы опираются на два несущих слова: «параметрическая» и «непараметрическая» память. Расшифруем оба.
Параметрическая память — то, что модель выучила при обучении и хранит в своих весах. Она обширна, но статична: чтобы её обновить, модель нужно переобучить. И проследить, откуда взялся конкретный факт, в ней нельзя.
Непараметрическая память — внешнее хранилище документов, к которому модель обращается в момент ответа. В оригинальной работе это был индекс Википедии. В поисковых системах — индекс страниц.
Мы исследуем универсальный рецепт дообучения для генерации с дополненной выборкой (RAG) — моделей, которые сочетают предобученную параметрическую и непараметрическую память для генерации текста.
Авторы прямо называли проблему, которую решали: у языковых моделей «указание происхождения их решений и обновление знаний о мире остаются открытыми исследовательскими задачами». RAG снимает часть этих ограничений — ответ строится на конкретных найденных документах, и эти документы можно назвать.
Как это выглядит в поиске
Для владельца сайта важна не архитектура, а последовательность шагов. Она такая:
- Приходит вопрос пользователя.
- Система ищет документы — это отдельный шаг, обычный поиск по индексу.
- Найденные фрагменты подаются модели вместе с вопросом.
- Модель формулирует ответ на их основе и иногда ссылается на источники.
Компании, стоящие за ИИ-ответами в поиске, редко используют само слово «RAG» в публичных материалах — чаще говорят о «поиске», «источниках» или «опоре на результаты поиска». Но описанная последовательность у них общая: сначала извлечение, потом генерация.
Почему это главный термин для владельца сайта
Из механики следует вывод, который меняет всю постановку задачи.
Если ответ строится из найденных документов, то попасть в ответ означает попасть в выборку. Не «понравиться нейросети» — а оказаться среди документов, которые система нашла и передала модели на вход. Шаг извлечения происходит раньше генерации, и он устроен ближе к привычному поиску, чем к магии.
Отсюда три практических следствия:
- Индексируемость первична. Страница, недоступная для сканирования, не попадёт в выборку ни при каком качестве текста.
- В ответ идёт фрагмент, а не страница. Модель получает куски текста. Если законченного ответа в тексте нет, извлекать нечего.
- Свежесть работает. Внешнее хранилище обновляют, не трогая саму модель, — именно поэтому ассистент может знать о вчерашнем событии.
Чего RAG не гарантирует
Опора на документы уменьшает выдумывание, но не отменяет его. Модель может неверно понять найденный фрагмент, соединить два источника в утверждение, которого нет ни в одном, или сослаться на страницу, которая говорит другое.
Второе ограничение — недетерминированность. Один и тот же вопрос, заданный дважды, даёт разные наборы источников и разные формулировки. Поэтому одиночная проверка «упоминают ли нас» ничего не доказывает: нужен набор вопросов и повторные замеры.
Видят ли нейросети ваш сайт
Бесплатная проверка по 26 пунктам — с конкретными приоритетами.
