RAG (Retrieval-Augmented Generation) — это подход, при котором языковая модель сначала находит релевантные фрагменты в ваших документах, а затем формирует ответ по ним. Благодаря этому ответ основан на ваших данных, а не на «памяти» модели, и его можно проверить по ссылке на первоисточник.
Зачем это бизнесу
Обычная языковая модель знает только то, на чём её обучили, и склонна выдавать правдоподобные, но неверные ответы — галлюцинации. Для бизнеса это неприемлемо: ответ по договору или регламенту должен быть точным. RAG решает проблему: модель отвечает строго по найденным фрагментам корпоративных документов.
Как работает RAG: четыре шага
- Индексация. Документы разбиваются на фрагменты и превращаются в векторы — числовые представления смысла. Их хранит векторная база.
- Поиск. По вопросу пользователя система находит наиболее релевантные фрагменты — векторным и полнотекстовым поиском.
- Реранжирование. Отдельная модель (реранкер) переупорядочивает найденное, чтобы вверх попали действительно подходящие фрагменты, а не просто похожие.
- Генерация. Языковая модель формирует ответ по найденным фрагментам и прикладывает ссылку на источник.
Когда RAG нужен, а когда нет
RAG оправдан, когда ответы должны опираться на большой массив ваших документов, которые часто меняются: базы знаний, договоры, регламенты, техдокументация. Если же данных мало и они статичны, иногда достаточно поместить их прямо в запрос к модели — без отдельной инфраструктуры поиска.
Что важно на практике
Качество RAG определяется не столько моделью, сколько поиском: как разбиты документы, как устроено ранжирование, как проверяется привязка ответа к источнику. Для чувствительных данных всю систему — векторную базу и модель — разворачивают в закрытом контуре, чтобы документы не покидали периметр компании.