Коротко
RAG (retrieval-augmented generation, генерация с дополненной выборкой) — способ заставить нейросеть отвечать по вашим документам: система сначала находит подходящие фрагменты регламентов, инструкций или базы знаний, а модель формулирует ответ только на их основе и может сослаться на источник. Переобучать модель не нужно — чтобы обновить знания, достаточно обновить документы. Качество такого ассистента в первую очередь определяется подготовкой документов и проверкой ответов, а не выбором модели.
Как это работает
- Подготовка базы. Документы разбиваются на фрагменты, для каждого вычисляется векторное представление (эмбеддинг) и сохраняется в векторной базе.
- Поиск. Вопрос пользователя тоже превращается в вектор, и система находит фрагменты, наиболее близкие по смыслу.
- Ответ. Модель получает вопрос и найденные фрагменты и формулирует ответ только по ним, с указанием источника.
Если нужного фрагмента нет, правильное поведение — честно сказать «в документах этого нет» и передать вопрос человеку, а не придумывать ответ.
Где RAG полезен
- ответы сотрудникам по регламентам, инструкциям и внутренним политикам — ускоряет онбординг и разгружает поддержку;
- ответы клиентам по описаниям услуг, условиям и частым вопросам;
- поиск по договорам, технической документации и базе знаний.
Что определяет качество
Документы. Устаревшие, противоречивые или дублирующиеся документы дают противоречивые ответы. Перед запуском нужно определить, какие документы считаются актуальными, и назначить владельцев.
Разбиение на фрагменты. Слишком мелкие фрагменты теряют контекст, слишком крупные — точность поиска. Таблицы, списки и заголовки нужно обрабатывать отдельно.
Проверка на реальных вопросах. Соберите набор реальных вопросов с правильными ответами и прогоняйте через систему до запуска и после каждого изменения — так же, как мы закрепляем поведение ИИ-сервисов автотестами.
Границы. Что ассистент отвечает сам, а что передаёт человеку, — решается заранее.
Где хранить данные
Если в документах есть персональные данные россиян, учитывайте 152-ФЗ: с 1 июля 2025 года их запись и хранение должны вестись в базах данных на территории России. Варианты — обезличивание документов, российская облачная инфраструктура или модель и векторная база на ваших серверах. Как устроен собственный LLM-сервер, мы разбирали в статье «LLM на своём железе».
С чего начать
- Выберите одну область: например, ответы сотрудникам по кадровым регламентам.
- Соберите актуальные документы и 30–50 реальных вопросов с правильными ответами.
- Запустите пилот на части пользователей и сравните ответы с эталоном.
- Масштабируйте, только когда качество устраивает.
Вопросы и ответы
Что такое RAG простыми словами? Это способ, при котором нейросеть перед ответом ищет подходящие фрагменты в ваших документах и отвечает только по ним, указывая источник.
Нужно ли дообучать модель на документах компании? Для ответов по документам обычно нет: в RAG знания хранятся в базе документов, и их достаточно обновить. Дообучение нужно для других задач — например, особого стиля или формата ответов.
Может ли RAG-ассистент ошибаться? Может, если документы противоречивы или нужный фрагмент не найден. Поэтому нужны набор проверочных вопросов, ссылки на источники в ответах и правило передавать вопрос человеку, когда ответа в документах нет.
Можно ли сделать RAG без передачи документов наружу? Да: модель и векторную базу можно развернуть на своих серверах или в российской облачной инфраструктуре.
Источники
Внедряет ИИ и LLM в процессы компаний, разрабатывает платформы и чат-ботов. LinkedIn
Внедрение ИИ и разработка чат-ботов для бизнеса
Внедряем LLM в процессы компании: AI-агенты, Telegram-боты, автоматизация на n8n, облачные и локальные модели на своей инфраструктуре.
Подробнее об услугеПохожая задача в вашем бизнесе?
Расскажите коротко — предложим путь от аудита до запуска. Можно без формальностей.
