RAG · АРХИТЕКТУРА И EVALUATION
RAG-ассистент: архитектура, оценка качества и ограничения
RAG — это не только векторная база и модель. Надёжный ассистент включает управление источниками и правами, воспроизводимую обработку документов, поиск, формирование ответа с доказательствами, контрольный набор и эксплуатационный мониторинг.
01 · КОРОТКИЙ ОТВЕТ
Короткий ответ
RAG-ассистент стоит строить как проверяемую цепочку «источник → обработка → поиск → контекст → ответ → цитата», оценивая поиск и генерацию раздельно. Он полезен для вопросов по меняющемуся корпусу документов, но не устраняет галлюцинации, не исправляет плохие источники и не заменяет человеческое решение в критичном сценарии.
02 · КРИТЕРИИ
Критерии до начала разработки
Критерии нужно проверять на конкретном процессе, данных и цене ошибки. Они не являются универсальным чек-листом готовности.
Управляемый корпус
Известны владельцы документов, права доступа, версия, дата обновления и правила удаления. Неуправляемая папка не становится надёжной базой знаний после индексирования.
Подходящий тип вопроса
Пользователь ищет объяснение или синтез по текстовым источникам. Для точной записи, суммы или статуса лучше запрос к системе учёта, а не вероятностный ответ.
Проверяемый ответ
Цитата ведёт к конкретному фрагменту доступного источника, а интерфейс отделяет найденные данные от вывода модели.
Известная цена ошибки
Сценарии разделены по риску; предусмотрены отказ, уточняющий вопрос и передача человеку там, где ответ нельзя безопасно предполагать.
Контрольный набор
Реальные вопросы имеют ожидаемые источники, признаки полезного ответа и недопустимые ошибки. Набор версионируется вместе с корпусом.
03 · ПРОЦЕСС
Последовательность проверки
- 01
Карта источников и доступов
Зафиксировать системы, владельцев, форматы, частоту обновления, чувствительность данных и модель прав до выбора поискового стека.
- 02
Воспроизводимая подготовка корпуса
Настроить извлечение, очистку, разбиение, метаданные, версии и удаление так, чтобы каждый найденный фрагмент можно было проследить до источника.
- 03
Сначала проверить поиск
На контрольном наборе убедиться, что релевантные фрагменты попадают в контекст. Генератор не компенсирует систематически пропущенный документ.
- 04
Добавить генерацию и отказ
Сформировать ответ только на основе доступного контекста, показать цитаты и определить поведение при недостатке или конфликте источников.
- 05
Оценивать и наблюдать по версиям
Сравнивать изменения поиска, модели и промпта на одном наборе, а в эксплуатации отслеживать качество, свежесть, задержку, стоимость и нарушения доступа.
04 · ВЫБОР
Таблица решений
Архитектура зависит от типа истины и действия, которое пользователь совершит после ответа.
| Сценарий | Подход | Граница |
|---|---|---|
| Нужна точная запись, сумма или текущий статус | Запрос к API, БД или поисковому индексу | Структурированное значение не следует пересказывать вероятностно. |
| Нужен ответ по меняющимся документам | RAG с цитатами и версиями | Внешний корпус можно обновлять и прослеживать независимо от модели. |
| Нужно выполнить действие в системе | Отдельный tool/API-контур с авторизацией | Поиск знаний и право изменить данные — разные уровни риска. |
| Источники не дают достаточного ответа | Отказ или уточнение | Правдоподобное дополнение модели не является найденным фактом. |
| Ответ влияет на критичное решение | Ассистирование с проверкой специалистом | Цитата помогает проверке, но не переносит ответственность на систему. |
05 · ИЗМЕРЕНИЕ
Что измерять
Сначала фиксируется исходный процесс и метод сбора. Затем сравниваются сопоставимые сценарии — без подмены фактического эффекта плановой целью.
Полнота поиска
На вопросах с известными источниками проверяется, попал ли нужный фрагмент в выдачу и контекст, с разбором причин пропуска.
Релевантность контекста
Оценивается, помогает ли каждый извлечённый фрагмент ответить на вопрос и не вытесняет ли шум полезные данные.
Опора ответа на источники
Каждое существенное утверждение сопоставляется с процитированным контекстом; противоречия и неподдержанные выводы учитываются отдельно.
Полезность для задачи
Профильный эксперт проверяет правильность, полноту, уместность отказа и возможность принять следующий шаг, не оценивая только стиль текста.
Эксплуатационный контур
Отслеживаются свежесть индекса, ошибки загрузки, задержка, стоимость, отказы и любые признаки выдачи данных за пределами прав пользователя.
06 · ГРАНИЦЫ
Риски
Пропуск при поиске
Нужный документ может существовать, но не попасть в контекст из-за обработки, формулировки запроса, фильтров или ранжирования.
Устаревший или конфликтующий источник
RAG воспроизводит проблемы корпуса. Нужны версии, приоритеты источников и явное поведение при конфликте.
Утечка прав доступа
Фильтрация после поиска может быть недостаточна. Авторизацию следует применять до извлечения контекста и проверять отдельными тестами.
Инъекция через документы
Текст источника может содержать инструкции для модели. Данные корпуса нельзя считать доверенным системным управлением.
Ложная уверенность автоматической оценки
LLM-судья тоже ошибается; автоматические метрики требуют калибровки на человеческих оценках и повторной проверки при смене домена.
ЧТО НЕЛЬЗЯ УТВЕРЖДАТЬ
Ограничения вывода
- RAG снижает зависимость от параметрической памяти модели, но не устраняет галлюцинации и неверные выводы.
- Наличие цитаты не доказывает, что утверждение верно или что выбран актуальный нормативный источник.
- Плохой, неполный или неразмеченный корпус нельзя исправить только подбором модели или промпта.
- Автоматические метрики полезны для сравнения версий, но не заменяют экспертную оценку критичных ответов.
- RAG не должен выполнять действия или обходить права доступа без отдельного управляемого инструментального контура.
07 · ПОРТФОЛИО
Связанные проекты и честная стадия
Связанный Legal Support MCP — концепция MVP, а не работающий RAG-кейс. Он показан как пример требований к источникам и обязательной эскалации к человеку.
Legal Support MCP
Зафиксирован MVP-контур: MCP-сервер с правилами, источниками, шаблонами и версиями, а также тонкий skill для AI-клиента. Результат задуман как структурированный пакет замечаний, вопросов, ссылок на источники и вариантов редакции с обязательной эскалацией существенных или неоднозначных вопросов к юристу.
Открыть разбор проекта08 · МЕТОДОЛОГИЯ
Первичные источники
Источники поддерживают методологию и определения. Они не подтверждают результаты проектов AI SaaS Solution.
Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
Открыть источникRAGAS: Automated Evaluation of Retrieval Augmented Generation
Открыть источникARES: An Automated Evaluation Framework for Retrieval-Augmented Generation Systems
Открыть источникArtificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile
Открыть источник