RAG · АРХИТЕКТУРА И EVALUATION

RAG-ассистент: архитектура, оценка качества и ограничения

RAG — это не только векторная база и модель. Надёжный ассистент включает управление источниками и правами, воспроизводимую обработку документов, поиск, формирование ответа с доказательствами, контрольный набор и эксплуатационный мониторинг.

РУКОВОДСТВО · ОБНОВЛЕНО 5 августа 2026 г.

01 · КОРОТКИЙ ОТВЕТ

Короткий ответ

RAG-ассистент стоит строить как проверяемую цепочку «источник → обработка → поиск → контекст → ответ → цитата», оценивая поиск и генерацию раздельно. Он полезен для вопросов по меняющемуся корпусу документов, но не устраняет галлюцинации, не исправляет плохие источники и не заменяет человеческое решение в критичном сценарии.

02 · КРИТЕРИИ

Критерии до начала разработки

Критерии нужно проверять на конкретном процессе, данных и цене ошибки. Они не являются универсальным чек-листом готовности.

01

Управляемый корпус

Известны владельцы документов, права доступа, версия, дата обновления и правила удаления. Неуправляемая папка не становится надёжной базой знаний после индексирования.

02

Подходящий тип вопроса

Пользователь ищет объяснение или синтез по текстовым источникам. Для точной записи, суммы или статуса лучше запрос к системе учёта, а не вероятностный ответ.

03

Проверяемый ответ

Цитата ведёт к конкретному фрагменту доступного источника, а интерфейс отделяет найденные данные от вывода модели.

04

Известная цена ошибки

Сценарии разделены по риску; предусмотрены отказ, уточняющий вопрос и передача человеку там, где ответ нельзя безопасно предполагать.

05

Контрольный набор

Реальные вопросы имеют ожидаемые источники, признаки полезного ответа и недопустимые ошибки. Набор версионируется вместе с корпусом.

03 · ПРОЦЕСС

Последовательность проверки

  1. 01

    Карта источников и доступов

    Зафиксировать системы, владельцев, форматы, частоту обновления, чувствительность данных и модель прав до выбора поискового стека.

  2. 02

    Воспроизводимая подготовка корпуса

    Настроить извлечение, очистку, разбиение, метаданные, версии и удаление так, чтобы каждый найденный фрагмент можно было проследить до источника.

  3. 03

    Сначала проверить поиск

    На контрольном наборе убедиться, что релевантные фрагменты попадают в контекст. Генератор не компенсирует систематически пропущенный документ.

  4. 04

    Добавить генерацию и отказ

    Сформировать ответ только на основе доступного контекста, показать цитаты и определить поведение при недостатке или конфликте источников.

  5. 05

    Оценивать и наблюдать по версиям

    Сравнивать изменения поиска, модели и промпта на одном наборе, а в эксплуатации отслеживать качество, свежесть, задержку, стоимость и нарушения доступа.

04 · ВЫБОР

Таблица решений

Архитектура зависит от типа истины и действия, которое пользователь совершит после ответа.

СценарийПодходГраница
Нужна точная запись, сумма или текущий статусЗапрос к API, БД или поисковому индексуСтруктурированное значение не следует пересказывать вероятностно.
Нужен ответ по меняющимся документамRAG с цитатами и версиямиВнешний корпус можно обновлять и прослеживать независимо от модели.
Нужно выполнить действие в системеОтдельный tool/API-контур с авторизациейПоиск знаний и право изменить данные — разные уровни риска.
Источники не дают достаточного ответаОтказ или уточнениеПравдоподобное дополнение модели не является найденным фактом.
Ответ влияет на критичное решениеАссистирование с проверкой специалистомЦитата помогает проверке, но не переносит ответственность на систему.

05 · ИЗМЕРЕНИЕ

Что измерять

Сначала фиксируется исходный процесс и метод сбора. Затем сравниваются сопоставимые сценарии — без подмены фактического эффекта плановой целью.

01

Полнота поиска

На вопросах с известными источниками проверяется, попал ли нужный фрагмент в выдачу и контекст, с разбором причин пропуска.

02

Релевантность контекста

Оценивается, помогает ли каждый извлечённый фрагмент ответить на вопрос и не вытесняет ли шум полезные данные.

03

Опора ответа на источники

Каждое существенное утверждение сопоставляется с процитированным контекстом; противоречия и неподдержанные выводы учитываются отдельно.

04

Полезность для задачи

Профильный эксперт проверяет правильность, полноту, уместность отказа и возможность принять следующий шаг, не оценивая только стиль текста.

05

Эксплуатационный контур

Отслеживаются свежесть индекса, ошибки загрузки, задержка, стоимость, отказы и любые признаки выдачи данных за пределами прав пользователя.

06 · ГРАНИЦЫ

Риски

01

Пропуск при поиске

Нужный документ может существовать, но не попасть в контекст из-за обработки, формулировки запроса, фильтров или ранжирования.

02

Устаревший или конфликтующий источник

RAG воспроизводит проблемы корпуса. Нужны версии, приоритеты источников и явное поведение при конфликте.

03

Утечка прав доступа

Фильтрация после поиска может быть недостаточна. Авторизацию следует применять до извлечения контекста и проверять отдельными тестами.

04

Инъекция через документы

Текст источника может содержать инструкции для модели. Данные корпуса нельзя считать доверенным системным управлением.

05

Ложная уверенность автоматической оценки

LLM-судья тоже ошибается; автоматические метрики требуют калибровки на человеческих оценках и повторной проверки при смене домена.

ЧТО НЕЛЬЗЯ УТВЕРЖДАТЬ

Ограничения вывода

  • RAG снижает зависимость от параметрической памяти модели, но не устраняет галлюцинации и неверные выводы.
  • Наличие цитаты не доказывает, что утверждение верно или что выбран актуальный нормативный источник.
  • Плохой, неполный или неразмеченный корпус нельзя исправить только подбором модели или промпта.
  • Автоматические метрики полезны для сравнения версий, но не заменяют экспертную оценку критичных ответов.
  • RAG не должен выполнять действия или обходить права доступа без отдельного управляемого инструментального контура.

07 · ПОРТФОЛИО

Связанные проекты и честная стадия

Связанный Legal Support MCP — концепция MVP, а не работающий RAG-кейс. Он показан как пример требований к источникам и обязательной эскалации к человеку.

Текущая стадия: Концепция MVP

Legal Support MCP

Зафиксирован MVP-контур: MCP-сервер с правилами, источниками, шаблонами и версиями, а также тонкий skill для AI-клиента. Результат задуман как структурированный пакет замечаний, вопросов, ссылок на источники и вариантов редакции с обязательной эскалацией существенных или неоднозначных вопросов к юристу.

Открыть разбор проекта

08 · МЕТОДОЛОГИЯ

Первичные источники

Источники поддерживают методологию и определения. Они не подтверждают результаты проектов AI SaaS Solution.

  1. Исследование · arXiv

    Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks

    Открыть источник
  2. Исследование · arXiv

    RAGAS: Automated Evaluation of Retrieval Augmented Generation

    Открыть источник
  3. Исследование · arXiv

    ARES: An Automated Evaluation Framework for Retrieval-Augmented Generation Systems

    Открыть источник
  4. Официальный документ · NIST

    Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile

    Открыть источник