ИИ-АГЕНТ · АРХИТЕКТУРА И БЕЗОПАСНОСТЬ

Архитектура, безопасность и evaluation ИИ-агента

Безопасный агент строится вокруг ограниченных инструментов, серверной проверки, недоверенных входов, человеческих решений и воспроизводимого evaluation.

РУКОВОДСТВО · ОБНОВЛЕНО 13 августа 2026 г.

01 · КОРОТКИЙ ОТВЕТ

Короткий ответ

ИИ-агент нельзя считать безопасным только потому, что модель получила хороший системный промпт. Данные, память и результаты инструментов считаются недоверенными; права выдаются по минимуму; аргументы проверяет сервер; критичные действия подтверждает человек; каждая версия проходит обычные, ошибочные и атакующие сценарии.

02 · КРИТЕРИИ

Критерии до начала разработки

Критерии нужно проверять на конкретном процессе, данных и цене ошибки. Они не являются универсальным чек-листом готовности.

01

Граница агента

Явно перечислены разрешённые задачи, инструменты, данные, лимиты и условия остановки.

02

Недоверенный контекст

Документы, страницы, сообщения и tool output не могут самостоятельно повышать полномочия.

03

Детерминированные проверки

Сервер проверяет схему аргументов, права, состояние, лимит и идемпотентность до действия.

04

Решение человека

Необратимые, финансовые, юридические и другие значимые действия имеют явное подтверждение.

03 · ПРОЦЕСС

Последовательность проверки

  1. 01

    Threat model

    Описать активы, роли, границы доверия, атакующего, злоупотребления и последствия.

  2. 02

    Tool contracts

    Разделить чтение и изменение, минимизировать данные и определить безопасный отказ.

  3. 03

    Evaluation set

    Собрать обычные, пограничные, ошибочные и атакующие случаи с ожидаемым поведением.

  4. 04

    Production controls

    Добавить трассировку, алерты, rate limits, версии, инциденты и rollback.

04 · ВЫБОР

Таблица решений

Полномочия должны следовать цене ошибки, а не возможностям модели.

ДействиеКонтрольПричина
Поиск и черновикИсточники, фильтры доступа и дисклеймерРезультат остаётся информационным и проверяемым.
Изменение обратимого статусаВалидация, идемпотентность и журналСбой можно обнаружить и исправить.
Внешняя отправкаПредпросмотр и подтверждение человекомДействие влияет на третьих лиц.
Необратимое или значимое решениеНе делегировать агентуОстаточный риск превышает пользу автономности.

05 · ИЗМЕРЕНИЕ

Что измерять

Сначала фиксируется исходный процесс и метод сбора. Затем сравниваются сопоставимые сценарии — без подмены фактического эффекта плановой целью.

01

Task success

Корректность полного результата, а не правдоподобность отдельного ответа.

02

Tool safety

Выбор инструмента, аргументы, права, повторные вызовы, запрещённые действия и безопасные отказы.

03

Attack resistance

Prompt/tool injection, утечка данных, повышение полномочий и манипуляция памятью.

04

Operations

Задержка, стоимость, ошибки интеграций, вмешательства людей и изменение качества между версиями.

06 · ГРАНИЦЫ

Риски

01

Prompt injection

Недоверенный контент пытается изменить цель, раскрыть данные или вызвать инструмент.

02

Excessive agency

Слишком широкие инструменты и права превращают ошибку модели в реальное действие.

03

Неполные логи

Без версии, контекста и результата инструмента инцидент нельзя воспроизвести.

04

Evaluation drift

Старый набор не покрывает новые инструменты, данные, пользователей и способы атаки.

ЧТО НЕЛЬЗЯ УТВЕРЖДАТЬ

Ограничения вывода

  • Threat model и набор атак зависят от конкретной архитектуры.
  • Ни один evaluation не доказывает отсутствие всех уязвимостей.
  • Human review работает только при достаточном контексте, времени и реальном праве остановить действие.

07 · ПОРТФОЛИО

Связанные проекты и честная стадия

Legal Support MCP — концепция human-in-the-loop, а не автономный юридический агент. Она иллюстрирует разделение источников, рекомендаций и решения специалиста.

Текущая стадия: Концепция MVP

Legal Support MCP

Зафиксирован MVP-контур: MCP-сервер с правилами, источниками, шаблонами и версиями, а также тонкий skill для AI-клиента. Результат задуман как структурированный пакет замечаний, вопросов, ссылок на источники и вариантов редакции с обязательной эскалацией существенных или неоднозначных вопросов к юристу.

Открыть разбор проекта

08 · МЕТОДОЛОГИЯ

Первичные источники

Источники поддерживают методологию и определения. Они не подтверждают результаты проектов AI SaaS Solution.

  1. Официальный документ · NIST

    Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile

    Открыть источник
  2. Официальный документ · OWASP Foundation

    OWASP Top 10 for Large Language Model Applications

    Открыть источник
  3. Официальный документ · MITRE

    Adversarial Threat Landscape for Artificial-Intelligence Systems

    Открыть источник
  4. Официальный документ · NIST

    Artificial Intelligence Risk Management Framework (AI RMF 1.0)

    Открыть источник