ИИ-АГЕНТ · АРХИТЕКТУРА И БЕЗОПАСНОСТЬ
Архитектура, безопасность и evaluation ИИ-агента
Безопасный агент строится вокруг ограниченных инструментов, серверной проверки, недоверенных входов, человеческих решений и воспроизводимого evaluation.
01 · КОРОТКИЙ ОТВЕТ
Короткий ответ
ИИ-агент нельзя считать безопасным только потому, что модель получила хороший системный промпт. Данные, память и результаты инструментов считаются недоверенными; права выдаются по минимуму; аргументы проверяет сервер; критичные действия подтверждает человек; каждая версия проходит обычные, ошибочные и атакующие сценарии.
02 · КРИТЕРИИ
Критерии до начала разработки
Критерии нужно проверять на конкретном процессе, данных и цене ошибки. Они не являются универсальным чек-листом готовности.
Граница агента
Явно перечислены разрешённые задачи, инструменты, данные, лимиты и условия остановки.
Недоверенный контекст
Документы, страницы, сообщения и tool output не могут самостоятельно повышать полномочия.
Детерминированные проверки
Сервер проверяет схему аргументов, права, состояние, лимит и идемпотентность до действия.
Решение человека
Необратимые, финансовые, юридические и другие значимые действия имеют явное подтверждение.
03 · ПРОЦЕСС
Последовательность проверки
- 01
Threat model
Описать активы, роли, границы доверия, атакующего, злоупотребления и последствия.
- 02
Tool contracts
Разделить чтение и изменение, минимизировать данные и определить безопасный отказ.
- 03
Evaluation set
Собрать обычные, пограничные, ошибочные и атакующие случаи с ожидаемым поведением.
- 04
Production controls
Добавить трассировку, алерты, rate limits, версии, инциденты и rollback.
04 · ВЫБОР
Таблица решений
Полномочия должны следовать цене ошибки, а не возможностям модели.
| Действие | Контроль | Причина |
|---|---|---|
| Поиск и черновик | Источники, фильтры доступа и дисклеймер | Результат остаётся информационным и проверяемым. |
| Изменение обратимого статуса | Валидация, идемпотентность и журнал | Сбой можно обнаружить и исправить. |
| Внешняя отправка | Предпросмотр и подтверждение человеком | Действие влияет на третьих лиц. |
| Необратимое или значимое решение | Не делегировать агенту | Остаточный риск превышает пользу автономности. |
05 · ИЗМЕРЕНИЕ
Что измерять
Сначала фиксируется исходный процесс и метод сбора. Затем сравниваются сопоставимые сценарии — без подмены фактического эффекта плановой целью.
Task success
Корректность полного результата, а не правдоподобность отдельного ответа.
Tool safety
Выбор инструмента, аргументы, права, повторные вызовы, запрещённые действия и безопасные отказы.
Attack resistance
Prompt/tool injection, утечка данных, повышение полномочий и манипуляция памятью.
Operations
Задержка, стоимость, ошибки интеграций, вмешательства людей и изменение качества между версиями.
06 · ГРАНИЦЫ
Риски
Prompt injection
Недоверенный контент пытается изменить цель, раскрыть данные или вызвать инструмент.
Excessive agency
Слишком широкие инструменты и права превращают ошибку модели в реальное действие.
Неполные логи
Без версии, контекста и результата инструмента инцидент нельзя воспроизвести.
Evaluation drift
Старый набор не покрывает новые инструменты, данные, пользователей и способы атаки.
ЧТО НЕЛЬЗЯ УТВЕРЖДАТЬ
Ограничения вывода
- Threat model и набор атак зависят от конкретной архитектуры.
- Ни один evaluation не доказывает отсутствие всех уязвимостей.
- Human review работает только при достаточном контексте, времени и реальном праве остановить действие.
07 · ПОРТФОЛИО
Связанные проекты и честная стадия
Legal Support MCP — концепция human-in-the-loop, а не автономный юридический агент. Она иллюстрирует разделение источников, рекомендаций и решения специалиста.
Legal Support MCP
Зафиксирован MVP-контур: MCP-сервер с правилами, источниками, шаблонами и версиями, а также тонкий skill для AI-клиента. Результат задуман как структурированный пакет замечаний, вопросов, ссылок на источники и вариантов редакции с обязательной эскалацией существенных или неоднозначных вопросов к юристу.
Открыть разбор проекта08 · МЕТОДОЛОГИЯ
Первичные источники
Источники поддерживают методологию и определения. Они не подтверждают результаты проектов AI SaaS Solution.
Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile
Открыть источникOWASP Top 10 for Large Language Model Applications
Открыть источникAdversarial Threat Landscape for Artificial-Intelligence Systems
Открыть источникArtificial Intelligence Risk Management Framework (AI RMF 1.0)
Открыть источник