Прежде чем позволить ИИ-агенту действовать самостоятельно, проверьте девять ограничителей. Первые четыре сопоставляют каждое действие, которое может выполнить агент, с оценкой риска, чтобы необратимые, чувствительные и затратные действия всегда останавливались для человека. Следующие пять подтверждают среду, которая удерживает агента, когда фильтр обманут: уникальная идентичность агента, права по принципу минимальных привилегий, песочница, ограниченный исходящий сетевой трафик и журналы аудита на уровне действий. Карта действий говорит вам, что безопасно автоматизировать. Среда же то, что реально держит оборону, потому что контентные фильтры, на которые опирается большинство чек-листов, это тот слой, что даёт сбой именно тогда, когда это важнее всего. Прогоните все девять как вопросы «да» или «нет», и если хоть один ответ «нет» или «мы не уверены», агент не готов работать без надзора.
Это тот аудит перед запуском, который мы проводим, прежде чем позволить построенному нами агенту действовать самостоятельно внутри другой компании, написанный так, чтобы его мог провести и нетехнический владелец, по своему агенту или по агенту поставщика. Если вы предпочтёте, чтобы мы сделали это за вас, посмотрите, как мы выстраиваем ответственное управление ИИ и риски. Всё, что ниже, вы можете использовать сами.
Как пользоваться этим чек-листом?
Относитесь к нему как к предполётной проверке, а не как к философии. Возьмите агента, которого вы вот-вот развернёте (или того, которого вам продаёт поставщик), и ответьте на каждый из девяти пунктов твёрдым «да» или «нет». «В основном» это «нет». Цель в том, чтобы выявить пробелы до того, как агент коснётся чего-то реального.
Девять пунктов делятся на две группы, выполняющие разные задачи:
- Пункты с 1 по 4 (карта действий). Они решают, что агенту позволено делать без спроса, а что должно останавливаться для человека. Это суждение о риске, и именно эту часть покрывает большинство руководств.
- Пункты с 5 по 9 (среда). Они ограничивают то, до чего агент вообще способен дотянуться и что способен сделать, независимо от того, что ему велели. Это часть, которую большинство чек-листов пропускают, и именно она удерживает агента, когда фильтр обманут.
Обе группы важны, но дают сбой по-разному. Карта действий о том, чтобы решать правильно. Среда о том, чтобы пережить неправильное решение. Нужны обе, потому что ни один фильтр не ловит всё: продакшен-классификатор авторежима от Anthropic, один из лучших, что есть, всё равно пропускает около 17% чрезмерно рьяных действий агента, даже будучи настроенным почти никогда не блокировать легитимную команду. Уровень пропусков в 17% приемлем при наличии ещё одного слоя позади и безрассуден, когда это единственное, что стоит между агентом и вашими деньгами.
Пункты с 1 по 4: сопоставили ли вы каждое действие с оценкой риска?
Нельзя ограничить то, что вы не перечислили. Начните с того, чтобы выписать каждое действие, которое может выполнить агент, а затем оцените каждое из них. Руководство OpenAI по агентам даёт самый чистый метод оценки: оцените каждое действие как низкое, среднее или высокое по четырём факторам.
| Фактор | Вопрос | Сигнал высокого риска |
|---|---|---|
| Доступ на запись | Оно только читает или что-то меняет? | Оно пишет, отправляет или удаляет |
| Обратимость | Можно ли отменить результат? | Его нельзя вернуть назад |
| Права аккаунта | Какой доступ ему нужен, чтобы это сделать? | Админский, финансовый доступ или доступ к данным клиентов |
| Финансовые последствия | Во что обойдётся ошибка? | Реальные деньги или потерянное доверие |
Ограничитель 1: перечислили ли вы каждое действие и оценили его как низкое, среднее или высокое? Если в списке есть действие, которое никто не оценил, именно оно вас и подведёт. Оценка распределяет почти всё по трём корзинам:
| Риск | Примеры | Правило |
|---|---|---|
| Низкий (только чтение, обратимое) | Найти заказ, кратко изложить тикет, набросать ответ | Дайте выполнить. Залогируйте. Проверьте постфактум. |
| Средний (пишет, но восстановимо) | Обновить запись, оставить внутреннюю заметку, создать черновик | Разрешите в жёстких рамках. Оповестите человека. |
| Высокий (необратимое, чувствительное, затратное) | Возврат или платёж, удаление записей, выдача доступа, отправка внешнего сообщения | Требуйте человеческого одобрения перед выполнением. Всегда. |
Ограничитель 2: останавливается ли каждое высокорисковое действие для явного человеческого одобрения перед выполнением? Это единственное правило, которое предотвращает худшие исходы. OpenAI называет именно эти действия требующими человеческой подписи: отмена заказов, авторизация крупных возвратов и совершение платежей. Добавьте удаления, выдачу доступа и любое сообщение, покидающее стены компании. Агент возвратов может читать сколько угодно заказов, но он никогда не должен двигать деньги выше небольшого порога без того, чтобы человек нажал «одобрить».
Ограничитель 3: достаточно ли редок барьер одобрения, чтобы люди всё ещё его читали? Ловушка в том, чтобы заставлять агента спрашивать обо всём. Сделайте так, и вы построите систему хуже, а не безопаснее. Anthropic измерила, что пользователи одобряют примерно 93% запросов разрешений, так что барьер, срабатывающий сорок раз в день, это театр: человек номинально в контуре, но перестал смотреть. Проверьте три вещи: агент запрашивает только по-настоящему рискованные действия, запрос излагает последствие простым языком («Вернуть 1000 $ на счёт X»), а молчание по умолчанию означает «нет», никогда «да».
Ограничитель 4: останавливается ли агент и просит ли помощи, когда продолжает терпеть неудачу? Запутавшийся агент, зацикленный на повторных попытках, это отдельный вид риска. Установите порог неудач, чтобы после заданного числа провальных попыток агент останавливался и эскалировал, а не молотил впустую. OpenAI перечисляет ровно два триггера для человеческого вмешательства: превышение порогов неудач и высокорисковые действия. Вы только что покрыли оба.
Пункты с 5 по 9: проверили ли вы среду, которая его удерживает?
Вот та часть, которую типовые чек-листы пропускают, и именно она делает основную работу. Пункты с 1 по 4 предполагают, что агент решает правильно. Пункты с 5 по 9 предполагают, что иногда он так не сделает, и ограничивают ущерб, когда это происходит.
Причина, по которой эта группа важна, это самый недооценённый факт в безопасности агентов: контентные фильтры дают сбой ровно тогда, когда вредоносная инструкция выглядит легитимной. Anthropic провела тест, где сотрудника фишингом скомпрометировали, так что вредоносная инструкция пришла от доверенного пользователя, которому агент был создан служить. За 25 повторных попыток агент завершил кражу учётных данных 24 раза, потому что, по их словам, когда инструкцию набирает сам пользователь, классификатору не за что зацепиться как за аномалию. Единственное, что надёжно его остановило, было средством среды: блокировка исходящего сетевого трафика агента, так что украденным данным было некуда уйти. Фильтры угадывают намерение. Среда убирает возможность. Возможность это то, что вы реально можете контролировать.
Ограничитель 5: есть ли у агента собственная идентичность, а не общий админский ключ? Каждый агент должен работать под уникальной идентичностью, никогда не под общим доступом и никогда не под человеческим админским логином. Общий ключ означает, что вы не можете определить, какой агент что сделал, а компрометация распространяется повсюду, куда дотягивается этот ключ. Уникальная идентичность это ещё и то, что делает журнал аудита из ограничителя 9 осмысленным.
Ограничитель 6: ограничена ли эта идентичность принципом минимальных привилегий? Агент получает самый узкий набор прав, который реально нужен для его работы, и ничего сверх того. Агент поддержки, оформляющий возвраты, не должен также иметь возможность выгрузить вашу базу клиентов или изменить начисление зарплат. Если его обманут, ущерб ограничен тем, что ему выдали, а не тем, поймал ли фильтр обман. Используйте наименее мощный доступ, который работает: только чтение лучше чтения-записи, а чтение-запись-без-удаления лучше полного доступа.
Ограничитель 7: работает ли агент в песочнице? Агент должен действовать внутри изолированной среды, построенной на устоявшейся, проверенной в боях изоляции (тех же контейнерах и песочницах, которые используются для запуска недоверенного кода), а не на чём-то самодельном. Как отмечает Anthropic, эти примитивы выдержали куда больше враждебного внимания, чем что-либо, что вы построили бы сами. Подгоните удержание и под пользователя: разработчик, который может читать и запускать код, и сотрудник поддержки, который не может, это не одна и та же модель угроз, и чем мощнее инструменты, тем теснее коробка.
Ограничитель 8: ограничен ли исходящий сетевой трафик агента и привязан ли он к возможностям? Это и есть средство контроля, остановившее фишинговую атаку выше. Но простого списка «разрешённых доменов» самого по себе недостаточно. Anthropic на горьком опыте узнала, что злоумышленники выгружали файлы через разрешённый домен, маршрутизируя их на собственный аккаунт на нём, так что думайте о правилах исходящего трафика как о выдаче возможностей (что агенту позволено делать), а не просто как о списке адресов, которых он может достичь.
Ограничитель 9: записывается ли каждое действие на уровне действий для аудита? Нельзя управлять тем, чего не видишь. Каждое действие, которое выполняет агент, особенно высокорисковые, должно фиксироваться с достаточной детализацией, чтобы восстановить, что произошло, кто или что это запустил и чего оно коснулось. Журналы на уровне действий это то, как вы ловите медленную проблему до того, как она станет заголовком, и как вы со временем подтягиваете остальные восемь ограничителей.
Как выглядит готовый чек-лист?
Вот все девять в одном месте, каждый сформулирован как «да» или «нет», которое вы можете проверить. «Нет» это пробел, который нужно закрыть до запуска, а не сноска.
| № | Ограничитель | Можно запускать, когда |
|---|---|---|
| 1 | Инвентаризация действий и оценка риска | Каждое действие перечислено и оценено как низкое, среднее или высокое |
| 2 | Человеческий барьер на высокорисковых действиях | Каждое необратимое или затратное действие останавливается для одобрения |
| 3 | Редкие одобрения простым языком | Барьер срабатывает только на реальном риске и по умолчанию означает «нет» |
| 4 | Эскалация по порогу неудач | Агент останавливается и просит помощи после повторных неудач |
| 5 | Уникальная идентичность агента | У агента собственная идентичность, без общих админских ключей |
| 6 | Права по принципу минимальных привилегий | Он может дотянуться только до того, что нужно для его работы |
| 7 | Песочница | Он работает в устоявшейся, изолированной инфраструктуре |
| 8 | Ограниченный, привязанный к возможностям исходящий трафик | Сетевой доступ огорожен, а не открытый список разрешённых доменов |
| 9 | Журналы аудита на уровне действий | Каждое действие записано и доступно для проверки |
Обратите внимание на форму. Первые четыре это решения, которые вы принимаете о риске; последние пять это средства контроля, которые вы встраиваете в среду. Первые четыре можно обмануть. Последние пять нельзя уговорить не делать свою работу, поэтому они не подлежат обсуждению даже когда модель превосходна.
Как провести этот аудит по агенту поставщика?
Те же девять вопросов работают столь же хорошо и по чужому агенту, и они самый быстрый способ отличить удержанный продукт от уверенной демонстрации. Демо доказывает, что агент работает в хороший день. Чек-лист доказывает, что происходит в плохой.
Попросите поставщика ответить на эти вопросы простым языком:
- Какие из моих действий требуют человеческого одобрения перед выполнением? Поставщик, который не может их назвать, их не оценил.
- Получает ли агент собственную идентичность с доступом по принципу минимальных привилегий или использует общий ключ в мои системы? Второй ответ это тревожный сигнал.
- Помещён ли он в песочницу и до чего может дотянуться в сети? «Он может выходить в интернет» это не ответ.
- Записывается ли каждое действие и могу ли я видеть эти журналы? Если вы не можете провести аудит, вы не можете управлять.
- Каков радиус поражения, если агента обманут? Честный ответ это список того, чего он может коснуться, а не обещание, что его никогда не обманут.
Если ответы расплывчаты или целиком опираются на «модель ведёт себя хорошо», агент не удержан, каким бы хорошим ни выглядело демо. Хороший поставщик будет иметь ответы наготове, потому что это те же вопросы, которые он должен был задать сам себе.
Почему это важно именно сейчас?
Потому что разрыв между командами, которые проходят этот аудит, и командами, которые его пропускают, вот-вот проявится в цифрах. Gartner ожидает, что более 40% проектов агентного ИИ будут отменены к концу 2027 года, и среди причин названы неадекватные средства контроля рисков, и прогнозирует, что к 2028 году 25% корпоративных приложений генеративного ИИ будут страдать по меньшей мере от пяти мелких инцидентов безопасности в год, по сравнению с 9% в 2025 году. Ограничители превращаются из настройки конфигурации в бюджетируемую управляющую плоскость, и аудит выше это то, как вы остаётесь на правильной стороне этого сдвига.
Обнадёживает то, что ничего из этого не является экзотикой. Сопоставьте каждое действие с оценкой риска и поставьте барьер на необратимом. Дайте агенту собственную идентичность с наименьшим нужным ему доступом, в песочнице, с огороженной сетью и каждым залогированным действием. Держите человеческий барьер достаточно редким, чтобы люди всё ещё его читали. Сделайте так, и злоумышленник, проскользнувший мимо вашего фильтра, всё равно упрётся в стену возможностей, которые ему никогда не выдавали.
Если вы хотите, чтобы эти девять ограничителей были построены, проверены и запущены за вас до того, как ваш первый агент выйдет в работу, это ровно та работа, которую мы делаем внутри стеков других компаний. Запишитесь на бесплатную консультацию ниже, и мы вместе прогоним этот чек-лист по вашему агенту.
