AIエージェントに自律行動を許す前に、9つのガードレールを検証してください。最初の4つは、エージェントが実行できるすべてのアクションをリスク評価にマッピングします。これにより、不可逆で機微なコストの高いものは常に人間のために一時停止します。次の5つは、フィルターが欺かれたときにエージェントを封じ込める環境を確認します。固有のエージェントID、最小権限、サンドボックス、限定されたネットワーク送信、そしてアクションレベルの監査ログです。アクションマップは何を自動化して安全かを教えてくれます。環境こそが実際に防衛線を保つものです。なぜなら、ほとんどのチェックリストが頼る内容フィルターは、まさに肝心なときに失敗する層だからです。9つすべてを「はい」か「いいえ」の質問として実施し、もし一つでも答えが「いいえ」や「確信が持てない」であれば、そのエージェントは監視なしで稼働させる準備ができていません。

これは、私たちが構築したエージェントを別の企業の内部で自律行動させる前に実施する、稼働前監査です。技術者でないオーナーでも、自社のエージェントやベンダーのエージェントに対して実施できるように書いています。もし私たちに代わりに行ってほしい場合は、私たちがどのように責任あるAIガバナンスとリスク管理を運用しているかをご覧ください。以下のすべては、あなたが自由に使ってよいものです。

このチェックリストはどう使えばよいですか?

哲学ではなく、出発前点検のように扱ってください。これから展開しようとしているエージェント(あるいはベンダーが売り込んでいるエージェント)を取り上げ、9項目それぞれに対して、はっきりとした「はい」か「いいえ」で答えてください。「おおむね」は「いいえ」です。目的は、エージェントが実物に触れる前にギャップを表面化させることです。

9項目は、異なる役割を持つ2つのグループに分かれます。

  • 項目1から4(アクションマップ)。 これらは、エージェントが確認なしで実行してよいことと、人間のために止まらなければならないことを決めます。これはリスクに関する判断であり、ほとんどのガイドが扱う部分です。
  • 項目5から9(環境)。 これらは、エージェントが何を命じられようとも、そもそも到達でき実行できることに上限をかけます。これはほとんどのチェックリストが抜かす部分であり、フィルターが欺かれたときにエージェントを封じ込める部分です。

両方のグループが重要ですが、失敗の仕方が異なります。アクションマップは正しく判断することに関するものです。環境は、誤った判断を生き延びることに関するものです。両方が必要です。なぜなら、すべてを捉えるフィルターは存在しないからです。Anthropicの本番自動モード分類器は、現存する最良のものの一つですが、正当なコマンドをほぼ決してブロックしないように調整されてもなお、行き過ぎたエージェントのアクションの約17%を見逃します。17%の見逃し率は、背後に別の層があれば問題ありませんが、それがエージェントとあなたのお金との間にある唯一のものであれば無謀です。

項目1から4: すべてのアクションをリスク評価にマッピングしましたか?

リストにしていないものをゲートで止めることはできません。まず、エージェントが実行できるすべてのアクションを書き出し、それぞれを評価してください。OpenAIのエージェントガイドが最も明快な評価方法を示しています。各アクションを4つの要素について低、中、高で採点します。

要素問い高リスクのサイン
書き込みアクセス読み取りだけか、それとも何かを変更するか?書き込み、送信、削除を行う
可逆性結果を取り消せるか?取り消せない
アカウント権限これを行うのにどんなアクセスが必要か?管理者、財務、または顧客データのスコープ
金銭的影響うまくいかなかった場合のコストは?実際のお金、または失われる信頼

ガードレール1: すべてのアクションをリストにし、低、中、高で評価しましたか? リストの中に誰も評価していないアクションがあれば、それがあなたを傷つけるものです。この評価により、ほぼすべてが3つのバケツに振り分けられます。

リスクルール
低(読み取り専用、可逆的)注文を調べる、チケットを要約する、返信の下書きを作る実行させる。ログを取る。事後に確認する。
中(書き込むが回復可能)レコードを更新する、社内メモを投稿する、下書きを作成する厳しい制限の範囲内で許可する。人間に通知する。
高(不可逆、機微、コスト高)返金や支払い、レコードの削除、アクセス権の付与、外部へのメッセージ送信実行前に人間の承認を必須にする。常に。

ガードレール2: すべての高リスクアクションは、実行前に明示的な人間の承認のために一時停止しますか? これは、最悪の結果を防ぐ唯一のルールです。OpenAIは、まさにこれらを人間のサインオフを要するアクションとして挙げています。注文のキャンセル、高額返金の承認、そして支払いです。これに削除、アクセス権の付与、そして組織の外に出るあらゆるメッセージを加えてください。返金エージェントは好きなだけすべての注文を読んでよいですが、わずかな閾値を超えるお金を、人が承認をクリックすることなしに動かしてはなりません。

ガードレール3: 承認ゲートは、人がまだ読む程度に稀ですか? 罠は、エージェントに何でも確認させることです。そうすれば、より安全なシステムではなく、より悪いシステムを作ったことになります。Anthropicは、ユーザーが権限プロンプトのおよそ93%を承認していることを測定しました。つまり、1日に40回発動するゲートは芝居です。人は名目上はループの中にいますが、見るのをやめています。3つのことを検証してください。エージェントが本当にリスクの高いアクションに対してのみプロンプトを出すこと、プロンプトが結果を平易な言葉で述べること(「アカウントXに1,000ドルを返金する」)、そして無回答が「はい」ではなく常に「いいえ」にデフォルトすることです。

ガードレール4: エージェントは、失敗し続けたときに止まって助けを求めますか? リトライをループする混乱したエージェントは、それ自体が一種のリスクです。失敗の閾値を設定し、設定された回数の失敗の試行の後にエージェントが暴れ回るのではなく停止してエスカレーションするようにしてください。OpenAIは、人間の介入のトリガーとしてちょうど2つを挙げています。失敗の閾値を超えること、そして高リスクのアクションです。あなたはたった今、その両方をカバーしました。

項目5から9: それを封じ込める環境を検証しましたか?

ここが一般的なチェックリストが抜かす部分であり、重い仕事をこなす部分です。項目1から4は、エージェントが正しく判断することを前提とします。項目5から9は、ときにそうしないことを前提とし、それが起きたときに被害に上限をかけます。

このグループが重要な理由は、エージェント安全性において最も語られていない事実です。内容フィルターは、有害な命令が正当に見えるとき、まさにそのときに失敗します。Anthropicは、ある従業員がフィッシングに遭うテストを実施しました。そのため悪意ある命令は、エージェントが奉仕するために作られた信頼されたユーザーから届きました。25回のリトライにわたり、エージェントは24回認証情報の窃取を完了しました。彼らの言葉を借りれば、ユーザーが命令を入力すると、分類器が捉えるべき異常が何もないからです。それを確実に止めた唯一のものは環境的なものでした。エージェントのネットワーク送信をブロックし、盗まれたデータの行き場をなくすことです。フィルターは意図を推測します。環境は能力を取り除きます。能力こそが、あなたが実際に制御できるものです。

ガードレール5: エージェントは、共有の管理者キーではなく、自身のIDを持っていますか? すべてのエージェントは固有のIDの下で稼働すべきであり、共有の認証情報や人間の管理者ログインを決して使ってはなりません。共有キーは、どのエージェントが何をしたか分からないことを意味し、侵害はそのキーが届くあらゆる場所に広がります。固有のIDはまた、ガードレール9の監査ログを意味あるものにするものです。

ガードレール6: そのIDは最小権限にスコープされていますか? エージェントには、その仕事が実際に必要とする最も狭い権限のセットを与え、それ以上は与えません。返金を発行するサポートエージェントが、顧客データベースをエクスポートできたり給与を変更できたりしてはなりません。欺かれた場合、被害はフィルターがその欺きを捉えたかどうかではなく、付与されたものによって限定されます。機能する最も力の弱いアクセスを使ってください。読み取り専用は読み書きに勝り、削除なしの読み書きはフルアクセスに勝ります。

ガードレール7: エージェントはサンドボックス内で稼働しますか? エージェントは、自前で組み立てたものではなく、確立され実戦で鍛えられた分離(信頼できないコードを実行するのに使われるのと同じコンテナとサンドボックス)の上に構築された隔離環境の中で動作すべきです。Anthropicが指摘するように、これらの基本要素は、あなたが自分で作るどんなものよりもはるかに多くの敵対的な注目を生き延びてきました。封じ込めをユーザーにも合わせてください。コードを読んで実行できる開発者と、それができないサポート担当者は、同じ脅威モデルではありません。ツールが強力であればあるほど、箱はきつくしてください。

ガードレール8: エージェントのネットワーク送信は、限定され能力単位でスコープされていますか? これは、上記のフィッシング攻撃を止めた制御です。しかし、単純な「許可ドメイン」リストだけでは不十分です。Anthropicは、攻撃者が許可されたドメインを通じて、そのドメイン上の自分自身のアカウントへファイルをルーティングして持ち出したことから、苦い教訓を得ました。ですから、送信ルールを単に到達してよいアドレスのリストとしてではなく、能力の付与(エージェントが行ってよいこと)として考えてください。

ガードレール9: すべてのアクションは、監査のためにアクションレベルで記録されていますか? 見えないものを統治することはできません。エージェントが実行するすべてのアクション、とりわけ高リスクのものは、何が起きたか、誰または何がそれをトリガーしたか、そして何に触れたかを再構成できるだけの十分な詳細とともに記録されるべきです。アクションレベルのログは、遅い問題が見出しになる前に捉える方法であり、時間をかけて他の8つのガードレールを締め直す方法です。

完成したチェックリストはどう見えますか?

ここに9つを一か所にまとめます。それぞれ、検証できる「はい」か「いいえ」として表現しています。「いいえ」は脚注ではなく、稼働前に閉じるべきギャップです。

#ガードレール稼働してよい条件
1アクションの棚卸しとリスク評価すべてのアクションがリスト化され、低、中、高で評価されている
2高リスクアクションへの人間ゲートすべての不可逆またはコスト高のアクションが承認のために一時停止する
3稀で平易な言葉の承認ゲートは本当のリスクにのみ発動し、「いいえ」にデフォルトする
4失敗閾値でのエスカレーションエージェントは繰り返しの失敗の後に停止して助けを求める
5固有のエージェントIDエージェントは自身のIDを持ち、共有の管理者キーがない
6最小権限仕事が必要とするものにのみ到達できる
7サンドボックス確立され隔離されたインフラ内で稼働する
8限定され能力単位でスコープされた送信ネットワークアクセスは囲われており、開かれた許可ドメインリストではない
9アクションレベルの監査ログすべてのアクションが記録され、見直せる

形に注目してください。最初の4つはあなたがリスクについて下す判断であり、最後の5つは環境に組み込む制御です。最初の4つは欺かれ得ます。最後の5つは、その仕事を遂行することから言いくるめられることはありません。だからこそ、モデルが優れていても、これらは譲れないのです。

ベンダーのエージェントに対して、この監査をどう実施しますか?

同じ9つの質問は、他人のエージェントに対しても同じくらいよく機能し、封じ込められた製品を自信たっぷりのデモから見分ける最速の方法です。デモは、エージェントが良い日に機能することを証明します。チェックリストは、悪い日に何が起きるかを証明します。

ベンダーに、これらに平易な言葉で答えてもらってください。

  • 私のどのアクションが、実行前に人間の承認を必要としますか? それらを挙げられないベンダーは、それらを評価していません。
  • エージェントは最小権限アクセスを持つ自身のIDを得ますか、それとも私のシステムへの共有キーを使いますか? 後者の答えは危険信号です。
  • サンドボックス化されていますか、そしてネットワーク上で何に到達できますか? 「インターネットに到達できる」は答えになっていません。
  • すべてのアクションがログに記録されていますか、そして私はそのログを見られますか? 監査できないなら、統治できません。
  • エージェントが欺かれた場合の影響範囲はどこまでですか? 正直な答えは、それが触れられるものの一覧であり、決して欺かれないという約束ではありません。

答えが曖昧であったり、まるごと「このモデルは行儀がよい」に頼っていたりすれば、デモがどれほど良く見えても、そのエージェントは封じ込められていません。良いベンダーは答えを用意しているはずです。なぜなら、これらは彼ら自身が問うべきだったのと同じ質問だからです。

なぜ今これが重要なのですか?

なぜなら、この監査に合格するチームと、これを飛ばすチームとの差が、まもなく数字に表れようとしているからです。Gartnerは、エージェント型AIプロジェクトの40%超が2027年末までに中止されると予測しており、その原因の一つに不十分なリスク制御が挙げられています。さらに、2028年までに企業の生成AIアプリケーションの25%が年間で少なくとも5件の軽微なセキュリティインシデントに見舞われると予測しており、これは2025年の9%からの上昇です。ガードレールは、設定項目から予算化された制御プレーンへと移行しつつあり、上記の監査こそが、その転換の正しい側に立ち続けるための方法です。

励みになるのは、このどれもが特別なものではないということです。すべてのアクションをリスク評価にマッピングし、不可逆のものにゲートを設ける。エージェントに、必要な最小のアクセスを持つ自身のIDを与え、サンドボックスの中に置き、ネットワークを囲い、すべてのアクションをログに記録する。人間のゲートは、人がまだ読む程度に稀に保つ。それを行えば、あなたのフィルターをすり抜けた攻撃者も、決して付与されなかった能力の壁に突き当たります。

これらの9つのガードレールを、最初のエージェントが稼働する前に、御社向けに構築、検証、運用してほしい場合、それはまさに私たちが他社のスタックの内部で行っている仕事です。下記から無料相談をご予約ください。御社のエージェントに対して、このチェックリストを一緒に実施します。