AIガードレール(一般的にAIガードレールと訳される)は、モデルの入力、コンテキスト、ツール呼び出し、出力の周囲に設けられた制約や検出メカニズムを指します。これらは禁止品に対するシステムのプロンプトとは異なります。真に実用的なガードレールは層ごとに機能し、回避された場合の影響を限定します。
なぜシステムプロンプトはセキュリティ境界ではないのか
プロンプトはモデルに行動方法を指示できますが、ユーザー入力、ウェブコンテンツ、ファイルテキストと同じ自然言語環境内にとどまります。攻撃者はプロンプト注入、エンコーディング歪み、複数回の誘導を用いてモデルの判断を変えることができます。さらに重要なのは、アプリケーションが高権限ツールを提供し続けている場合、誤った呼び出しは実際の結果を引き起こす可能性があるということです。
プロンプト注入のリスクは重要な原則を示しています。すなわち、セキュリティ制御はモデルの外に置かれ、決定論的なプログラムや権限システムによって実行されなければならず、モデル自身に監視を求めることはできません。
ガードレールのセットは通常、5つの層に分かれています
- 入力層:ファイルの種類、長さ、悪意のあるコマンド、機密データを検査し、モデルにアクセス可能な内容を明確にします。
- コンテキストレイヤー:システムルール、ユーザーデータ、外部検索コンテンツを分離し、ソースとテナントの境界を設定します。
- ツールレイヤー:最小権限、パラメータ検証、許可リスト、手動承認を使用し、特に支払い、削除、メール送信などの高影響操作を制限します。
- 出力層:プライバシーリーク、危険な内容、フォーマットの制約、事実に基づくチェックを行います。必要に応じて手動を拒否またはリダイレクトします。
- ランタイム:機密認証情報なしで監査記録を保存し、異常パターンを監視し、レッドチームを継続的にテストし、ルールを更新します。
各層は異なる故障モードを解決します。出力フィルタリングは不正な呼び出しをブロックできず、入力傍受はモデルが事実を捏造するのを防ぐことはできません。
ガードレールは精度プラグインではありません
ガードレールは誤った傍受、検出見逃し、さらなる遅延を招くことがあります。ルールは厳しすぎて通常のリクエストは満たされません。ルールが緩すぎるとセキュリティディスプレイのみが残ります。チームはビジネスリスクに基づいて強度を設定するべきです。通常のコンテンツ生成は自動的にレビューできますが、高リスクの運用は構造化されたパラメータ、二次確認、取り消し可能な仕組みが必要です。
稼働前に、AI評価は実際の攻撃サンプルと通常の境界サンプルを用いて、傍受率、誤検知、インシデントの影響を観察する必要があります。成熟したガードレールは決して失敗しない保証ではなく、継続的なテスト、許可分離、迅速な復旧の間に閉じたループを形成します。