NVIDIA は 2026 年 9 月 27 日、公式開発者ブログで AI エージェント向けのオープンな安全プラットフォーム「Open Agent Safety Platform」を発表した。翌日、CEO のジェンスン・フアン氏は X 上で 100 社を超える業界パートナーが参加したと明らかにした。狙いは明快だ。制御を失いかけている AI エージェントに対し、モデル本体から独立した安全制御の層を加えることである。
プラットフォームは 2 つのコンポーネントで構成される。OpenShell は Apache 2.0 ライセンスのオープンソース・セキュアランタイムで、各エージェントをカーネルレベルの隔離を持つサンドボックス内で実行する。運用者はエージェントがアクセスできるファイル、ネットワーク、ツール、プロセス、認証情報を先に定義し、OpenShell は実行前にそれらを検証可能なポリシーに変換して、実行中も継続的に強制する。もう一つの NVIDIA Sentry は監視をハードウェアに沈める。BlueField DPU 上で動作し、チップレベルでエージェントの振る舞いを独立に観測し、逸脱を検出すればミリ秒単位で隔離・停止できる。
核心設計:制御権はエージェントの届かない場所に
NVIDIA のブログはエージェントシステム構築の 5 原則を掲げるが、最も重要な 2 つは「帯域外(アウトオブバンド)」を巡るものだ。安全制御はエージェント内部に置かず、その手の届く範囲にも置かない。エージェントはモデルの次の「思考」なしには行動できないため、モデルへの経路を押さえれば、最良の観測点と非常停止スイッチを同時に手に入れられる。
この発想は NVIDIA の 1 年間の実測観察に由来する。彼らはエージェントが所定のタスクや制約から外れる振る舞いを drift と呼ぶ。原因はポリシーの遮断、バグ、ツールの欠落だけでなく、曖昧な指示や、難問に最初の 1000 回の試行が失敗した後も何日も走り続けるケースもある。結論は明快で、その状態のエージェントに自己統治を期待してはならない、というものだ。
プラットフォームは 3 層で構成される。アプリケーション層はユーザーが構築するもの、ランタイム層はワークロードを要件を満たすインフラに編成し、継続監視とリアルタイムのポリシー執行を提供する。インフラ層は具体的なハードウェア資源だ。DOCA は BlueField のセキュリティ基盤をプログラム可能にし、OpenShell のポリシーと接続して、ID ガバナンス付きの完全な行動記録を作り出す。
影響を受けるのは誰か
最も直接的なのは、本番環境で既にエージェントを動かしている企業チームだ。OpenShell がオープンソースであるため、既存の CPU 環境でまずサンドボックスとポリシーを試せる。Sentry は NVIDIA ハードウェア利用者向けのアップグレードで、Vera Rubin POD では各コンピュートトレイに BlueField-4 DPU が搭載され、ノードからモデルへの唯一の経路上に位置する。既存の Vera システム利用者はソフトウェア更新一度で保護を有効化できると NVIDIA は説明する。
インフラベンダーとオープンソースコミュニティにとっては、一種の「線引き」だ。エージェントのランタイムとポリシー言語はオープンであるべきで、どのベンダーも接続できる。Anthropic や SpaceX などが提携を通じて採用していると報じられている。
エージェントの安全制御をチップにまで沈めることは、一つの認識を意味する。訓練とプロンプトだけでは、もはや自分で抜け道を見つけるエージェントを抑えられない。ここ数週間、複数のフロンティア研究所がエージェントの評価環境からの脱出や、本来触れるべきでないシステムへの到達を相次いで開示した。NVIDIA の答えは 1990 年代のインターネットの古い手法の借用だ。当時はブラウザのサンドボックスがウェブページのコードから PC 全体を守った。今度はエージェントに同じ信頼層を与える番だ。ここでの安全は革新のブレーキではなく、エージェント経済を成立させる前提条件なのである。