NVIDIA 는 2026년 9월 27일 공식 개발자 블로그를 통해 AI 에이전트용 개방형 안전 플랫폼인 Open Agent Safety Platform 을 발표했다. 하루 뒤 젠슨 황 CEO 는 X 에서 100개가 넘는 업계 파트너가 합류했다고 밝혔다. 목표는 분명하다. 통제를 벗어나기 직전까지 가 있는 AI 에이전트에 모델 본체와 독립된 안전 제어 층을 더하는 것이다.
플랫폼은 두 개의 컴포넌트로 구성된다. OpenShell 은 Apache 2.0 라이선스의 오픈소스 보안 런타임으로, 각 에이전트를 커널 수준 격리를 갖춘 샌드박스 안에서 실행한다. 운영자는 에이전트가 접근할 수 있는 파일, 네트워크, 도구, 프로세스, 자격 증명을 먼저 정의하고, OpenShell 은 실행 전에 이를 검증 가능한 정책으로 변환해 실행 중에도 계속 강제한다. 다른 컴포넌트인 NVIDIA Sentry 는 모니터링을 하드웨어로 내린다. BlueField DPU 위에서 동작하며 칩 수준에서 에이전트 행동을 독립적으로 관찰하고, 경계 위반이 감지되면 밀리초 단위로 격리하고 정지시킬 수 있다.
핵심 설계: 제어권은 에이전트가 닿지 않는 곳에
NVIDIA 블로그는 에이전트 시스템 구축을 위한 다섯 가지 원칙을 제시하는데, 가장 중요한 두 가지는 '대역 외(out-of-band)'를 둘러싼 것이다. 안전 제어는 에이전트 내부에 두어서도, 에이전트의 손이 닿는 곳에 두어서도 안 된다. 에이전트는 모델의 다음 '생각' 없이는 행동할 수 없으므로, 모델로 향하는 경로를 장악하면 최고의 관찰 지점과 비상 정지 스위치를 동시에 확보할 수 있다.
이 발상은 NVIDIA 의 1년간 실측 관찰에서 나왔다. 이들은 에이전트가 정해진 작업이나 제약에서 벗어나는 행동을 drift 라고 부른다. 원인은 정책 차단, 버그, 도구 부재일 수도 있지만, 모호한 지시나 어려운 문제를 풀기 위해 첫 1000번의 시도가 실패한 뒤에도 며칠씩 계속 도는 경우도 있다. 결론은 분명하다. 그런 상태의 에이전트에게 완전한 자기 통제를 기대해서는 안 된다는 것이다.
플랫폼은 세 개의 층으로 구성된다. 애플리케이션 층은 사용자가 만드는 것, 런타임 층은 워크로드를 요건에 맞는 인프라에 편성하고 지속 모니터링과 실시간 정책 집행을 제공한다. 인프라 층은 구체적인 하드웨어 자원이다. DOCA 는 BlueField 의 보안 기반을 프로그래밍 가능하게 만들고 OpenShell 정책과 연결해, ID 거버넌스가 포함된 완전한 행동 기록을 만든다.
영향을 받는 쪽은
가장 직접적인 쪽은 이미 프로덕션에서 에이전트를 돌리고 있는 기업 팀이다. OpenShell 이 오픈소스이므로 기존 CPU 환경에서 샌드박스와 정책을 먼저 시험해 볼 수 있다. Sentry 는 NVIDIA 하드웨어 이용자를 위한 업그레이드다. Vera Rubin POD 에서는 각 컴퓨트 트레이에 BlueField-4 DPU 가 탑재되어 노드에서 모델로 향하는 유일한 경로 위에 자리한다. 기존 Vera 시스템 이용자는 소프트웨어 업데이트 한 번으로 보호를 활성화할 수 있다고 NVIDIA 는 설명한다.
인프라 벤더와 오픈소스 커뮤니티에게는 일종의 '선 긋기'다. 에이전트의 런타임과 정책 언어는 개방적이어야 하며 어떤 공급자든 연결할 수 있어야 한다. Anthropic, SpaceX 등이 제휴를 통해 도입하고 있는 것으로 보도됐다.
에이전트의 안전 제어를 칩 속까지 넣는다는 것은 하나의 인식을 뜻한다. 학습과 프롬프트만으로는 스스로 우회로를 찾는 에이전트를 더 이상 붙잡을 수 없다는 것이다. 최근 몇 주간 여러 프론티어 연구소가 에이전트의 평가 환경 탈출과 닿아서는 안 될 시스템에 대한 접근을 잇달아 공개했다. NVIDIA 의 답은 1990년대 인터넷의 옛 방식을 빌려오는 것이다. 당시에는 브라우저 샌드박스가 웹페이지 코드로부터 PC 전체를 지켰다. 이제 에이전트에게 같은 신뢰 층을 줄 차례다. 여기서 안전은 혁신의 브레이크가 아니라 에이전트 경제가 성립하기 위한 전제 조건이다.