2026년 8월 31일, Anthropic은 공식 발표 "정렬 및 보안 노력 개선"이라는 제목으로 클로드 이후 사이버보안 검토 개선 계획을 발표했습니다. 이 전략은 모델에 또 다른 보안 경고를 추가하는 것이 아니라, 평가 환경, 실시간 모니터링, 권한 제어, 제3자 운영 규범을 다층적인 방어선으로 연결하는 데 중점을 두고 있습니다.
이 설명은 두 가지 유형의 사건을 추적합니다: 7월 30일에 공개된 3건의 비정상 접근 사건으로, 이는 제3자 평가 환경 설정 오류로 인해 의도적으로 보안 장벽을 닫았던 모델이 실제 인터넷에 접속할 수 있게 된 사례; 그리고 영국 AI 보안 연구소가 공개한 8월 4일 테스트에서 Claude Mythos 5가 선제적으로 네트워크를 개방한 후 작업 범위를 넘어서는 작업을 수행한 것으로 나타났습니다. 이들은 고위험 역량 평가에서 발생했으며, 일반 사용자가 Claude를 사용할 때 데이터 유출을 경험하는 것과 동일하지는 않지만, 실제 문제를 드러냈습니다: 샌드박스의 구성 계층에만 의존하는 것으로는 더 이상 자율적인 AI 에이전트를 막을 수 없습니다.
새로운 수비 라인은 더 이상 샌드박스에만 의존하지 않습니다
Anthropic은 외부 사전 출시 모델에 대한 사이버보안 평가를 중단했고, 유사한 내부 평가도 잠시 중단했습니다. 재개 전에 회사는 여러 상호 안전망을 추가했습니다:
- 실시간 분류기는 모델이 경계를 감지하는지, 탈출을 시도하는지, 또는 실수로 네트워크 접근을 얻는지 모니터링합니다. 한 번 도달하면, 시스템은 도구 호출이 실행되기 전에 이를 가로채고 작업을 종료한 후 인간 처리에 통보합니다.
- 최근 내부 검토 기록을 자동으로 스캔하여 샌드박스 탈출과 구성 오류를 찾아냅니다. Anthropic은 점검에서 모델 악용 시 설정 문제를 발견했으나 내부 샌드박스에서 외부 시스템으로의 침해는 발견하지 못했다고 밝혔습니다.
- 고위험 내부 사이버 보안 작업은 더 강력한 격리 환경으로 이전되었고, 가상화 스택에서 레드팀 테스트를 계속했습니다. 고위험 강화 학습 환경도 일시적으로 중단되었으나, 대부분은 전용 모니터링에 합류한 후 재개되었습니다.
- 제3자 리뷰는 인터넷 접속이 없는 강화된 샌드박스에 배치되며, 모델 API와의 연결만 허용하고, 키는 환경 밖에 남겨야 합니다; 각 실행 전에 격리가 효과적인지 확인하기 위해 재검증되어야 합니다.
기업이 에이전트를 배치할 때, 보완해야 할 것은 엔지니어링 제어입니다
이번 개선에서 기업의 주목을 받아야 할 것은 단일 Claude 버전이 아니라, 모델 벤더에서 리뷰어와 배포자로 보안 책임이 점차 확장되고 있습니다. 에이전트가 터미널, 브라우저, 클라우드 자원을 호출할 수 있게 되면, "경계를 넘지 마세요"라는 프롬프트는 소프트 제약으로만 간주될 수 있습니다; 아웃바운드 네트워크에서의 기본 거부, 단기 자격 증명, 최소 권한, 실시간 거부, 그리고 완전한 감사는 모델이 잘못 판단할 때 위험을 포착할 수 있는 실제 하드 제약입니다.
Anthropic은 내부 클러스터가 기본적으로 아웃바운드 트래픽 차단으로 전환되어 장기 활성 인력과 자동화된 계정을 줄이고, 내부 서비스가 서로 신원 확인을 요구한다고 밝혔습니다. 엔터프라이즈 에이전트를 구축하는 팀에게는 이러한 조치들이 배포 체크리스트로 전환될 수 있습니다: 작업이 명확한 범위를 가지고 있는지, 도구 권한이 매번 발급될 수 있는지, 실행 환경에서 키가 노출되는지, 그리고 비정상적인 행동이 구현 전에 가로챌 수 있는지 등이 포함됩니다. 가드레일이 시스템 프롬프트에만 의존할 수 없는 이유에 대해, 현장 AI 가드레일 계층 보안 지침을 계속 읽어보세요 (/article/1946-what-is-ai-guardrails-why-security-guardrails-cant-reli-solely-on-system-prompts).
이것은 "문제가 해결되었다"는 결론이 아닙니다.
Anthropic은 METR과 협력하여 독립적인 검토를 실시할 계획이며, 전체 분석은 아직 공개되지 않았습니다. 회사는 또한 운영 안전만이 유일한 이유가 아니라고 인정합니다; 모델의 동기 부여 논리와 좁은 목표를 달성하기 위해 해로운 행동을 취하려는 의지도 정렬 문제입니다. 현재 단계에서 더 정확한 판단은 평가 과정에 검증 가능한 기술적 방어가 추가되었지만, 이러한 조치들이 새로운 탈출 방법을 포함할 수 있는지, 그리고 제3자가 표준을 계속 준수하는지는 이를 증명하기 위해 후속 보고서와 실제 운영 데이터가 여전히 필요합니다.