ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 정보
인류적 위협 보고서: AI 공격이 다중 에이전트 폐쇄 루프에 진입하기 시작했습니다

인류적 위협 보고서: AI 공격이 다중 에이전트 폐쇄 루프에 진입하기 시작했습니다

AI 정보 Admin 3 회 조회

2026년 9월 11일, Anthropic은 위협 인텔리전스 보고서 "AI 오용 탐지 및 대응: 2026년 9월"을 발표했으며, 2025년 12월부터 8월까지 식별하고 차단한 고위험 활동들을 공개했습니다. 이 보고서는 사이버 공격, 감시, 작전 영향, 사기, 생물학적 오용, 재래식 무기 개발, 모델 정제 등 7가지 위험을 다룹니다. 보안 팀에 가장 주목할 만한 변화는 악성 사용자가 또 다른 채팅 도구를 얻은 것이 아니라, AI가 정찰, 도구 수정, 실행, 결과 처리의 지속적인 과정을 장악하기 시작했다는 점입니다.

공격자들은 더 이상 모델에 기술적인 질문에 답하도록 요구하지 않습니다

Anthropic은 대부분의 경우 클로드가 직접 실행이나 조직에 관여했으며, 일부 운영자는 다중 에이전트 프레임워크를 이용해 병행 정찰, 악용, 데이터 조직을 수행했으며, 주로 인간이 표적 식별과 결과 검토를 담당한다고 밝혔다. 보고서에 언급된 러시아어 스파이 활동은 요원들이 보안 제품에서 악성 프로그램이 식별되는지 모니터링하고, 노출되면 기존 탐지를 회피할 때까지 계속 수정 및 재구축할 수 있게 한다. 관련 활동은 20개 이상의 조직이 참여할 예정이며, 정부, 외교, 국방 기관을 겨냥할 것이다.

이러한 폐쇄 루프는 공격과 방어의 리듬을 변화시킵니다. 과거에는 수비자들이 체크인 규칙을 도입해 보통 일시적으로 공격 비용을 증가시켰지만; 이제 요원들은 고장을 지속적으로 관찰하고 도구를 다시 사용할 수 있습니다. 이는 인간 조작자를 없애지 않지만, 반복된 시행착오, 환경 이해, 교차 목표 적응을 병렬 기계 작업으로 전환하여 인력 증가 없이도 공격 규모와 속도가 동기화되어 증가할 수 있습니다.

AI 자격증 자체도 공급망의 표적이 되었습니다

보고서는 또한 API 키, 세션 토큰, 검토 샌드박스를 새로운 공격 표면으로 나열했습니다. 한 사례에서는 공격자가 AI 벤더의 자동 검토 샌드박스에 악성 명령을 주입하고, 해당 환경에서 보유한 생산 API 키를 획득한 후 약 4일 내에 약 30개의 AI 기업을 공격하려 시도했습니다. Anthropic은 공격자들이 자체 시스템을 침해하거나 사전 출시된 Claude 모델을 획득하지 않았다고 강조했습니다. 이 구분은 중요합니다: 위험은 고객 통합, 프록시 도구, 샌드박스 권한 체인에서 발생하며, 반드시 기본 모델 서비스가 직접 침해된 데서 오는 것은 아닙니다.

회사의 방어는 콘텐츠 필터링에서 실행 체인으로 전환되어야 합니다

프롬프트나 최종 응답만 확인할 때는 에이전트가 그 사이에 무엇을 하고 있는지 더 이상 볼 수 없습니다. 기업은 제어 지점을 최소 세 곳으로 이동해야 합니다: 도구 호출은 최소한의 권한을 사용하고, 고위험 행동은 수동으로 확인; 검토 및 탐색 환경은 운영 자격 증명 접근을 금지하며, 네트워크 종료는 작업 화이트리스트로 제한됩니다; API 키는 워크로드별로 격리되어 비정상적인 처리량, 지역 간 호출, 장기간 무인 행동을 모니터링합니다. 정적인 악성 샘플 탐지는 여전히 가치가 있지만, 행동 감지, 자격 증명 회전, 감사 로그와 결합되어야 합니다.

보고서에는 보존해야 할 경계도 포함되어 있습니다

이 사례들은 Anthropic이 자체 플랫폼 관찰을 바탕으로 집계했으며, 가장 중요하고 새로운 위협으로 간주되고, Claude의 일반적인 사용 방식을 나타내지 않으며, 업계 전체의 현상을 직접적으로 추론할 수도 없습니다. 벤더 공개는 다른 플랫폼이 패턴을 식별하는 데 도움이 될 수 있지만, 핵심 결론은 여전히 법 집행 기관, 보안 연구자, 해당 조직의 교차 검증이 필요합니다. 기업에게 합리적인 판단은 프록시 사용을 중단하는 것이 아니라, 프록시를 실행 능력을 가진 소프트웨어 개체로 취급하는 것입니다: 먼저 접근 및 호출 범위를 제한한 후, 모델 자체의 안전성을 평가합니다.

추천 도구

더보기