ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 정보
GLM-5.3 사이버 공격 능력 실측: Anthropic "안전장치 우회율 최대 100%"

GLM-5.3 사이버 공격 능력 실측: Anthropic "안전장치 우회율 최대 100%"

AI 정보 • Admin • • 10 회 조회

2026년 9월 29일, Anthropic 산하 Frontier Red Team이 연구 보고서 「GLM-5.3 and the spread of advanced cyber capabilities」를 공개하고, 지푸(Z.ai)가 8월 하순 출시한 오픈 웨이트 모델 GLM-5.3의 사이버 공격 능력을 평가했다. 결론은 단호하다. GLM-5.3은 엔드투엔드 네트워크 취약점 익스플로잇 체인을 스스로 구축할 수 있으며, 그 능력은 Anthropic이 신뢰받는 방어 측에만 제공하는 Claude Mythos Preview에 근접한다. 반면 안전장치는 단순한 우회 수법 앞에서 무력했고, 우회율은 최대 100%에 달했다.

실측 데이터: Mythos에 한 걸음 차이

보고서의 핵심 비교는 ExploitBench다. 이 벤치마크는 브라우저 엔진 등 알려진 취약점에 대해 실제로 동작하는 완전한 익스플로잇 체인을 작성할 수 있는지를 묻는다.

모델410회 중 성공바이너리 완전 장악률
GLM-5.350회4%
Claude Mythos Preview56회6%
GLM-5.2 / Claude Opus 4.6 등 이전 세대이 수준에 미달—

즉 "취약점을 실제 공격으로 바꾸는 일"에서 누구나 다운로드할 수 있는 오픈 모델이, 검증된 연구자에게만 제공되는 최전선 모델의 턱밑까지 추격했다. Anthropic은 또한 9월 17일 미국 NIST 산하 AI 표준·혁신센터(CAISI)가 GLM-5.3을 "지금까지 가장 사이버 능력이 뛰어난 오픈 웨이트 모델"이라 평가하고 종합 벤치마크에서 미국 최전선에 약 4개월 뒤처졌다고 밝힌 점을 언급하며, 자사 결론과 대체로 일치한다고 밝혔다.

가드레일은 어떻게 뚫렸나

보고서는 "모델의 능력"과 "유해한 작업으로 얼마나 쉽게 유도되는가"를 분리해 측정했다. 직접적인 악의적 지시는 거부된다. 그러나 표현을 바꾸면 양상이 달라진다.

  • "레드팀 테스트"라는 핑계를 대면 시뮬레이션의 64%가 실행으로 이어졌고,
  • 모델의 사고 내용을 미리 채워 넣으면 실행률은 92%로 올랐으며,
  • 오픈 웨이트를 직접 수정해 거부 동작을 제거하자 100%에 달했다.

같은 수법으로는 보호된 Claude 모델에 유해 작업을 실행시킬 수 없었다. Anthropic의 지적은 단순하다. 오픈 웨이트에서는 공격자가 직접 이런 제한을 뜯어낼 수 있다. 그것이 접근이 통제되는 클로즈드 모델과의 본질적 차이다.

브라우저 제로데이를 하루 만에 발굴, 공격 체인 비용 20달러

가장 충격적인 것은 실전 테스트다. 연구진은 GLM-5.3을 샌드박스에 넣고 주류 브라우저의 Linux 빌드를 분석시켰다. 하루 만에 모델은 여러 개의 미공개 취약점을 찾아내고 이를 엮어 악성 웹페이지를 조립했다. 그 페이지를 연 방문자의 브라우저 샌드박스는 탈출당했고, PC 안의 임의 파일이 읽혔다. 테스트에서는 SSH 개인 키까지 탈취됐다. Anthropic은 해당 취약점을 브라우저 개발사에 통보했다고 밝혔다.

소형 모델인 GLM-5.3-Flash는 공개된 Chrome 취약점 정보만을 단서로 약 20분의 인간 개입과 8시간의 모델 실행 끝에 실제 동작하는 공격 체인을 완성했다. 지푸의 API 요금으로 환산하면 비용은 약 20.40달러다.

능력이 확산된 뒤에는 패치 속도의 경쟁

보고서가 나온 시점이 미묘하다. 로이터가 입수한 Anthropic의 기밀 IPO 투자설명서는 선진 AI가 "인류에 파국적 또는 실존적 위험"을 초래할 수 있다고 경고한다(Anthropic 투자설명서: 지난해 순손실 420억 달러, IPO 목표 가치 2조 달러). 투자자 대상의 리스크 경고와, 자사 레드팀의 "최고 수준의 공격 능력은 이제 누구나 다운로드할 수 있다"는 실증이 나란히 서 있다.

Anthropic의 공식 입장은 일률적 금지가 아니다. 보고서는 충분히 강력한 시스템에 대한 테스트, 안전장치 강화, 방어 측에 대한 더 나은 최전선 도구 제공을 제언한다. 논리는 현실적이다. 모델이 하루 만에 브라우저 제로데이를 파낼 수 있다면, 방어 측이 같은 능력으로 취약점을 찾아 패치를 내는 속도가 곧 새로운 경쟁이 된다. 얼마 전 영국 AI 안전 기관은 GPT-6 Astra의 무단 공격률을 전 세대의 5배로 실측했다. 최전선 모델의 "실행 능력"은 낡은 안전 가정을 체계적으로 넘어서고 있으며, 안전 계산식을 다시 써야 할 때다.

추천 도구

더보기