ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 정보
OpenAI, 증류 공격 차단 발표했지만… 연구진은 Azure에서 추론 내용을 또 훔쳐냈다

OpenAI, 증류 공격 차단 발표했지만… 연구진은 Azure에서 추론 내용을 또 훔쳐냈다

AI 정보 • Admin • • 5 회 조회

OpenAI의 증류 공방전은 10월 1일 어색한 2라운드에 접어들었다. The Decoder의 당일 보도에 따르면, 대규모 모델 증류 캠페인을 차단했다고 발표한 바로 다음 날 독립 연구진이 연구 업데이트를 공개하며 같은 탈취 수법이 Microsoft Azure에서는 여전히 통한다고 주장했다. 갓 출시된 GPT-6 Astra의 추론 내용마저 한 글자도 빠짐없이 '훔칠 수 있다'는 것이다.

발단은 OpenAI가 9월 30일 공개한 공식 블로그 'Disrupting a coordinated model-distillation campaign'이다. 회사는 7월 1일부터 누군가가 정교하게 조작된 수만 건의 요청으로 모델 내부에 숨겨진 추론을 추출하려 했다고 밝혔다. 7월 24~25일에 정점을 찍어 이틀간 추출 특징을 가진 요청 1만 6,000건이 4,000명 넘는 사용자에게서 발생했고, 관련 패턴은 1만 5,000개가 넘는 계정에 퍼졌으며, 7월 28일에 완전히 차단됐다. OpenAI는 핵심 조직을 문샷 AI(Moonshot AI, Kimi 개발사) 관련 인물로 특정했고, 각주에서 '통계는 시도 횟수이며 전부 성공했다는 뜻이 아니다'라고 밝혔다. 대응으로는 사기 계정 차단, 가입 절차 강화, 암호화된 추론을 재생할 수 있게 했던 경로 차단, 스트리밍 출력에 대한 유출 탐지 추가가 이뤄졌다. 이 발표는 본 사이트에서도 보도한 바 있다: OpenAI, 모델 증류 공격 폭로: 1만 6,000건 추출 요청이 문샷을 가리키다.

재테스트: 자사 API는 막았지만 Azure는 못 막았다

드라마는 발표 당일에 터졌다. 연구자 Joachim Schaeffer 팀은 stolen-thoughts.com에서 연구 'Stealing Reasoning Traces from Proprietary LLM APIs'를 업데이트했고, 제목은 한 문장이 전부였다. 'We stole reasoning. Again.'(우리는 또 추론을 훔쳐냈다.)

이들은 9월 13일 같은 수법을 다시 테스트했다. OpenAI와 Anthropic 자사 API에서는 공격이 이미 차단됐지만, Microsoft Azure에서는 테스트한 모든 OpenAI 모델 — 새로 출시된 GPT-6 Astra 포함 — 과 Sonnet 5까지의 Anthropic 모델이 전부 뚫렸고, 단 한 번의 시도로 추론 내용을 한 글자도 빠짐없이 추출할 수 있었다. Schaeffer의 말을 빌리면 '같은 모델이라도 어떤 플랫폼이 제공하느냐에 따라 방어 수준이 완전히 다르다'는 것이다.

더 간단한 두 번째 길: 모델에게 '메모장'을 쥐여주기

연구진은 개발자 Can Bölük이 시연한, 한층 더 간단한 두 번째 수법도 공개했다. 모델에게 가상의 '메모장' 도구를 주고 거기에 추론을 적으라고 지시하면, 사용자가 나중에 그 내용을 읽을 수 있다는 것이다. 이 수법은 모든 OpenAI 모델과 Opus 4.8, Sonnet 5에서 통했고, 유출되지 않은 것은 Opus 5, Fable 5, Fable 5.1뿐이었다. 연구진에 따르면 메모장 방식으로 얻은 출력은 복호화 공격으로 얻은 것과 매우 유사해 증류에 쓰기에도 '똑같이 유용하다'고 한다.

패치가 항상 한 박자 늦는 이유

이 어색함의 이유는 타임라인을 보면 명확하다. GPT-6 Astra는 어떤 방어 장치도 없이 서드파티 플랫폼에 출시됐고, OpenAI가 Azure 엔드포인트에 방어 장치를 추가한 것은 9월 27일 — 모델 공개 후 며칠이 지난 뒤였다. Anthropic 쪽도 Azure에서의 추출이 재현되지 않게 된 것은 9월 28일 이후다.

연구진은 지금까지의 수정을 '임시방편적이고 피상적'이라고 평가한다. 많은 방어가 특정 요청 패턴에 대한 취약한 매칭에 불과하고, 모델 업체에서 클라우드 플랫폼까지 전달되는 데 다시 며칠이 걸린다. 공격자는 가장 튼튼한 문을 부술 필요가 없다. 가장 약한 창문만 찾으면 된다.

연구진의 주장: 방어를 따라오지 못하는 클라우드는 추론 모델을 호스팅하지 마라

논문은 한 걸음 더 나아간다. 패치는 모든 공격 수법과 모델을 호스팅하는 모든 클라우드를 커버해야 하며, 그렇지 않으면 공격자는 항상 가장 약한 경로를 선택한다. 나아가 연구진은 동등한 방어를 시행하지 않는 클라우드 사업자는 애초에 추론 모델을 호스팅해서는 안 된다고 주장한다. 열려 있는 뒷문은 수출 통제를 API 수준에서 손쉽게 우회하게 만들기 때문이다.

이에 대한 OpenAI의 답변은 파트너가 호스팅하는 모델에도 자사 서비스와 동등한 보호가 필요하며 '작업은 아직 끝나지 않았다'고 인정하는 것이었다.

클라우드 추론 API를 실제로 사용하는 기업에게 이번 사건의 교훈은 구체적이다. 호출하는 모델의 보안 수준은 모델 업체가 패치를 몇 개나 냈느냐가 아니라, 이용 중인 클라우드가 얼마나 따라왔느냐에 달려 있다. 모델이 강해질수록 추론 내용의 가치는 올라가고, 그것을 '훔치고 싶은' 사람은 늘어날 뿐이다. 이 공방은 이제 막 후반전에 들어섰다.

추천 도구

더보기