2026년 9월 30일, OpenAI는 공식 블로그에 「Disrupting a coordinated model-distillation campaign」이라는 글을 올려 자사 모델을 겨냥한 '적대적 증류(adversarial distillation)' 공격을 공개하고 차단했다고 밝혔다. 공격자는 7월 1일부터 정교하게 조작된 수만 건의 요청으로 모델에 숨겨진 내부 추론을 추출하려 했으며, OpenAI는 이 활동의 핵심 조직을 Moonshot AI(Kimi 개발사) 관련 인사로 특정하고 7월 28일 완전히 차단했다고 설명했다.
노린 것은 답이 아니라 '사고 과정'
공격의 표적은 모델의 답변이 아니라 OpenAI가 '보호 추론(protected reasoning)'이라 부르는, 문제 해결 과정의 내부 기록이었다. 이를 손에 넣으면 공격자는 모델의 능력을 복제하고, 최종 답변에서 의도적으로 숨겨진 정보를 캐내어 자사 모델 훈련에 활용할 수 있다.
수법은 교묘했다. 공격자는 한 대화에서 암호화된 추론을 복사한 뒤, 다른 대화에서 모델에게 그 숨겨진 내용의 '복호화와 전사'를 요구했다. 암호를 깨뜨리지도, 데이터베이스에 침입하지도, 실제 사용자 대화를 열람하지도 않았다. 우회된 것은 대화 흐름 그 자체였다. 암호화된 추론이 대화 사이를 오가며 휴대·재생될 수 있었던 것이다.
규모를 보면 7월 초 소규모 탐색으로 시작해 7월 24~25일에 정점을 찍었다. 이틀간 추출 특징을 가진 요청 16,000건이 4,000명이 넘는 사용자에게서 발생했고, 관련 프롬프트 패턴은 1만 5,000명이 넘는 사용자에게 퍼져 있었다. OpenAI는 각주에서 이 수치는 '시도 횟수'이며 전부 성공한 것은 아니라고 밝혔다.
OpenAI가 이를 국가안보 문제로 격상한 이유
OpenAI의 발표 어조는 강했다. 추출된 추론은 다른 모델 훈련에 쓰일 수 있는데, 새 모델은 원본 모델 출력에 적용된 안전 가드레일을 물려받지 않는다. 대규모 증류는 '능력 이전'의 비용은 낮추지만 그에 상응하는 안전 투자는 이전하지 않는다. 생물·화학 같은 이중용도 분야에서 모델이 강해질수록, 이런 '벌거벗은 능력 이전'은 국가안보 이슈가 된다는 논리다.
고립된 사건도 아니다. 올여름 Anthropic이 공개한 Claude 대상 유사 증류 활동 역시 Moonshot AI를 가리켰다. OpenAI는 이번에 독립 보안 연구자들이 책임 있는 공개를 통해 제보한 관련 취약점도 함께 확인하고, 발견 내용을 Frontier Model Forum을 통해 업계 파트너와 정부 정보공유 채널에 전달했다. 자사의 뒷수습이 아니라 업계 공통의 위협으로 규정한 셈이다.
OpenAI는 어떻게 막았고, 일반 사용자는 무엇을 주의해야 하나
대응으로 OpenAI는 사기 계정을 차단·제한하고, 가입 및 인프라 통제를 강화했으며, '암호화 추론 재생' 경로를 막고, 추론 유출 가능성이 있는 스트리밍 출력을 탐지하는 장치를 추가했다. 활동이 제3자 서비스를 경유한 경우에는 해당 사업자와 협력해 차단했다. 증류 공격 공개 바로 전날, 본 사이트는 OpenAI 보안 사고 전야: 수개월 전 직원의 경고 메일은 무시됐다는 소식도 전했다. OpenAI의 안전 서사는 지난 두 달간 '자발적 공개'와 '몰린 뒤의 폭로' 사이를 오가고 있다.
일반 사용자와 개발자에게 주는 교훈은 분명하다. '모델의 숨겨진 사고 과정을 풀어준다'고 광고하는 서드파티 도구들은 이번 공격과 기술적으로 같은 길을 간다. 그런 도구를 쓰는 것은 자신의 계정을 이 회색 공급망의 하류에 넘기는 것과 같다.
더 깊은 차원에서, 이번 사건은 프런티어 기업 해자의 균열을 드러냈다. 추론 암호화 자체는 깨지지 않았다. 깨진 것은 '암호화된 추론은 대화 사이를 오갈 수 있다'는 설계상의 전제다. 앞으로의 방어는 출력 텍스트만 볼 것이 아니라 호출 체인 전체를 봐야 한다. 증류를 둘러싼 공방은 앞으로 더 정교해질 것이다.