nthropic은 DeepSeek, Moonshot AI, MiniMax 세 개의 AI 연구소를 클로드에 대해 "산업 규모" 증류 능력 추출 작전을 시작했다고 발표했습니다. 약 24,000개의 사기 계정을 통해 1,600만 건 이상의 클로드와의 상호작용이 생성되어 자체 모델을 학습 및 개선했으며, 서비스 약관 및 지역 접근 제한 위반 혐의가 있었습니다.
발표에서는 '증류' 자체가 일반적인 교육 방법이지만, 경쟁사들이 사기성 계정, 프록시 서비스, 반복 높은 일괄 프롬프트를 사용해 추론, 도구 사용, 코딩 등 차별화된 능력을 중앙에서 추출할 경우, 보안 방위가 약화되고 보안 위험을 초래할 것이라고 지적했습니다. 세 가지 작업 중 문샷은 약 340만 건, 미니맥스는 약 1,300만 건, 딥시크는 규모는 작지만 '단계별 추론 궤적' 출력을 유도하는 전략을 포함했습니다.
Anthropic은 탐지와 행동 지문 인식 등 학대 취약한 경로의 검증을 강화하고, 교육 및 연구를 개선했으며, 기술 지표를 다른 기관과 공유했다고 밝혔습니다. 불법 증류에 사용되는 산출물의 효과를 줄이기 위해 제품, API, 모델 수준에서의 대응책도 개발됩니다. 발표에서는 이러한 공격이 모델 수출과 컴퓨팅 파워 제한에 관한 정책 논의에 영향을 미칠 수 있으나, 관련 외부 영향은 모든 당사자의 후속 조치에 달려 있다고 언급했습니다.
자주 묻는 질문
질문: 이 사건의 주인공은 누구입니까?
A: 이 발표는 Anthropic에서 이루어졌으며, 모델인 Claude와 이름이 붙은 DeepSeek, Moonshot AI, MiniMax가 참여했습니다.
Q: 증류 공격은 일반 증류와 어떻게 다른가요?
답변: 일반 증류는 주로 내부 압축과 비용 절감이 동일 기관 내에서 이루어집니다; 디스틸레이션 공격은 사기 계정과 대규모 프롬프트를 통해 경쟁사의 역량을 추출하는 것을 의미합니다.
Q: 공개된 규모 데이터는 무엇인가요?
A: 약 24,000건의 사기 계정과 1,600만 건 이상의 클로드와의 상호작용; 그중 문샷은 약 340만 회, 미니맥스는 약 1,300만 회에 달했습니다.
Q: 이러한 유형의 공격에서 주로 어떤 기능을 추출하나요?
A: 공지에는 추론 능력, 도구 사용, 코딩 및 에이전트 작업 등이 중점을 두고 있다고 명시되어 있습니다.
Q: 일반 사용자가 알아야 할 위험은 무엇인가요?
A: 가드레일 없이 모델이 확산되면 남용 위험이 증가할 수 있다면; 사용자들은 에이전트 재판매나 비정상적으로 저렴한 '프록시 액세스'와 같은 서비스에도 주의해야 합니다.