2026년 1월 9일, Anthropic은 "차세대 헌법 분류기"(Constitutional Classifiers++라고도 함)를 출시하기 위한 연구 논문과 보고서를 발표하여 대형 모델의 "일반 탈옥" 공격으로부터 보호 효율성을 향상시키기 위해 발표했습니다. 관계자들은 새 시스템이 생산 배치 시 추가 컴퓨팅 파워 오버헤드를 약 1%로 줄이고, 무해한 요청에 대한 거부율을 0.05%로 낮추며, 테스트 및 공격 및 방어 레드팀 구성에서 안정적으로 작동하는 범용 탈옥 솔루션은 찾지 못했다고 밝혔습니다.
이 체계의 핵심은 결합된 방어선입니다: "대화 교환" 분류기를 사용해 입력과 출력을 동일한 맥락에 배치하고, 2단계 연쇄 구조로 모든 대화를 가벼운 스크리닝으로 덮으며, 의심스러운 콘텐츠만 더 강력한 분류기로 업그레이드합니다. 연구는 또한 기존 시스템이 여전히 두 가지 유형의 기법에 사용될 것임을 지적했습니다: 해로운 정보를 겉보기에는 무해한 조각으로 분해해 다시 조립하는 '리팩토링 공격'과, 비유와 대체어를 사용해 출력물을 무해하게 보이게 하는 '출력 난독화'입니다.
자주 묻는 질문
Q: Anthropic의 Constitutional Classifiers++는 주로 무엇을 해결하나요?
A: 이 시스템은 대규모 모델 보안 보호에 중점을 두고 있으며, 가드레일을 우회하는 '범용 탈옥'의 성공률을 줄이는 데 중점을 두고 비용과 허위 거부를 통제합니다.
Q: 이전 세대에 비해 Constitutional Classifiers++의 개선점은 어디에 있나요?
답변: 주요 변화는 입력과 출력을 동일한 '교환' 공동 구별으로 사용하고, 2단계 연쇄 및 프로브 통합을 통해 컴퓨팅 파워 오버헤드와 무해한 거부 효과를 줄이는 것입니다.
Q: 연구에서 '보편적 탈옥'이란 무엇을 의미하나요?
A: 다양한 질문에 대해 보안 메커니즘을 안정적으로 우회하고 모델이 지속적으로 제한된 콘텐츠를 출력하도록 유도하는 공격 전략 집합을 의미합니다.
Q: 기업이나 개발자가 이러한 보안 분류기에 접근할 때 주의해야 할 점은 무엇인가요?
답변: 허위 거절이 비즈니스 프로세스, 대화 기록 및 민감한 데이터의 준수 처리, 그리고 레드팀 커버리지 부족으로 인한 잔여 위험에 미치는 영향은 여전히 평가되어야 합니다.