돌아가기 AI 정보
Anthropic이 약 1%의 컴퓨팅 파워 오버헤드로 Constitutional Classifiers++: Combat Universal Jailbreaks를 출시했습니다

Anthropic이 약 1%의 컴퓨팅 파워 오버헤드로 Constitutional Classifiers++: Combat Universal Jailbreaks를 출시했습니다

AI 정보 Admin 69 회 조회

2026년 1월 9일, Anthropic은 "차세대 헌법 분류기"(Constitutional Classifiers++라고도 함)를 출시하기 위한 연구 논문과 보고서를 발표하여 대형 모델의 "일반 탈옥" 공격으로부터 보호 효율성을 향상시키기 위해 발표했습니다. 관계자들은 새 시스템이 생산 배치 시 추가 컴퓨팅 파워 오버헤드를 약 1%로 줄이고, 무해한 요청에 대한 거부율을 0.05%로 낮추며, 테스트 및 공격 및 방어 레드팀 구성에서 안정적으로 작동하는 범용 탈옥 솔루션은 찾지 못했다고 밝혔습니다.

이 체계의 핵심은 결합된 방어선입니다: "대화 교환" 분류기를 사용해 입력과 출력을 동일한 맥락에 배치하고, 2단계 연쇄 구조로 모든 대화를 가벼운 스크리닝으로 덮으며, 의심스러운 콘텐츠만 더 강력한 분류기로 업그레이드합니다. 연구는 또한 기존 시스템이 여전히 두 가지 유형의 기법에 사용될 것임을 지적했습니다: 해로운 정보를 겉보기에는 무해한 조각으로 분해해 다시 조립하는 '리팩토링 공격'과, 비유와 대체어를 사용해 출력물을 무해하게 보이게 하는 '출력 난독화'입니다.

자주 묻는 질문

Q: Anthropic의 Constitutional Classifiers++는 주로 무엇을 해결하나요?

A: 이 시스템은 대규모 모델 보안 보호에 중점을 두고 있으며, 가드레일을 우회하는 '범용 탈옥'의 성공률을 줄이는 데 중점을 두고 비용과 허위 거부를 통제합니다.

Q: 이전 세대에 비해 Constitutional Classifiers++의 개선점은 어디에 있나요?

답변: 주요 변화는 입력과 출력을 동일한 '교환' 공동 구별으로 사용하고, 2단계 연쇄 및 프로브 통합을 통해 컴퓨팅 파워 오버헤드와 무해한 거부 효과를 줄이는 것입니다.

Q: 연구에서 '보편적 탈옥'이란 무엇을 의미하나요?

A: 다양한 질문에 대해 보안 메커니즘을 안정적으로 우회하고 모델이 지속적으로 제한된 콘텐츠를 출력하도록 유도하는 공격 전략 집합을 의미합니다.

Q: 기업이나 개발자가 이러한 보안 분류기에 접근할 때 주의해야 할 점은 무엇인가요?

답변: 허위 거절이 비즈니스 프로세스, 대화 기록 및 민감한 데이터의 준수 처리, 그리고 레드팀 커버리지 부족으로 인한 잔여 위험에 미치는 영향은 여전히 평가되어야 합니다.

Anthropic이 Constitutional Classifiers++ 안티-제네릭 탈옥을 출시했습니다 Anthropic은 Classifiers++가 컴퓨팅 파워가 1% 증가했음에도 여전히 더 안전하다고 말합니다 Anthropic은 거짓 거절률을 0.05%로 낮추어 가드레일 논란을 일으켰습니다 Anthropic은 이제 차세대 헌법 모드로 제공됩니다 분류기는 탈옥 방지를 개선합니다 Anthropic은 안정적인 범용 탈옥 솔루션이 없다고 주장하지만, 여전히 사각지대가 존재합니다 Anthropic은 입출력과 맥락적 구별을 사용하여 탈옥 취약점을 해결합니다 Anthropic의 2단계 계단식 분류기++ 비용과 인터셉트 비율의 균형 Anthropic은 가드레일을 우회하기 어렵게 만들기 위해 활성화된 선형 탐침을 도입합니다 강화된 안전성 판단을 위한 인류적 통합 프로브 + 외부 분류기 Anthropic의 논문은 오래된 가드레일이 리팩토링 공격으로 쉽게 우회될 수 있음을 밝힙니다 Anthropic은 출력 혼란이 단어를 은유로 대체함으로써 여전히 침투할 수 있다고 지적합니다 Anthropic Red Team Test Classifiers++는 아직 Universal Jailbreak에 의해 깨지지 않았습니다 Anthropic은 Classifiers++를 프로덕션에 배포하며, 낮은 오버헤드와 높은 보호에 중점을 둡니다 Anthropic은 대화 교환을 유닛 평가로 사용해 탈옥을 실제 전투에 더 가깝게 만듭니다 Anthropic은 가드레일을 단일 라운드에서 판결 교환으로 업그레이드하여 오탐을 줄입니다 왜 Anthropic Classifiers++가 무해한 거부율을 0.05%로 낮추는지 Anthropic의 새로운 보안 팁: 의심스러울 때만 강력한 분류기를 업그레이드해 비용을 줄입니다 인류적 경량 스크리닝은 전체 대화를 포괄하며, 의심 후 심층 조사가 더 안정적입니다 Anthropic은 Classifiers++가 반(反)범용 탈옥이라고 주장하지만, 두 공격 모두 여전히 위험합니다 Anthropic은 리팩토링 공격이 해로운 조각을 무해한 조각으로 위장한다고 경고합니다 Anthropic은 산출물을 혼란스럽게 하면 콘텐츠가 겉보기에는 무해해 보이지만 실제로는 불법이라고 경고합니다 Anthropic이 계단식 구조를 사용해 가드레일 오버헤드를 1%로 제어하는 방법 Anthropic의 새로운 가드레일 시스템이 진정으로 보편적인 탈옥을 끝낼 수 있을지가 초점입니다 Anthropic은 안정적인 탈옥 솔루션이 없다고 주장하지만, 기업들은 여전히 스스로 테스트하고 검증해야 합니다 인류적 분류기++는 거짓 거부를 줄이지만, 인용 딜레마를 놓칠 수 있습니다 Anthropic은 입출력을 결합하여 탈옥 엣지 공간을 줄입니다 Anthropic은 내부 활성화를 탐침 읽기를 사용하여 해석 가능성 논의를 촉발합니다 Anthropic의 보안 논문은 Classifiers++ 통합 결정의 세부 사항을 공개합니다 Anthropic은 Constitutional Classifiers++ 감옥 탈출 무기 경쟁에 반대 Anthropic은 생산 가능 여부가 있지만 대화 기록 준수 위험은 여전히 남아 있다고 밝혔습니다 Anthropic은 개발자들에게 탈옥 방지 보호막을 제공하지만, 실수로 사업에 영향을 미치지 않습니다 인류적 가드레일 업그레이드는 출시 후 패치 비용을 줄이기 위한 범용 탈옥을 목표로 합니다 인류적 Classifiers++가 은유적 탈옥을 어떻게 인식하는지는 아직 검증되지 않았습니다 Anthropic의 2단계 분류기 전략이 긴 대화 공격에 대응할 수 있을까? Anthropic의 새로운 방안은 오류가 적은 거절에 초점을 맞추고 있어, 검열 논란의 강도를 높일 수 있다 Anthropic은 요격이 더 강하다고 말했지만, 정상적인 창조 과정에서 우발적으로 손상될까 걱정하고 있습니다 Anthropic이 Classifiers++를 프로덕션에 내장하면서 프라이버시 거버넌스 우려가 제기됩니다 Anthropic의 보편적 탈옥 정의는 보안 평가의 표준화를 촉진합니다 Anthropic은 공격과 수비를 레드팀으로 구성하는 Classifiers++를 지지하지만, 보장 부족에 대한 우려도 있습니다 Anthropic은 탈옥의 새로운 경향을 드러냅니다: 분할과 리팩토링이 직선 볼보다 막기 더 어렵다는 점입니다 Anthropic은 탈옥의 새로운 경향을 드러내다: 출력 난독화가 중재를 더 어렵게 만든다 Anthropic Classifiers++는 맥락 외 의미를 줄이기 위해 교환 문맥을 판단에 통합합니다 Anthropic의 새 시스템이 무해한 요청에 대해 0.05% 거절되는 결과를 재현할 수 있을지는 의문입니다 Anthropic은 추가 컴퓨팅 파워 오버헤드의 1%를 주장하지만, 실제 비용은 시나리오에 따라 달라질 수 있습니다 Anthropic은 차세대 헌법 분류기(Constitutional Classifiers)에 가드레일 노선을 재편하도록 추진하다 왜 Anthropic 가드레일 업그레이드가 선형 프로브와 외부 분류기를 도입하는가 Anthropic Classifiers++는 기업 접근에 대한 비용 절감과 준수 압력을 높인다는 의미입니다 Anthropic은 레드 팀은 여전히 검사가 필요하며, 그렇지 않으면 잔여 위험이 반작용할 것이라고 강조했습니다 Anthropic의 새로운 가드레일은 동시에 보편적 탈옥을 막으며 두 가지 주요 공백, 즉 리팩토링과 난독화를 드러냅니다

추천 도구

더보기