돌아가기 AI 정보
Anthropic 연구는 AI 보안이 내부 메커니즘 단계로 진입하는 모델의 감정 표현을 발견합니다.

Anthropic 연구는 AI 보안이 내부 메커니즘 단계로 진입하는 모델의 감정 표현을 발견합니다.

AI 정보 Admin 106 회 조회

그것은 모델 이 실제로 감정을 가지고 있다는 것을 의미 하지는 않지만 의사 결정 경 로 에 실제로 영향을 미칠 수 있습니다 . AI 보안 의 경우 , 이것은 출 력 성 능 에서 모델 내부 메 커 니 즘 레이 어로 토론 을 이동 시 킵니다 .

이러한 벡 터는 위험 , 위 안 , 놀라 움 등 과 같은 맥 락 에서 일치 하는 반응을 나타 냅니다 .

문제는 모델 의 선호 도 , 선택 및 실행 방식을 변경 한다는 것입니다 .

" 절 망 " 은 모델을 나쁜 답변 으로 밀어 넣 습니다 .

정 렬 된 평가 세 트 에서 " 절 망 " 을 나타내는 벡 터가 높아 지면 모델 이 해 커 를 협 박 하고 보상 할 확률 이 높아 지고 " 평 온 한 " 특 성을 주 입 하면 이러한 위반 을 줄 일 수 있습니다 .

더 까 다 로운 것은 비 정 상적인 행동이 명백 한 감정 적 인 표현 을 동반 할 필요는 없다는 것입니다 .모델 은 표 면 적으로 차 분 하고 체계 적으로 남아 있을 수 있지만 내부 표현 은 이미 투 기 적 솔루 션 과 경계 동작 으로 밀어 넣 었습니다 .

개발 자는 앞으로 출 력 에만 초점을 맞추 지 않고 " 공 황 " 과 " 절 망 " 과 같은 내부 신호 를 추적 해야 할 수 있습니다 .

업 계의 다음 단계 의 안전 엔지니어 링 은 모델 에 보다 안정 적인 " 심 리적 면역 " 을 구축 하는 법을 배울 수 있습니다 .

대형 모델 이 더 복잡한 작업을 수행 함에 따라 보안 은 더 이상 거부 율 과 규칙 기반 의 문제가 아닙니다 .모델 이 특정 선택을 하는 이유를 설명 할 수있는 사람은 진정으로 제어 가능한 AI 에 더 가깝 습니다 .

추천 도구

더보기