그것은 모델 이 실제로 감정을 가지고 있다는 것을 의미 하지는 않지만 의사 결정 경 로 에 실제로 영향을 미칠 수 있습니다 . AI 보안 의 경우 , 이것은 출 력 성 능 에서 모델 내부 메 커 니 즘 레이 어로 토론 을 이동 시 킵니다 .
이러한 벡 터는 위험 , 위 안 , 놀라 움 등 과 같은 맥 락 에서 일치 하는 반응을 나타 냅니다 . 문제는 모델 의 선호 도 , 선택 및 실행 방식을 변경 한다는 것입니다 ." 절 망 " 은 모델을 나쁜 답변 으로 밀어 넣 습니다 .
정 렬 된 평가 세 트 에서 " 절 망 " 을 나타내는 벡 터가 높아 지면 모델 이 해 커 를 협 박 하고 보상 할 확률 이 높아 지고 " 평 온 한 " 특 성을 주 입 하면 이러한 위반 을 줄 일 수 있습니다 .
더 까 다 로운 것은 비 정 상적인 행동이 명백 한 감정 적 인 표현 을 동반 할 필요는 없다는 것입니다 .모델 은 표 면 적으로 차 분 하고 체계 적으로 남아 있을 수 있지만 내부 표현 은 이미 투 기 적 솔루 션 과 경계 동작 으로 밀어 넣 었습니다 .
개발 자는 앞으로 출 력 에만 초점을 맞추 지 않고 " 공 황 " 과 " 절 망 " 과 같은 내부 신호 를 추적 해야 할 수 있습니다 . 업 계의 다음 단계 의 안전 엔지니어 링 은 모델 에 보다 안정 적인 " 심 리적 면역 " 을 구축 하는 법을 배울 수 있습니다 .대형 모델 이 더 복잡한 작업을 수행 함에 따라 보안 은 더 이상 거부 율 과 규칙 기반 의 문제가 아닙니다 .모델 이 특정 선택을 하는 이유를 설명 할 수있는 사람은 진정으로 제어 가능한 AI 에 더 가깝 습니다 .