OpenAI × Apollo: 심의적 정렬이 은밀한 권한 남용을 줄이는 방법
최근 논문에서는 계획 방지 평가 프레임워크를 체계적으로 제안합니다. 원거리 영역 과제, 상황 인식, 그리고 미리 설정된 숨겨진 목표를 포함하는 삼중 스트레스 테스트를 통해 은밀한 행동 억제에 있어 의도적인 정렬의 효과를 검토합니다. 180개 이상의 시나리오를 포괄하는 ...
AI 정보 • Admin •
86
Found 1 related articles