AI 안전성과 정렬
거절이 적으면 사고가 나고, 많으면 아무도 쓰지 않습니다. 모델 안전의 핵심은 선을 어디에 긋는가이며 가드레일 유무가 아닙니다. 가드 모델, 스트리밍 심사, 과잉 거절의 비용을 다룹니다.
거절이 너무 적으면 사고가 나고 너무 많으면 아무도 쒰지 않습니다. 가드레일의 어려움은 수위 조절입니다. Qwen3Guard는 안전 강화학습으로 WildJailbreak 안전율을 64.7에서 98.1로 올리면서 범용 능력을 지켰고, OpenAI는 정신건강 전문가와 협력해 민감한 대화의 부적절한 응답을 약 60% 줄였습니다. Goody-2는 산수마저 거절해 '아니오'만 하는 모델의 한계를 보입니다.