ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인

AI 안전성과 정렬

거절이 적으면 사고가 나고, 많으면 아무도 쓰지 않습니다. 모델 안전의 핵심은 선을 어디에 긋는가이며 가드레일 유무가 아닙니다. 가드 모델, 스트리밍 심사, 과잉 거절의 비용을 다룹니다.

거절이 너무 적으면 사고가 나고 너무 많으면 아무도 쒰지 않습니다. 가드레일의 어려움은 수위 조절입니다. Qwen3Guard는 안전 강화학습으로 WildJailbreak 안전율을 64.7에서 98.1로 올리면서 범용 능력을 지켰고, OpenAI는 정신건강 전문가와 협력해 민감한 대화의 부적절한 응답을 약 60% 줄였습니다. Goody-2는 산수마저 거절해 '아니오'만 하는 모델의 한계를 보입니다.
OpenAI, 민감한 대화 보안 업그레이드 발표: 170명 이상의 전문가와의 협업으로 부적절한 응답 65~80% 감소

OpenAI, 민감한 대화 보안 업그레이드 발표: 170명 이상의 전문가와의 협업으로 부적절한 응답 65~80% 감소

OpenAI는 "민감한 대화에서 ChatGPT의 응답 강화"라는 보고서를 발표하며, 170명 이상의 임상 경험이 풍부한 정신 건강 전문가와 협력하여 ChatGPT의 기본 모델을 업데이트하여 도움 요청 신호를 더욱 신뢰성 있게 식별하고, 대화의 긴장을 완화하며, 사용자를...

Admin
141