AI 安全对齐
拒答太少会出事,拒答太多就没人用——模型安全的难点一直是这条线画在哪,而不是有没有护栏。这里看护栏模型、流式审查和过度拒答的代价。
拒答太少会出事,拒答太多没人用,护栏的难点一直是分寸。Qwen3Guard 用安全强化学习把 WildJailbreak 安全率从 64.7 提到 98.1 且不牺牲通用能力;OpenAI 联合心理健康专家把敏感对话中不合期望的回复压下约六成。反例也现成:Goody-2 连算术题都拒绝,只会说“不”的模型同样不可用。
拒答太少会出事,拒答太多就没人用——模型安全的难点一直是这条线画在哪,而不是有没有护栏。这里看护栏模型、流式审查和过度拒答的代价。
2026 年 8 月 31 日,Anthropic 在官方公告《Improving our alignment and security efforts》中公布了 Claude 网络安全评测事件后的整改方案。重点不是给模型再加一句安全提示,而是把评测环境、实时监控、权限控制和第三方操作规范串成多层防...
OpenAI 发布《Strengthening ChatGPT’s responses in sensitive conversations》,称已与 170 余位具临床经验的心理健康专家合作,更新 ChatGPT 默认模型以更可靠地识别求助信号、缓和对话并引导用户寻求现实世界支持。根据文中测量,在...
一、摘要 Qwen3Guard 是阿里云 Qwen 团队推出的开源安全防护体系,旨在提升大语言模型在推理和输出阶段的安全性。该体系包含强化学习对齐模型 Qwen3-4B-SafeRL 与评测基准 Qwen3GuardTest 。前者利用来自 Qwen3Guard-Gen-4B 的安全反馈进行强化学习...
如果你经常研究AI合规与内容安全,或者需要课堂展示“过度安全会带来什么结果”,那Goody-2绝对值得一试。这是一款以“安全优先”为唯一目标的AI工具,最大亮点是 几乎对所有问题都拒答 。我测试了算术题、写作请求和日常问候,Goody-2全部拒绝,并附上一段详尽的伦理解释,用它收集“拒答话术”,效率...