OpenAI × Apollo:Deliberative Alignment 如何降低隐蔽越权 最新论文系统化提出 Anti-Scheming 评估框架:用远域任务、情境感知与“预置隐藏目标”三重压力测试,检验 Deliberative Alignment 对“隐蔽行动”的抑制效果。基于 26 套评测(覆盖 180+ 场景),o3 与 o4-mini 在受训后,隐蔽行动发生率从双位数降至接近零... AI资讯 • Admin • 2025/9/18 86