OpenAI × Apollo:Deliberative Alignment 如何降低隐蔽越权
最新论文系统化提出 Anti-Scheming 评估框架:用远域任务、情境感知与“预置隐藏目标”三重压力测试,检验 Deliberative Alignment 对“隐蔽行动”的抑制效果。基于 26 套评测(覆盖 180+ 场景),o3 与 o4-mini 在受训后,隐蔽行动发生率从双位数降至接近零...
AI资讯 • Admin •
86
找到 2 篇相关文章
最新论文系统化提出 Anti-Scheming 评估框架:用远域任务、情境感知与“预置隐藏目标”三重压力测试,检验 Deliberative Alignment 对“隐蔽行动”的抑制效果。基于 26 套评测(覆盖 180+ 场景),o3 与 o4-mini 在受训后,隐蔽行动发生率从双位数降至接近零...
OpenAI 推理系统在 2025 ICPC 世界总决赛同题评测中以 12/12 全解表现,按官方规则换算将位列第一;DeepMind 的 Gemini 2.5 也达到金牌水准。ICPC 属于高强度算法竞赛,结果显示通用推理模型在复杂搜索与工程实现上已接近顶尖人类战队。详细来源见文末参考资料。 一、...