OpenAI × Apollo: 熟慮に基づく調整が隠れた行き過ぎをどのように削減するか
最近の論文では、反策略評価フレームワークを体系的に提案しています。これは、遠隔領域タスク、文脈認識、そして事前に設定された隠れたターゲットを含む三重ストレステストを用いて、熟慮に基づくアライメントが隠蔽行動を抑制する効果を検証するものです。180以上のシナリオを対象とした26の評価に基づくと、o3お...
AI情報 • Admin •
86
Found 1 related articles