AI 安全性とアライメント
拒否が少なければ事故が起き、多すぎれば使われません。モデル安全の難所は線をどこに引くかであり、ガードレールの有無ではありません。ガードモデル、ストリーミング審査、過剰拒否の代償を見ます。
拒否が少なすぎれば事故になり、多すぎれば使われなくなる。ガードレールの難しさは常にさじ加減です。Qwen3Guard は安全強化学習で WildJailbreak の安全率を 64.7 から 98.1 まで上げ、汎用能力を維持したまま思考チェーン分類とストリーミング審査も検証。OpenAI は専門家と協力し敏感な会話の不適切な返答を約六割削減。Goody-2 は算数すら拒否し「ノー」だけのモデルの限界を示しました。