OpenAIは、米国のCAISIおよび英国のAISIとの最新の協力の進捗状況を発表しました:ChatGPT AgentとGPT-5を中心とした共同悪の評価とエンドツーエンドのレッドチーム、主要な脆弱性の発見と修正、バイオセキュリティと製品セキュリティスタックの反復、「政府×業界」の共同評価の新しいパラダイムの実証。
1. 簡単な事実1
. 協力のレイアウトとタイムライン
1 年以上続いた OpenAI と CAISI のモデル セキュリティ評価は、「プロキシ セキュリティ」に拡張されました。 英国のAISIとのバイオセキュリティ協力は、5月以来、ChatGPT AgentとGPT-5について継続的にレッドチーム化されており、モデルから製品までの全リンクをカバーしています。
2. キーディスカバリー (エージェント セキュリティ)
CAISI は 7 月の共同演習で 2 つの新しいタイプの脆弱性を特定し、特定の条件下でバイパスして完全な悪用チェーンに組み合わせることができます。 OpenAI は同日を受け入れ、修理を完了し、1 営業日以内に返却し、迅速な閉ループを形成します。
3. バイオセキュリティAISI
は、OpenAIのカスタマイズされたテスト環境における「ユニバーサルジェイルブレイク」と脆弱性の監視に関する10以上の詳細なレポートを提出し、監視スタックと製品構成のパッチ適用を促進し、悪意のあるコンテンツがバイパスされる可能性を減らし、アラートの可視性を向上させました。
2. なぜ重要なのか
1. 「打ち上げ前」から「フルサイクル」までの評価
は、単一の打ち上げ前検査だけでなく、ChatGPT Agent と GPT-5 の反復的な継続的な検証を伴い、「発見、修復、再テスト」のエンジニアリング リズムを強調します。
2. 官民協力の詳細なモデル政府
の研究機関は、ネットワーク セキュリティと国家安全保障シナリオの専門知識を提供し、企業はシステム カードとプロトタイプ環境をオープンにし、双方は実際のシステムに関する技術的コンセンサスを形成し、業界のセキュリティ ベースラインを引き上げます。
3. 開発者と企業への影響エージェント
は、ルーティング、エスケープ防止、および動作監視を構築するために、従来の Web/端末セキュリティと並行して構築する必要がある一種の「操作可能な自動クライアント」と見なされています。
3. ランディングリスト (直接適用可能)
(1) エージェントのセキュリティ最小設定
a. ツールの最小化とホワイトリストルーティング
b. ファイルシステムからのセッションレベルの権限サンドボックスの分離
c. リスクの高いアクションの二次確認と記録
(2) レッドチームとオブザーバビリティ
a. 「プロキシハイジャック、プロンプトインジェクション、データ流出」の3種類のスクリプトを導入
b. 障害サンプルデータベースの構築とシーン
の復元 c. 主要な指標: 傍受率、誤検知率、修復時間
(3) バイオセキュリティ ガバナンス
a. システム カードを参照して高機能ドメインの保護しきい値を設定する
b. ポリシー ルールを検索およびツール層
にプリロードするc. リスクの高いリクエストの階層的な実装と手動レビュー
4. AI チームの選択リマインダー
1. 製品スタック
自動化とクロスサイト運用のシナリオでは、「システム カード + 外部評価記録」を持つモデルとエージェント (ChatGPT エージェントなど、 GPT-5) を使用して、監査とコンプライアンスの調整を促進します。
2. プロジェクトスタック
レッドチームの結果をCIに書き込む:バージョンが更新されるたびに、脱獄回帰、エージェントツールの権限回帰、およびコンテンツセキュリティ回帰がトリガーされます。
3.
セキュリティ、法務、製品を整理および調整して「セキュリティ変更ログ」を共有し、検出、修復、再テストのトレーサビリティを実現します。
よくある質問 (Q&A)Q
: OPENAI、CAISI、AISI は今回の協力ラウンドで具体的に何をしましたか?
A: ChatGPT Agent と GPT-5 に関する共同レッドチームとシステム評価を実施して、エージェントレベルで新しい脆弱性を発見し、1 営業日以内に修正を完了しながら、バイオセキュリティ監視と製品構成保護を強化します。
Q: ChatGPT Agent または GPT-5 を使用するチームにとっての直接的な価値は何ですか?
A: CAISIとAISIから実戦対決スタイルと修復の経験を継承し、「プロキシハイジャック、一般的な脱獄、コンテンツ恐喝」などのテストを回帰に組み込んで、生産事故のリスクを減らすことができます。
Q: システムカードはエンジニアリングでどのように使用されますか?
A: GPT-5 と ChatGPT Agent のシステム カードを「セキュリティ機能マニュアル」として使用して、高機能ドメインのしきい値、監視インジケーター、および無効化リストを実行可能なポリシーとテスト ケースに変換します。
Q: 発売前の侵入テストのみを行うだけで十分ですか?
A: 十分ではありません。 「フルサイクル評価」については、バージョングレースケール - レッドチーム再登場 - ルール実装 - 回帰検証については、この協力を参照し、新機能や新しいツールの攻撃対象領域を引き続きカバーします。