ToolNavs 便利なAIツールを発見
ツール投稿 ログイン

AI ガードレール

モデル自身に監視させても安全境界にはなりません。ガードレールを何層に分けるべきか、プロンプトインジェクションがどこから入るのか、権限と承認をなぜモデルの外の決定的な処理に置くべきかを分解します。

システムプロンプトはユーザー入力と同じ言語空間にあり、注入や誘導で判断は書き換わります。だからガードレールはモデルの外に置き、入力でファイルと指示を調べ、ツール呼び出しは許可リストで絞り、高リスク操作には承認を挟みます。Constitutional Classifiers++ は追加計算を約 1% に抑えます。攻撃は止めきれませんが、失敗は権限の内側に閉じ込めます。
Anthropic Threat Report:AI攻撃がマルチエージェントによるクローズドループに入り始めている

Anthropic Threat Report:AI攻撃がマルチエージェントによるクローズドループに入り始めている

2026年9月11日、Anthropicは脅威インテリジェンスレポート「AIの誤用の検出と対策:2026年9月」を発表し、2025年12月から2026年8月の間に特定・阻止した高リスク活動を明らかにしました。このレポートは、サイバー攻撃、監視、作戦への影響、詐欺、生物学的誤用、通常兵器開発、モデルの...

Admin
3
AIガードレールとは何か?なぜセキュリティガードレールはシステムプロンプトだけに頼れないのか

AIガードレールとは何か?なぜセキュリティガードレールはシステムプロンプトだけに頼れないのか

AIガードレール(一般的にAIガードレールと訳される)は、モデルの入力、コンテキスト、ツール呼び出し、出力の周囲に設けられた制約や検出メカニズムを指します。これらは禁止品に対するシステムのプロンプトとは異なります。真に実用的なガードレールは層ごとに機能し、回避された場合の影響を限定します。 なぜシス...

Admin
150
プロンプトインジェクションとは何ですか? なぜウェブページ、PDF、ナレッジベースがモデルに影響を与えるための入り口となり得るのか

プロンプトインジェクションとは何ですか? なぜウェブページ、PDF、ナレッジベースがモデルに影響を与えるための入り口となり得るのか

プロンプト注入とは、攻撃者がモデルの挙動に影響を与えるコマンドを秘密裏にモデルが読み取る内容に詰め込み、モデルが従うべきタスクやルールから逸脱させることを意味します。 必ずしも「悪意のあるコード」のように見えるわけではなく、ウェブページやPDFドキュメント、ナレッジベースの内容、表記、あるいは一見普...

Admin
110
OpenAIはプロキシのアンチプロンプト注入を解体:高リスクの行動が事前に制限され、機密データをワークフローに保護する

OpenAIはプロキシのアンチプロンプト注入を解体:高リスクの行動が事前に制限され、機密データをワークフローに保護する

OpenAIはエージェントがプロンプト注入に抵抗する方法についての技術記事を公開しており、その核心的な意味はシンプルです。つまり、本当の危険は悪意のあるテキストを余分に読むことではなく、誘発された後にユーザーのために行うべきでない行動をエージェントが行うことです。 エージェント製品の場合、コンテンツ...

Admin
174
OpenAIはPromptfooの買収を発表し、AIセキュリティテストを開発段階に進め、エンタープライズリスク管理リンクも引き続き組み込まれています

OpenAIはPromptfooの買収を発表し、AIセキュリティテストを開発段階に進め、エンタープライズリスク管理リンクも引き続き組み込まれています

OpenAIは、主に開発段階でAIシステムの脆弱性を特定し修正するのを支援する企業向けAIセキュリティプラットフォームPromptfooを買収すると発表しました。 大規模モデルを本番システムに接続している企業にとって、これは単なるM&Aニュースではなく、非常に明確な製品シグナルです。モデル機能に加え...

Admin
142
Anthropicが約1%の計算能力オーバーヘッドで『Constitutional Classifiers++: Combat Universal Jailbreaks』をリリース

Anthropicが約1%の計算能力オーバーヘッドで『Constitutional Classifiers++: Combat Universal Jailbreaks』をリリース

2026年1月9日、Anthropicは「次世代憲法分類器」(Constitutional Classifiers++とも呼ばれる)を立ち上げるための研究論文を発表し、大規模モデルの「一般的な脱獄」攻撃に対する保護効率を向上させました。 関係者によると、新システムは本番環境での追加の計算能力オーバー...

Admin
134
快手ライブ放送室ポルノコンテンツの混乱:黒・灰色産業の攻撃の下で、AIコンテンツのセキュリティの最終ラインはどう維持できるのか?

快手ライブ放送室ポルノコンテンツの混乱:黒・灰色産業の攻撃の下で、AIコンテンツのセキュリティの最終ラインはどう維持できるのか?

12月22日の夜、クァイショウの生放送ルームにポルノやその他の違法コンテンツが現れ、プラットフォームはこれを白黒とグレーの制作による攻撃とし、警察に通報したと発表しました。 すべてのライブ配信プラットフォームにおいて、このようなインシデントの本質はコンテンツセキュリティと対立のエスカレーションにあり...

Admin
176
Qwen3Guard リリース: 119 言語をカバーするグローバルリアルタイムセキュリティのための多言語レビューモデル

Qwen3Guard リリース: 119 言語をカバーするグローバルリアルタイムセキュリティのための多言語レビューモデル

同益千文は、多言語対応、リアルタイム、そして実装可能な機能を特徴とするQwen3Guardセキュリティレビューモデルシリーズを発表しました。119の言語と方言をサポートするこのシリーズは、3つのパラメータスケール(0.6B、4B、8B)と2つのフォームファクターを提供します。Qwen3Guard -...

Admin
135