ToolNavs 便利なAIツールを発見
ツール投稿 ログイン
戻るAI情報
Project Beacon開始:BasetenとGoodfireが安全シグナルをオープンモデルの推論に組み込む

Project Beacon開始:BasetenとGoodfireが安全シグナルをオープンモデルの推論に組み込む

AI情報 • Admin • • 5 回閲覧

Project Beaconは2026年10月9日にBasetenが公式ブログで発表した取り組みで、パートナーはGoodfire AI。能動的な安全制御をオープンモデルの推論過程そのものに組み込むことを目指す。出力後にテキストフィルターをかけるのではなく、生成中にモデルの内部活性化を読み取り、プローブで進行中のリスク事象を検知し、内容がユーザーやツールに届く前に対処する仕組みだ。

監視対象は4種類のリスク

Basetenが挙げる推論層のリスクには、文書やツールの返り値に潜みエージェントを誘導しようとするプロンプトインジェクション、ユーザーや組織の許可を超えた行動をエージェントが提案すること、顧客や会社の機微情報が不適切な場所に現れること、セキュリティ感受性の高いワークフローでのサイバー悪用の兆候がある。各リスクで必要な対応は異なるため、BeaconはGoodfireが具体的な振る舞いごとに開発したモニター信号を、アプリケーションの応答方法を決めるBaseten側のシステムにつなぐ。人間の承認を求める、拒否する、別の手段に切り替える、あるいは管理者の確認用に記録するだけにとどめる、といった選択が可能になる。

監視が生成と並行して走る理由

アーキテクチャ上、活性化ベースのモニターとテキストモニターが各リクエストを同時に分類し、両者の意見が割れた場合にのみフロンティアモデルが裁定する。監視は生成と並行して動き、応答をブロックしない。企業顧客向けには、中央から適用できる安全ベースライン、ワークロードごとに調整できるポリシー、何が検出されどう処理されたかの記録が計画されている。開発者向けには、安全イベントと制御が推論に使うのと同じAPIとツール経由で届く。具体例も示された。支払い紛争を処理するエージェントは加盟店のメッセージと口座記録を読むが、悪意ある内容に誘導される可能性があり、誤った行動はデータ漏えいや送金につながりかねない。別の大規模モデルで全ステップを確認する方法では、コストと遅延の面で規模化できない。

今後数カ月で、Beaconの機能は対象モデルと監視対象の振る舞いを絞った形から始まり、企業向け制御と開発者向け体験へ広がり、まずは少数の早期パートナーを通じて市場に出る。オープンモデルでエージェントを構築するチームにとって、この更新の信号は明確だ。安全チェックは外付けフィルターから推論インフラの一部へ移りつつあり、推論プラットフォームを比べる際、監視シグナルを自社のポリシーから直接呼び出せるかどうかが、価格や速度と並ぶ比較項目になる。

おすすめツール

もっと見る