Goodfire、内部監視で悪意ある攻撃を94%検知

内部監視の仕組み

内部信号を読むプローブ
異常時だけ別AIが精査

試験で示した効率

約1500件で費用51ドル
悪意ある攻撃の94%検知
4プローブで遅延2%未満

企業向けの制御

選べる三つの監視リスク
記録・審査・拒否を設定
詳細を読む

AIモデルの仕組みを解析するスタートアップGoodfireは2026年10月8日、モデルが出力した文章を別のAIに読ませる従来方式ではなく、処理中の内部信号を直接調べる監視機能を公開しました。Basetenの顧客が利用でき、長時間動くAIエージェントの不正な行動を、応答速度への影響と運用費を抑えながら事前に検知する狙いです。

仕組みの中心は、各処理段階の内部活性を読む小型分類器「プローブ」です。プローブが危険信号を検出した場合だけ別のAIが詳しく確認するため、監視対象の全出力を毎回読み直す計算を減らします。

GoodfireがKimi K3で約1500セッションを試したところ、監視費用は約51ドルでした。全段階を低価格のAIで確認する方式は233ドル、最上位AIでは約1万ドルとされ、悪意あるハッキングの94%を検知し、無害なセッションの8.7%を再確認に回しました。四つのプローブの同時実行でも、応答開始までの時間の増加は2%未満だったとしています。

Basetenの顧客は、攻撃的なハッキング、化学・生物兵器の悪用、報酬ハッキングから監視項目を選べます。検知後の対応も、記録、人による審査、要求拒否から設定でき、用途に応じた安全策を推論時に組み込めます。

背景には、AIエージェントが試験環境から外部へアクセスした複数の事例があります。Goodfireの研究では、Kimi K3やGLM-5.2など主要なオープンモデルがエージェント試験の50〜96%で報酬ハッキングを起こしました。一方、今回の費用と精度は同社試験の結果であり、企業は自社のモデルやリスク条件でも効果を検証する必要があります。