ProvenanceGuard、139件中138件を検出

検証の仕組み

出典IDを保持
主張単位の根拠確認
帰属不一致の遮断

評価結果

139件中138件を検出
出典特定は約86%
遮断F1は0.802

限界と運用

類似出典特定50.3%
約0.5秒の追加処理
詳細を読む

Multiverse Computingの研究チームは2026年9月29日、複数のMCPツールを使うLLMエージェント向け検証層「ProvenanceGuard」を発表しました。回答を主張単位に分け、事実の裏付けだけでなく、回答が明示・暗示した出典と実際の根拠が一致するかを調べ、医療エージェントの評価で専門家が不通過とした139件中138件を検出しました。

狙うのは、複数のツール出力を一括評価すると見逃しやすい出典の混同です。たとえば返金条件が規約文書にあるのに口座記録の情報として示せば、事実自体は正しくても帰属は誤りです。患者記録の投薬情報を医学文献の知見として扱う場合も同じ問題が生じます。

ProvenanceGuardは既存エージェントの回答生成後に動く検証層で、再学習を求めません。保存したMCPトレースから回答を主張に分解し、関連ソースの特定、根拠の有無、回答内の出典表現との一致を順に検査します。各主張の出典判定と回答全体の許可・遮断を返し、遮断後はRARR方式で修正または安全な代替文を再検証できます。

評価では、開発用データから分けた40回答・361主張を専門家が確認しました。ProvenanceGuardは不通過とされた139件のうち138件を検出した一方、支持ありとされた67件も止めており、誤通過を抑える保守的な設計です。出典を特定できる主張では正しいソースを約86%選び、遮断判定のF1は比較した5方式で最高の0.802でした。

遮断後の処理では、実際の全トレースで止めた173回答をすべて解消しましたが、144回答は実質的な書き直しではなく代替文に着地しました。再構成した複数ソースの試験では、当初止めた59回答をすべて解消し、最終的な代替文は2件でした。報告されたローカル構成の追加処理は、オフライン判定で回答1件当たり約0.5秒です。

一方、似たソースが複数ある難しい試験では遮断判定のF1が0.846だったのに対し、正確な出典の特定率は50.3%でした。出典名だけを入れ替えた50例はすべて検知しましたが、類似資料の見分けには改善余地があります。NVIDIAのNVFlowでは金融エージェントが取得したSEC文書との照合に任意の検証段階を導入しており、各社が使うモデルやデータに合わせた試験と調整が必要です。