GitHub、AIコードレビュー評価基盤を公開
実務を映す評価対象
精度を測る仕組み
本番改善への活用
詳細を読む
GitHubは2026年10月5日、AIコードレビューエージェントを比較する公開ベンチマーク「ReviewBench」の研究プレビューを公開しました。1億390万件の実在するプルリクエストを分析し、187の公開リポジトリから19言語、219件を選定しました。評価データや採点方法、実行ツールも公開し、開発チームが自社エージェントの精度と見逃しの傾向を同じ条件で確かめられるようにしました。
実務とのずれを抑えるため、言語とリポジトリ規模の分布はGitHub全体に合わせ、変更量は小規模案件への偏りを減らすよう調整しました。正解集は、人間のレビュー、投稿者の修正コミット、決定論的解析ツール、複数系列の先端LLMから候補を集め、意味の重複を除いたうえでClaude Sonnet 5を判定役とする共通基準で検証しています。
採点は、既存の正解集だけで適合率・再現率・F1を測る「grounded」と、正解集にない指摘の真偽も判定する「augmented」の計6指標です。重要度や分野ごとの比較に加え、Fβのβを変えて網羅性とノイズ抑制の優先度を調整できるため、チームの運用方針に合うエージェントを選べます。
正解集の品質は、構築に参加していない上級エンジニアが全件を再判定し、真偽の判断が96.6%一致しました。データセット、判定モデル、照合方法を版管理し、評価基準や検証方法、既知の限界も公開することで、結果を同じ構成で再現・再検証できるようにしています。
GitHubはCopilotコードレビューの複数モデル構成で、ReviewBenchが予測した改善方向と本番A/Bテストの結果が一致したと報告しました。本番では、修正につながったコメント率が8.0%、再現率が13.6%上昇し、コメント数は61%増えた一方、レビュー当たりの費用は8.0%低下しました。重大な指摘はオフラインで227%増、本番で262%増となりましたが、GitHubは利用者への最終的な効果を本番実験で測る位置づけとしています。