ReviewBench は、GitHub が AI コードレビューエージェント向けに用意したオフラインの試験である。2026年10月5日、GitHub は公式ブログでこの公開ベンチマークを発表した。実在の pull request 1億390万件の分布を分析した上で、187の公開オープンソースリポジトリから19言語にわたる219件の PR を選び、異なるコードレビューエージェントを同一の模範解答と採点ルールの下で比べられるようにした。誰の見逃しが少なく、誤報が少なく、重大な問題を掴めるか。ReviewBench はリサーチプレビューで、完全なデータセットは公開されており、どのチームも自分のレビューエージェントを受験させて成績を提出できる。
模範解答は一人のレビュアーが決めたものではない
コードレビューの評価が難しいのは、模範解答そのものが割れるからだ。同じ PR でも、人間のレビュアー、静的解析ツール、異なる大規模モデルでは、見つけられる問題の集合がそれぞれ違う。どれか一つの視点を欠けば、試験は特定のタイプのレビュアーに偏る。ReviewBench の金標セットは複数ソースから作られる。候補となる指摘は、実際の人間のレビューコメント、著者の後続コミットから逆推した問題、決定的な解析ツール、複数のフロンティア LLM から集められ、重複は意味的に統合された上で、公開された一つの採点基準に照らして真偽が判定される。指摘が数えられるのは、それが真実で、関連があり、些細でない場合に限られ、どのソースから来たかは関係ない。審査員は Claude Sonnet 5 で、採点基準と審査員の設定も公開されている。すべての指摘には深刻度(重大、中、低)とカテゴリ(正確性、セキュリティ、信頼性、保守性、テストなど)のラベルが付く。公開前に、構築に関わらなかったシニアエンジニアが金標の全指摘を独立に付け直し、ベンチマークとの一致率は96.6%だった。
新しい指標は「模範解答の外の新発見」に居場所を作る
従来のベンチマークは固定された解答に対して精度と再現率を測るため、解答にない本物の問題を見つけたレビュアーは罰せられる。ReviewBench はそこで二組の指標を用意した。一つは金標セットだけで厳密に比べるもの、もう一つは金標に一致しない新発見について審査員が真偽を独立に判定し、本物の発見に得点を与える拡張指標である。結果は深刻度やカテゴリで切り分けることもでき、Fβ の重みで「重大な問題は絶対に見逃さない」と「ノイズを減らす」の間で好みを調整すれば、ランキングも並び替わる。コードレビューに万能の好みなどないからだ。
オフラインの点数は本番を予測できるか、GitHub は自社で試した
このベンチマークはまず GitHub 社内で Copilot コードレビューの改善に使われた。ブログには完全な対照事例がある。複数のモデルを組み合わせた集成レビューの実験で、ReviewBench は精度、再現率、コメント量の上昇と、レビュー1回あたりのコスト低下を予測した。続くオンライン A/B テストも同じ方向を示した。開発者が対応したコメントの比率は8.0%上昇、再現率は13.6%上昇、コメント量は61%増え、レビュー1回あたりのコストは8.0%下がった。重大な問題のコメント量は、オフライン予測が227%増、オンライン実測が262%増で、深刻度の分布まで一致した。
外部チームの受験手順も開かれている。ReviewBench のサイトで GitHub アカウントでログインし、エージェントのコンテナイメージ、設定、自前のモデルキーを登録する。まず25件の PR のテストセットで調整を繰り返し、次に219件すべてを3ラウンド走らせる正式な成績を出す。成績はメンテナの審査を経て初めてランキングに載り、既存の自分の成績を上回ったときだけ差し替わる。AI コードレビューは開発ワークフローの標準装備になりつつある。Codex の速い反復から数々のレビューボットまで道具は増えたが、業界に欠けていたのは、公開され、共通で、深刻度まで区別できる物差しだった。ReviewBench は採点基準、データセット、受験の仕組みをすべて公開した。次に問われるのは、主要なレビューツールが自分の点数を表に出す度胸があるかどうかだ。