ReviewBench ist GitHubs neue Offline-Prüfung für KI-Agenten zur Codeüberprüfung. Am 5. Oktober 2026 veröffentlichte GitHub den offenen Benchmark in seinem offiziellen Blog: Nach einer Analyse der Verteilung von 103,9 Millionen echten Pull Requests wählte es 219 öffentliche PRs aus 187 Open-Source-Repositories in 19 Sprachen aus, damit verschiedene Code-Review-Agenten unter einem gemeinsamen Referenzsatz und denselben Bewertungsregeln verglichen werden können — wer übersieht weniger, wer schlägt seltener falschen Alarm, wer findet die kritischen Probleme. ReviewBench ist eine Research Preview, der vollständige Datensatz ist öffentlich, und jedes Team kann seinen eigenen Review-Agenten antreten lassen und Ergebnisse einreichen.
Der Referenzsatz wurde nicht von einem einzelnen Prüfer festgelegt
Code-Reviews lassen sich schwer bewerten, weil schon die Referenz umstritten ist: Beim selben PR finden menschliche Prüfer, statische Analysewerkzeuge und unterschiedliche große Modelle jeweils andere Probleme, und wer eine Perspektive auslässt, verzerrt die Prüfung zugunsten eines Typs von Prüfer. ReviewBench baut seinen Goldsatz aus mehreren Quellen auf: Kandidaten stammen aus echten menschlichen Review-Kommentaren, aus Problemen, die aus den Folge-Commits der Autoren erschlossen wurden, aus deterministischen Analysewerkzeugen und aus mehreren Frontier-LLMs. Überlappende Befunde werden semantisch zusammengeführt und dann nach einer einzigen veröffentlichten Bewertungsregel beurteilt — ein Befund zählt nur, wenn er wahr, relevant und nicht trivial ist, unabhängig von seiner Quelle. Als Richter dient Claude Sonnet 5, Regelwerk und Richterkonfiguration sind veröffentlicht. Jeder Befund ist mit Schweregrad (kritisch, mittel, niedrig) und Kategorie (Korrektheit, Sicherheit, Zuverlässigkeit, Wartbarkeit, Tests und mehr) versehen. Vor der Veröffentlichung kennzeichneten Senior-Entwickler, die am Aufbau nicht beteiligt waren, jeden Goldbefund unabhängig neu; die Übereinstimmung mit dem Benchmark lag bei 96,6 %.
Neue Metriken lassen Raum für Entdeckungen außerhalb des Lösungsschlüssels
Ein herkömmlicher Benchmark misst Präzision und Trefferquote gegen einen festen Lösungsschlüssel, sodass ein Prüfer, der ein echtes, nicht im Schlüssel enthaltenes Problem findet, dafür bestraft wird. ReviewBench berichtet deshalb zwei Metrikfamilien: eine, die strikt auf dem Goldsatz beruht und den fairen Direktvergleich erlaubt, und eine erweiterte, bei der der Richter unabhängig beurteilt, ob neue, nicht zugeordnete Befunde wahr oder falsch sind, sodass echte Entdeckungen Punkte bringen. Ergebnisse lassen sich zudem nach Schweregrad und Kategorie aufschlüsseln, und die Fβ-Gewichtung kann zwischen „nichts übersehen, vor allem keine kritischen Probleme" und „wenig Rauschen" verschoben werden, woraufhin sich die Rangliste neu sortiert — denn bei Code-Reviews gibt es keine Präferenz, die für jedes Team passt.
Können Offline-Werte die Produktion vorhersagen? GitHub hat es an sich selbst getestet
Der Benchmark wurde zunächst intern genutzt, um die Copilot-Codeüberprüfung zu verbessern, und der Beitrag liefert eine vollständige Fallstudie: In einem Experiment mit einem Multi-Modell-Ensemble sagte ReviewBench höhere Präzision, höhere Trefferquote und mehr Kommentare bei niedrigeren Kosten pro Review voraus. Der anschließende Online-A/B-Test bewegte sich in dieselbe Richtung — der Anteil der Kommentare, auf die Entwickler reagierten, stieg um 8,0 %, die Trefferquote um 13,6 %, das Kommentarvolumen um 61 %, und die Kosten pro Review sanken um 8,0 %. Bei kritischen Kommentaren sagte die Offline-Messung einen Anstieg um 227 % voraus, online waren es 262 %, und selbst die Verteilung der Schweregrade stimmte überein.
Auch der Einreichungsweg für externe Teams ist offen: Mit einem GitHub-Konto auf der ReviewBench-Website anmelden, Container-Image, Konfiguration und eigenen Modellschlüssel des Agenten registrieren, an einem Testset mit 25 PRs abstimmen und dann den vollen Satz von 219 PRs über drei Runden laufen lassen; Werte erscheinen erst nach Prüfung durch Maintainer auf der Rangliste und ersetzen einen bestehenden Eintrag nur, wenn sie ihn übertreffen. KI-Code-Reviews werden zum Standardbestandteil des Entwicklungsablaufs — von der schnellen Iteration von Codex bis zu einer Vielzahl von Review-Bots — doch was dem Feld fehlte, war ein öffentlicher, gemeinsamer Maßstab, der auch die Schwere unterscheidet. ReviewBench veröffentlicht Regelwerk, Datensatz und die Prüfung selbst; die offene Frage lautet nun, welche der großen Review-Werkzeuge sich trauen, ihre Punktzahlen zu zeigen.