GitHub hat ReviewBench vorgestellt, einen Benchmark zum Vergleichen von KI-Agenten für Code-Reviews. Er nutzt 219 echte Pull Requests aus 187 Open-Source-Repositories und 19 Programmiersprachen. Ein Bewertungsmodell prüft, ob gemeldete Probleme zutreffen, relevant und nicht trivial sind; unabhängige Senior Engineers stimmten laut GitHub in 96,6 Prozent der Fälle mit ReviewBench überein. Copilot Code Review steht an der Spitze der ersten Rangliste, doch GitHub hat diese Einträge selbst erstellt. Entwickler können ihre Agenten zunächst an 25 Pull Requests testen; für die finale Bewertung werden alle 219 dreimal geprüft.
Warum es wichtig ist
Entwickler können KI-Code-Reviewer mit einem gemeinsamen Datensatz vergleichen; wie gut die Rangliste den Nutzen in echten Teams vorhersagt, bleibt offen.