Oossa

GitHub startet ReviewBench für KI-Code-Reviews

Der Benchmark bewertet KI-Prüfer anhand echter Pull Requests. GitHub Copilot Code Review führt die erste Rangliste an, die GitHub selbst erstellt hat.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

GitHub hat ReviewBench vorgestellt, einen Benchmark zum Vergleichen von KI-Agenten für Code-Reviews. Er nutzt 219 echte Pull Requests aus 187 Open-Source-Repositories und 19 Programmiersprachen. Ein Bewertungsmodell prüft, ob gemeldete Probleme zutreffen, relevant und nicht trivial sind; unabhängige Senior Engineers stimmten laut GitHub in 96,6 Prozent der Fälle mit ReviewBench überein. Copilot Code Review steht an der Spitze der ersten Rangliste, doch GitHub hat diese Einträge selbst erstellt. Entwickler können ihre Agenten zunächst an 25 Pull Requests testen; für die finale Bewertung werden alle 219 dreimal geprüft.

Warum es wichtig ist

Entwickler können KI-Code-Reviewer mit einem gemeinsamen Datensatz vergleichen; wie gut die Rangliste den Nutzen in echten Teams vorhersagt, bleibt offen.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.