Чтобы понять, какой код на самом деле попадает на ревью, GitHub изучил 103,9 млн пул-реквестов на своей платформе. Из этого массива в новый бенчмарк вошли 219 штук. Их взяли из 187 публичных репозиториев с открытыми лицензиями, и написаны они на 19 языках.[1][2]
Бенчмарк называется ReviewBench. Он нужен, чтобы оценивать ИИ-ревьюеров кода в офлайн-режиме, то есть без экспериментов на живых пользователях. Компания рассказала о нём в своём блоге, и все подробности ниже приводятся по её данным. Исследовательская предварительная версия уже открыта на сайте проекта. Там можно изучить бенчмарк, сравнить агентов код-ревью между собой и подключить собственного агента, чтобы оценить его и дорабатывать дальше.[3][4]
По словам GitHub, распределение по языкам и по размеру репозиториев в бенчмарке повторяет общую картину платформы. С размером самих пул-реквестов поступили иначе. Выборку сознательно сместили к средним и крупным изменениям, чтобы мелкие правки в одном файле не перевешивали более содержательные пул-реквесты, затрагивающие несколько файлов.[2][5]
Ответы ИИ-ревьюера сверяют с эталонным набором находок. Этот набор собирали из трёх источников: замечаний живых ревьюеров, выводов передовых языковых моделей и результатов статического анализа. Судьёй служит Claude Sonnet 5: он оценивает находки каждой системы по одному и тому же рубрику.[6][7]
Системы сравнивают между собой прежде всего по grounded recall. Метрики группы augmented компания называет дополнительной диагностикой, которая описывает отдельную систему. Пользователь может менять коэффициент β в показателе Fβ. Так он сдвигает вес к полноте, если важнее широкий охват, или к точности, если нужно меньше лишних замечаний.[8][9]
Перед релизом GitHub проверил сам эталон. Компания попросила старших инженеров, которые не участвовали в сборке датасета, разметить все эталонные находки с нуля. «Их суждения о том, где истинное срабатывание, а где ложное, совпали с ReviewBench в 96,6% случаев», говорится в блоге.[10]
Бенчмарк уже работает и на собственный продукт GitHub. По словам компании, с ним офлайн-оценка Copilot code review (CCR) стала лучше предсказывать, в какую сторону пойдут эксперименты в продакшене.[11]
Полный датасет выложен в открытый доступ: пул-реквесты, находки, метки, аннотации серьёзности и категорий. GitHub публикует и рубрик оценки, и судью, который его применяет. Датасет, судья и матчер версионируются для каждой оценки. По замыслу компании, так результаты можно сравнивать при одной и той же конфигурации бенчмарка и перепроверять, когда бенчмарк изменится.[12][13][14]
По материалам
Текст составлен ИИ по материалам ниже и не содержит фактов, которых нет в источниках.
ReviewBench contains 219 pull requests from 187 public open source licensed repositories spanning 19 languages, with its language and repository-size distributions closely matching GitHub overall.
ReviewBench’s research preview version is now available through the ReviewBench website, where you can explore the full benchmark, compare code review agents, and bring your own agent to evaluate and iterate.
while language and repository size mirror GitHub directly, pull request size is weighted toward the reviewable middle and tail. This reduces the overrepresentation of tiny, single-file changes while preserving more substantive, multi-file pull requests
we asked senior engineers who had not participated in building the benchmark dataset to independently re-label every ground-truth finding from scratch. Their true/false-positive judgments agreed with ReviewBench 96.6% of the time.
with the help of ReviewBench, our offline evaluation of Copilot code review (CCR) has become more effective at anticipating the direction of production experiments
Explore the full benchmark dataset. The complete ReviewBench dataset is publicly available, including the pull requests, findings, labels, severity and category annotations.
We version the benchmark dataset, judge, and matcher used in every evaluation, so results can be compared under the same benchmark configuration and revalidated when the benchmark changes.