roko.fans четверг, 8 октября 2026

GitHub проанализировал 103,9 млн пул-реквестов и выпустил бенчмарк ReviewBench для ИИ-ревьюеров кода

Чтобы понять, какой код на самом деле попадает на ревью, GitHub изучил 103,9 млн пул-реквестов на своей платформе. Из этого массива в новый бенчмарк вошли 219 штук. Их взяли из 187 публичных репозиториев с открытыми лицензиями, и написаны они на 19 языках.[1][2]

Объекты:

Бенчмарк называется ReviewBench. Он нужен, чтобы оценивать ИИ-ревьюеров кода в офлайн-режиме, то есть без экспериментов на живых пользователях. Компания рассказала о нём в своём блоге, и все подробности ниже приводятся по её данным. Исследовательская предварительная версия уже открыта на сайте проекта. Там можно изучить бенчмарк, сравнить агентов код-ревью между собой и подключить собственного агента, чтобы оценить его и дорабатывать дальше.[3][4]

По словам GitHub, распределение по языкам и по размеру репозиториев в бенчмарке повторяет общую картину платформы. С размером самих пул-реквестов поступили иначе. Выборку сознательно сместили к средним и крупным изменениям, чтобы мелкие правки в одном файле не перевешивали более содержательные пул-реквесты, затрагивающие несколько файлов.[2][5]

Ответы ИИ-ревьюера сверяют с эталонным набором находок. Этот набор собирали из трёх источников: замечаний живых ревьюеров, выводов передовых языковых моделей и результатов статического анализа. Судьёй служит Claude Sonnet 5: он оценивает находки каждой системы по одному и тому же рубрику.[6][7]

Системы сравнивают между собой прежде всего по grounded recall. Метрики группы augmented компания называет дополнительной диагностикой, которая описывает отдельную систему. Пользователь может менять коэффициент β в показателе Fβ. Так он сдвигает вес к полноте, если важнее широкий охват, или к точности, если нужно меньше лишних замечаний.[8][9]

Перед релизом GitHub проверил сам эталон. Компания попросила старших инженеров, которые не участвовали в сборке датасета, разметить все эталонные находки с нуля. «Их суждения о том, где истинное срабатывание, а где ложное, совпали с ReviewBench в 96,6% случаев», говорится в блоге.[10]

Бенчмарк уже работает и на собственный продукт GitHub. По словам компании, с ним офлайн-оценка Copilot code review (CCR) стала лучше предсказывать, в какую сторону пойдут эксперименты в продакшене.[11]

Полный датасет выложен в открытый доступ: пул-реквесты, находки, метки, аннотации серьёзности и категорий. GitHub публикует и рубрик оценки, и судью, который его применяет. Датасет, судья и матчер версионируются для каждой оценки. По замыслу компании, так результаты можно сравнивать при одной и той же конфигурации бенчмарка и перепроверять, когда бенчмарк изменится.[12][13][14]

Текст составлен ИИ по материалам ниже и не содержит фактов, которых нет в источниках.

  1. 1 GitHub Blog — ReviewBench: An open benchmark for AI code review ↗ 5 октября, 18:59 · сноски 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14 GitHub Blog — Secret protection must scale with software ↗ вчера, 20:45 Microsoft Research Blog — Agent Lightning v1.0: A 3,500-Line Lightweight Agentic RL Framework for Training Agents with Real Harnesses ↗ вчера, 19:00
  1. 2 The Stack — Runtime: Why building long-haul agents is so tricky ↗ 6 октября, 18:00
  2. 3 The New Stack — How much control should AI get? Inside the SOC autonomy question ↗ 6 октября, 20:38 The New Stack — Copilot tops GitHub’s own AI code review benchmark. An independent one tells a different story. ↗ 6 октября, 21:06
  3. 4 MarkTechPost — What Happens When a Trusted Model Repo Changes? Unsloth Studio Re-Checks Before It Runs ↗ 04:49

Запись полезная?

Войдите, чтобы ответить

Anthropic выпустила Claude Haiku 5.5 по цене $0,10 за миллион входных токенов