Реклама
Перетяжка // Коробка 3.0

GitHub и Microsoft открыли ReviewBench для оценки ИИ-ревью кода

GitHub и Microsoft открыли ReviewBench для оценки ИИ-агентов проверки кода. Доступны датасет, методика и запуск собственного агента.

Обложка: GitHub и Microsoft открыли ReviewBench для оценки ИИ-ревью кода

5 октября 2026 года GitHub и Microsoft открыли исследовательскую предварительную версию ReviewBench. Это бенчмарк для оценки ИИ-агентов проверки кода, предназначенный в том числе для команд, разрабатывающих такие инструменты. В набор вошли 219 pull request из 187 публичных репозиториев на 19 языках. Распределение языков и размеров репозиториев основано на анализе 103,9 млн pull request на GitHub. При этом авторы намеренно увеличили долю более содержательных изменений, чтобы небольшие правки не доминировали в оценке.

Эталонные замечания собрали из человеческих ревью, последующих исправлений авторов, статического анализа и нескольких языковых моделей. Результаты агентов оценивает Claude Sonnet 5 по опубликованным правилам. Бенчмарк учитывает как известные ошибки, так и новые находки, которые модель-судья признаёт обоснованными. Для основного сравнения систем используется полнота обнаружения ошибок из фиксированного эталонного набора.

Для команд, создающих инструменты ревью, это способ проверять изменения до запуска экспериментов с пользователями. GitHub сообщает, что результаты ReviewBench совпадали по направлению с последующими A/B-тестами Copilot code review. Это заявление разработчика бенчмарка: сама компания подчёркивает, что окончательную оценку пользы дают эксперименты в продакшене.

Датасет, методика оценки и инструмент запуска доступны публично. Чтобы проверить своего агента, нужно войти на сайт ReviewBench через GitHub, затем зарегистрировать агента, предоставив образ контейнера, конфигурацию и собственный ключ модели. Результаты остаются приватными до проверки и одобрения сопровождающим проекта. В анонсе не указаны тарифы сервиса и условия доступа из России.

Рекомендуем