
ReviewBench мери буку AI рецензената на 219 стварних pull request-ова

GitHub је 5. октобра 2026. у најави ReviewBench-а отворио истраживачку верзију бенчмарка за AI рецензенте кода: обухвата 219 стварних јавних pull request-ова из 187 репозиторијума и 19 програмских језика, одабраних уз анализу 103,9 милиона GitHub-ових захтева за спајање кода. Резултати одвојено приказују познате проблеме које агент налази, оне које пропушта и примедбе које стварају буку у рецензији.
За избор алата важније је то раздвајање него једно место на ранг-листи: прецизност говори о квалитету налаза, одзив о покривености проблема, а тежина и категорија показују шта је агент заиста открио. У анализи LATENT-а објашњено је да 96,6% означава сагласност старијих инжењера са оценама тачних и нетачних налаза у референтном скупу, а не удео грешака које је пронашао неки AI рецензент.
Како је састављен скуп измена
ReviewBench пореди агенте на јавним изменама пројеката отвореног кода. Расподела програмских језика и величина репозиторијума приближена је широј активности на GitHub-у, док су веће измене намерно заступљеније како ситни захтеви са једном датотеком не би потиснули сложеније рецензије. Зато резултат описује рад на овако састављеном корпусу, а не просечан исход на сваком захтеву који тим добија.
За сваку измену постоји референтни скуп налаза. Кандидати потичу из људских рецензија, накнадних исправки аутора, статичке анализе и више породица AI модела. Налази о истом проблему се спајају, па више рецензената који уоче једну грешку не увећавају вештачки њен значај. Затим се по заједничком критеријуму оцењује да ли је примедба тачна, релевантна и довољно значајна за рецензију; њено порекло само по себи није доказ.
Јавни репозиторијум ReviewBench-а садржи пробни скуп од 25 задатака и пуни скуп од 219; званична завршна евалуација користи три круга на пуном скупу. Објављени су измене кода, референтни налази и поступак оцењивања. Резултат на ранг-листи припада одређеној конфигурацији агента и поступку којим је оцењена, па само име модела не описује све услове тог резултата.
Шта заиста мере прецизност и одзив
Прецизност показује колики је део оцењених примедби исправан, а одзив колики је део познатих ваљаних проблема агент пронашао. Агент који објављује много коментара може имати добар одзив и истовремено стварати посао људима који одбацују лажне узбуне. Агент са мало примедби може деловати поуздано, али пропустити проблеме због којих је рецензија уопште покренута.
Ознака grounded значи да се резултат рачуна према већ означеном референтном скупу. Grounded одзив је погодан за поређење агената јер сви добијају исти скуп познатих ваљаних проблема. Grounded прецизност има ужу основу: у њу улазе налази упарени са постојећим ознакама, док се неупарене примедбе изостављају. Зато висок резултат овде не говори колики је део баш свих коментара агента користан.
Метрике augmented обухватају и неупарене примедбе које оцењивач накнадно прогласи ваљаним или неваљаним. Тако агент добија признање ако открије стварни проблем који није ушао у референтни скуп, али се у прецизности виде и његове нове погрешне примедбе. Код augmented одзива нови ваљани налази увећавају и број пронађених и укупан број проблема у прорачуну. Пошто сваки агент може открити другачије нове проблеме, та метрика је корисна за разумевање његовог рада, док grounded одзив даје заједничку основу за директно поређење.
Који резултат је важан за одређени ризик
ReviewBench разврстава налазе по тежини и врсти, међу којима су исправност кода, безбедност, поузданост, одржавање и тестирање. Ако тим настоји да смањи ризик од озбиљног пропуста, одзив за налазе високе тежине и одговарајућу категорију говори више од општег броја коментара. Ако људски рецензенти већ губе време на сувишне примедбе, већу тежину добија прецизност. Оба погледа су потребна кад алат треба да открива важне грешке без непотребне буке.
Бенчмарк дозвољава и промену односа прецизности и одзива у збирној оцени, после чега се редослед на ранг-листи мења. То чини видљивим зашто један победник није нужно најбољи избор за сваки тим: алат који налази више проблема може тражити више провере његових коментара. Исто тако, висок укупан резултат може прикрити слабији учинак баш у категорији због које тим набавља рецензента.
Домет резултата на јавном коду
Јавни корпус омогућава да се виде измене и референтни налази на којима је агент оцењен. Он ипак не обухвата приватна пословна правила, унутрашњу архитектуру и зависности које могу бити пресудне у репозиторијуму конкретног тима. Референтни скуп такође може пропустити проблем који нису уочили његови аутори; augmented оцена може препознати такав налаз, али зависи од накнадне процене оцењивача. ReviewBench зато може сузити избор AI рецензената према врсти ризика, док се њихов учинак на приватном коду утврђује тек на изменама тог тима.
Прочитајте и:
Повезани чланци


GitHub почетну страну претвара у ред за рад — agent сесије су сада подразумеване

GitHub Actions без трајног cloud кључа: OIDC тражи строжи subject

AI агент или радни ток: аутономија пада на тесту поновљивости

NIST тражи „личну карту“ за AI агенте — стигло је више од 600 одговора

K3s или Kubernetes: мање RAM-а плаћа се компромисом у протоку
Претплатите се на наш билтен
Добијајте најновије вести о Web3, AI-у и криптовалутама директно у пријемно сандуче.