GitHub 开源 ReviewBench:按 1 亿多个真实 PR 的口径,来量 AI 代码评审到底行不行
十月五日,GitHub 发布了 ReviewBench,一个开放的 AI 代码评审基准,研究预览版已可试用。它的设计思路是把评测贴近真实:题目按 GitHub 上超过 1 亿个真实 PR 的语言、仓库规模与体量分布来构造;答案用多来源的「金标准」,而不是依赖单一标注者;评测采用一致的评分细则,并由资深工程师独立验证过。GitHub 说,改用 ReviewBench 做离线评测后,Copilot 代码评审(CCR)的离线结果更能预示线上实验的方向。网站上可以浏览完整基准、比较不同评审 agent,也能带上自己的 agent 去评。