标签: Open Code Review

  • Open Code Review:阿里巴巴开源的 AI 代码评审 CLI,Token 只用 1/9 却更精准

    Open Code Review:阿里巴巴开源的 AI 代码评审 CLI,Token 只用 1/9 却更精准

    如果你用过 Claude Code 之类的通用 Agent 做代码评审,大概率遇到过这些坑:改动一多就”偷工减料”只看部分文件、报出来的问题行号对不上、换个提示词质量就飘。Open Code Review(OCR) 是阿里巴巴刚开源的一款 AI 代码评审命令行工具,它把”确定性工程”和”Agent 动态决策”拧在一起,专门解决这些问题。项目上线不久便冲上 GitHub Trending,目前已收获约 12.2K Stars

    Open Code Review 功能亮点
    Open Code Review 功能亮点(图片来源:项目 README)

    一句话简介

    Open Code Review 是阿里巴巴开源的 AI 代码评审 CLI 工具——读取 Git diff,交给可配置的大模型 Agent 进行带工具调用的深度评审,产出行级精准的结构化评审意见。它源自阿里内部使用两年、服务数万开发者、累计发现数百万代码缺陷的官方评审助手,经大规模验证后开源。

    安装要求与快速上手

    环境要求

    • Git ≥ 2.41:OCR 依赖 Git 生成 diff、检索代码与仓库操作。
    • 支持 Windows / macOS / Linux 三大平台;需要配置一个大模型接口(OpenAI / Anthropic 兼容即可),或使用”委托模式”无需配模型。

    安装(npm 全局安装)

    npm install -g @alibaba-group/open-code-review

    安装完成后,全局即可使用 ocr 命令。也支持安装脚本、GitHub Release 二进制、源码编译等方式。

    配置模型

    # 选择内置服务商或添加自定义服务商
    ocr config provider
    # 为当前服务商选择模型
    ocr config model

    交互式界面会引导你完成服务商选择、API Key 填写与模型配置,并自动测试连通性。

    模型配置界面
    交互式模型配置界面(图片来源:项目 README)

    开始评审

    cd your-project
    
    # 工作区模式:评审所有暂存/未暂存/未跟踪的改动
    ocr review
    
    # 分支范围:对比两个 ref
    ocr review --from main --to feature-branch
    
    # 单个 commit
    ocr review --commit abc123
    
    # 整文件扫描:不看 diff,直接审阅整个仓库或指定目录
    ocr scan
    ocr scan --path internal/agent

    核心功能

    • 确定性工程 × Agent 混合架构:对”绝不能出错”的评审步骤(选文件、匹配规则、定位行号)用工程逻辑硬约束保证正确,把动态决策与上下文检索交给 Agent,各司其职。
    • 精准选文件 + 智能打包:明确判定哪些文件需评审、哪些应过滤;把关联文件(如中英两份 message 属性文件)打包为一个评审单元,每包作为隔离上下文的子 Agent 并发运行,在超大改动集上依然稳定。
    • 行级精准定位 + 反思模块:独立的评论定位与评论反思模块,系统性提升 AI 反馈的位置准确度与内容准确度,避免”行号漂移”。
    • diff 评审 + 整文件扫描ocr review 审阅改动,ocr scan 审阅整份文件——适合审计陌生代码库或没有有意义 diff 的目录。
    • 丰富集成能力:内置 MCP Server 扩展工具、CI/CD 集成(GitHub Actions / GitLab CI / Gerrit 等),并可作为 Skill 或插件接入 Claude Code、Codex、Cursor;浏览器端 Session Viewer 可回放评审过程。

    性能基准

    官方基于 50 个热门开源仓库、200 个真实 PR、10 种编程语言构建了真实世界评审基准,由 80+ 资深工程师交叉标注出 1505 个基准问题。结果显示:在同一底座模型下,OCR 的 准确率(Precision)与 F1 显著更高,而 Token 消耗仅约通用 Agent 的 1/9、评审更快;召回率略低,是”以精度换噪声”的有意取舍。

    性能基准对比
    在同一底座模型下的基准表现概览

    典型使用场景

    • 提交前自检:在本地 ocr review 一把,把行级问题在推送前就修掉,减少来回改 PR 的成本。
    • CI 流水线自动评审:接入 GitHub Actions / GitLab CI,对每个 PR 自动评审并留下行级评论,低 Token 成本让团队大规模跑得起。
    • 审计陌生代码库:接手老项目或第三方代码时用 ocr scan 整文件扫描,快速摸清 NPE、线程安全、XSS、SQL 注入等隐患。

    推荐理由

    市面上”给 Agent 套个 Skill 就当代码评审”的方案不少,但真正在工程上把稳定性做扎实的不多。OCR 最打动我的一点,是它没有一味迷信大模型,而是把”该确定的地方交给工程、该灵活的地方交给 Agent”这条边界划得很清楚——这正是它能在阿里内部大规模跑两年、且在基准上只花约 1/9 Token 就拿到更高精度的原因。对追求 CI 成本可控、又不想被误报刷屏的团队来说,这是个值得一试的选择。它还内置了针对 NPE、线程安全、XSS、SQL 注入等常见缺陷的微调规则集,开箱即用。

    下载地址