标签: 阿里巴巴

  • 阿里发布Qwen3.8-Max:2400亿参数、下周开源权重,直接对标Claude Fable 5

    阿里这周一又把自家旗舰模型推到了台前。新模型叫Qwen3.8-Max(对外主打名Qwen Max),阿里给它的定语是”迄今为止规模最大、能力最强”,并且放话性能可以对标Anthropic的Claude Fable 5,也能跟OpenAI和国内对手Kimi K3掰手腕。

    参数和数字

    官方给出的参数量是2.4万亿。这个数字代表的是模型训练时学到的那一大堆可调权重,用来处理信息、识别模式、完成各种任务。不过参数量从来只是个粗略信号——Moonshot的Kimi K3有2.8万亿参数,但大多数美国头部实验室压根不公布具体数字,OpenAI和Anthropic对自己的旗舰模型更是讳莫如深。

    阿里自己的测试显示,Qwen3.8-Max在多个基准上和Fable 5基本持平,有时还能反超。在第三方众包对比平台Arena.AI上,它的文本榜只排在Fable 5和三个Opus系列模型之后。

    更具体一点:前端代码生成它只输给两个Claude Opus和Kimi K3;视觉理解榜上,唯一把它压住的只有Fable 5。换句话说,在野外的真实对撞里,它确实挤进了第一梯队。

    阿里杭州总部外的公司标识
    阿里杭州总部(图源:NurPhoto via Getty Images)

    重点在”开源权重”

    真正让这波发布在圈内炸开的,是阿里说下周就会放出模型权重。权重就是决定模型怎么处理信息的那组数值。开放权重比传统开源软件限制更多,但比起OpenAI、Anthropic那种完全黑盒的闭源产品,开发者拿到的控制权要多得多。

    这其实是阿里的一次”回摆”。今年早些时候,它对更先进的模型短暂转向过闭源路线,现在又回到了开放权重的老路。放在中国AI圈里,这已经是常态:上周Kimi K3刚放了权重,字节和MiniMax也在周五各自推出了能打的视频生成模型。北京方面一直把开放权重当成策略在推进,既是为了扩大国产技术的影响力,也是在全球AI治理的话语权上多下注。

    • 对开发者:下周拿到权重后,可以自己部署、微调、改架构,不用被厂商的API定价卡脖子。
    • 对美国同业:开放权重阵营又多了一个能打的对手,关于”该不该限制开源工具”的争论会更难收场。
    • 对用户:更强的模型通过Qwen入口直接用上,中文场景下的体验通常会更贴。

    有意思的是,就在美国几家闭源巨头因为自家”越狱”的AI智能体惹出一堆安全风波时,开放权重这边反而越走越宽。阿里这步棋算不算真追平Fable 5,最终还得看开发者和真实工作流买不买账。但有一点是清楚的:当最强模型开始把权重交出来,竞争的规则书又得改写一页。

  • Open Code Review:阿里巴巴开源的 AI 代码评审 CLI,Token 只用 1/9 却更精准

    Open Code Review:阿里巴巴开源的 AI 代码评审 CLI,Token 只用 1/9 却更精准

    如果你用过 Claude Code 之类的通用 Agent 做代码评审,大概率遇到过这些坑:改动一多就”偷工减料”只看部分文件、报出来的问题行号对不上、换个提示词质量就飘。Open Code Review(OCR) 是阿里巴巴刚开源的一款 AI 代码评审命令行工具,它把”确定性工程”和”Agent 动态决策”拧在一起,专门解决这些问题。项目上线不久便冲上 GitHub Trending,目前已收获约 12.2K Stars

    Open Code Review 功能亮点
    Open Code Review 功能亮点(图片来源:项目 README)

    一句话简介

    Open Code Review 是阿里巴巴开源的 AI 代码评审 CLI 工具——读取 Git diff,交给可配置的大模型 Agent 进行带工具调用的深度评审,产出行级精准的结构化评审意见。它源自阿里内部使用两年、服务数万开发者、累计发现数百万代码缺陷的官方评审助手,经大规模验证后开源。

    安装要求与快速上手

    环境要求

    • Git ≥ 2.41:OCR 依赖 Git 生成 diff、检索代码与仓库操作。
    • 支持 Windows / macOS / Linux 三大平台;需要配置一个大模型接口(OpenAI / Anthropic 兼容即可),或使用”委托模式”无需配模型。

    安装(npm 全局安装)

    npm install -g @alibaba-group/open-code-review

    安装完成后,全局即可使用 ocr 命令。也支持安装脚本、GitHub Release 二进制、源码编译等方式。

    配置模型

    # 选择内置服务商或添加自定义服务商
    ocr config provider
    # 为当前服务商选择模型
    ocr config model

    交互式界面会引导你完成服务商选择、API Key 填写与模型配置,并自动测试连通性。

    模型配置界面
    交互式模型配置界面(图片来源:项目 README)

    开始评审

    cd your-project
    
    # 工作区模式:评审所有暂存/未暂存/未跟踪的改动
    ocr review
    
    # 分支范围:对比两个 ref
    ocr review --from main --to feature-branch
    
    # 单个 commit
    ocr review --commit abc123
    
    # 整文件扫描:不看 diff,直接审阅整个仓库或指定目录
    ocr scan
    ocr scan --path internal/agent

    核心功能

    • 确定性工程 × Agent 混合架构:对”绝不能出错”的评审步骤(选文件、匹配规则、定位行号)用工程逻辑硬约束保证正确,把动态决策与上下文检索交给 Agent,各司其职。
    • 精准选文件 + 智能打包:明确判定哪些文件需评审、哪些应过滤;把关联文件(如中英两份 message 属性文件)打包为一个评审单元,每包作为隔离上下文的子 Agent 并发运行,在超大改动集上依然稳定。
    • 行级精准定位 + 反思模块:独立的评论定位与评论反思模块,系统性提升 AI 反馈的位置准确度与内容准确度,避免”行号漂移”。
    • diff 评审 + 整文件扫描ocr review 审阅改动,ocr scan 审阅整份文件——适合审计陌生代码库或没有有意义 diff 的目录。
    • 丰富集成能力:内置 MCP Server 扩展工具、CI/CD 集成(GitHub Actions / GitLab CI / Gerrit 等),并可作为 Skill 或插件接入 Claude Code、Codex、Cursor;浏览器端 Session Viewer 可回放评审过程。

    性能基准

    官方基于 50 个热门开源仓库、200 个真实 PR、10 种编程语言构建了真实世界评审基准,由 80+ 资深工程师交叉标注出 1505 个基准问题。结果显示:在同一底座模型下,OCR 的 准确率(Precision)与 F1 显著更高,而 Token 消耗仅约通用 Agent 的 1/9、评审更快;召回率略低,是”以精度换噪声”的有意取舍。

    性能基准对比
    在同一底座模型下的基准表现概览

    典型使用场景

    • 提交前自检:在本地 ocr review 一把,把行级问题在推送前就修掉,减少来回改 PR 的成本。
    • CI 流水线自动评审:接入 GitHub Actions / GitLab CI,对每个 PR 自动评审并留下行级评论,低 Token 成本让团队大规模跑得起。
    • 审计陌生代码库:接手老项目或第三方代码时用 ocr scan 整文件扫描,快速摸清 NPE、线程安全、XSS、SQL 注入等隐患。

    推荐理由

    市面上”给 Agent 套个 Skill 就当代码评审”的方案不少,但真正在工程上把稳定性做扎实的不多。OCR 最打动我的一点,是它没有一味迷信大模型,而是把”该确定的地方交给工程、该灵活的地方交给 Agent”这条边界划得很清楚——这正是它能在阿里内部大规模跑两年、且在基准上只花约 1/9 Token 就拿到更高精度的原因。对追求 CI 成本可控、又不想被误报刷屏的团队来说,这是个值得一试的选择。它还内置了针对 NPE、线程安全、XSS、SQL 注入等常见缺陷的微调规则集,开箱即用。

    下载地址

  • page-agent:阿里巴巴出品的页面内JS GUI代理,一行脚本让网页拥有AI操控能力(23K+Stars)

    page-agent:阿里巴巴出品的页面内JS GUI代理,一行脚本让网页拥有AI操控能力(23K+Stars)

    page-agent Logo

    ## 项目简介

    **page-agent** 是阿里巴巴出品的 **JavaScript 页面内 GUI 代理**,让 AI 通过自然语言直接控制 Web 界面。其核心理念是 —— *”The GUI Agent Living in Your Webpage”*,即:智能体不再运行在外部脚本或 Python 环境中,而是**活在页面内部**,用纯 JavaScript 操作 DOM,实现真正的轻量化 AI 能力嵌入。

    亮点概要:一行脚本接入、无需浏览器插件、无需 Python 环境、无需截图 —— 纯页面内 JS 实现的 GUI 代理,让任何 Web 应用瞬间拥有 AI 操作能力。

    ## 安装要求和过程

    ### 环境要求
    – **浏览器**:任意现代浏览器(Chrome/Edge/Firefox/Safari)
    – **Node.js**:≥ 18(仅 NPM 安装方式需要)
    – **LLM API**:支持接入任意兼容 OpenAI API 格式的大模型(默认可使用阿里云百炼、OpenAI、DeepSeek 等)

    ### 快速安装(一行脚本体验)

    最简单的方式,在任意网页的 HTML 中插入一行 `



    ```

    插入后刷新页面,即可看到 page-agent 的演示界面(使用官方免费测试 LLM)。

    > ⚠️ 免费测试 API 仅用于技术评估,生产使用请接入自有 LLM API Key。

    ### NPM 安装(生产使用)

    ```bash
    npm install page-agent
    ```

    ```javascript
    import { PageAgent } from 'page-agent'

    const agent = new PageAgent({
    model: 'qwen3.5-plus',
    baseURL: 'https://dashscope.aliyuncs.com/compatible-mode/v1',
    apiKey: 'YOUR_API_KEY',
    language: 'zh-CN',
    })

    await agent.execute('点击登录按钮')
    ```

    ## 核心功能

    1

    极低接入成本 —— 一行脚本即可嵌入

    无需浏览器插件、无需 Python 环境、无需无头浏览器,纯页面内 JavaScript 实现,所有功能都在当前网页内运行。仅需一行 <script> 标签即可为任意 Web 应用接入 AI 控制能力,CDN 和 NPM 包双重分发。

    2

    轻量交互模式 —— 基于 DOM 操作,无需截图

    摒弃了传统 GUI 代理依赖截图 + 多模态大模型的重量级方案,page-agent 直接基于 DOM 结构理解页面,用文本描述操作指令。优势:延迟更低、成本更低、无需特殊权限、不依赖视觉大模型。

    3

    自定义大模型支持 —— 无绑定,完全开放

    支持接入任意兼容 OpenAI API 格式的自有 LLM,无厂商绑定。推荐使用阿里云百炼 qwen3.5-plus,也可接入 OpenAI GPT、DeepSeek、Gemini 等主流大模型,灵活适配企业已有 AI 基础设施。

    4

    扩展能力 —— Chrome 扩展 + MCP Server(Beta)

    可选安装 Chrome 扩展,支持跨多页面任务调度;同时提供 Beta 版 MCP Server,允许外部 AI 系统通过 MCP 协议控制浏览器,与主流 AI Agent 框架无缝集成。

    ## 典型使用场景

    ### 场景一:SaaS AI Copilot 快速接入
    仅需少量代码即可为 SaaS 产品接入 AI 助手,用户可通过自然语言操控产品界面,无需重写后端逻辑。例如:在 CRM 系统中,用户说"创建一个跟进任务并设置明天的提醒",page-agent 即可自动完成一系列 DOM 操作。

    ### 场景二:智能表单填充
    将原本需要 20 次点击的复杂工作流简化为一句话指令,特别适合 ERP、CRM、后台管理系统等表单密集型应用。结合 LLM 的语义理解能力,page-agent 可自动识别表单字段并填入正确内容。

    ### 场景三:Web 应用无障碍适配
    通过自然语言、语音指令、屏幕阅读器,让任意 Web 应用实现无障碍使用,极大降低残障人士使用复杂 Web 应用的门槛。page-agent 作为页面内代理,可直接操作 DOM 实现无障碍导航。

    ### 场景四:MCP 协议集成
    通过 Beta 版 MCP Server,允许外部 AI Agent 客户端控制浏览器,实现"AI 操控 AI"的自动化链路。例如:让 Claude Code 通过 MCP 调用 page-agent,实现完整的端到端 Web 自动化测试。

    ## 推荐理由

    > 在传统方案里,让 AI 操控 Web 界面往往意味着:部署 Python 服务、运行无头浏览器、截图 + 多模态大模型理解、处理各种环境依赖……这套方案对中小企业和个人开发者极不友好。

    **page-agent 的最大价值在于"去重量化"** —— 它把 GUI 代理的核心能力塞进了一个 JS 脚本里,让任何能加载 JS 的网页都能获得 AI 操控能力。这对以下人群尤为有价值:

    - **前端开发者**:无需学习 Python 自动化框架,直接用 TypeScript 扩展 AI 能力
    - **SaaS 产品经理**:快速为产品 prototype 添加 AI Copilot,验证用户需求
    - **企业 IT**:为内部 ERP/CRM 系统添加自然语言操作界面,提升员工效率
    - **无障碍开发**:用最简单的方式为现有 Web 应用添加语音/自然语言操控

    此外,项目由 **阿里巴巴** 官方开源,采用 MIT 许可证,社区活跃,文档完善(在线 Demo、完整文档站、HN 讨论帖均已上线),值得长期关注。

    🔗 相关链接

    GitHub:github.com/alibaba/page-agent(23K+ Stars)

    在线演示:alibaba.github.io/page-agent

    官方文档:alibaba.github.io/page-agent/docs

    NPM 包:npmjs.com/package/page-agent

    许可证:MIT License(可自由商用、修改、分发)

  • 千问接入淘宝:阿里把AI购物这件事做透了

    对话就能买东西,阿里这次玩真的

    阿里巴巴最近把通义千问和淘宝打通了。不是那种噱头式的”AI购物助手”,而是真正能让用户通过对话完成浏览、比价、下单全流程的整合。你在千问App里说一句话,它就能帮你把商品找好、对比完毕、直接下单。

    这套系统接入了淘宝和天猫超过40亿件商品。40亿是什么概念?基本上你能想到的东西都在里面了。以前要用关键词搜索、翻页、对比详情页,现在直接跟AI说你想要什么,它帮你搞定。

    传统电商的逻辑是”人找货”——你得知道自己要什么、怎么描述、哪个关键词有效。AI购物的逻辑是”对话即交易”——你只需要表达需求,剩下的事AI帮你完成。

    淘宝里头也有AI助手了

    阿里这套打法挺聪明的,不是只做一个独立的AI购物App,而是双向打通。千问App能调用淘宝的商品库,淘宝站内也上线了千问赋能的AI购物助手。

    淘宝里头的AI助手还加了几个实用功能:虚拟试穿、30天价格走势追踪。这些功能单独看不算新鲜,但跟对话式购物结合起来,体验就完全不一样了。你可以直接问”这件衣服我穿好看吗”,AI帮你试穿;也可以说”这个价格划算吗”,AI给你看价格走势。


    依托专属”技能库”,千问还能帮你管理物流、处理售后。以前买完东西要查物流得去淘宝App,要退货得找客服,现在直接在对话里说一声就行。

    中外电商的AI路数不一样

    看看国外的玩法,就会发现阿里的打法挺特别的。亚马逊也在用AI优化购物体验,但它不敢让你直接通过AI完成交易,担心失控。加拿大电商平台Shopify倒是接了AI助手,但它用的是第三方的,自己不研发。

    阿里这种”我有大模型、我有电商平台、我把它们打通”的路数,中外都没几家能抄。Google有模型但没电商,亚马逊有电商但模型不够强,只有阿里两家都有。

    这种全链路打通,才是AI商业化真正有力的打法。不是做个聊天机器人让你玩,而是让AI真正进入交易环节、产生实际收入。


    AI购物到底是噱头还是趋势

    肯定有人会说,这不就是个升级版的”智能客服”吗?其实差别挺大的。智能客服是”你问它答”,而且通常只能处理固定流程里的问题。AI购物助手是”你说需求,它帮你完成交易”,主动权在用户手里,但执行权在AI手里。

    这种模式能不能成,关键看两件事:一是AI推荐的准确性,别你想要的跟它给的不是一回事;二是用户对AI做决策的信任度,敢不敢让它帮你下单、处理售后。

    阿里敢全线铺开,说明它在内部测试里对这两件事都有底气。接下来几个月,看用户买不买账就知道了。