标签: 强化学习

  • Hello-Agents:69K Star 的《从零开始构建智能体》——Datawhale 出品的中文 Agent 系统性实战教程

    Hello-Agents:69K Star 的《从零开始构建智能体》——Datawhale 出品的中文 Agent 系统性实战教程

    Hello-Agents 项目主视觉
    Hello-Agents——《从零开始构建智能体》开源教程

    项目简介

    Hello-Agents 是 Datawhale 开源社区出品的系统性智能体(AI Agent)中文实战教程——《从零开始构建智能体》,16 章内容从智能体原理、经典范式(ReAct / Plan-and-Solve / Reflection)一路讲到自研 Agent 框架、记忆与 RAG、MCP 通信协议、Agentic RL 训练与多智能体综合项目,目标是带你从大语言模型的”使用者”蜕变为智能体系统的”构建者”。目前已斩获 69,381 Stars,并曾登顶 GitHub Trending,是当下最热门的中文 Agent 学习资源之一。

    与 Dify、Coze、n8n 这类”流程驱动”的低代码 Agent 平台不同,Hello-Agents 的重心是教你构建 AI 原生(AI Native)智能体——真正以 LLM 推理驱动决策的 Agent。教程配套自研轻量框架 HelloAgents(基于 OpenAI 原生 API 从零实现),让你兼具”用轮子”与”造轮子”的能力。

    安装要求和过程

    环境要求

    • Python 3.10+(具备基础 Python 编程能力即可,无需模型训练背景)
    • 任意一个 LLM API Key(OpenAI 兼容接口,如 DeepSeek、通义千问、GLM 等国产模型均可)
    • 可选:Jupyter Notebook / VS Code,用于运行配套代码

    快速开始

    # 1. 克隆仓库(含全部 16 章文档 + 配套代码)
    git clone https://github.com/datawhalechina/hello-agents.git
    cd hello-agents
    
    # 2. 安装自研教学框架 HelloAgents(V1.0.0)
    pip install helloagents
    
    # 3. 配置模型 API(OpenAI 兼容接口均可)
    export LLM_API_KEY="your-api-key"
    export LLM_BASE_URL="https://api.deepseek.com/v1"
    
    # 4. 跟随章节运行 code/ 目录下的配套代码
    

    不想装环境?可直接在线阅读国内加速站 | GitHub Pages;官方还提供带 Datawhale 水印的免费 PDF 版本下载

    核心功能

    • 16 章完整学习路径:五大部分层层递进——智能体与 LLM 基础 → 亲手实现 ReAct / Plan-and-Solve / Reflection 经典范式 → 记忆·RAG·上下文工程·通信协议等高级技术 → 综合案例 → 毕业设计,每章配可运行代码。
    • 自研教学框架 HelloAgents:不依赖任何重型框架,基于 OpenAI 原生 API 从零构建 Agent 框架,穿透 LangGraph / AutoGen 等框架表象理解底层原理。
    • Agentic RL 训练实战:第十一章覆盖从 SFT 到 GRPO 的 LLM 训练全流程,是少有的把”训练智能体模型”讲透的中文教程。
    • MCP / A2A / ANP 协议解析:系统讲解智能体通信协议,配合智能旅行助手案例演示 MCP 与多智能体协作的真实应用。
    • 丰富的 Extra 番外篇:Agent 面试题总结、GUI Agent / Web Agent 实战、Agent Skills 与 MCP 对比、Agent 自进化、Skill 写作最佳实践等 13+ 篇社区共创内容持续更新。

    典型使用场景

    1. 系统学习 Agent 开发的工程师/学生:按五大部分循序渐进,从手写 ReAct 循环到构建自己的多智能体应用,毕业设计产出可写进简历的完整项目;番外篇的 Agent 面试题总结对求职者尤其实用。
    2. 复现深度研究智能体(DeepResearch Agent):第十四章手把手复现自动化深度研究智能体,理解 OpenAI Deep Research 类产品的任务规划、搜索、综合报告全链路。
    3. 构建多智能体模拟应用:第十五章”赛博小镇”将 Agent 与游戏结合,模拟社会动态,是学习 Generative Agents(斯坦福小镇)范式的中文最佳实践入口。

    推荐理由

    市面上 Agent 教程要么是框架 API 说明书,要么是零散博客,而 Hello-Agents 是我见过体系最完整的中文 Agent 教程:它不满足于教你调用 LangGraph,而是带你从零造一个框架出来——这种”造轮子”式学习对建立底层直觉极其有效。内容覆盖也足够前沿:上下文工程、MCP 协议、GRPO 训练、Agent 自进化这些 2025-2026 年的热点全部收录,且持续更新。Datawhale 社区运营成熟,配套读者群、视频课共创、社区精选投稿一应俱全,完全免费开源。一周内 Star 从 1 万飙到近 7 万足以说明其质量。给想在”Agent 元年”入场的中文开发者:这就是那本该收藏的教科书。

    下载地址

    项目数据:69,381 Stars | 语言:Python / Markdown | 出品:Datawhale 开源社区(数据截至 2026-07-29)

  • Prime Intellect 融了 13 亿美元:企业不想再给大模型厂商”交租”了

    Prime Intellect 创始人团队
    Prime Intellect 把训练 AI 智能体的全套家当打包成”全栈”服务(图源:TechCrunch)

    一家 2024 年才成立的公司,靠帮企业自己训练 AI 智能体,融到了 1.3 亿美元 A 轮,估值直接站上 10 亿美元。投资方名单读起来像一张 AI 圈名人堂——英伟达、英特尔、戴尔的战投都在,还有 Perplexity、Box、Harvey、Cognition 这些公司的创始人以个人身份下注。这轮由 Radical Ventures 领投,光看阵容就知道,芯片和云厂商都想在”谁来训练明天的模型”这件事上占个座。

    一家成立两年的公司,凭什么值 10 亿

    Prime Intellect 做的事说白了就是一句话:别再从 OpenAI 或 Anthropic 那里按 token 租智能了,自己造一个更适合业务的。它把训练 AI 智能体需要的家当打包成一套”全栈”——算力、强化学习框架、评估工具,客户像逛市场一样按需取用,不会被绑死在一套方案上。

    “不应该只有旧金山玻璃大厦里的少数极客才拥有训练 AI 模型的能力,每一家企业、每一个国家都应该拥有这种能力。”——Prime Intellect CEO Vincent Weisser

    为什么这件事忽然有了土壤?几年前,自己训模型还是只有巨头玩得起的游戏。但现在强化学习这套打法成熟了,模型可以在具体任务上反复试错、被奖励、被修正,企业慢慢能当自己的”AI 实验室”。真正的难点在于底层基建太复杂,大多数公司根本凑不齐这套零件——Prime Intellect 就卡在了这个缝里。

    企业为什么不想再”租”智能了

    吸引力来自实打实的结果。金融公司 Ramp 用它做了一个在表格里找答案的 Agent,官方说法是准确率高过前沿模型,速度更快,成本只有零头。更关键的是心态变化:企业越来越不愿意把专有数据喂给 OpenAI 和 Anthropic,也怕哪天模型像上个月 Anthropic 的 Fable 那样说关就关。

    • 把敏感业务数据留在自己手里,而不是交给第三方大模型厂商;
    • 不用担心模型被突然下线,业务连续性更有保障;
    • 在垂直任务上,自训的小模型成本可能远低于调用前沿 API。

    Radical Ventures 的合伙人 David Katz 说得更直白:大家开始琢磨”怎么把企业自己的智能掌握在手里,别冒那些风险”。目前年化收入已经冲到 1 亿美元,Ramp、Zapier 都是付费客户。


    钱正流向训练场,而不是模型

    这轮融资背后藏着一个正在成形的判断——资本正在涌向”训练场”,而不是模型本身。就在五天前,做 Agent 安全训练环境的 Bespoke Labs 也拿了 4000 万美元。两笔加起来的信号很清楚:企业想要的不再是又一份订阅,而是 Agent 这个东西的所有权。英伟达和英特尔同时开出支票,说明连芯片厂也信了这套逻辑——它们不在乎模型最后归谁,只要训练跑在自己的硅上就行。接下来一年要回答的问题是,Prime Intellect 能不能在 OpenAI 和 Anthropic 自己猛攻企业市场时,守住这 1 亿美元的增速。

  • Cua:开源 Computer-Use 2.0 框架,让 AI 智能体像人一样操作电脑

    Cua:开源 Computer-Use 2.0 框架,让 AI 智能体像人一样操作电脑

    Cua 开源 Computer-Use 2.0 框架

    项目简介

    Cua 是 trycua 出品的一套开源「Computer-Use 2.0」基础设施,围绕「让 AI 智能体像人一样看屏幕、点按钮、敲键盘完成任务」这一目标,提供了四大模块——后台驱动(Cua Drivers)、智能体沙箱(Cua Sandboxes)、评测基准(Cua-Bench)与 macOS 虚拟化(Lume),覆盖从训练、评测到数据生成的全流程。它把「驱动—沙箱—评测—虚拟化」四件事拆成可独立使用又互相咬合的开源组件,MIT 协议、跨平台,并支持通过 MCP 接入 Claude Code、Cursor、Codex 等主流编码智能体。

    安装要求和过程

    环境要求:

    • Cua Drivers(后台驱动):macOS 12+ / Windows 10+ / Linux(X11 或 Wayland);需搭配 Claude Code、Cursor、Codex 等编码智能体。
    • Cua Sandboxes(沙箱):Python 3.11+,pip install cua
    • Cua-Bench(评测):需 uv;Linux / macOS。
    • Lume(虚拟化):Apple Silicon(M1+)macOS,依赖 Apple Virtualization.Framework。

    快速安装:

    # 1) Cua Drivers — 后台驱动原生桌面应用(macOS / Linux)
    /bin/bash -c "$(curl -fsSL https://cua.ai/driver/install.sh)"
    #  Windows (PowerShell)
    irm https://cua.ai/driver/install.ps1 | iex
    
    # 2) Cua Sandboxes — 任意系统的智能体沙箱
    pip install cua
    
    # 3) Lume — macOS 虚拟化
    /bin/bash -c "$(curl -fsSL https://cua.ai/lume/install.sh)"
    
    # 4) Cua-Bench — 评测与 RL 环境
    git clone https://github.com/trycua/cua && cd cua/cua-bench
    uv tool install -e . && cb image create linux-docker

    核心功能

    Cua 四大模块生态图

    1. 后台 Computer-Use 驱动:在 macOS / Windows / Linux 上后台驱动原生应用,智能体点击、键入、校验,全程不抢走你的光标与窗口焦点;同一套 CLI + MCP 服务器可接入 Claude Code、Cursor、Codex、OpenClaw 等。
    2. 跨 OS 智能体沙箱:一个统一 API 调度任意系统的 VM/容器(Linux / macOS / Windows / Android 及 BYOI),看屏、点击、执行代码,云端或本地(QEMU)皆可。
    3. 评测与 RL 基准(Cua-Bench):在 OSWorld、ScreenSpot、Windows Arena 上评测 computer-use 智能体,并导出轨迹用于训练与强化学习。
    4. macOS 原生虚拟化(Lume):基于 Apple Virtualization.Framework,在 Apple Silicon 上以近原生性能创建、管理 macOS / Linux 虚拟机,支持 unattended 无人值守安装。
    5. 开放可组合生态:cua-driver / cua-agent / cua-sandbox / cua-computer-server / cua-bench / lume / lumier 七大包,lumier 还提供 Docker 兼容接口,便于把 Lume 虚拟机接入现有编排。

    典型使用场景

    Cua 后台 Computer-Use 工作流

    • 给编码智能体一台「电脑」:把 Cua Sandbox 接进 Claude Code,让它在隔离的 macOS / Windows 虚拟机里自行打开浏览器、跑脚本、截图验证,完成端到端任务而不污染本机。
    • 后台自动化办公流:用 Cua Drivers 在后台驱动 Slack、Excel、浏览器等原生应用,自动填表、导出报表、跨软件搬运数据,你依旧能正常用电脑。
    • 评测与训练自己的 CUA 模型:用 Cua-Bench 在标准化环境里跑基准、收集轨迹,进而做监督微调或 RL,持续改进自家 computer-use 模型。

    推荐理由

    一句话:如果你在折腾「让 AI 操作电脑」,Cua 是目前最完整、最务实的开源底座。它把「驱动—沙箱—评测—虚拟化」四件事拆成了可独立使用又互相咬合的模块——想给 Agent 加双手,用 Drivers;想搞评测训练,用 Bench;想在 Mac 上批量起虚拟机,用 Lume。MIT 协议、跨平台、支持 MCP 接入主流编码助手,落地门槛低。相比闭源的 Operator / Manus 类服务,Cua 把控制权和数据都留在你手里——这正是本地优先时代最该有的样子。

    下载地址

  • 不租AI了,自己练:Prime Intellect拿1.3亿美元帮企业造专属智能体

    一家叫Prime Intellect的初创公司刚刚宣布完成1.3亿美元A轮融资,估值站上10亿美元。这轮由Radical Ventures领投,Nvidia Ventures、Intel Capital、Dell Technologies Capital、Iconiq跟投,还有一长串创始人天使,比如Perplexity的Aravind Srinivas、Box的Aaron Levie、Harvey的Winston Weinberg、Cognition的Jeff Wang。换句话说,半个AI创业圈都来捧场了。

    Prime Intellect 融资
    Prime Intellect 完成 1.3 亿美元 A 轮,帮企业训练专属 AI 智能体(图源:TechCrunch)

    它到底在卖什么

    简单说,Prime Intellect想让企业不依赖OpenAI、Anthropic这种封闭前沿实验室,也能拥有自己的AI智能体。它提供一套”全栈”工具:算力接入、强化学习框架、评测工具,客户像逛市场一样按需取用,不用被绑死在一整套方案里。

    这事儿放在几年前几乎不可能。但强化学习(RL)的出现改变了局面——它用”做对了奖励、做错了惩罚”的方式,让公司能在自己的产品和数据上反复打磨模型,为具体业务调出专属能力。谁掌握了这个训练循环,谁就相当于有了自己的AI实验室。

    “不该只有旧金山某栋玻璃大楼里的几个极客才有能力训练AI模型,”Prime Intellect联合创始人兼CEO Vincent Weisser对TechCrunch说,”每一家企业、每一个国家都应该拥有这种能力。”

    真有人买单吗

    有,而且不少。Ramp、Zapier、Flapping Airplanes都在付费使用它的托管版本,这股势头把公司的年化收入冲到了1亿美元。更关键的是效果:金融科技公司Ramp用Prime Intellect搭了个在电子表格里找答案的智能体,结果在准确率上超过了前沿模型,速度更快,成本只是零头。联合创始人Karim Atiyeh的原话是:”比前沿模型准,跑得更快,价钱只有零头。”

    • Radical Ventures 合伙人 David Katz:别人只给零碎能力,Prime Intellect 把顶级实验室的本事做成了”一站式”
    • 客户已超 6000 家,覆盖众多头部 AI 创业公司和大型企业
    • 英伟达、英特尔、戴尔集体下注,说明算力与基础设施方也看好这条路

    企业为什么想”自己掌控智能”

    背后的推力其实有点被迫的意味。越来越多的公司不愿意把专有数据交给OpenAI和Anthropic,怕失去对数据的掌控;也怕依赖一个随时可能被关掉的模型——上个月Anthropic关停Fable就是活生生的例子。Katz说得很直白:企业都在琢磨”怎么才能掌握自己的企业智能,而不是把这些风险交给别人”。

    RL正在悄悄改写”谁能做前沿AI”这件事。过去预训练把能力锁在少数实验室手里,现在后训练和强化学习把优化循环交到了使用者手上。Prime Intellect要做的,就是把这套原本只在实验室内部的基建,原封不动地搬到成千上万家公司面前。接下来它打算把规模继续做大,往更长程的智能体和”会自己学习的模型”方向上押注。

  • 把德州扑克赢家算法搬进股市:三个DeepMind老兵的印钞实验

    有一群人先在扑克牌桌上证明了自己能打败人类顶尖职业选手,现在他们把同一套本事搬到了华尔街。三家前DeepMind研究员创办的布拉格AI实验室EquiLibre Technologies,刚完成一笔金额未公开的A轮融资,估值冲到5亿美元,领投方是欧洲老牌风投Creandum。用Creandum副总裁Cameron Sellers的话说,这是他们”有史以来单笔投出的最大筹码”。

    扑克和炒股,原来是同一道数学题

    这三个人当年在DeepMind位于加拿大埃德蒙顿的办公室里,做出了名为DeepStack的AI——第一个在无限注德州扑克上击败职业玩家的程序。后来他们发现,扑克和金融市场在底层逻辑上高度相似:两者都适合用强化学习来训练,也就是让模型在”奖励”的驱动下自我对弈、自我进化。

    CEO Martin Schmid说得很直白:”交易和市场的好处在于,打分方式简单到不能再简单,就看这个agent到底赚了多少钱。”扑克里每赢一局是一次reward,市场里每一毫秒都在给agent打分。

    Schmid强调,EquiLibre首先是一家实验室,而不是金融机构:”我做这件事不是因为我对让市场更有效率感到兴奋,而是因为我们都对建造前所未有的东西感到兴奋,而且这事儿做起来真的很好玩。”

    已经不是在模拟盘里玩了

    EquiLibre不是只停留在论文阶段。它与知名量化机构Tower Research Capital合作,算法每天在标普500和纳斯达克上跑出数十亿美元的实盘交易量。公司宣称,自2025年先在加密货币市场上线以来,”从成立到现在没有哪个月是亏损的”——也就是说每个月整体都是正收益。

    有意思的是,三名创始人Schmid、CTO Rudolf Kadlec、CSO Matej Moravcik全都没有金融背景,驱动他们的也不是”让市场更有效”这类使命感。他们更在意的是用更少的芯片榨出更强的算力,并在中欧亲手搭起一座大型计算集群。

    风投为什么抢着下注

    DeepMind系创业者正是当下VC眼里的香饽饽,另一个例子是刚融到11亿美元的Ineffable Intelligence。EquiLibre的顾问团里还坐着强化学习泰斗Rich Sutton——他因为在这领域的贡献拿下了2024年的图灵奖。Sellers看中的是金融市场的体量:”地球上总可寻址市场最大的领域之一,就是金融交易。”

    风险当然也在。像Jane Street这样的交易巨头已经公开说自己用上了RL加LLM,手里攥着上万块高端GPU;EquiLibre想靠”用更少芯片做更多事”弯道超车,难度不小。但Schmid的态度很松弛:”这不是一个赢家通吃的游戏。”

    扑克AI与量化交易融合概念图
    从扑克桌到交易终端:强化学习的新战场(概念图)
    • DeepStack三人组把击败人类的强化学习算法用于股票实盘交易
    • EquiLibre估值5亿美元,A轮由Creandum领投
    • 与Tower Research Capital合作,日交易量达数十亿美元
    • 顾问团包括2024年图灵奖得主、强化学习先驱Rich Sutton