标签: AI

  • Meta退出全球清洁能源联盟:一年批了十几座天然气电厂,还自称100%可再生

    Meta向TechCrunch确认,公司已经不再是RE100的成员。这个由气候组织(Climate Group)运营的企业可再生能源倡议,Meta加入了整整十年,苹果、谷歌、微软至今都还在444家成员名单里。Meta发言人的说法是”和平分手”,双方都不愿多谈原因,但时间点实在太微妙了。

    天然气发电厂
    Meta过去一年资助了至少十几座天然气电厂 | 图源:TechCrunch / Getty Images

    十几座燃气电厂,发电量抵一个州

    过去一年,Meta为AI数据中心资助建设的天然气电厂至少有十几座。故事从去年6月俄亥俄州一座200兆瓦的”表后”电厂开始,两个月后路易斯安那州Hyperion数据中心配套的3座大型燃气电厂立项,今年4月又追加7座。光是Hyperion这10座电厂加起来就是7.5吉瓦——发出来的电够整个南达科他州用,还有富余。

    巧的是,RE100最近刚更新了问责指南,要求成员企业更严格地汇报可再生能源进度。而Meta当年给RE100的承诺是”2020年前整个运营用上可再生电力”。一边是收紧的审查,一边是加速的燃气布局,这场”好聚好散”里谁先提的分手,其实不难猜。率先报道此事的Recharge News用的标题更直接:Meta是因为”燃气狂潮”被踢出局的。

    一座1吉瓦、全靠天然气驱动、全天候运转的数据中心,一年会排放438吨氮氧化物、149吨细颗粒物、61吨硫氧化物和298吨一氧化碳——这些污染物与哮喘、癌症、心血管疾病和痴呆都有关联。

    “100%可再生”是怎么算出来的

    面对质疑,Meta的回应是仍然承诺用”100%清洁和可再生能源”匹配数据中心的用电量。这里的关键词是”匹配”。靠购买环境属性证书,公司可以在亚利桑那投一座光伏电站,同时在俄亥俄烧天然气,只要光伏电站一年发的电抵得上数据中心一年的用量,账面上就是100%可再生。至于数据中心半夜烧的是什么,证书不管。

    行业里其实有更较真的玩法。微软在推按小时匹配,让绿电供应和数据中心的实际用电曲线对上;谷歌今年2月在明尼苏达花10亿美元向Form Energy买下100小时长时储能,配合可再生能源使用。这条路更贵也更难,但至少不是拿证书遮眼睛。

    • Meta结束十年RE100成员身份,苹果、谷歌、微软仍在名单内;
    • Hyperion数据中心配套10座燃气电厂共7.5吉瓦,超过南达科他州全州用电;
    • 谷歌、微软近期也投了大型化石能源项目,但下注最重的是Meta。

    退出一个自愿性行业组织,平时算不上大新闻。但放在AI算力军备竞赛把美国电网逼到极限、大厂纷纷重拾化石燃料的当口,Meta这次退群更像一个信号:当”100%可再生”的承诺和AI扩张的电力缺口撞在一起,先让路的是承诺。剩下的问题只有一个——对一家嘴上说可再生、手里批燃气电厂的公司来说,”清洁能源”这四个字到底还剩多少含金量。

  • 特斯拉Robotaxi在倒车:城市扩到6个,付费里程反而跌了36%

    特斯拉本周三发布二季度财报,随附的一张图表让人看出了问题。表面上,Robotaxi的付费乘车数据从2025年8月到2026年6月一路稳步上扬,但那是累计值。把数字按季度拆开,画风立刻变了:一季度Model Y车队为付费乘客跑了约110万英里,二季度掉到70万英里左右,环比缩水大约36%。

    特斯拉Robotaxi车队
    特斯拉Robotaxi的付费里程在二季度不升反降 | 图源:TechCrunch / Getty Images

    更尴尬的是背景。这一年里特斯拉把Robotaxi服务从奥斯汀扩张到了得州和佛州的6个城市,有监管员的、没监管员的车都在跑,甚至旧金山湾区那些没拿到自动驾驶运营许可、还得配安全员的挂牌车,大概率也被算进了”Robotaxi覆盖范围”。城市多了、车多了,付费里程却少了三分之一,这笔账怎么算都不好看。财报当天核心业务利润同样不及华尔街预期,周四早盘股价一度跳水超过13%。

    马斯克松口了:千万辆车的数据,喂不熟Cybercab

    财报电话会上有分析师追问扩张为什么这么慢,马斯克给出了一个多年来罕见的坦白。他说,公司得先积累”专属于Cybercab的驾驶数据”,才敢往路上大规模投放这款金色双座无方向盘小车。现阶段的办法有点滑稽:给Cybercab装回方向盘和刹车油门踏板,让它先当普通车跑,用来校准底盘。

    “Model 3、Model Y在路上有几百万辆,Cybercab没有。我们必须用改装过的Cybercab去积累里程。”——马斯克在财报电话会上的原话

    这番话和特斯拉过去的叙事直接打架。多年来公司一直宣称,近千万辆客户车在后台默默收集数据,训练出的能力可以直接迁移给未来的Robotaxi。现在看,换个底盘就得重新攒里程,那套”车队数据护城河”的故事至少要打个折扣。

    拦路虎从”监管”悄悄换成了”安全”

    另一个耐人寻味的变化是说辞。特斯拉过去几年一直把Robotaxi铺不开归咎于监管,虽然从没说清到底是哪条法规拦着。这次口径变了:马斯克说必须谨慎,因为哪怕伤到一个人,就会变成全球头条,监管马上会收紧。他还顺带感慨,美国每年三四万起车祸死亡没人报道,特斯拉出一起事故就是大新闻。

    AI副总裁Ashok Elluswamy则负责报喜:无安全员行驶超38万英里,”零重大事故”,出事的都是别人撞过来的。不过他没定义什么叫”重大”。查一下监管记录,特斯拉这一年向美国高速公路安全管理局报告了22起碰撞,多数确实是被撞,但也有3起是远程操作员挪车时撞的,还有若干次低速磕上马路牙子、电线杆和拖车斗。

    • 二季度付费里程约70万英里,环比下滑约36%,服务城市却从1个扩到6个;
    • Cybercab需要重新积累专属驾驶数据,”千万辆车喂数据”的旧叙事被自己修正;
    • 无安全员里程每周约增10%,马斯克承诺”非常非常快”地扩张,但节奏由安全验证说了算。

    有意思的是,即便处在这么早期的阶段,特斯拉还是选择在这个节点给自己的纯视觉路线庆功。Elluswamy说,”所谓专家”一直宣称安全驾驶离不开激光雷达、毫米波雷达和高精地图,”我们证明了只用摄像头也能做到安全、舒适、便宜”。对面的Waymo每周付费单量还在爬坡,这场路线之争谁笑到最后,恐怕还得再看几个季度的数字,而不是电话会上的形容词。

  • Buzz:Block 开源的”人机同室”协作平台,让 AI 智能体成为团队正式成员 | GitHub 今日 Trending 榜首

    Buzz:Block 开源的”人机同室”协作平台,让 AI 智能体成为团队正式成员 | GitHub 今日 Trending 榜首

    Buzz 项目频道:人与智能体在同一房间协调发布计划
    Buzz 项目频道:人与智能体在同一房间协调发布计划

    项目简介

    Buzz 是 Block, Inc.(Square/Cash App 母公司,也是知名开源智能体 goose 的东家)开源的一款「人类与 AI 智能体共处一室」的自托管协作工作空间——用一条 Nostr 签名事件日志,把聊天、代码评审、CI、工作流、审批和项目记忆统一到同一个 Relay 上,智能体和人拥有完全相同的操作界面与审计轨迹。今日登顶 GitHub Trending 榜首(单日 +2,100 星),目前已收获 7,600+ Stars,Rust 编写,Apache-2.0 许可。

    一句话概括:Slack + GitHub + CI 面板 + 自动化胶水代码,被压缩成一个你自己掌控的事件日志;智能体不再是”闹鬼的定时任务”,而是房间里的正式成员。

    一条签名事件日志,统一七种工具
    一条签名事件日志,统一七种工具

    安装要求和过程

    环境要求

    • 只想试用桌面应用:直接下载打包版,macOS(.dmg)/ Linux(.AppImage / .deb)/ Windows(.exe),无需任何依赖
    • 自托管 / 源码运行:Docker + Hermit(或 Rust 1.88+、Node 24+、pnpm 10+、just)
    • Windows 额外要求:安装 Git for Windows(智能体 Shell 工具依赖 Git Bash,可用 BUZZ_SHELL 指向其他 bash 兼容 Shell)

    快速安装

    方式一:下载安装包(最简单)

    GitHub Releases 下载对应平台安装包,像普通应用一样安装。默认连接 ws://localhost:3000,可通过 BUZZ_RELAY_URL 环境变量或应用内切换 Relay。

    方式二:源码构建 + 自托管(开发者路径)

    # 克隆并激活固定工具链(工具首次使用自动下载)
    git clone https://github.com/block/buzz.git && cd buzz
    . ./bin/activate-hermit
    
    # 一次性初始化:复制 .env、启动 Docker 服务 + 数据库迁移
    just setup && just build
    
    # 日常开发:同时启动 Relay + 桌面应用
    just dev
    

    Relay 跑在 ws://localhost:3000,桌面应用自动弹出。智能体侧设置 BUZZ_PRIVATE_KEY 后即可使用 buzz-cli(JSON 进 / JSON 出,为 LLM 工具调用而设计)。

    核心功能

    智能体是成员,不是机器人——像添加同事一样把智能体拉进频道
    智能体是成员,不是机器人——像添加同事一样把智能体拉进频道
    1. 智能体是”正式成员”而非外挂机器人——每个智能体持有自己的密钥、自己的频道成员身份、自己的审计轨迹,能开仓库、发补丁、评审代码、跑工作流、编辑画布、进语音房间,操作面与人类teammate完全一致,权限按身份而非标志位划分。
    2. 一条事件日志统一一切——消息、表情回应、工作流步骤、评审批准、Git 事件(NIP-34 补丁/仓库公告/状态)全部是同一形状的 Nostr 签名事件,同一身份模型、同一搜索索引、同一审计链。
    3. 分支即房间——开一个 feature 分支就自动生成一个频道,补丁、CI 结果、智能体首轮评审、同事表情反馈和最终合并决定都留在同一个房间里,”这段代码为什么存在”从此有据可查。
    4. YAML 工作流自动化——支持消息 / 表情回应 / 定时 / Webhook 四种触发器;一个 👍 表情就能作为审批门放行一次发布,且每一步都被签名、可搜索。
    5. ACP 智能体接入 + 完整的 Rust Crate 生态——buzz-acp 桥接 ACP↔MCP,官方已适配 goose、Codex、Claude Code;buzz-persona 提供智能体人格包;git-sign-nostr 实现 Nostr 签名的 Git 操作。桌面端 Tauri + React,后端 Postgres + Redis + S3/MinIO。
    Buzz 架构:Relay 是唯一事实来源
    Buzz 架构:Relay 是唯一事实来源

    典型使用场景

    1. 凌晨两点的事故记忆:线上报错,你在频道里问一句”这个错误以前见过吗?”,值守频道的智能体翻出六个月的历史,贴出相关线程、根因和修复记录,并主动提出呼叫上次修复的人——问、答、证据全部留在频道里。
    2. 会自己写发布说明的 Release:打 tag 触发工作流,智能体读取项目频道里合并的 PR,起草 Release Notes 发给人类审阅,收到 👍 表情后自动发布——每一步签名、每一步可搜索。
    3. 不交出”王国钥匙”的 Bug 分诊:让智能体在限定频道内分诊 Bug,它的密钥、成员身份和审计轨迹与人类隔离,像管理一个新同事一样管理它的可见范围,而不是给它一把全局 API Key。
    可讨论的媒体:评论钉在视频的具体帧上
    可讨论的媒体:评论钉在视频的具体帧上

    推荐理由

    我把 Buzz 跑起来体验后的最大感受是:它认真回答了”智能体在团队里应该以什么身份存在”这个问题。市面上的方案大多把 AI 塞进聊天工具当 bot,或者塞进 CI 当脚本,权限靠一堆 API Key 拼凑,出了事没法追溯。Buzz 的答案干脆利落——给智能体一把自己的密钥,让它跟人用同一套协议、进同一个房间、留同一种审计记录。

    值得注意的三点:一是出身硬,Block 是 goose 的东家,这套 ACP harness 直接兼容 goose/Codex/Claude Code,不是玩具;二是技术选型有味道,Nostr 协议的签名事件模型天然适合”人机同权”的审计需求,且不含任何区块链代币成分(README 原话:不用买纪念币);三是坦诚,README 明确列出”今天能用 / 正在接线 / 只有想法”三栏,移动端和推送还在路上。如果你的团队正被 Slack + GitHub + CI 面板 + 各种 bot 胶水折磨,这个”一个基底替代七个标签页”的赌注非常值得关注。

    下载地址


    项目数据(截至 2026-07-24):7,648 Stars · 608 Forks · 语言 Rust · 许可 Apache-2.0 · 创建于 2026-03 · 今日 GitHub Trending 榜首(单日 +2,100 星)

  • Gemini月活冲到9.5亿,谷歌又要多一个十亿级产品

    谷歌手里”十亿用户俱乐部”的名单又要添一位新成员了。搜索、Gmail、云端硬盘、安卓、YouTube、Chrome——现在轮到AI助手Gemini。财报电话会上,谷歌说Gemini的月活已经冲到9.5亿,离十亿只剩一步之遥。

    谷歌Gemini应用
    Gemini月活一年翻了三倍,正逼近十亿门槛

    一年翻三倍,紧咬ChatGPT

    这个增速挺猛的。今年2月,谷歌才说Gemini应用刚过7.5亿月活,转眼到二季度就摸到9.5亿,比去年同期整整翻了三倍。这么一冲,它就跟OpenAI的ChatGPT站到了同一条起跑线上——后者6月已经率先破了十亿月活。

    “用户特别喜欢像’每日简报’这样的智能体新功能,还有我们的个性化助手Gemini Spark,现在美国和海外都能用了。我们一直在以惊人的速度推出这类好用的新功能。”——Alphabet CEO 桑达尔·皮查伊

    除了安卓自带的基本盘,Gemini在iOS上也站稳了脚跟。去年9月靠着Nano Banana图像生成模型一炮而红后,据Appfigures统计,过去12个月这款应用在iOS上被下载了超过1.37亿次。

    ChatGPT市占跌破一半

    格局确实在变。分析公司Sensor Tower最新的”AI现状”报告提到,在AI助手这个赛道,ChatGPT的市场份额头一回掉到了50%以下,而Gemini的份额涨到了27.7%。追赶的势头很明显。

    • Gemini月活约9.5亿,接近十亿门槛;
    • iOS端过去一年下载量超1.37亿次;
    • Gemini在AI助手市场的份额升至27.7%,ChatGPT首次跌破50%。

    搜索没被AI掏空,反而更稳

    很多人担心AI助手会把传统搜索吃掉,谷歌这份财报给出的答案是”没有”。经过那轮以AI为核心的大改版,谷歌的搜索业务反而更强了。本季度它那个问答式的”AI模式”用户数也破了十亿,公司说这带来了搜索查询量的”增量增长”。

    更关键的是成本。谷歌特别提了一句,靠硬件工程优化,即便不断上新模型和新功能,AI模式的单位成本反而降下来了。对一家把AI塞进几乎所有产品的公司来说,这句话的分量不小——用户涨得快是好事,但能一边涨用户一边压成本,才真正让这门生意跑得通。

  • AI大厂给模型装的安全锁,正把’好人’研究员逼向中国开源模型

    这两年AI大厂拼命给自家模型上锁,生怕被黑客拿去搞破坏。可锁装得太死,最先被卡住的反而是那群本该被保护的人——正儿八经找漏洞、修系统的网络安全研究员。他们现在越来越头疼,甚至开始转投中国的开源模型。

    Anthropic的Mythos与Fable模型
    Anthropic曾把Mythos包装成只能给”通过审核用户”的末日级模型

    一把工具,既能盖房也能砸人

    今年6月,美国政府对Anthropic两款被吹得神乎其神的模型Mythos和Fable下了出口管制。导火索之一,是有报告称能绕过模型防护、拿它来造网络攻击。后来管制解除了——Fable 5在7月1日恢复公开访问,Mythos 5只对通过审核的美国机构重新开放。但这场风波把一个矛盾摆上了台面。

    NCC Group首席科学家Chris Anley说得很直白:让AI去尝试利用一个漏洞,是确认它”真的是漏洞、值得修”的关键一步。可一旦护栏直接让模型拒答,防守方就抓瞎了。

    “这就像一把锤子。没有锤子你盖不了房子,它是工具,但它也无可避免地是件武器。攻击工具和防御工具其实是同一样东西,根本掰不开。”

    “把客户当小孩看管”

    干了几十年、专门找零日漏洞卖给西方政府的资深研究员Mark Dowd吐槽,让一堆大公司随意决定”安全领域什么能做什么不能做”,让他很不舒服。漏洞交易公司Crowdfense的CTO Paolo Stagno话更冲,说AI公司搞审核和护栏这套,”本质上是把客户当成需要保姆看着的小孩”。

    不过也有人觉得没那么夸张。研究员Giuseppe Cali就说护栏没挡他的路,因为他压根不用AI做攻击那部分——只拿来做初步逆向、理解代码、搭辅助工具。用他的话说,他”舍不得把自己的漏洞交给模型去玩”,这游戏他自己玩得太上头。


    护栏时好时坏,逼人转向中国模型

    RemoteThreat的CEO、Offensive AI Con创办人Chris Thompson的抱怨更具体:前沿模型的护栏时松时紧,每天表现都不一样,哪怕是在Anthropic和OpenAI那些”审核过的项目”里也是如此。结果研究员大把时间花在跟模型”讨价还价”上,而不是真正分析漏洞。

    • 一名智能手机零件厂商的研究员说,公司没进Anthropic的审核项目,模型”一嗅到跟安全沾边就停下来,根本没法用”;
    • 碰壁之后,不少人干脆退回到完全没护栏的开源模型;
    • Thompson直言,很多人被推向了像GLM这类中国开源模型——免费下载、本地运行、没有任何审核和使用限制。

    这就有点讽刺了。”你把这些负责任的研究员,从美国管辖的系统赶到了外国拥有的系统上,”Thompson说,”我觉得这些护栏弊大于利。”他呼吁前沿实验室别再一味收紧,而是把项目开放、给出负责任的访问权限,再去追究真正滥用工具的人。否则真等那波”前所未有、又快又大规模”的攻击浪潮来了,防守的一方反而先被自己人的锁困住。

  • Meta拍了支AI乐观主义广告,配乐却是一首人类灭绝之歌

    Meta 新 AI 乐观主义广告
    Meta 新发布的 AI 乐观主义品牌广告(图源:TechCrunch / Getty)

    Meta 最近上了一支新品牌广告,想告诉大家:AI 不会让人更孤独,也不会把谁甩下车。片子开头是黑白画面里的一只眼睛,映出一条条”AI 要抢工作、让人孤立、引发全球危机”的恐慌标题,旁白紧接着说”有人想让你相信这些,我们完全不同意”。随后画面转成彩色:天台上跳舞的情侣指着彩虹,一群少年跳进湖里,孩子在田野里疯跑,久别重逢的朋友抱在一起。

    “叫我们乐观派也好,叫我们做梦的人也罢,随你怎么叫。但我们赌的是人,而且我们喜欢这个赔率。未来属于所有人。”——Meta 广告旁白

    尴尬的不是画面,是那首歌

    情绪渲染没毛病,问题出在配乐上——广告用的是 David Bowie 的《Five Years》。这首歌讲的是人类得知五年后将在大灭绝中消失时的集体崩溃。TechCrunch 的作者还做了个小实验:把歌放给她那位”只爱 Claude Code、从不读闲书”的区块链分析师弟弟听,对方猜”气候灾难?丧尸末日?小行星撞地球?”——都沾边,就是跟乐观不沾边。

    广告截取的段落反复唱着”people”,不看上下文确实显得温暖昂扬。可往前翻两句歌词:”我们只剩五年可以哭了””地球真的在死去,播报新闻的人哭湿了脸”。用一首末日悲歌来宣传”AI 让未来更好”,这个反差就这么从整个 Meta 团队眼皮底下溜了过去,包括亲自发帖配文的扎克伯格。

    科技圈的”文学理解”老毛病

    这也不是硅谷第一次在文艺作品上会错意。Oculus 当年给新员工人手一本《头号玩家》,那本书写的恰恰是一家 VR 公司膨胀成邪恶巨头;Sam Altman 公开说灵感来自电影《她》,而那部片子是在警告拿 AI 当情感寄托的代价;Palantir 的名字取自《指环王》里黑暗魔君用来监视敌人的真知晶石。原文作者忍不住感叹:这些大佬就是”人文学科很重要”的活广告。

    • 几周前 Anthropic 也发过一支画风阴郁的广告:着火的房子、人脸识别下的人群、成排墓碑,配上”AI 能被信任吗”的画外音;
    • Altman 当场开嘲:”我以为是恶搞,一直在找账号名是不是拼成 c1audeai”;
    • Pew 最新调查显示,只有 16% 的美国人认为 AI 未来 20 年会给社会带来正面影响,40% 认为是负面。

    一家把几千亿美元押在”AI 革新人类”上的公司,配乐却选了首世界末日之歌,怎么看都像一场没对上频道的乌龙。头部 AI 公司们争着抢夺公众叙事,可从民调看,这些昂贵的乐观宣言暂时没能扭转什么。原文的结尾只留了一句:Meta,祝下次好运。

  • 两个前谷歌安全老兵拿了3600万美元,专治AI写的钓鱼邮件

    AegisAI 两位联合创始人
    AegisAI 的两位联合创始人(图源:TechCrunch)

    这两年最让公司 IT 部门头疼的,可能不是哪个系统漏洞,而是收件箱里那封”看起来完全没问题”的邮件。两位前谷歌安全高管——Cy Khormaee 和 Ryan Luo,带着他们创办的 AegisAI 又拿了一笔钱:3600 万美元 A 轮,Battery Ventures 领投,老股东 Accel 和 Foundation Capital 跟投,公司累计融资来到 4900 万美元。他们要对付的,正是被 AI 武装起来的”鱼叉式钓鱼”。

    他们在谷歌干的就是防邮件被黑

    这两位不是半路出家。在谷歌时,他们一个做安全浏览技术,一个做 reCAPTCHA 验证码,跟邮件攻击缠斗了十年。也正是这段经历让他们看透一件事:老一套”如果……就……”的规则引擎,根本追不上 AI 现写现发的钓鱼邮件。AI 能在几秒钟内扒出你的同事关系、手头项目、最近的出差行程,然后拼出一封逼真到离谱的信。

    “AI 驱动的攻击现在有超过一半的概率绕过现有防护,效果几乎是过去的两倍。它们把你研究透了,攻击是为你量身定制的。”——AegisAI 联合创始人 Cy Khormaee

    让 AI 智能体像人一样读每封信

    AegisAI 的解法,是派 AI 智能体去逐封分析邮件,模仿安全分析师的思路,盯那些再详尽的规则清单也罗列不出来的细小异常。Khormaee 举了个例子:有些恶意 PDF 附件乍看很正规,还内置了密码和验证码,专门骗过标准垃圾邮件过滤器,而他们的智能体能识破这类伪装。

    上线不到一年,AegisAI 已经拿下几十家客户,包括加密支付公司 Mesh、AI 明星创企 LangChain 和隐私合规平台 Lokker。领投方 Battery Ventures 的合伙人 Dharmesh Thakker 说,自己就是注意到邮件攻击明显变多,才专门找一家能”用 AI 防 AI”的公司下注。

    • 赛道并不只有 AegisAI 一家:Lightspeed 支持的 Ocean、更早入局的 Abnormal Security,都在抢 Proofpoint、Mimecast 这些老牌厂商的地盘;
    • 但 Thakker 押注的理由很直接——这支团队参与守护过 Gmail,全世界用户最多的邮箱系统;
    • 邮件只是起点,AegisAI 已经放话要往数据安全等更大的防御面扩张。

    Khormaee 对终局的判断也够直白:能不能造出会自己做调查的高级定制智能体,将决定谁成为下一代安全巨头。攻击方已经全面 AI 化,防守方还停留在规则清单时代的话,这场仗从一开始就输了一半。

  • Open Multi-Agent —— 描述目标而非流程图的 AI 多智能体编排框架

    Open Multi-Agent —— 描述目标而非流程图的 AI 多智能体编排框架

    项目简介

    Open Multi-Agent(简称 OMA)是一个面向 TypeScript 后端的 AI 多智能体编排框架,核心理念是「描述目标,而非流程图」。你只需告诉 OMA 你想达成什么目标,框架内置的 Coordinator 就会在运行时自动将目标拆解为任务 DAG(有向无环图),分派给团队中的各个 Agent 执行,最终汇总结果。

    OMA 于 2026 年 3 月在 GitHub 开源,采用 MIT 许可证。截至本文撰写时已获得 6,646 Stars / 2,415 Forks,社区活跃度极高——从首次提交至今仅约 4 个月,已成为多智能体编排领域增长最快的项目之一。

    Open Multi-Agent

    安装要求与快速开始

    环境要求

    • Node.js ≥ 18(推荐 LTS 版本)
    • TypeScript ≥ 5.6(OMA 使用最新 TS 特性)
    • npmyarn/pnpm 包管理器
    • LLM API Key(OpenAI / Anthropic / Gemini / DeepSeek 等,或本地模型如 Ollama)

    方式一:脚手架创建(推荐新手)

    # 一键创建项目并运行本地演示(无需 API Key)
    npm create oma-app@latest my-oma-app

    交互式终端会引导选择模板和运行时,安装依赖后直接启动一个确定性本地 Demo——无需任何 API Key,使用脚本化模拟响应驱动真实的调度器和离线 Dashboard。可用 --no-install 仅生成文件,或 --no-run 安装但不启动。

    方式二:集成到现有 Node.js 项目

    npm install @open-multi-agent/core
    import {{ OpenMultiAgent }} from '@open-multi-agent/core'
    
    const oma = new OpenMultiAgent({{
      defaultProvider: 'openai',
      defaultModel: 'gpt-5.4'
    }})
    
    // 创建研究团队:研究员 + 分析师 + 共享记忆
    const team = oma.createTeam('research-team', {{
      agents: [
        {{ name: 'researcher', systemPrompt: 'Find the relevant facts.' }},
        {{ name: 'analyst', systemPrompt: 'Compare evidence and identify tradeoffs.' }}
      ],
      sharedMemory: true,
    }})
    
    // 只需描述目标,Coordinator 自动规划 DAG 并执行
    const result = await oma.runTeam(team, 'Compare three approaches and recommend one.')
    console.log(result.agentResults.get('coordinator')?.output)

    三种执行模式:runTeam() 从目标规划执行、runAgent() 单 Agent 运行、runTasks() 显式流水线执行。

    核心功能

    OMA 工作原理

    1. 动态工作流编排(Dynamic Orchestration)

    这是 OMA 最核心的差异化能力。与传统框架需要手写 DAG 节点不同,OMA 的 Coordinator 在运行时根据目标描述生成任务图、分配角色、设定依赖关系,最后综合各 Agent 结果输出答案。整个流程不需要维护硬编码的流程图。

    2. 可控执行(Controlled Execution)

    • 计划审批:预览并审批 Coordinator 生成的计划或单个分派操作,审批通过后可冻结计划用于回放复现
    • 约束声明:当拓扑不能漂移时,声明必需的角色和顺序;用多智能体共识验证输出正确性

    3. 生产级可靠性

    • 检查点续跑:中断的运行可从最近检查点恢复
    • 边界控制:重试策略、超时限制、循环检测、Token 和成本预算确保执行有界
    • 工具安全:默认拒绝所有工具调用,逐个审批开启;支持隐私控制

    4. 全链路可观测性

    每次运行都有稳定身份标识、执行回执和完整追踪记录:

    • TraceStore:本地存储追踪数据,支持查询
    • Run Viewer:离线 Dashboard 回放真实运行的 Task DAG 和 Span 瀑布视图
    • OpenTelemetry 集成:可选 OTel 插件,与企业统一监控栈对接

    5. 开放运行时(Open Runtime)

    • Agent 兼容:Process/ACP 后端让 Claude Code、Gemini CLI、Codex 与 LLM Agent 在同一 DAG 上协作
    • 模型自由:云+本地混合、原生中文大模型支持、OpenAI 兼容端点、AI SDK Provider
    • 部署灵活:自有基础设施、本地运行、完全离线、甚至气隙网络环境均可

    典型使用场景

    场景一:PR 自动审查(PR-Copilot)

    开发者 kidoom 用 OMA 构建了 PR-Copilot——一个 AI Pull Request 审查助手。它运行一个由 Coordinator + 多个领域 Reviewer Agent 组成的审查团队,用 defineTool 定义仓库上下文工具,配合自定义 ContextStrategy 实现 Token 感知的 PR Diff 压缩。每次提交 PR 时自动触发多角度代码审查。

    场景二:文档转图表工作室(Reports to Charts Studio)

    NARNIX0 的 Evident-Project 将研究报告和表格数据转化为幻灯片级图表。OMA 在其中扮演五角色提取委员会的编排者:结构化输出 + 确定性验证,确保每个数据点都有据可查。

    场景三:WordPress 安全分析平台(temodar-agent)

    Ali Sünbül 的 WordPress 安全分析平台直接使用 OMA 内置工具(bash、file_*、grep)在 Docker 运行时中执行安全扫描任务,已确认在生产环境中使用。

    推荐理由

    作为长期关注 AI 编排框架的开发者,我对 OMA 的第一印象是:终于有人认真对待「动态」这件事了

    目前市面上的主流方案大致分两派:LangGraph/Mastra 要求你手写节点和边(图优先),Vercel AI SDK/CrewAI 则偏单次调用工具包。OMA 找到了中间地带——你只管说目标,框架负责拆解、分配、执行、审计。这种「目标驱动」的范式在原型阶段特别高效,而它的可控执行机制又让你能逐步收紧边界,平滑过渡到生产环境。

    另外几个让我印象深刻的点:

    1. 离线优先设计:Run Viewer 是纯离线 Dashboard,不依赖外部服务,这对隐私敏感场景非常友好
    2. 50+ 可运行示例:从基础用法到 Cookbook 工作流、Provider 配置、集成模式全覆盖,上手曲线平缓
    3. 真正的 TypeScript 原生:不是 JS 库加类型装饰,而是从底层就用 TS 5.6+ 特性构建,IDE 体验一流
    4. 生态开放:已有 Engram 记忆同步、Agentsonar 异常检测、Bilig WorkPaper 公式协作等多个第三方集成

    如果你正在评估多智能体编排方案,或者对 LangGraph 的手动构图感到疲惫,强烈建议给 OMA 一个下午的时间——npm create oma-app@latest 跑一遍 Demo,你会感受到「描述目标而非流程图」的魅力。

    下载地址

  • 模型卷不动了就卖调度:Runway发布首个生成式媒体模型路由器

    Runway 不想再只当一家”卖模型的公司”了。周四,这家 AI 视频起家的明星创业公司通过本月刚上线的开发者平台 Runway Dev,发布了一个叫 Media Router 的新工具——号称是第一个专为生成式媒体打造的模型路由器。它的野心写在明面上:做整个生成式媒体行业的基础设施层。

    Runway Media Router 模型路由
    Runway Media Router 会按质量、速度或成本自动挑选最合适的生成模型(图源:Runway)

    模型太多挑花眼?那我来替你挑

    Media Router 干的事说来简单:开发者发一个图像、视频或音频的生成请求,它根据你更看重质量、速度还是成本,自动把请求分给最合适的模型——既包括 Runway 自家的,也包括接入平台的一堆第三方模型。模型路由在大语言模型圈早就是常规操作,但在生成式媒体这边,Runway 说自己是头一家。

    Runway 首席产品官 Anthony Maggio:大多数开发者根本没时间搞清楚每个模型在视频、图像、音频上各自强在哪。我们带来的独特价值,就是把这套”哪个模型最适合哪种场景”的判断力打包给你。

    这套判断力不是拍脑袋来的。Runway 内部创意团队常年评测各类模型——视频模型的运动表现、图像模型的构图水平、语音模型的口型同步,积累成了路由器背后的智能层。这层能力原本是为 5 月发布的 Runway Agent(对话式创意智能体)搭建的,现在直接打包卖给外部开发者。目前 Adobe、Cloudflare、ElevenLabs、Expedia、Shutterstock、Quora 都已经在通过 Runway Dev 的 API 把媒体生成能力嵌进自家产品。

    Token 账单疼了一年,路由就是止疼药

    Maggio 透露,客户最关心的路由维度就是 token 价格和质量。2026 年企业圈被智能体的天价 token 账单结结实实上了一课,按价格路由早成了大模型领域的显学,生成式媒体跟进只是时间问题。有意思的是,Runway 自己几周前刚把无限量订阅改成按 token 计费,还挨了不少用户的骂——一边挨骂一边顺势把”帮你省 token”做成新生意,这算盘打得不可谓不精。


    模型不再领跑,那就去做发牌的人

    转型背后有现实压力。Runway 上一款旗舰视频模型 Gen 4.5 还是去年 12 月发的,当时确实登顶过榜单,压过谷歌一头。但如今按 Artificial Analysis 的排名,它的文生视频和图生视频模型已经掉出领先位置,前 20 名里挤满了谷歌和中国大厂的模型,Gen 5 至今没有音讯。

    • Media Router 的底层假设很清醒:”最好的模型”会不断易主,与其赌自己永远领先,不如做那个替所有人分发请求的枢纽;
    • 联合创始人兼联合 CEO Anastasis Germanidis 直言,公司必须建起完整技术栈——开发者平台、创意工具套件、底层推理层缺一不可;
    • 在他看来,当客户开始用模型生产整套营销活动和多场景成片时,编排层的价值只会越来越大。

    当不成最强的模型,就去当最好的调度台——这条路 OpenRouter 们在大语言模型市场已经验证过一遍。生成式媒体这边格局更碎、模型更迭更快,路由生意理论上更有得做。剩下的悬念是:等谷歌、字节这些既有顶级模型又有平台野心的巨头也想通了这一层,Runway 的先发优势还能守多久。

  • Claude语音模式大升级:动嘴就能改日历发邮件,OpenAI还做不到

    OpenAI 前几周刚给 ChatGPT 换上一套新的对话模型,把语音体验拉了一个档次。Anthropic 显然坐不住了,周四直接给 Claude 的语音模式来了次大升级——以后动嘴聊天,也能用上 Opus、Sonnet、Haiku 三档模型,想要脑子还是想要速度,自己挑。

    Claude 语音模式升级界面
    Claude 语音模式此次升级支持切换 Opus、Sonnet、Haiku 三档模型(图源:Anthropic)

    以前只能”快问快答”,现在能干正事了

    Claude 的语音模式去年就上线了,但一直由最小杯的 Haiku 模型驱动。回话是挺快,可一碰到复杂点的活儿就露怯,更像个语音玩具。这次更新之后,语音模式会自动沿用你在文字聊天里最后用过的那个模型,并默认调它的最快版本——你在文字端用 Opus 干活,切到语音也还是那颗聪明的脑子。

    Anthropic 给的使用场景也很务实:跟它进行更长的对话、让它点评你的表达方式、陪你排练给客户的提案,或者一起头脑风暴做市场调研。换句话说,语音不再只是”帮我设个闹钟”级别的功能,而是想接住真正的工作流。

    最狠的一招:动嘴就能操作 Gmail 和 Notion

    新版语音模式可以直接调用 Gmail、Google 日历、Slack、Canva、Notion 等外部应用——改会议时间、起草邮件、新建文档,全程动嘴不动手。

    这才是这次更新真正的差异点。OpenAI 那边的新语音模式虽然聊天风格更自然了,但至今没法调用外部工具替你干活。Anthropic 直接把”能办事”作为卖点打出来,等于在语音助手这条赛道上换了个打法:你比谁聊得像人,我比谁真能把事办了。

    多语言方面,Claude 语音模式今年早些时候就开始测试,目前支持英语、法语、德语、印地语、日语、韩语、西班牙语等十来种语言,不过得手动指定语言,还做不到自动识别。


    免费用户有门槛,语音底层没动

    • 新语音模式以 Beta 形式向全平台所有用户开放;
    • 免费用户只能用 Haiku 模型,且只能连接一个外部应用;
    • 这次升级只换了”大脑”,没换”嗓子”——语音模型本身没有更新,Anthropic 也没披露底层语音技术栈;
    • 所以像打断处理这类对话体验,别指望有 OpenAI 新版那样的提升。

    这么看,两家的路线分歧越来越清楚:OpenAI 在把语音”调教得更像人”,Anthropic 在把语音”武装得更能干”。对用户来说这未必是坏事,一个负责好聊,一个负责好用,最后逼着双方把两头都补齐。下一步就看 OpenAI 什么时候给语音模式接上工具调用,以及 Anthropic 什么时候舍得换一副新嗓子了。