标签: 具身智能

  • OpenAI当年出价5亿没买下,如今它靠游戏录像训练机器人、估值23亿

    两年前,OpenAI 揣着 5 亿美元想买下 Medal——一个让玩家上传和分享游戏录像的平台,创始人 Pim de Witte 拒绝了。当时看有点莽。但到了 2026 年,de Witte 手里的 AI 公司 General Intuition 完成 3.2 亿美元 A 轮融资,估值冲到 23 亿美元,Khosla Ventures 领投,贝佐斯、前谷歌 CEO 施密特,以及 MIT 和 DeepMind 的研究人员都跟了进来。算上去年 10 月启动时的 1.34 亿,累计融资已经超过 4.54 亿。市场用真金白银证明了一件事:那堆游戏录像,比大多数人以为的值钱得多。

    用游戏数据训练机器人世界模型概念图
    用游戏数据训练机器人世界模型概念图(本文配图由 AI 生成)

    游戏画面里藏着什么

    General Intuition 的赌注听上去有点反直觉:用电子游戏里的人类操作记录,去教现实世界的机器人。它的训练数据来自 Medal 积累的数十亿小时游戏画面。但真正关键的不是画面本身,而是内嵌在每一帧里的”动作标记”——玩家在哪一刻按下了哪个键、做了什么决策。多数同行只靠视频去猜动作,而 de Witte 认为,拥有真实的人类操作数据,才是模型理解”自我”和”环境”分野、进而掌握因果关系的内核。

    de Witte 把公司的逻辑讲得很直白:”模型本身的泛化能力,就是产品。”他不想做机器人整机厂商,而是要成为别的机器人公司搭建产品时脚下的那块地基。

    8 分钟,让四足机器人学会走路

    传统机器人训练有两条老路:在真实环境里采数据,贵且慢;在仿真器里练,速度快却躲不开”仿真到现实的鸿沟”——你在 Unity 里训好的模型,放到真实地板和墙壁前常常像个路痴。General Intuition 把游戏数据当成连接两者的桥:先在海量游戏交互里学”物体怎么动、智能体怎么走、动作怎么改变状态”,再拿极少量的真实机器人数据做下游微调。他们演示过一台四足机器人,只经过 8 分钟真实世界微调,仅靠前置摄像头,就在有行人和动态障碍的办公室里零样本导航成功。

    • 领投方 Khosla 看中的是独有数据壁垒,以及”AI 直觉涌现”的愿景
    • de Witte 划下红线:不做任何用于伤害人类的自主武器
    • 目标是对标 NLP 的 GPT-3 之后——通用基座加轻量适配,取代每个任务单独训练

    有意思的是,当中国的人形机器人公司在拼命扩产量、把模仿学习的工业栈跑起来时,General Intuition 想走的是另一条路:卖”世界模型”这个软件层,而不是卖铁。这条路线能不能扛住工厂车间和客厅里那些充满摩擦、接触密集的真实物理,还得等它在同行评审的环境里被反复验证。但至少现在,顶级硅谷资本愿意为”通用世界模型”这个赌注下重注。

  • 用电子游戏训练机器人?General Intuition说机器人的ChatGPT时刻要来了

    从游戏手柄到机器人腿,这家公司赌的是”通用”两个字

    在GPT-3带火基础模型之前,做自然语言处理的公司基本都得从零开始,针对每个具体任务攒一堆专用数据去训练。现在谁还这么干?大家都是先拿GPT、Claude或者Llama这类通用模型过来,再微调一下应付自己的业务。General Intuition的CEO Pim de Witte觉得,机器人这行迟早也会走一模一样的路。

    他说的”专用路线”是什么样?就是现在很多团队各自为战,盯着某一个具体的机器人、某一个固定的环境、某一项专门动作死磕。de Witte的判断很直接:等通用模型真正成熟,这类苦活儿大部分都得作废。他甚至抛了个挺挑衅的说法——模型本身的泛化能力才是产品,”它只要对空间和时间有了最底层的理解,大家就没必要再去收集几十万、上百万小时的真实世界数据了,因为说白了,你其实只需要几分钟。”

    四足机器人在办公室中行走
    用游戏数据训出来的基础模型,正在让机器人摆脱对海量真实数据的依赖

    他们的秘密武器,是几百万小时的电子游戏录像

    General Intuition自己那套基础模型,训练素材来源有点出人意料:几百万小时的游戏视频,里面连”人类什么时候按了手柄上的哪个键”这种细节都标得清清楚楚。de Witte和投资方Vinod Khosla都认同一件事——这种”动作数据”才是让AI长出类人空间直觉的关键。

    他们最有说服力的一次演示,是让机器人只靠一个前置摄像头、没有任何别的传感器,在有人走来走去、不断有东西乱入的办公室里零样本跑起来。de Witte说,这事儿连他们自己都吓了一跳,而这八分钟真实数据之外的部分,全是模型自己泛化出来的。

    靠着这套逻辑,General Intuition上个月刚融了3.2亿美元,估值冲到23亿。钱不是白给的——他们的模型既能连续玩上几个小时游戏,也能驱动一台四足机器人,而后者只用了八分钟真实机器人数据做微调。de Witte给公司的定位也很清醒:他们不造机器人,要做的是”物理AI领域的基础模型”,相当于给其他机器人公司当地基。


    机器人行业的”ChatGPT时刻”到底还差什么

    • 数据逻辑在变:从”为每个动作攒数据”转向”用高质量数据训出能迁移的通用模型”。
    • 门槛在降:真实世界采集不再是必选项,几分钟的针对性微调可能就够了。
    • 生意在转:卖机器人的会越来越多,但卖”机器人脑子”的可能是另一拨人。

    de Witte有句话挺能概括野心:”我们不去造一家自动驾驶公司,我们要做的是,让下一个人造自动驾驶公司的难度大降十倍。”这话听着像在致敬当年基础模型对NLP行业的改造。只不过这一次,战场从屏幕里的文字,挪到了真实世界的四肢和空间里。

  • 亚马逊把Anthropic给”卖”了?AI圈最尴尬的投资关系

    亚马逊CEO向政府报告Anthropic模型安全问题
    亚马逊CEO向政府报告Anthropic模型安全问题,导致最强大模型被全球封禁

    Anthropic的Claude Fable 5和Mythos 5两款模型,本来是这家公司当下最强大的王牌,结果上周五突然被A一刀切了访问权限——而且是全球范围。表面上看,是美国政府以国家安全为由实施了出口管制禁令。但《华尔街日报》挖出来的内幕显示,这件事的源头可能指向亚马逊首席执行官安迪·贾西。

    亚马逊的尴尬位置

    这件事最尴尬的地方在于,亚马逊可是Anthropic的主要投资方。双方之前达成协议,亚马逊投50亿美元,Anthropic承诺花1000亿美元在AWS上。结果投资方转头就把被投公司给”卖”了,这剧情也是够讽刺的。当然亚马逊不会承认自己主动告的状。亚马逊发言人的声明说得滴水不漏:政府寻求我们关于潜在安全风险的建议并不罕见,但我们不会分享这些讨论的细节。话说到这个份上,基本上就等于”我不否认,但我不说”。

    越狱漏洞还是借口?

    特朗普的前人工智能顾问大卫·萨克斯现在在总统科学技术顾问委员会当联合主席,他给了另一个版本的说法。按照萨克斯的说法,是一位Anthropic和美国政府都高度信任的合作伙伴站出来,提供了关于越狱的相关信息。然后政府要求Anthropic的CEO达里奥·阿莫代伊把越狱问题修复,不然就下线模型。结果达里奥拒绝了。这个说法如果属实,那Anthropic的拒绝就成了一个关键点——是公司坚持模型开放性的原则,还是他们觉得自己模型的安全性没问题、不需要按政府的要求改?


  • 工信部出手了:AI要和通信网络深度捆绑,2028年要打成什么样?

    6月10日,工信部印发了一份文件,名字挺长——《”人工智能+信息通信”创新发展实施意见(2026—2028年)》。翻译成人话就是:未来三年,要让AI和通信网络深度捆绑,互相催着往前走。

    500万个5G基站背后,算力已经堆到1882 EFLOPS

    先说个直观的数字:国内5G基站已经建了500.9万个,400Gbps的骨干传输网络也开始规模部署了。算力这边,智能算力规模达到了1882 EFLOPS(FP16精度)。这些数字不是摆着看的,机器视觉检测、精准设备控制这类场景已经在用起来了。

    但问题是,AI和信息通信两个领域凑在一起,是个新兴交叉地带,技术突破、融合路径、商业模式都还在摸索。这份文件就是来管这件事的。

    这份意见围绕四个方向部署了17项具体任务:推动信息通信行业智能化升级、夯实AI发展底座、深化融合应用创新推广、增强信息通信行业治理能力。

    网络、算力、算网,三件事一起抓

    文件把”底座”这件事拆得很细。网络层面,要加快建设400Gbps/800Gbps骨干传输网络,城域400Gbps及以上高速光传输系统也要有序推进。目标是构建城域毫秒级低时延入算能力——说白了,就是让数据和算力之间的路更宽、延迟更低。

    算力层面,要构建枢纽—区域—边缘三级节点协同的算力设施体系,建国家和区域算力平台,搞全国一体化、集约化、市场化的算力服务体系。这件事的背后,是AI训练和推理对算力的渴求已经到了不惜成本的地步。

    工信部AI+信息通信政策
    工信部部署AI与信息通信融合发展任务(图源:新华网)

    到2028年,要打成什么样?

    文件给了两个时间节点的目标。2028年,AI和信息通信要初步构建融合互促的创新发展格局,信息通信网络初步实现高等级自智,形成30个以上高价值典型场景,打造一批典型应用和特色智能体。城域算力1毫秒时延圈覆盖率不低于75%。

    再往远看,2030年的目标是:”人工智能+信息通信”步入技术引领、产业繁荣、安全可靠、智能普惠的发展新阶段。

    具身智能、AI手机、智能家居,要进千家万户

    融合应用这部分,文件提了几个方向:加强具身智能与信息通信融合创新;大力发展AI手机和电脑、智能家居设备、智能穿戴设备;鼓励基础电信企业用AI赋能传统电信业务,深化智慧个人助理、智慧管家、家庭看护等应用。

    这些不是新概念,但由工信部出面系统性部署,释放的信号是:AI往落地走,信息通信网络是基础设施,两者必须一起建、一起用。

    • 网络侧:400G/800G骨干网+城域毫秒级低时延入算
    • 算力侧:枢纽—区域—边缘三级协同,全国一体化算力服务体系
    • 应用侧:具身智能、AI终端、智慧家庭、垂直行业提质升级
    • 目标:2028年城域算力1毫秒时延圈覆盖率≥75%,30+高价值场景

  • MIT发布2026年AI十大趋势:从人形机器人训练数据到AI反制浪潮



    MIT发布2026年AI十大趋势:从人形机器人训练数据到AI反制浪潮

    MIT Technology Review 2026年AI趋势
    MIT Technology Review 发布2026年AI十大趋势报告

    MIT Technology Review发布了2026年”当下AI领域最重要的10件事”清单。这是该刊首次将AI领域的核心趋势、行业动态、前沿进展汇总为单一清单。从人形机器人训练数据到AI反制浪潮,这10个趋势正在重塑整个行业。


    人形机器人的”动作库”正在建立

    训练AI理解物理世界,需要的不再只是文本。现在,无数摄像头对准工厂工人、仓库管理员、甚至远程操控的”傀儡机器人”,记录他们每一个动作。这些视频会成为下一代人形机器人的训练数据。问题是,这种规模的采集能不能真的让机器人学会干活,现在还没人能打包票。

    MIT Technology Review认为,人类动作视频正在成为人形机器人训练的新”石油”,只是这套方法论还没被验证过。

    大语言模型没过时,只是需要升级

    LLM已经席卷全球,但容易摘的果子基本摘完了。整个行业都在找下一个爆点,但大语言模型本身不会消失。它还有大量潜力没释放——更长的上下文、更好的推理、更强的多模态能力。只是,光靠把模型做得更大,已经不够了。

    诈骗的门槛正在被AI削平

    钓鱼邮件、深度伪造电话、自动化的社交工程攻击——AI正在让这些事变得更快、更便宜、更容易上手。以前需要耐心和技术的活儿,现在脚本小子都能干。这对普通用户来说,意味着你收到的每一条”紧急信息”都可能是AI生成的。


    世界模型:让AI理解物理规律

    大语言模型擅长处理文字,但它们不了解物理世界是怎么回事。AI公司现在想构建”世界模型”——能理解重力、因果关系、空间结构的系统。如果做成,AI就不只是聊天机器人,它能真正进入工厂、仓库、医院,在真实世界里做决策。

    战场上的AI:从辅助到决策

    算法早就在做军事情报分析了,但生成式AI正在进入作战室。指挥官开始认真考虑AI的建议——该把资源投到哪里、怎么预测敌人的下一步。这改变的不只是技术,还有军队和科技巨头合作的方式,甚至是什么时候该按下”开火”按钮的决策逻辑。

    MIT的报道指出,AI在军事领域的渗透速度比大多数人意识到得要快,而且这次不只是自动化,是真正的决策参与。

    深度伪造的武器化已经到来

    Grok大规模生成非自愿色情图像、美国政府用AI技术做宣传——人们长期预警的”武器化深度伪造”威胁,现在已经不是预言,是正在发生的事。假视频、假音频、假文章,正在成为信息战的一部分。

    多智能体协作:从单打独斗到团队合作

    第一代AI智能体只能做单一任务——运行浏览器、写几行代码。下一代智能体会组队工作,一个负责研究,一个负责写代码,一个负责测试,互相协调完成复杂目标。这就像从”一个工程师”进化到”一个产品团队”。


    中国的开源赌注:免费的前沿模型

    中国实验室把前沿模型免费开放,这招赢得了全球开发者的好感。现在,世界各地都有人在基于中国的开源模型做开发。问题是,这种模式能不能赚钱?没人知道答案。但不管怎样,开源的势头已经起来了。

    AI科学家的出现:诺奖级别的合作者?

    高校和企业都在开发能自主完成研究任务的AI智能体——不只是查文献,而是提出假设、设计实验、分析结果。一些业内人士相信,这类AI合作科学家未来可能做出达到诺贝尔奖级别的研究成果。当然,这话现在听起来还有点早。

    反AI浪潮正在汇聚

    经过多年几乎不受约束的AI发展,全球范围内正在形成一股强大的反对力量。保守派、自由派、艺术家、工会——不同立场的人开始在同一个问题上发声:AI跑得太快了,我们需要刹车。这股力量已经开始在一些具体问题上取得小范围胜利。



  • 英伟达Lyra 2.0:一张照片生成90米3D世界,具身智能有”健身房”了

    4月16日,英伟达研究团队悄悄放了个大招:Lyra 2.0,一个能从单张照片生成大规模3D场景的系统。这东西的目标很明确——给具身智能(embodied AI)提供训练场,让机器人在虚拟世界里先练熟了,再到现实中干活。

    你只需要喂给它一张图片,它就能给你生成一个纵深90米的连贯3D环境。这个距离什么概念?差不多一个足球场的长度。而且相机一路走一路拍,回来的时候场景还是你刚才看到的那个,不会突然变形或者裂开。

    它解决了两个老大难问题

    以前的3D生成模型有两个通病,英伟达这次都给治了。

    第一个叫”空间遗忘”——相机绕着场景走一圈再回到原点,发现原来的地方已经不认识了,场景扭曲得像进了哈哈镜。Lyra 2.0的做法很直白:实时把每一帧的3D几何信息存下来,相机回到老地方的时候,直接调档案,保证看到的东西跟第一次看到的一样。

    第二个问题更麻烦,叫误差累积——生成的帧数越多,前面犯的错会一直往后传,到最后整个场景崩掉。Lyra 2.0在训练的时候故意把一些有缺陷的输出喂给模型,让它学会自己纠正自己。这个思路有点像让模型”打草稿→检查→修改”,而不是一条路走到黑。

    在图像质量、相机控制这两项核心指标上,Lyra 2.0干掉了GEN3C、Yume-1.5等6个同类型竞品。快速版本比基础版效率提升13倍。

    跟机器人仿真平台打通了

    这是Lyra 2.0最实用的地方。它跟英伟达自己的Isaac Sim(机器人仿真平台)无缝集成,生成的3D场景可以直接导出为网格模型,机器人就能在这个虚拟环境里训练算法。

    以前要训练一个具身智能模型,你得派人拿着激光雷达和相机去现实世界扫一大堆3D数据,费时费力还贵。现在Lyra 2.0能自动生成多样化的训练场景,机器人先在虚拟世界里把活干熟练了,再到现实里上路。

    目前它只支持静态场景生成,动态物体还没搞定。但光是静态场景这个突破,已经给自动驾驶、通用机器人的物理感知训练提供了不少帮助。

    为什么这事值得关注

    3D世界生成这个方向,本质上是给AI建”健身房”。大模型是靠海量文本数据喂出来的,具身智能要靠海量3D交互数据,而现实世界的数据采集成本太高了。

    英伟达这步棋很精明——它不跟你卷大模型,它给你造训练大模型需要的”场地”。你用不用它的GPU跑模型另说,但你要想训练具身智能,它的仿真工具链几乎是绕不开的。

    目前没有看到Lyra 2.0开源的消息,但英伟达过去在研究方向上有开放的传统,后续会不会放出来让社区用,值得盯着。


    对于做具身智能的团队来说,这类工具的价值在于缩短迭代周期。以前一个场景要扫好几天,现在一张图几分钟出结果,测完不行马上改,迭代速度快了不止一个量级。

  • 自动驾驶是具身智能上半场,李想让理想”造人”的时间表提前了

    最近汽车圈出了一个挺有意思的判断——理想汽车CEO李想说了一句话,把自动驾驶和人形机器人放在了一条时间轴上:自动驾驶是具身智能的上半场,通用人形机器人是下半场。

    这句话不是随便说说的,背后有一张非常清晰的时间表。上半场自动驾驶分三个阶段:2018到2023年是L2辅助驾驶,2023到2028年是L3,2028到2033年是L4。下半场人形机器人则是:2030到2035年达到6岁泛化能力,2035到2040年达到12岁,2040年之后接近AGI水平。

    李想还做了一个预判:购买L4自动驾驶汽车的用户,和购买家庭家政机器人的用户,重合度将高达90%。这意味着上半场的感知、模型、芯片、控制能力,可以无缝迁移到下半场,形成跨场景的商业闭环。

    研发组织彻底打散重编

    最让人意外的是理想今年1月的研发重组。他们把按软硬件划分的传统部门全部拆掉,按”造硅基人”的逻辑重新组合。infra团队负责算力数据,对应”心脏”;基座模型团队管多模态训练,对应”大脑”;软件本体团队做Agent和工具链,对应”手脚”;硬件本体团队管芯片传感器,对应”身体”;评估团队独立评估工作质量,对应”免疫系统”。

    改完之后立竿见影:智驾模型训练从每两周迭代一次,直接压缩到每天一次。过去部门之间来回扯皮的沟通成本,就这么被彻底消解了。

    两款机器人已经立项

    资金投入上也不含糊。2025年理想研发花了113亿,其中AI相关占一半,2026年预算120亿基本保持同等比例。5月15日上市的L9 Livis,定价50.98万元,是理想切入具身智能赛道的首款量产旗舰。

    值得注意的是,理想前高管创立的至简动力,在发布会当天放出了一个视频:旗下ix和i7两款机器人全程围观新车发布会,其中一台手持理想自研的马赫M100芯片。这说明理想系的人形机器人项目,早已跑在路上了。

    理想L9 Livis
    理想L9 Livis 具身智能旗舰SUV

    李想说这是理想的第三次”逆共识”。前两次分别是2015年坚持增程而非纯电,以及聚焦家庭场景而非个人用户。现在,当行业还在讨论具身智能是否遥不可及时,理想已经把芯片、模型、操作系统全部打通。

    “理想汽车做AI,不是冒险。不做才是冒险。”

    这不只是理想一家的事。国内近期也在从国家层面加速具身智能落地。杭州刚刚启用了全国首个国家级具身智能应用中试基地,130多台机器人在此接受30多种职业技能训练,由中国工程院院士王耀南担任学术委员会主任,宇树科技等行业企业也参与其中。

    从实验室到真实场景,从自动驾驶的感知能力到人形机器人的泛化智能——这场变革正在加速。


  • Figure AI人形机器人直播33小时:分拣超4万包裹,具身智能进入真实工厂

    昨晚刷到一个直播,愣是看了半小时停不下来——Figure AI的人形机器人在仓库里干活,一干就是33个小时,分拣了4万多个快递包裹。

    这事说起来还有点来头。Figure AI创始人Brett Adcock之前被投资人Scott Walter怼过:人形机器人到底能不能扛住工厂班次的强度?能不能别光靠PPT吹牛,给大家真刀真枪跑一个8小时看看?Adcock当时还挺硬气,直接宣布要做一场全程直播。结果原本承诺的8小时,机器人根本停不下来,一路跑到了33小时,到我看直播的时候已经分拣了超过33000个包裹。

    三台机器人,分别叫Bob、Frank和Gary

    直播间里有个很有意思的细节:Adcock在观众的建议下,给三台Figure 03贴上了物理铭牌,分别叫Bob、Frank和Gary——就跟给宠物起名一样随意。整个机器人舰队在传送带前分工协作,每台机器人负责扫描条码、把标签朝下放好、再推上传送带,全流程完全自主,没有人在远程操控。

    速度大概是每2.6秒处理一个包裹,已经接近人类工人的水平了。机器人手指尖的触觉传感器能感知轻至3克的压力——相当于一枚回形针的重量。视觉系统也做了大幅升级,帧率比上一代提升2倍,延迟降到原来的四分之一。

    Figure AI人形机器人处理包裹
    Figure 03机器人正在处理各种形状尺寸的包裹(来源:TechTimes)

    当然也有翻车的时候

    不过Adcock说的”零故障”有点标题党了。直播间观众能清楚看到,机器人偶尔会把包裹直接推到传送带外面,包裹掉一地。当机器人被卡住或者AI策略遇到超出训练分布的情况时,系统会触发自主重置。Adcock的解释是:人类在类似高强度任务里同样会有失误,这个逻辑……好像也没毛病。

    竞争对手Agility Robotics直接开怼:”我们从2023年起就在GXO物流的真实仓库里干活了,已经移动超过10万个周转箱,还有OSHA安全认证。”言下之意:你才刚开始直播,我们早就打卡上班了。

    Figure AI目前估值390亿美元,已经交付超过350台第三代机器人,从每天1台的生产速度提升到了每小时1台——120天内产能翻了24倍。电池快没的时候,机器人会自主离开工作站换岗,新单元无缝顶上,整个轮班节奏靠的是Helix-02神经网络自主协调,没有中心控制器。

    这代表什么?

    33小时的连续运行意味着什么?意味着人形机器人第一次在真实工业场景下展示了接近人类工人的耐力和吞吐量,而不是在实验室里做表演性质的演示。Figure AI的直播虽然有点营销的成分,但数据是实打实的——4万多个包裹,没有人工干预。当然,翻车片段也被几万人同时围观了,这个效果大概比任何广告都好。

    现在的问题是:竞争对手Agility Digit已经在真实仓库跑了两三年,Tesla Optimus也在推进量产。Figure AI能不能在规模化量产和稳定性上真正追上来,才是决定这390亿估值能不能撑住的关键。毕竟直播间里的33小时固然漂亮,但如果要真正替代工厂工人,还得先过”掉包裹”这一关。


    📎 原文来源:Figure AI’s 8-Hour Gamble Becomes a Livestream Marathon: 33,000+ Packages(Humanoids Daily,2026年5月14日)
  • Meta收购ARI机器人AI团队:具身智能的抢人大战开始了

    Meta砸钱买下一个20人的机器人AI团队,这步棋下得挺准

    5月1日,Meta悄悄宣布了一笔收购——把人形机器人AI初创公司Assured Robot Intelligence(简称ARI)整个团队拿了过来。具体价格没披露,但按AI研究领域种子阶段收购的惯例来估算,大概在5000万到1.5亿美元之间。ARI整个公司才成立约12个月,约20个人,全在加州圣地亚哥。

    这个时机选得相当精准。就在收购前一个月,Amazon刚把Fauna Robotics收入囊中——而Fauna的联合创始人Lerrel Pinto,恰好也是ARI的联合创始人。人才圈的窗口正在关闭,Meta抢在ARI开A轮之前把它拿下了,估值还没被市场炒到天上去。

    “人形机器人正在从硬件竞赛转向智能捕获。Meta收购ARI是最清晰的信号——大科技公司已经从围观这个赛道,转向直接买入场券。”

    ARI到底在做什么

    ARI对外声称在做”机器人的前沿AI”,但产品宣传很少,真正有价值的信息在它的创始人背景里。两位联合创始人都是学术圈的人:

    • Xiaolong Wang——UC San Diego教授,研究方向是视觉运动控制和机器人灵巧操作,论文发表在CVPR、NeurIPS、ICLR这些顶会上
    • Lerrel Pinto——同为UC San Diego出身,联合创立了Fauna Robotics(被Amazon收购),在机器人学习领域有扎实的积累

    ARI的核心方向是给人形机器人做基础模型,特别强调在非预设环境下的全身控制和灵巧操作——这恰恰是现在大部分人形机器人最薄弱的地方。它们能走个直线、挥个手,但要让机器人像人一样在动态环境里做复杂操作,模型还差得很远。

    值得注意的是,ARI强调”自学习”——模型通过物理交互来改进,而不是只靠离线数据集训练。这直接针对当前VLA(视觉-语言-动作)模型架构的一个已知局限:泛化能力不足。


    为什么是ARI,不是别的公司

    其实市面上做机器人智能层的初创公司不止ARI一家。Physical Intelligence(PI)融了6亿美元以上,Skild AI估值140亿美元——但这些公司要么太大太贵,要么已经走上独立发展的轨迹,买起来不划算。

    ARI的巧妙之处在于:它足够小,可以干净地吸收进Meta的组织架构;它的人才足够顶尖,直接补充Meta Superintelligence Labs的短板;它的估值还没被炒高,收购成本低。

    Meta在2025年成立了Reality Labs内部的机器人工作室,编制齐全,但缺的就是基础模型研究人才。ARI填的不是一块模糊的野心,而是一个精确的缺口。

    大厂抢人大战才刚开始

    把视野拉宽一点,这场收购其实是整个行业的一个缩影。Amazon在2025-2026年间连续拿下Fauna、Rivr,还投资了Agility;Tesla在全栈自研路线上上越走越深;NVIDIA坐在平台层,给所有人提供芯片和仿真工具,稳稳抽取margin。

    Meta的策略和Amazon形成鲜明对比:Amazon是”广撒网”——连续收购,布局 warehouse、配送、家庭三大场景,但没有一个统一的平台叙事;Meta是”精准打击”——先在内部定义好机器人智能的路线图,再去买最匹配的人才来填空。

    这两种路径哪个更有效,接下来两三年会见分晓。但至少从目前来看,Meta这步棋下得挺准——在种子阶段的机器人智能公司变成”不得不买”的独立巨头之前,先把人拿到手。