标签: 物理AI

  • Mistral也来抢机器人赛道:一个普通摄像头,让机器人在办公室里自己认路

    法国AI公司Mistral,大家更熟悉的是它那些开源大语言模型。但7月8日它悄悄把触角伸到了”物理世界”。新发布的Robostral Navigate是Mistral第一款面向机器人导航的模型,参数只有80亿,却干了件挺反直觉的事:让机器人只靠一个最普通的RGB摄像头,就能在复杂空间里自己走路、认路,不用激光雷达,也不用深度传感器。

    传统方案要让机器人不撞墙,往往得堆传感器——LiDAR、深度相机、好几路摄像头一起上。Robostral Navigate偏要做减法。它接收摄像头画面和一句大白话指令,比如”走出大堂,穿过走廊,进储物间,停在第二个货架正前方”,就自己驱动机器人走完整个流程,连训练时从没见过的人和障碍物都能现场避让。

    Mistral Robostral Navigate 单摄像头机器人导航
    仅凭一颗摄像头,Robostral Navigate 让机器人在办公空间自主导航(配图由AI生成)

    在R2R-CE这个导航基准上,它在没见过的环境里成功率76.6%,见过的有79.4%。更扎眼的是,它比此前最好的单摄像头方案高出9.7个百分点,甚至比用着深度或多摄像头的系统还高出4.5个百分点——”一只眼”反而赢了”多只眼”。

    怎么做到的:先学会”指路”,再学会”走路”

    核心是一套基于”指向”的导航机制。模型看着当前画面和历史指令,预测机器人下一步该往画面里的哪个坐标走、到了之后该朝向哪边。比起直接给”往前两米、左转25度”这种精确位移指令,这种”指路”的方式天然不挑相机参数、也不挑空间尺度,同一个模型能装在轮式的、腿式的甚至飞行的机器人上。

    训练上Mistral也走了一条省钱的路。整个模型完全在模拟环境里训出来,用6000个虚拟场景攒了大约40万条轨迹。再配上前缀缓存(prefix-caching)的训练算法,把整段任务压成一条序列一次训完,训练token量砍到原来的1/22,原本要几个月的活儿压缩到几天。最后再上一轮在线强化学习(CISPO),成功率又多榨出3.2个百分点。

    为什么这件事值得盯

    对Mistral来说,这只是通向”统一具身智能体”的第一步,但它戳中的是机器人落地最贵、最麻烦的一块——感知与导航。制造业、配送、物流、酒店这些场景里,”让机器自己从A走到B”向来是客户最想要的本事。把硬件门槛从一套传感器阵列降成”一颗摄像头加80亿参数”,意味着更多中小玩家也能碰机器人了。

    • 模型完全自研,不依赖任何开源视觉语言模型,从Mistral自家的 grounding 模型初始化而来。
    • 对相机内参差异很皮实,不同机器人、不同摄像头都能通用,部署起来省心。
    • 团队明确说还没看到性能天花板,更多训练和数据还能继续把数字往上推。

    当然,模型目前还没开源,权重和代码要走商务接洽。但Mistral从语言模型跨界到机器人,信号已经很清楚:当小模型也能用一颗摄像头搞定复杂导航,机器人自主移动的硬件护城河,正在被重新画一遍。


  • 用电子游戏训练机器人?General Intuition说机器人的ChatGPT时刻要来了

    从游戏手柄到机器人腿,这家公司赌的是”通用”两个字

    在GPT-3带火基础模型之前,做自然语言处理的公司基本都得从零开始,针对每个具体任务攒一堆专用数据去训练。现在谁还这么干?大家都是先拿GPT、Claude或者Llama这类通用模型过来,再微调一下应付自己的业务。General Intuition的CEO Pim de Witte觉得,机器人这行迟早也会走一模一样的路。

    他说的”专用路线”是什么样?就是现在很多团队各自为战,盯着某一个具体的机器人、某一个固定的环境、某一项专门动作死磕。de Witte的判断很直接:等通用模型真正成熟,这类苦活儿大部分都得作废。他甚至抛了个挺挑衅的说法——模型本身的泛化能力才是产品,”它只要对空间和时间有了最底层的理解,大家就没必要再去收集几十万、上百万小时的真实世界数据了,因为说白了,你其实只需要几分钟。”

    四足机器人在办公室中行走
    用游戏数据训出来的基础模型,正在让机器人摆脱对海量真实数据的依赖

    他们的秘密武器,是几百万小时的电子游戏录像

    General Intuition自己那套基础模型,训练素材来源有点出人意料:几百万小时的游戏视频,里面连”人类什么时候按了手柄上的哪个键”这种细节都标得清清楚楚。de Witte和投资方Vinod Khosla都认同一件事——这种”动作数据”才是让AI长出类人空间直觉的关键。

    他们最有说服力的一次演示,是让机器人只靠一个前置摄像头、没有任何别的传感器,在有人走来走去、不断有东西乱入的办公室里零样本跑起来。de Witte说,这事儿连他们自己都吓了一跳,而这八分钟真实数据之外的部分,全是模型自己泛化出来的。

    靠着这套逻辑,General Intuition上个月刚融了3.2亿美元,估值冲到23亿。钱不是白给的——他们的模型既能连续玩上几个小时游戏,也能驱动一台四足机器人,而后者只用了八分钟真实机器人数据做微调。de Witte给公司的定位也很清醒:他们不造机器人,要做的是”物理AI领域的基础模型”,相当于给其他机器人公司当地基。


    机器人行业的”ChatGPT时刻”到底还差什么

    • 数据逻辑在变:从”为每个动作攒数据”转向”用高质量数据训出能迁移的通用模型”。
    • 门槛在降:真实世界采集不再是必选项,几分钟的针对性微调可能就够了。
    • 生意在转:卖机器人的会越来越多,但卖”机器人脑子”的可能是另一拨人。

    de Witte有句话挺能概括野心:”我们不去造一家自动驾驶公司,我们要做的是,让下一个人造自动驾驶公司的难度大降十倍。”这话听着像在致敬当年基础模型对NLP行业的改造。只不过这一次,战场从屏幕里的文字,挪到了真实世界的四肢和空间里。

  • 贝索斯悄悄砸了120亿美元,这次不是火箭也不是电商

    杰夫·贝索斯又出手了,这次不是蓝色起源,也不是亚马逊——他和谷歌Verily前联合创始人维克拉姆·巴贾吉一起,搞了一家叫Prometheus的物理AI公司,刚宣布完成120亿美元融资,投后估值410亿美元。

    Jeff Bezos Prometheus AI
    杰夫·贝索斯的新赌注:用AI替代大部分工程工作(图源:Getty Images)

    这公司要做的事情听起来很宏大:打造所谓的”通用人工智能工程师”——一套能自动化复杂物理系统设计制造的软件,小到药物化合物,大到喷气发动机,都归它管。

    贝索斯的AI就业观:短缺,不是失业

    贝索斯对AI的看法跟硅谷很多人大不一样。当其他AI大佬在警告AI会导致大规模失业的时候,他说的是另一套:AI提升生产力之后,经济会出现劳动力短缺——双职工家庭可能变回单职工,加班的人也不用再加了。

    “经济的显著生产力提升将提高生活水平。如今的双职工家庭将变成单职工家庭,一些加班的人或许就不再需要加班了。”——杰夫·贝索斯

    这轮融资的投资方名单很长:贝索斯本人、摩根大通、高盛、贝莱德都在里面。去年底Prometheus才完成62亿美元的首轮融资,不到一年又来了120亿,而且大部分钱要拿去满足算力需求。

    物理AI,下一个防御性赛道?

    公司目前在旧金山、伦敦和苏黎世设有办公室,150名员工,具体产品细节还没披露。但可以肯定的是,这是目前为止物理AI领域最大的一笔单轮押注。

    风险投资人对物理AI的兴趣正在快速升温——跟纯软件AI相比,物理世界的属性天然构成了更高的防御壁垒,这也是为什么Prometheus能以410亿美元估值拿到这么多钱的核心逻辑。


  • 贝索斯又出手了,这次是120亿美元砸向「通用人工工程师」

    贝索斯又出手了,这次是120亿美元

    杰夫·贝索斯悄悄布局AI这几年,这次的动作大得有点离谱。他跟谷歌旗下Verily的前联合创始人维克拉姆·巴贾杰一起搞了个物理AI公司,叫Prometheus,刚完成120亿美元融资,投后估值410亿美元。这个估值什么概念?这是有史以来估值最高的AI初创公司之一。

    这已经是Prometheus的第二轮融资了。去年年底成立的时候拿了62亿美元,这次直接翻倍还多。投资方名单读起来像全球金融圈的点名:摩根大通、高盛、贝莱德,再加上贝索斯本人。

    Jeff Bezos
    杰夫·贝索斯,来源:Getty Images

    “通用人工工程师”是个什么玩意

    Prometheus要做的东西,他们自己叫”通用人工工程师”(Artificial General Engineer)。说白了,就是一套能自动搞定复杂物理系统设计和制造的软件——从喷气发动机到药物化合物,都算。

    这个野心大到有点吓人。他们想用AI替代大部分工程类工作。但贝索斯在接受CNBC采访时表示,AI带来的生产力提升会产生他所说的”劳动力短缺”——意思是未来对劳动力的需求会超过供给。这个观点跟科技圈很多人的判断正好相反。不少人觉得AI会导致大规模失业,贝索斯不这么看。

    “经济的显著生产力提升将提高生活水平。现在很多双职工家庭会变成单职工家庭,有些加班的人也会不再需要加班。”贝索斯是这么说的。

    410亿美元估值,钱要花在哪

    Prometheus目前在旧金山、伦敦和苏黎世设有办公室,一共150名员工。贝索斯说,这轮融资的大部分资金将用于满足公司的大规模算力需求。这个信息很直白——物理AI很烧钱,尤其是训练模型和运行仿真。

    410亿美元的估值让Prometheus站在了物理AI赛道的最前面。但这个赛道不是只有它一个。近几个月,风险资本家正越来越多地向物理AI领域投钱。这个赛道被投资者和创业者认为比纯软件赛道更具防御性——因为物理世界能产生仅靠代码无法构建的护城河。

    贝索斯对大规模劳动力运作有深刻认知。在亚马逊,他担任执行董事长,也是最大的个人股东,亚马逊在全球拥有超过150万名员工。过去一年,随着公司加速自动化进程,亚马逊已经裁员数万人。所以他说”劳动力短缺”,多少有点讽刺——他自己的公司正在用自动化减少劳动力。

    Prometheus目前尚未披露其已有的具体研发成果。150人,120亿美元,410亿估值——这些数字摆在一起,外界难免好奇他们到底做出来了什么。接下来几个月,应该是Prometheus从神秘走向公开的关键期。


    • Prometheus完成120亿美元融资,投后估值410亿美元
    • 由Jeff Bezos和Verily前联合创始人Vik Bajaj创立
    • 开发”通用人工工程师”软件,目标替代大部分工程类工作
    • 贝索斯预测AI将导致”劳动力短缺”,与主流观点相反
    • 融资主要用于算力需求,公司在旧金山、伦敦、苏黎世设有办公室
  • 这家AI公司说自己的世界模型能模拟真实驾驶,但跑着跑着纽约就消失了

    AI初创公司Decart本周发布了Oasis 3,一个声称能实时生成照片级真实驾驶环境的世界模型。TechCrunch提前拿到了独家信息,我仔细读完了整篇报道,感觉这个故事比标题看起来复杂得多。

    世界模型到底是什么

    先解释一下背景。所谓”世界模型”,简单说就是AI学会了对物理世界的运行规律建模,给它一个文本提示,它能生成一个你可以交互的虚拟环境。这东西在自动驾驶仿真、机器人训练这些领域有很大价值——你可以用它低成本地生成各种罕见的驾驶场景,不用真的去马路上冒险。

    Decart的Oasis 3主打的就是这个方向。他们声称这个模型能生成物理准确、多摄像头(一个前置加两个侧置)的驾驶环境,而且可以无限生成场景。目前通过API对外提供,定价是每秒0.02美元。

    Decart Oasis 3 世界模型演示
    Decart Oasis 3 生成的照片级真实驾驶场景丨来源:TechCrunch

    理想很丰满,现实有点骨感

    TechCrunch的记者亲自测试了Oasis 3,结果发现的问题还不少。最明显的一个:你让模型生成一个”早晨的纽约市街道”,它确实能跑出来,看起来挺像那么回事。但你往前开个一阵子,周围的场景就开始走样了,越来越不像纽约,最后变成了”任何一个西方城市的普通版本”。

    当你试图掉头回到最开始的那个路口时,你会发现它已经消失了,取而代之的是一个全新的环境。整个体验不像一个连贯的模拟,更像是一个梦幻般的、脱节的意识流。

    还有一个更基础的问题:物理一致性。在Oasis 3生成的世界里,汽车会直接穿过其他汽车,就像幽灵一样。Decart的CEO Dean Leitersdorf承认这是一个”正在破解的重大研究问题”,原因是”关于良好驾驶的数据远远多于事故数据”——模型没见过足够的事故场景,所以学不会避让。

    为什么效率这么高

    尽管有上述问题,Decart在技术效率上确实有两把刷子。他们的DOS(Decart优化栈)软件能让模型在英伟达、亚马逊和谷歌的硬件上高效运行,声称运行成本比竞争对手低一个数量级以上。

    Leitersdorf甚至说,公司整个生命周期的烧钱额”远低于”1亿美元。考虑到他们刚刚完成3亿美元融资、估值接近40亿美元,投资方里还有丰田、Adobe、eBay和英伟达,这个烧钱速度在今天的AI初创圈里确实算克的。


    拥挤的赛道

    世界模型这个方向现在挤得不行。谷歌今年1月发布了Genie 3的研究预览版,李飞飞的World Labs推出了商用产品Marble,Luma和Runway这些视频生成公司也在把他们的技术往世界模型方向转。Decart的差异化策略是:从第一天就开放API,让开发者在上面构建应用——这个玩法确实有点像OpenAI当年对LLM做的事。

    目前Decart已经积累了超过10万名开发者的社区,很多人用他们的实时视频模型Lucy在做电子商务和直播相关的产品。Oasis 3发布之后,这个社区规模大概率还会涨。

    至于世界模型什么时候能真正可靠到可以替代真实路测,现在还没人能给出确切答案。Decart说下一个版本会允许用户基于视频(而不是图片)来生成世界,这可能会改善一致性问题。但从根本上说,这个世界模型还是一个自回归系统——一次生成一帧,然后看之前生成了什么来决定下一帧,这个架构本身就很吃算力,要保持长时间的一致性非常难。