标签: 蚂蚁灵波

  • 蚂蚁灵波要融15亿:一家不造机器人本体的公司凭什么值钱

    具身智能机器人大脑概念图
    蚂蚁灵波把赌注压在“机器人大脑”而非本体上(配图由 AI 生成)

    宇树科技刚把“具身智能第一股”的招牌挂上科创板,另一边,蚂蚁旗下的灵波又抛出一个问题:如果不造机器人本体,只做“大脑”,这家公司到底值多少钱?8 月 8 日,晚点 LatePost 报道,灵波正式启动首轮融资,拟募 15 亿元,年底前还要推第二轮。

    慢不是问题,泛化才是

    采访里有个细节很妙。有记者讲起在浙江仓库看到的场景:机器人叉车取货,工人三十秒干完的活它要一分多钟,遇到没见过的情况还会停下来“想一想”。台上的 CEO 朱兴没急着辩驳速度,只说了一句:脱离成功率谈效率,意义不大。在他看来,慢是个确定性的技术问题,迟早有解;真正卡脖子的是机器人能不能把任务完成,也就是对复杂真实世界的理解力——行内叫泛化能力,而泛化的难点本质在 data。

    首席科学家沈宇军打了个比方叫“开门见猫”:数字世界的模型看一只猫,识别、描述、生成都不在话下;可对真要走过去的机器人来说,隔着一层玻璃门的猫“不该存在”,得等门推开,猫才在深度感知里一点点显形。

    这恰恰点出了物理 AI 和语言 AI 的根本差别。数字世界里理解语义往往就够了,物理世界还多一层空间关系:人和人隔多远、谁在谁后面、要走几步才够得着。大脑比小脑破局更晚,核心原因就是数据——大模型几乎吞掉了整个互联网,物理 AI 的数据量却小得多,要理解的世界复杂度却指数级更高。

    “具身原生”:不从数字世界模型改造

    行业里做大脑主要有两条路:一条是 VLA,从多模态大模型迁移过来,落地最快;另一条是世界动作模型(WAM),由视频生成模型改造,擅长预测未来。灵波的选择是自己从头搭底座,叫“具身原生”——不直接把数字世界的模型改造成机器人,而是从物理世界的需求出发重做数据、训练目标和架构。

    他们给出的阶段成果是 LingBot-VA 2.0,号称行业首个具身原生的世界动作模型。从语义视觉—动作 VAE、单向因果建模到 MoE 架构,都按机器人在真实世界里稳定干活的需求重新设计,并且从头预训练。朱兴打了个更直白的比方:两条路线的第一需求不一样,就像“两个人性格不合,长期在一起还是要出事情的”。

    • 成立一年半,灵波已经发布十余款模型,组出 1.0 和 2.0 两代“全栈大脑”;
    • 覆盖视觉、空间感知、世界预测到动作执行,技术未收敛时便于定位每一环的问题;
    • 背后依托蚂蚁百灵团队训练 1T 参数开源大模型的整套 infra 能力,CTO 何征宇长期管基础设施。

    不押注本体,反而做起了“土壤”

    灵波给自己的硬件定位划了条线:会根据模型需要探索一点本体能力,但不押注本体,在大脑和硬件之间保持中立。做法是把跨构型的泛化直接塞进预训练——预训练见过某种构型的真实数据,模型在该构型上用起来就天然熟悉。LingBot-VLA 2.0 已经覆盖 17 家厂商的 20 多种构型,乐聚基于它只用约 300 条数据、微调一两天就能跑通场景。

    更关键的是开源。灵波把大部分模型、300 万对 RGB-深度配对数据集,甚至完整后训练工具链都放了出来。朱兴想建两个生态:一个数据、一个本体,让伙伴的数据反哺大脑,大脑再输出给更多硬件。用他的话说,灵波像在种一片具身版的“蚂蚁森林”——自己不长成最高的树,而是给整片林子供养分。