标签: 机器人训练数据

  • 训练机器人卡在了数据上,有人干脆给“陪练”戴上了脑电头盔

    加州圣莱安德罗有一间仓库,里面正在上演一场很不寻常的叠叠乐。一个叫 Andrew Ceja 的人戴着头盔,小心翼翼地从摇摇欲坠的木塔里抽木块。头盔上有摄像头,记录他看到的画面——这在采集机器人训练数据时挺常见。但他这顶头盔还多了一样东西:一圈能读取脑电波的传感器。

    这家公司叫 Encord,本行是给 AI 模型训练做数据工具。Ceja 的头衔是“飞行员”(pilot),也就是公司里专门给机器人当陪练的人。他们赌的是一件事:接下来卡住人形机器人和仓储机器人的,不会是模型架构,而是真实世界物理训练数据实在太少。所以 Encord 干脆不只帮客户管理已有的数据,而是把那些还不存在的数据造出来。

    Encord 的陪练戴着脑电头盔玩叠叠乐
    Encord 的“飞行员”戴着 Zander Labs 的脑电头盔采集训练数据。图片来源:Tim Fernholz / TechCrunch

    脑波到底能告诉机器人什么

    那顶脑电头盔是德国神经科学创业公司 Zander Labs 做的。他们的想法是,通过测量大脑活动,能推断出人做事时的一些心理状态——比如出错、意图、意外——这些信号打包进数据集,也许能训出更聪明的模型。目前 Encord 和 Zander 还只是试运行:先攒一批带脑波标记的数据,塞进客户的机器人模型跑一跑,看看到底有没有用,再决定要不要放大规模。

    在现场盯着这套流程的 Zander 神经科学家 Lucas Gehrke 说,一个人做某个动作时大脑投入了多少精力,本身就是个有用的线索——它能提示模型开发者,什么时候该调用算力最猛的那档模型,什么时候随便应付就行。Encord 机器人学习负责人 Vineeth Velmurugan 把这称作解决数据瓶颈的“最前沿”尝试。他之前待过 OpenAI 的机器人实验室,也在仓储自动化公司 Berkshire Grey 干过。

    “这些数据根本就不存在。”——Vineeth Velmurugan,Encord 机器人学习负责人

    生成式 AI 撞上了物理世界的墙

    “生成式 AI 能给机器人做到它给聊天机器人做到的事”,这个念头一次次撞上同一堵墙。大语言模型是拿整个互联网的文字喂出来的,可要教神经网络怎么在物理世界里动手操作,同样量级的原料太难找。自动驾驶公司靠自己采集,但很难规模化;用视频来训练也行,可视频缺了真实数据那种精细度。Velmurugan 估算,想真正突破,需要一个大约相当于 YouTube 视频库五倍体量的数据集——这也解释了为什么“造数据”本身能变成一门生意,而不只是研究课题。

    现在做“机器人大脑”的公司主要盯上两类数据来源:一是工人戴摄像头采集的第一人称视角视频,通常再补上别的机位和指标;二是远程操控机器人采集的数据。Encord 两样都做,第一人称数据来自全球好几家工厂,圣莱安德罗那间仓库则专门试验脑波这类新花样,或者针对某个具体技能攒数据做微调。

    TechCrunch 去现场时,飞行员们正在用“主从机械臂”——一只由人直接操控,另一只模仿它的动作——采集数据,任务包括把咖啡从壶里倒进杯子(洒得到处都是)和码扑克筹码。“每一家做人形机器人的公司都来问我们要这些片段。”Velmurugan 说。货架上堆着假花、书、塑料蔬菜、猫砂盆和铲子、成捆的电线,全是训练机器人干家务活的道具。


    机器人的手,还差得远

    另一个工位上,飞行员 Sofia Infante 操控机械臂给服务器背后插拔网线——这正是数据中心运营方做梦都想自动化的活儿,前提是机器人得有那个精度。记者自己上手试了试就明白差在哪:夹钳远不如人的手指灵活,也没有我们手臂那种理所当然的自由度。Encord 还在开发一种新数据形态,把一组传感器绑在前臂上,捕捉肌肉里的电信号,希望据此还原出手在每一刻的三维姿态——因为拍手部动作的视频往往拍不全整只手。

    • Encord 给数据集做密集标注,比如“右手拧紧螺栓”,帮基于大模型的系统看懂画面里在发生什么。
    • Velmurugan 估算,这种密集标注的价值是“垃圾第一人称数据”的 100 倍,而制作成本只贵 20 倍——纸面上是笔划算买卖。
    • 但 20 倍也是真金白银。当年从 Stack Overflow 之类的网站扒文字几乎不花钱,物理数据却得一点点“制造”出来,这就彻底改变了做模型的经济账。

    仓库里那十几个飞行员因此不会闲着。Infante 和 Ceja 都是从另一家数据标注公司 Scale 跳过来的。Ceja 更早还在一家废物管理公司干过,因为对技术感兴趣,被派去照看一台机器人垃圾分拣机。如今叠叠乐的塔一次次倒下,他说自己挺享受给机器人解题的过程——“每天都有新鲜事”。

  • 英伟达开源机器人技能库 ASPIRE:机器人开始像程序员一样,边改 bug 边攒本事

    英伟达开源机器人技能库 ASPIRE:机器人开始像程序员一样,边改 bug 边攒本事

    以前训练机器人,靠的是海量数据反复喂、靠梯度下降一点点更新权重,练完就是一堆定死的浮点数。英伟达刚开源的 ASPIRE 把这套逻辑掀了——它让机器人像程序员改 bug 一样,边干边试错、边试错边把经验攒下来。负责具身智能的 Jim Fan 直接放话:这是训练范式的一次彻底改写。

    机器人持续学习与技能库概念图
    ASPIRE 让机器人把每次操作经验沉淀成可复用的技能库

    ASPIRE 全称是 Agentic Skill Programming through Iterative Robot Exploration,说白了就是物理世界里的机器人版 Coding Agent。背后调用的 GPT 或 Claude 不再直接输出机械动作,而是写出一段可调试、可复现的控制代码;机器人执行时,把感知图像、导航、抓取、碰撞报错、运动轨迹全程记下来。

    任务失败了,AI 就回放这段多模态轨迹,像研究员一样判断哪一步出了问题,改代码、再跑一遍;一旦跑通,就把这套解决办法提炼成标准化的 Skill,存进一个越攒越厚的技能库,下次遇到同类场景直接调用,不用从零再试。

    三个变化,把老路子整个翻了过来

    Jim Fan 把这次转变拆成三条,新旧对比很清楚。训练,从梯度下降变成了不断打磨技能;练出来的东西,不再是一份网络权重文件,而是一座持续扩容的感知运动技能库;至于分布式训练,则变成一群 Agent 各自练不同的技能,再把经验汇总进同一个库里。

    这么做的直接好处,是把机器人开发的数据门槛砍了下来。技能库里已经涵盖抓取、移动、操作这些常见任务的预训练模型,开发者拿来组合、微调就行,不再需要动辄百万级的训练数据从头练。

    对国内厂商是把双刃剑

    开源当然降低了研发门槛,谁都能站在英伟达的肩膀上往前走。但硬币的另一面是,一旦大家都用它的技能库、它的标准,机器人的核心能力就等于被英伟达定义了。这跟当年 CUDA 的路数如出一辙——先把地基铺好、免费给你用,等你离不开了,话语权也就攥在人家手里。

    值得留意的几点:

    • 训练目标从更新权重,变成不断打磨和复用单条技能
    • 技能支持跨机型迁移,能大幅省下仿真复现和重训的成本
    • 为人形、工业机器人的通用自主学习提供了一套开源底座

    从大模型卷参数,到智能体卷能不能真把活干成,再到现在机器人开始攒技能,AI 的竞争重心正一步步从静态的权重,挪向动态的、能持续成长的能力。ASPIRE 未必是终点,但它至少给出了一个方向:让机器人像人一样,把每次踩过的坑都变成下次的本事。

  • 用电子游戏训练机器人?General Intuition说机器人的ChatGPT时刻要来了

    从游戏手柄到机器人腿,这家公司赌的是”通用”两个字

    在GPT-3带火基础模型之前,做自然语言处理的公司基本都得从零开始,针对每个具体任务攒一堆专用数据去训练。现在谁还这么干?大家都是先拿GPT、Claude或者Llama这类通用模型过来,再微调一下应付自己的业务。General Intuition的CEO Pim de Witte觉得,机器人这行迟早也会走一模一样的路。

    他说的”专用路线”是什么样?就是现在很多团队各自为战,盯着某一个具体的机器人、某一个固定的环境、某一项专门动作死磕。de Witte的判断很直接:等通用模型真正成熟,这类苦活儿大部分都得作废。他甚至抛了个挺挑衅的说法——模型本身的泛化能力才是产品,”它只要对空间和时间有了最底层的理解,大家就没必要再去收集几十万、上百万小时的真实世界数据了,因为说白了,你其实只需要几分钟。”

    四足机器人在办公室中行走
    用游戏数据训出来的基础模型,正在让机器人摆脱对海量真实数据的依赖

    他们的秘密武器,是几百万小时的电子游戏录像

    General Intuition自己那套基础模型,训练素材来源有点出人意料:几百万小时的游戏视频,里面连”人类什么时候按了手柄上的哪个键”这种细节都标得清清楚楚。de Witte和投资方Vinod Khosla都认同一件事——这种”动作数据”才是让AI长出类人空间直觉的关键。

    他们最有说服力的一次演示,是让机器人只靠一个前置摄像头、没有任何别的传感器,在有人走来走去、不断有东西乱入的办公室里零样本跑起来。de Witte说,这事儿连他们自己都吓了一跳,而这八分钟真实数据之外的部分,全是模型自己泛化出来的。

    靠着这套逻辑,General Intuition上个月刚融了3.2亿美元,估值冲到23亿。钱不是白给的——他们的模型既能连续玩上几个小时游戏,也能驱动一台四足机器人,而后者只用了八分钟真实机器人数据做微调。de Witte给公司的定位也很清醒:他们不造机器人,要做的是”物理AI领域的基础模型”,相当于给其他机器人公司当地基。


    机器人行业的”ChatGPT时刻”到底还差什么

    • 数据逻辑在变:从”为每个动作攒数据”转向”用高质量数据训出能迁移的通用模型”。
    • 门槛在降:真实世界采集不再是必选项,几分钟的针对性微调可能就够了。
    • 生意在转:卖机器人的会越来越多,但卖”机器人脑子”的可能是另一拨人。

    de Witte有句话挺能概括野心:”我们不去造一家自动驾驶公司,我们要做的是,让下一个人造自动驾驶公司的难度大降十倍。”这话听着像在致敬当年基础模型对NLP行业的改造。只不过这一次,战场从屏幕里的文字,挪到了真实世界的四肢和空间里。

  • 这家公司免费帮你打扫房间,条件是记录全过程用来训练机器人

    AI训练数据初创公司Shift最近在社交媒体上宣布了一个听起来有点奇怪的优惠:他们将免费为用户提供家庭清洁服务,条件是允许设备记录清洁人员的工作过程,以此收集高质量的机器人训练数据。

    该公司的”魔法帽”计划本质上是在用未来的机器人能力,换取今天的真实世界动作数据。清洁人员戴着配有摄像头的帽子工作,记录他们如何擦洗、吸尘、除尘、整理和清洗——这些都是未来家庭服务机器人需要掌握的核心技能。

    “你得到一间一尘不染的公寓。我们得到训练数据。双赢。”——Shift官方网站

    魔法帽里有什么?

    清洁人员戴着一顶看起来有点尴尬的白色帽子——官方称之为”魔法帽”——里面藏着一台摄像头,从清洁人员的第一视角捕捉工作画面。

    Shift清洁人员戴着魔法帽工作
    Shift的”魔法帽”从清洁人员第一视角记录工作过程(图源:The Verge)

    当然,让别人的摄像头进到你家里,这本身就是你得”支付”的代价。Shift在官网上说客户的”隐私得到充分保护”,敏感细节(如姓名、面部、屏幕和个人信息、身份证)在用于AI训练之前会被模糊化和匿名化处理。


    越脏越好?

    Shift在宣传视频中说:”今天清洁的每一间房子,都为明天能自己清洁的房子打下基础。”

    有意思的是,该公司表示“更具挑战性的清洁环境”可能特别有用。换句话说,你家越脏乱,对训练机器人来说反而越有价值。当然,清洁人员”可以拒绝执行任何他们感到不舒服的具体任务”。

    不只是清洁

    清洁可能只是开始。Shift的视频显示,该公司最终计划扩展到管道维修、烹饪和建筑等其他领域。

    Shift表示,它已经向15个国家的数万人支付报酬,让他们通过应用程序记录自己的活动。这个市场正在增长——用于训练AI系统和机器人的人类任务录像,正成为AI数据竞赛中的稀缺资源。


    目前只在纽约,很快扩展到更多城市

    这项免费清洁服务目前仅在纽约提供。但联合CEO兼联合创始人Bercan Kilic表示,很快将在旧金山、伦敦、苏黎世和慕尼黑推出。

    免费清洁只是”限时”优惠,但这个模式其实触及了一个更大的趋势:AI公司越来越愿意用真实世界的服务,来换取训练下一代机器人所需的高质量数据。

    • 清洁人员戴”魔法帽”第一视角记录工作过程
    • 隐私保护:敏感信息在训练前被模糊化和匿名化
    • 目前仅在纽约,即将扩展至旧金山/伦敦/苏黎世/慕尼黑
    • Shift已在15个国家拥有数万名数据贡献者
    • 未来计划扩展至管道/烹饪/建筑等更多家庭场景