标签: 数据标注

  • 训练机器人卡在了数据上,有人干脆给“陪练”戴上了脑电头盔

    加州圣莱安德罗有一间仓库,里面正在上演一场很不寻常的叠叠乐。一个叫 Andrew Ceja 的人戴着头盔,小心翼翼地从摇摇欲坠的木塔里抽木块。头盔上有摄像头,记录他看到的画面——这在采集机器人训练数据时挺常见。但他这顶头盔还多了一样东西:一圈能读取脑电波的传感器。

    这家公司叫 Encord,本行是给 AI 模型训练做数据工具。Ceja 的头衔是“飞行员”(pilot),也就是公司里专门给机器人当陪练的人。他们赌的是一件事:接下来卡住人形机器人和仓储机器人的,不会是模型架构,而是真实世界物理训练数据实在太少。所以 Encord 干脆不只帮客户管理已有的数据,而是把那些还不存在的数据造出来。

    Encord 的陪练戴着脑电头盔玩叠叠乐
    Encord 的“飞行员”戴着 Zander Labs 的脑电头盔采集训练数据。图片来源:Tim Fernholz / TechCrunch

    脑波到底能告诉机器人什么

    那顶脑电头盔是德国神经科学创业公司 Zander Labs 做的。他们的想法是,通过测量大脑活动,能推断出人做事时的一些心理状态——比如出错、意图、意外——这些信号打包进数据集,也许能训出更聪明的模型。目前 Encord 和 Zander 还只是试运行:先攒一批带脑波标记的数据,塞进客户的机器人模型跑一跑,看看到底有没有用,再决定要不要放大规模。

    在现场盯着这套流程的 Zander 神经科学家 Lucas Gehrke 说,一个人做某个动作时大脑投入了多少精力,本身就是个有用的线索——它能提示模型开发者,什么时候该调用算力最猛的那档模型,什么时候随便应付就行。Encord 机器人学习负责人 Vineeth Velmurugan 把这称作解决数据瓶颈的“最前沿”尝试。他之前待过 OpenAI 的机器人实验室,也在仓储自动化公司 Berkshire Grey 干过。

    “这些数据根本就不存在。”——Vineeth Velmurugan,Encord 机器人学习负责人

    生成式 AI 撞上了物理世界的墙

    “生成式 AI 能给机器人做到它给聊天机器人做到的事”,这个念头一次次撞上同一堵墙。大语言模型是拿整个互联网的文字喂出来的,可要教神经网络怎么在物理世界里动手操作,同样量级的原料太难找。自动驾驶公司靠自己采集,但很难规模化;用视频来训练也行,可视频缺了真实数据那种精细度。Velmurugan 估算,想真正突破,需要一个大约相当于 YouTube 视频库五倍体量的数据集——这也解释了为什么“造数据”本身能变成一门生意,而不只是研究课题。

    现在做“机器人大脑”的公司主要盯上两类数据来源:一是工人戴摄像头采集的第一人称视角视频,通常再补上别的机位和指标;二是远程操控机器人采集的数据。Encord 两样都做,第一人称数据来自全球好几家工厂,圣莱安德罗那间仓库则专门试验脑波这类新花样,或者针对某个具体技能攒数据做微调。

    TechCrunch 去现场时,飞行员们正在用“主从机械臂”——一只由人直接操控,另一只模仿它的动作——采集数据,任务包括把咖啡从壶里倒进杯子(洒得到处都是)和码扑克筹码。“每一家做人形机器人的公司都来问我们要这些片段。”Velmurugan 说。货架上堆着假花、书、塑料蔬菜、猫砂盆和铲子、成捆的电线,全是训练机器人干家务活的道具。


    机器人的手,还差得远

    另一个工位上,飞行员 Sofia Infante 操控机械臂给服务器背后插拔网线——这正是数据中心运营方做梦都想自动化的活儿,前提是机器人得有那个精度。记者自己上手试了试就明白差在哪:夹钳远不如人的手指灵活,也没有我们手臂那种理所当然的自由度。Encord 还在开发一种新数据形态,把一组传感器绑在前臂上,捕捉肌肉里的电信号,希望据此还原出手在每一刻的三维姿态——因为拍手部动作的视频往往拍不全整只手。

    • Encord 给数据集做密集标注,比如“右手拧紧螺栓”,帮基于大模型的系统看懂画面里在发生什么。
    • Velmurugan 估算,这种密集标注的价值是“垃圾第一人称数据”的 100 倍,而制作成本只贵 20 倍——纸面上是笔划算买卖。
    • 但 20 倍也是真金白银。当年从 Stack Overflow 之类的网站扒文字几乎不花钱,物理数据却得一点点“制造”出来,这就彻底改变了做模型的经济账。

    仓库里那十几个飞行员因此不会闲着。Infante 和 Ceja 都是从另一家数据标注公司 Scale 跳过来的。Ceja 更早还在一家废物管理公司干过,因为对技术感兴趣,被派去照看一台机器人垃圾分拣机。如今叠叠乐的塔一次次倒下,他说自己挺享受给机器人解题的过程——“每天都有新鲜事”。

  • 跑了 21 年的 Mechanical Turk 要关新用户了:AI 亲手埋了给它打工的人类

    这可能是 Amazon Mechanical Turk 最后的时光。平台官网最近贴出通知:2026 年 7 月 30 日起,这个运营了 21 年的众包服务将不再接收新客户。亚马逊说现有用户还能照常用,但”不打算再加新功能”——翻译一下,就是拔了氧气管,只维持心跳。

    一个以骗局命名的平台

    Mechanical Turk 2005 年上线,做的事情很简单:把机器还搞不定的零碎活儿——填验证码、判断一句话是夸还是骂、给图片打标签——发给全球打工人,按件付费。名字本身是个梗:18 世纪有台号称会下棋的”机械土耳其人”,其实箱子里藏着个真人棋手。亚马逊故意借这个名,因为它干的也是”用人类假装机器”的买卖,内部甚至造了个词叫”人工的人工智能”(artificial artificial intelligence)。

    “有人会在亚马逊决定,养着 MTurk 的服务器纯属浪费时间和资源,然后干脆拔掉电源。”——公告后一位 Reddit 用户的预言

    它其实是 AI 的”母乳”

    2018 年起,亚马逊把它塞进 SageMaker,变成训练神经网络的人工标注工厂。监督学习要人标例子,RLHF 要人比较两个回答哪个更好——这些活儿大量落在 MTurk 工人头上。SQuAD 这种经典 benchmark、无数心理学和行为经济学论文的被试数据,都从这来。说它是现代 AI 的承重墙,一点不夸张。

    Amazon Mechanical Turk 众包平台走向终结
    运营 21 年的众包平台 Mechanical Turk 进入维护模式(图源:TechCrunch / Getty Images)

    最讽刺的闭环

    2023 年一篇论文拆穿了一个套娃笑话:平台上 33% 到 46% 的工人,其实在用大语言模型替自己完成任务。也就是说,用来训练 AI 的”人类判断”,有一大批是 AI 自己生成的。一个靠”人工的人工智能”起家的平台,被它帮忙养大的 AI 反过来啃食,连名字都成了预言。

    • 工人时薪中位数曾低到约 2 美元,社保福利一概没有,长期被骂是数字血汗工厂
    • 机器人刷单、欺诈横行,社区早就在衰败,很多人说它”几年前就死了”
    • 亚马逊早有替代品 SageMaker Ground Truth,自动预标注加人工复核,更快更稳

    MTurk 没被立刻关掉,但它被挪进了 AWS 的”维护中”名单,等于判了死缓。对那些还靠它做标注、做评测的小团队来说,信号已经很清:廉价公开众包正在变成 legacy 基础设施。以后想要干净、可控、可追溯的训练数据,得走专业标注服务或自有审核流程,不能再指望从云里随手薅一批”人工”了。

  • 三个23岁辩论队友做的AI数据公司,估值冲上200亿美元

    AI训练数据标注场景
    给AI实验室供训练数据,正在成为一门估值惊人的生意(图源:TechCrunch / Getty Images)

    硅谷最疯的造富故事又添一笔:一家帮 AI 实验室做数据标注的公司,估值要在不到一年里从 100 亿翻到 200 亿美元。更离谱的是,把它做起来的是三个 23 岁的年轻人,而且公司从成立第一天起就盈利。

    高中辩论队出来的独角兽

    Mercor 成立于 2023 年,三位创始人是在旧金山湾区一所高中的辩论队里认识的。去年10月,他们 22 岁,被福布斯评为全球最年轻的自手起家亿万富豪。如今 23 岁,据估算如果本轮融资顺利完成,每人身家将接近 43 亿美元。

    从 100 万美元到 20 亿美元年化营收,Mercor 只用了 24 个月——创始人称这是”史上最快的增长曲线”。

    卖的不是软件,是专家的人力

    Mercor 的生意模式很直接:把领域专家——博士、律师、医生、工程师、银行家、程序员——对接给需要高质量专业数据来训练前沿模型的 AI 实验室。它目前管理着约 3 万名合同工,用自研的 AI 面试平台筛过 500 多万候选人,每天给合同工发出的报酬超过 400 万美元。客户名单里有 OpenAI、Anthropic 和 Google;Meta 曾是它的大客户,直到 2026 年 3 月因一次安全问题暂停合作。

    估值翻倍的逻辑

    据彭博报道,Mercor 正在洽谈以约 200 亿美元估值融资 5 亿美元,并且已经拿到至少一份 term sheet。九个月前它刚以 100 亿估值完成 3.5 亿美元 C 轮。撑起估值的硬指标是营收:年化收入今年2月刚破 10 亿,到6月就翻倍到 20 亿,CEO 在 X 上亲自确认了这一里程碑。同一天,Mercor 还宣布收购 Deeptune——一家帮训练 AI agent 的公司,曾拿到 a16z 领投的 4300 万美元 A 轮,重写了数百个真实软件环境供强化学习练习,团队整体并入。这意味着 Mercor 正从静态标注,一路延伸到 agent 训练。

    光鲜背后的暗面

    2026 年一开始,Mercor 过得并不顺。3 月它卷入了开源库 LiteLLM 的供应链攻击,最多有 4TB 的内部与合同工数据暴露;Meta 因此暂停合作,合同工也发起了集体诉讼。福布斯还曝出前员工怀疑有朝鲜特工用盗取的凭证渗透进平台,另有员工因挪用资金被解雇。Mercor 自称调查显示对客户和合同工数据的影响”非常有限”。


  • Mercor估值冲上200亿美元:雇专家给AI当考官,这门生意两年涨了四倍

    Mercor这家公司最近又成了风投圈的话题中心。彭博7月9日报道,这家从AI训练数据起步的创业公司正在谈新一轮融资,估值直接喊到了200亿美元。要知道去年10月它刚完成3.5亿美元C轮,估值还只是100亿美元——不到一年,数字就翻了一倍。

    更抓人的是创始人兼CEO布伦丹·福迪(Brendan Foody)自己在X上晒的数据:公司年化收入跑到了20亿美元以上,比四个月前整整翻了一倍。一边是收入暴涨,一边是并购动作——上周四Mercor宣布买下Deeptune,一家专门训练AI智能体的公司,对方整个团队一并加入。再加上这轮可能的新钱,看起来年初那场风波已经被它甩在身后了。

    Mercor估值冲上200亿美元
    Mercor靠给AI模型 supplying人类考官,估值一年翻倍(图源:TechCrunch)

    说白了,Mercor干的事听起来简单,细想却有点荒诞:它雇各路专家——诗人、经济学家、程序员、科学家——付钱让他们去评估AI模型的输出到底好不好。那些训练前沿大模型的实验室,需要人来告诉自己”模型是不是真的变强了”。Mercor就是提供这批”考官”的人。

    两个辩论队队友,撑起一个200亿的故事

    这家公司2023年才成立,三个创始人是从高中辩论队里走出来的朋友:福迪、阿达什·希雷马特(Adarsh Hiremath)和苏里亚·米德哈(Surya Midha),福迪今年才23岁。从C轮时大约4.5亿美元的年化收入,到今年中接近20亿,二十来个月里涨了四倍多。背后站着Felicis、Benchmark、General Catalyst这些一线基金,累计融资大约4.92亿美元。

    有意思的是,估值倍数反而被”压”下来了。100亿对4.5亿收入,是大约22倍市销率;如果按200亿对20亿算,只剩10倍。换句话说,市场一边兴奋于生意盘子变大,一边也在悄悄担心这门买卖到底能撑多久。

    它在训练那个可能取代自己的东西

    这种担心不是没来由。Mercor赚的正是”派人类专家去训练AI模型”的钱,可模型越聪明,对人工评估的依赖理论上就越少。真有一天模型能自己给自己、或者互相打分,那批考官的需求可能就缩水了。

    但福迪在斯坦福的演讲里抛出了另一种看法,他管这叫”agentic data”(智能体数据):AI能力越强,要它被评估的维度反而越细,而不是越窄。会写诗,就需要诗人来评;能做经济分析,就需要经济学家。需求不是一次性的训练浪潮,而是跟着整个行业一起长。

    • 它给AI实验室供应的是”懂行的人”——这是大厂自己很难内部搞定的一摊运营活。
    • 买下Deeptune,是把盘子从传统数据标注,扩到了更吃香的AI智能体训练。
    • 年初的数据泄露和外包员工诉讼还没完全翻篇,能这么快把收入和估值同时拉回来,说明资本现在愿意为”训练流水线的掌控者”付高价。

    在不少人眼里,谁捏住了数据这一环,谁就捏住了AI往上走的长期价值。Mercor赌的,正是自己能一直站在模型和它所需要的”人”之间。