标签: AI

  • 字节跳动放出 Seed Audio 1.0:给视频配音,AI 不再只会「念稿」

    字节跳动 Seed Audio 1.0 音频创作模型
    Seed Audio 1.0 用统一框架联合建模人声、音效与环境声(概念图)

    做短视频、短剧的人大概都有过这种崩溃:画面拍好了,配一段像样的音效比写脚本还费劲。人声要去录音棚,环境声要现找素材,音效还得一笔笔手动对时间轴。7月20日,字节跳动 Seed 团队丢出一个叫 Seed Audio 1.0 的模型,想把这个流程一口气吞掉。

    它不是拼接,是「一起想」

    过去这类工具大多是各管一摊:一个模型生成人声,一个模型找音效,最后人工混音。Seed Audio 1.0 的卖点在于,它在一个统一框架里同时建模人声、音效和环境声,端到端直接产出一段能拿来叙事的完整声音。官方一句话挺妙:声音不再只是画面的补丁,而是能直接参与讲故事,「听见」即「看见」。

    具体有三个本事。第一是精细的时间编排,按时间线控制对白和音效什么时候进场,精度能到 100 毫秒,做视频配音和广告卡点刚好。第二是音色稳,支持零样本生成和长音频延展,一个角色从头到尾音色不变,还能同一声音演多个角色、带不同情绪。第三是语种全,覆盖中文、英文、日语等 20 多种语言,重音和节奏都按当地习惯来。

    官方评测显示,在影视、短剧、动漫、播客等多数场景里,音频可用率已经跑到 90% 以上;多语言自然度方面,大部分语种 MOS 评分超过 4 分,算优秀水平。

    从「会说」到「会创作」

    这中间的区别挺关键。早几年的语音合成,本质是把文字念出来,语调再自然也还是「读稿」。Seed Audio 1.0 瞄准的是创作——你给一条指令,它自己安排谁说话、什么情绪、背景音怎么铺、什么时候淡入。对短剧和动漫团队来说,这意味着原本要分几个工种、花几天的活,可能压缩到一轮生成。

    • 影视级音频:对白、音效、环境声统一编排,叙事更连贯
    • 可控音色:长音频保持一致,同一声音可演多角色
    • 20+ 语种:自然生成,适配本地表达节奏

    先上体验,后面还有大招

    模型现在已经放在火山方舟体验中心,创作者能直接试。团队放话,接下来会接进视频参考这类多模态输入,还会做可控翻译、长音频和分轨生成,方向是把脑子里的声音构想更快变成能听见的成品。


    大模型从文本、图像一路卷到音频,Seed Audio 1.0 是个信号:AI 音频正从单点工具走向全场景创作平台。对内容创作者,门槛又低了一截;对行业,竞争也从「谁念得真」变成「谁编得巧」。

  • AMD把「太阳神」搬进机房:Helios机架系统正面刚英伟达

    AMD Helios 机架级 AI 系统
    AMD 首款机架级 AI 系统 Helios,集 GPU、CPU、网络与软件于一体(概念图)

    7月20日,AMD 把憋了好久的一张王牌亮了出来——名叫 Helios 的机架级 AI 系统。名字取自希腊太阳神,摆明是要当算力界的「太阳」。这不是一块显卡,而是一整柜子:GPU、CPU、网络、软件全打包,直接对标英伟达那些动辄几百万美元的 AI 机柜。

    微软带头,巨头排队下单

    最让 AMD 长脸的是客户名单。就在发布当天,微软 CEO 纳德拉亲自表态,要在 Azure 数据中心部署 Helios,还顺手推出两款基于 AMD 新「Venice」CPU 的计算实例。更早之前,Meta 已经承诺逐步部署高达 6 吉瓦的 AMD GPU,其中 1 吉瓦今年就通过 Helios 机架交付;OpenAI 和甲骨文也点头要在年内大规模铺开;印度的塔塔咨询服务也在列。

    这背后是 AMD 十年的翻身账。它靠着三代产品路线图的严格执行,加上收购赛灵思、ZT Systems,一步步把 CPU 和 GPU 都做起来了。现在它敢说,Instinct GPU 已经服务全球前十 AI 公司里的八家,包括 OpenAI 和 SpaceX AI。

    苏姿丰此前放话:Helios 在推理、内存带宽和容量上,相比英伟达的机架系统有「显著优势」。

    算的是总账,不是单项性能

    AMD 数据中心业务负责人 Forrest Norrod 反复强调一个词:TCO,也就是总拥有成本。他说 Helios 追求的是最低的「每 token 综合成本」。道理不复杂——对微软、Meta 这种要养几吉瓦算力的巨头来说,单卡跑分高一点,不如整柜更省电、更便宜。

    不过现实也很骨感。研究机构 Futurum Group 估算,一台 Helios 机柜成本大约 500 万到 550 万美元,比英伟达第二代机架 Vera Rubin 的 350 万到 400 万美元还要贵;而且它重达 7000 磅,个头也更大。更要命的是份额:英伟达占数据中心 GPU 市场超过 95%,AMD 只有约 4.5%。

    • 分析师 Daniel Newman 认为,如果 AMD 执行到位,份额有望冲到 20%–25%,对应数千亿美元收入空间
    • AMD 一季度数据中心营收同比增长 57%,已是公司收入主力
    • 公司预计从 2027 年起,数据中心 AI 年收入将达到数百亿美元,大头来自 Helios

    硬件追上了,软件才是硬仗

    Counterpoint 的分析师 Neil Shah 点破了一层窗户纸:AMD 硬件已经和英伟达站到同一水平,但胜负手在软件生态。英伟达的 CUDA 护城河太深,AMD 这几年猛补 ROCm 开源生态,就是想拆这道墙。


    Helios 的早期部署马上就要展开。接下来一两年,市场会检验一件事:AMD 到底是靠真技术赢,还是仅仅因为英伟达产能紧缺捡了漏。对用算力的公司来说,多一个能打的供应商,怎么都不是坏事。

  • 谷歌悄悄研发新 AI 芯片 Frozen v2:要让 Gemini 省下大笔电费

    Google 自研 AI 芯片相关示意图
    大厂自研 AI 芯片已成趋势,Google 的 Frozen v2 瞄准的是推理能效(图源:TechCrunch)

    Alphabet 正在悄悄搞一颗新的服务器芯片,内部代号叫 Frozen v2,专门用来让自家的 Gemini 模型跑得更省、更稳。消息来自 The Information 的爆料,说这颗芯片大概会在 2028 年前后亮相。

    能效说是现在的六到十倍

    按那篇报道的说法,Frozen v2 的衡量标准是「每消耗一单位电力能生成多少 token」,在这个口径下,它要比 Google 现有的 AI 芯片高效 6 到 10 倍。对此 Google 既没承认也没否认,只给了一句四平八稳的回应。

    「我们的团队一直在研究和试验各种新方案,为用户和客户带来极致的性能与效率。」

    大厂为什么都在自己造芯

    把模型训练和推理从通用 GPU 上挪到自己定制的芯片上,已经成了大厂的共同动作。动机很直白:一是让自家模型跑得更划算,二是摆脱对英伟达的依赖——这家公司长期把持着 AI 芯片市场,也让所有大模型厂商都被它的硬件绑住。

    就在今年 6 月,OpenAI 刚亮出第一颗自研推理芯片 Jalapeño;本月初又有消息说,Anthropic 正在和三星谈新的芯片合作。Google 自己本来就有 TPU 这条线,Frozen v2 像是把这条路继续往下走。

    • 代号 Frozen v2,目标 2028 年前后发布,专供 Gemini 使用。
    • 能效按 token / 单位电力计,号称达现有芯片 6 到 10 倍。
    • 背景是 OpenAI、Anthropic 相继布局自研芯片,全行业试图降低对英伟达的依赖。

    股价先涨为敬

    这类消息背后,其实是投资者的算盘。大家一直担心 Alphabet 为了 AI 基建砸下的天价开支——公司年初说今年要花 1800 亿到 1900 亿美元。钱花出去了,得证明能回本。Frozen v2 一旦坐实,等于给市场一个「我们在把成本压下来」的信号。报道出来后,Google 股价周一上午就涨了大约 3%。

    当推理成本变成卖点,AI 的故事就从「大力出奇迹」变成了「谁更会过日子」。


  • Anthropic 15亿美元版权和解获批:AI训练「合理使用」第一案落槌

    Anthropic 的 Claude 形象
    Anthropic 这场版权和解,给整个行业留下了「训练算合理使用」的定性(图源:TechCrunch)

    上周末,一桩拖了快两年的官司终于画上句号。联邦法官批准了 Anthropic 拿出 15 亿美元,摆平那场由一群作家和图书出版商发起的集体版权诉讼。钱要开始发了,但这件事真正的看点不在钱,而在法官留下的那个判断。

    15 亿到底怎么分

    按照和解方案,大约 50 万部作品每部能拿到 3000 美元,在握有版权的作者和出版商之间分摊。这个数额被认为是美国版权史上最大的一笔和解金。不过,很多写作者并不觉得这是一场胜利,原因得看法院到底是怎么裁的。

    主审法官 Alsup 站在了 Anthropic 这一边:用受版权保护的文本去训练 AI 模型,算「合理使用」。这个判断被不少人视为整个 AI 行业的一个转折点。

    真正踩线的是「怎么拿的书」

    Alsup 虽然点了头,但他没把获取方式也一并放过。Anthropic 的训练书库有两个来源:一部分是买来纸质书自己扫描,这部分没问题;另一部分是直接从 Library Genesis、Pirate Library Mirror 这类盗版站下载,这部分被 Alsup 认定为非法。换句话说,训练本身合法,偷书不合法。

    正因为盗版下载这条单独成立,案子本来可能要上陪审团、赔多少由陪审团定。Anthropic 选择和解,把不确定的风险先掐灭。

    • 和解金约 15 亿美元,按每部作品 3000 美元、覆盖约 50 万部作品分摊。
    • 训练模型被认定为「合理使用」,但盗版下载被单独判定非法。
    • 判决仅为地区法院层级,不构成全国性先例,同类诉讼仍在多州推进。

    为什么作家们高兴不起来

    核心争议是以对 AI 公司有利的方式收尾的。法官认定训练属于合理使用,等于给整个行业发了张准生证。可对于辛苦写书的人而言,自己的作品被拿来喂模型、还只拿到每部 3000 美元,怎么看都不像赢。

    更重要的是,这个判决只是加州北区一个地区法院的决定。Anthropic 一和解,案子就不会上上诉法院,也就没法变成有约束力的先例。别的法官完全可以对别的事实给出别的结论——事实也正在发生。Google、Meta、Midjourney、OpenAI 眼下都还背着各自的版权官司。就在上周,Hachette、Cengage、Elsevier 等出版商加上作家 Scott Turow,又把 Google 告了,理由是 Gemini 拿他们的书训练。


  • mattpocock/skills:把顶级工程师的经验,打包成 AI 编码智能体的「技能库」

    mattpocock/skills:把顶级工程师的经验,打包成 AI 编码智能体的「技能库」

    mattpocock/skills 项目封面

    mattpocock/skills 是 TypeScript 布道师 Matt Pocock 日常使用的「AI 编码智能体技能库」——它不教你写 prompt,而是把数十年的工程经验浓缩成一组小而可组合、跨模型通用/skills 指令,专门修复 Claude Code、Codex 等编码智能体最常犯的四种失败模式。目前已在 GitHub 收获 17.8 万+ Stars,是近期最火的 AI 工程化开源项目之一。

    一、安装要求和过程

    环境要求

    • Node.js 18+(用于 skills.sh 安装器,npx 一行搞定)
    • 一个支持 skills 的编码智能体:Claude Code / Codex / 任意 Agent-Skills 标准 harness
    • 可选:GitHub 或 Linear 账号(/triage 技能需要对接 issue 追踪器)

    方式一 · 可改副本(推荐,想魔改就选它)

    npx skills@latest add mattpocock/skills

    选择要安装的技能与目标 agent,务必勾选 /setup-matt-pocock-skills;随后在 agent 中运行一次该命令完成仓库配置(选择 issue 追踪器、triage 标签、文档存放位置)。

    方式二 · Claude Code 原生插件(只读、常新、省心)

    /plugin marketplace add mattpocock/skills
    /plugin install mattpocock-skills@mattpocock

    装好后再跑一次 /setup-matt-pocock-skills。两种哲学:skills.sh 把技能复制进项目任你改;插件把它们作为只读束订阅更新

    二、核心功能

    整套技能围绕「软件工程基本功」展开,把对齐、TDD、架构、评审变成 Agent 拿来即用的小工具:

    四个失败模式对应技能

    • 对齐优先/grill-me/grill-with-docs——动手前先让 Agent 把你「拷问」一遍,并用 CONTEXT.md 沉淀项目共享语言,从根上消除需求歧义与啰嗦。
    • 测试驱动与诊断/tdd(红-绿-重构循环)、/diagnosing-bugs(复现→最小化→假设→插桩→修复→回归),让 Agent 真正跑起「代码运行反馈」闭环。
    • 架构纪律/to-spec/improve-codebase-architecture/codebase-design——对抗「一坨烂泥」,鼓励深模块、小接口。
    • 流程编排/implement/code-review/research/wayfinder/triage——把需求拆成可追溯的工单与规格,并以并行子智能体做「规范 + 标准」两轴评审。
    • 可组合、跨模型:所有技能与具体模型解耦,Claude Code / Codex / 其他 Agent 都能用;用户主动触发(User-invoked)与 Agent 自动调用(Model-invoked)两类技能分工清晰。

    User-invoked 与 Model-invoked 技能分类

    三、典型使用场景

    • 接手新项目前的「对齐会话」:用 /grill-with-docs 先和 Agent 把需求与领域术语聊透,生成 CONTEXT.md;后续每次对话都更省 token、更精准,变量/函数命名也跟着统一。
    • 写带测试的新功能:用 /implement 驱动 /tdd,先写失败测试再实现,最后 /code-review 把关——提交前质量稳,回归风险低。
    • 拯救腐烂的代码库:定期跑 /improve-codebase-architecture,扫描可深化的模块并生成可视化 HTML 报告,按图索骥重构,避免软件熵增失控。

    四、推荐理由

    这不是又一个「流程框架」(GSD/BMAD/Spec-Kit 那类会把过程控制权收走),而是把工程基本功变成 Agent 拿来即用的小工具——轻量、可改、不绑架你。最让我惊艳的是 CONTEXT.md 共享语言:用一句话把「section 里的 lesson 被 materialize」说清,代码命名、导航、token 消耗全跟着受益。两种安装方式恰好对应两种心态:想魔改就 fork 副本,想省心就装插件订阅更新。17.8 万 Stars、MIT 协议、几乎零上手成本,强烈建议所有用 Claude Code / Codex 的开发者装一套。

    五、下载地址

    许可:MIT | 语言:Shell/Markdown | Stars:178.9K+ | 创建于 2026-02,持续高频更新

  • 中国开源模型 Kimi 搅动美国 AI 圈:特朗普阵营自己先吵翻了

    这个周末,特朗普身边的 AI 人先内讧了。几位现任和前任顾问在公开场合互喷顶尖 AI 公司:刚卸任的 AI 与 crypto「沙皇」David Sacks 说 Anthropic 的模型「像被切了前额叶」「太觉醒」;五角大楼高官 Emil Michael 则骂 OpenAI 新设的战略主管是「头号村傻」。火药味这么冲,源头却是一个中国模型。

    导火索:一个免费的中国模型

    争论的焦点是 Kimi——中国公司 Moonshot 上周刚放出的开源模型,能力已经逼近 OpenAI 和 Anthropic 那些要花钱的对手,而且免费。问题就出在「免费」二字上:每冒出一个够强的中国开源模型,美国企业就少一分理由掏钱买 Anthropic 或 OpenAI。而眼下 AI 热情正撑着美国经济很大一块增长,这等于同时给了特朗普经济和政治两记闷棍,美股也被吓了一跳。

    卡内基国际和平基金会研究员 Anton Leicht 在 X 上写道:这对一个「真不想要更多经济坏消息」的政府来说,本身就是个威胁。

    中美 AI 竞争与开源模型
    中国开源模型的崛起,正把美国 AI 政策圈搅成一锅粥(图:MIT Technology Review)

    白宫转向「管起来」

    Sacks 已经离任,他「开源更好」的论调在政府里渐渐失势,取而代之的是一种新思路:既然模型强到能威胁国家安全,政府就得管住它们怎么用。这直接催生了白宫一套新审查流程——模型发布前先过安全评估。

    前特朗普顾问、如今在 OpenAI 的 Dean Ball 把这叫做「前沿 AI 的事实许可制」,还预测特朗普可能用软权力施压,让美国企业不敢碰 Kimi。Michael 当场反击,强调要走「民主程序,不是深层政府的小算盘」。有意思的是,吵来吵去,没人认真聊过 Kimi 到底是怎么变强的。

    • OpenAI 和 Anthropic 长期抱怨中国公司用「蒸馏」偷师,已请求政府出手;
    • 特朗普松口让英伟达多卖芯片给中国、换政府抽成,出口管制事实上松动;
    • 美方还指控存在芯片走私,Kimi 用的是什么算力至今成谜。

    更大的背景是,Anthropic 自家的 Mythos、Fable 模型上半年接连被扣上「国家安全风险」、遭出口管制,那场「五角大楼文化战争」反而帮了倒忙。法国政客说这是欧洲该醒来的警钟,智谱等中国开源阵营的股价随之飙升。模型越强、越免费,世界就越不情愿把命脉系在几家美国公司身上——这局棋,才刚开局。

  • 模型上下文协议 MCP 迎来大改:AI 接外部工具不再卡脖子

    如果你最近半年听人聊 AI 智能体,十有八九会撞见一个词:MCP。它的全称是 Model Context Protocol(模型上下文协议),可以理解为 AI 世界的「通用插头」。有了它,聊天机器人才能顺手翻你的日历、查你的数据库、调用内部工具,而不用工程师为每个连接单独焊一根管子。

    下周,这套协议就要迎来一次不小的升级。普通用户大概率无感,但它可能实实在在地改变整个生态的玩法。

    卡在哪:一台服务器要记住所有人

    这次改动的核心,是服务器处理「会话 ID」的方式。你可以把它想成服务员手里的桌号:Claude 这类客户端第一次连上服务器时会先「打招呼」,服务器回一个会话 ID,之后每次请求都带着它,服务器才知道「还是刚才那位」。

    Arcade 的 Nate Barbettini 打了个比方:真实部署里,你背后是一台负载均衡器,专门把请求丢给农场里任何一台空闲的机器,有时还跨区。可现在每台机器都得知道「另一台机器发过的那个会话 ID」——不是不能做,但极其折磨人,而且它是在和负载均衡器对着干,而不是配合它。

    换句话说,旧方案默认「一台服务器记住你」,可大公司早把流量摊到几十台互不相通的机器上了。光是为了搞清楚「谁是谁」,今天的 MCP 服务器就得多干一堆活。这也是为什么,尽管今年智能体被吹得火热,真敢上规模、自己兜售 MCP 集成的公司却没几个。

    AI 互操作协议 MCP 概念图
    MCP 要做的事,是给 AI 模型接外部工具铺一条标准通道(图:TechCrunch)

    新方案:把「状态」甩给客户端

    新版本在服务端改走更宽松的「无状态」路线,思路和绝大多数普通网站一样:服务器不再费劲记着你是谁,把状态交给客户端自己带着走。这样一来,整套系统更好维护,理论上大规模跑起来也更便宜。

    • 会话 ID 改为服务端无状态,服务器能轻松躲在负载均衡器后面;
    • 大规模部署的运维成本有望下降,更多公司敢做一手 MCP 集成;
    • 新规范自 5 月就出了候选版,7 月 28 日正式定稿。

    说到底,这件事挺提神:不是所有 AI 进展都在狂奔。模型训练一路加速,可模型脚下的那套基础设施,仍被标准委员会慢悠悠的共识拽着走。变化确实在发生,只是比想象中慢一点。

  • 研究发现:AI筛简历时,比人更容易给求职者贴标签

    下次投简历,可能先过一遍 AI 的法眼,才轮得到真人看一眼。但普林斯顿和芝加哥大学的研究者发现,这种 AI 招聘官未必比人类更公平——它甚至可能比人更爱给人贴标签。

    研究团队把 ChatGPT、Claude、Gemini 等模型拉进一场改编自心理学实验的模拟招聘游戏。模型扮演一个被市长雇来的顾问,要在 40 轮里为医生、律师、保育员、清洁工等 20 种岗位挑人,候选人来自四个虚构族群。诡异的地方在于:所有候选人的成功概率其实完全一样,模型并不知道这点。

    AI 在招聘决策中形成偏见的研究配图
    研究图示:AI 从少量经验里快速形成刻板印象(图源 MIT Technology Review)

    大模型真的非常急于从很少的数据里总结出规律,而这恰恰就是它们被优化出来的方向。—— Ryan Liu,普林斯顿博士生、论文共同作者

    模型很快开始学乖:一旦某个族群的某个人在被视为需要高温暖与能力的岗位上失败,它就整个族群都不考虑了,转而去安排清洁工这类它认为要求更低的活。在衡量隔离程度的量表上,人类参与者得分 0.84(2 分代表完全隔离),而模型高出约 65%,OpenAI 的推理模型 o3 直接冲到 1.83,几乎贴着上限。

    越聪明,越敢贴标签

    更反直觉的是,推理能力越强的模型,偏见反而越重。o3 和 DeepSeek 的 R1 在实验里表现得更决绝。原因藏在训练方式里:模型在数学、代码、科学题上被训练成从几个例子就敢下结论,这套本能帮它解逻辑题,也让它秒变贴标签高手。

    • 光喊要公平几乎没用——模型要么执行不了这条价值观,要么被多招对人的目标盖了过去。
    • 但给它加一笔多样化招聘奖金,偏见立刻大幅降低。
    • 当模型拿到更多关于个人的真实信息(年龄、学历),反而更少按族群划分人;给无关信息(发色、纹身形状)才会退回贴标签。

    这项研究七月发表在首尔的 ICML 上。它的现实分量在于:当企业开始用大模型筛简历、甚至主持面试,模型从经验里长出来的那些偏见,可能是人类从来没教过它的。我们担心的歧视,未必都来自训练数据里的旧世界。

  • 苹果认了:我们确实下架了那几款AI脱衣App

    旧金山市检察官 David Chiu 这周把一封信甩到了苹果和谷歌面前,要求两家把 13 款能生成「非自愿裸图」的 App 从应用商店里清掉。这类软件俗称 nudify——上传一张普通照片,AI 就能把它改成裸体图像,本质上就是对着真人做的深度伪造色情。

    苹果在 7 月 19 日给了正面回应。发言人 Adam Dema 向 The Verge 确认,他们已经下架了其中三款,并且正在走流程,把这几位开发者的账号从开发者计划里踢出去。谷歌那边动作更早,之前就暂停了信里点名的五款 Android 应用,理由是 Play 商店「不允许包含性内容的应用」。

    AI 脱衣应用下架与数字隐私保护
    平台开始对 AI 深伪色情内容动手(配图由 AI 生成)

    「我们一贯严格禁止那些用来生成、传播或消费色情内容的 App。nudify 这类应用违反我们的审核指南,我们主动拒绝过很多,也移除过很多——包括用户通过举报通道标记出来的那些。」

    这件事的抓手在加州法律。当地法规明确禁止销售性化的 AI 深伪内容,所以 Chiu 给两家公司扣的帽子是「协助和教唆」这类 App 的售卖。换句话说,平台不再只是提供场地的角色,而是要为架上摆了什么货负责。

    为什么是现在

    非自愿亲密图像从来不是新麻烦,但生成式 AI 把它变成了流水线生意。过去做一张假裸照要懂点 Photoshop,现在一个不懂技术的普通人花几分钟就能拿到成品。应用商店审核往往滞后于这类 App 的上架速度,等投诉堆积起来,伤害已经造成。

    • 被点名的 13 款 App 横跨 iOS 和 Android 两个生态,说明这不是某一家平台的问题。
    • 下架只是起点:开发者换个马甲重新上架的成本极低。
    • 真正的难点在于,平台怎么在审核环节就拦住这类应用,而不是等监管写信来催。

    苹果和谷歌这次的反应算快,但推动他们的不是技术自觉,而是一封带着法律后果的信。当 AI 生成的色情内容开始大规模针对真实个人,应用商店这个守门人角色,迟早会被监管一层层钉死。

  • 跑了 21 年的 Mechanical Turk 要关新用户了:AI 亲手埋了给它打工的人类

    这可能是 Amazon Mechanical Turk 最后的时光。平台官网最近贴出通知:2026 年 7 月 30 日起,这个运营了 21 年的众包服务将不再接收新客户。亚马逊说现有用户还能照常用,但”不打算再加新功能”——翻译一下,就是拔了氧气管,只维持心跳。

    一个以骗局命名的平台

    Mechanical Turk 2005 年上线,做的事情很简单:把机器还搞不定的零碎活儿——填验证码、判断一句话是夸还是骂、给图片打标签——发给全球打工人,按件付费。名字本身是个梗:18 世纪有台号称会下棋的”机械土耳其人”,其实箱子里藏着个真人棋手。亚马逊故意借这个名,因为它干的也是”用人类假装机器”的买卖,内部甚至造了个词叫”人工的人工智能”(artificial artificial intelligence)。

    “有人会在亚马逊决定,养着 MTurk 的服务器纯属浪费时间和资源,然后干脆拔掉电源。”——公告后一位 Reddit 用户的预言

    它其实是 AI 的”母乳”

    2018 年起,亚马逊把它塞进 SageMaker,变成训练神经网络的人工标注工厂。监督学习要人标例子,RLHF 要人比较两个回答哪个更好——这些活儿大量落在 MTurk 工人头上。SQuAD 这种经典 benchmark、无数心理学和行为经济学论文的被试数据,都从这来。说它是现代 AI 的承重墙,一点不夸张。

    Amazon Mechanical Turk 众包平台走向终结
    运营 21 年的众包平台 Mechanical Turk 进入维护模式(图源:TechCrunch / Getty Images)

    最讽刺的闭环

    2023 年一篇论文拆穿了一个套娃笑话:平台上 33% 到 46% 的工人,其实在用大语言模型替自己完成任务。也就是说,用来训练 AI 的”人类判断”,有一大批是 AI 自己生成的。一个靠”人工的人工智能”起家的平台,被它帮忙养大的 AI 反过来啃食,连名字都成了预言。

    • 工人时薪中位数曾低到约 2 美元,社保福利一概没有,长期被骂是数字血汗工厂
    • 机器人刷单、欺诈横行,社区早就在衰败,很多人说它”几年前就死了”
    • 亚马逊早有替代品 SageMaker Ground Truth,自动预标注加人工复核,更快更稳

    MTurk 没被立刻关掉,但它被挪进了 AWS 的”维护中”名单,等于判了死缓。对那些还靠它做标注、做评测的小团队来说,信号已经很清:廉价公开众包正在变成 legacy 基础设施。以后想要干净、可控、可追溯的训练数据,得走专业标注服务或自有审核流程,不能再指望从云里随手薅一批”人工”了。