分类: AI资讯

聚焦前沿人工智能动态,速览行业热点、技术突破、产业风向与实用 AI 干货,紧跟科技潮流,第一时间掌握 AI 最新趋势。

  • OpenAI 给小生意人递了把 AI 伙计:ChatGPT for Small Businesses 上线

    OpenAI 周二扔出一个叫 ChatGPT for Small Businesses 的计划,瞄准的是那种一个人顶五个岗位的小老板——既要当营销、又要做会计、还得管销售和战略。他们的想法很朴素:与其让这些人在工具面前抓瞎,不如把刚发布的 ChatGPT Work 智能体直接塞进他们的日常。

    不是卖工具,是手把手带

    这个计划里有一堆落地的东西:针对具体场景的线上 webinar、OpenAI Academy 牵头在各城市做的线下培训、可随时回看的图文指南,还有一票合作伙伴的插件集成。ChatGPT Work 是 7 月 9 日和 GPT-5.6 一起推出的,本质上是个住在 ChatGPT 里的智能体,能啃下分析预算、写营销物料、准备会议这类多步骤的活儿——前提是老板愿意给它读文件、接应用的权限。

    一个人、一支 lean 的团队、时间有限、资源匮乏,每个老板都被期待身兼数职。我们相信 AI 能改变这一点,它像放大器一样延伸个人的能力。 —— OpenAI 公告

    把活儿交给插件

    OpenAI 拉来了 Dropbox、Shopify、Intuit、Slack、Atlassian 这些老面孔做集成,把小企业常见的流程直接打包成可复用的智能体插件。去年那轮 AI Jam 里,78% 的参与者当天就搭出了能用的 AI 工作流,42% 的人每周省下五个小时以上——这组数字大概就是 OpenAI 现在想放大的。非营利机构 Community Solutions 的 Adam Ruege 就说,他现在每天用连着 Google Drive 和 Gmail 的参谋长智能体盯日程、备材料。

    • 线上 webinar 加城市线下培训加图文指南,手把手教
    • 打通 Dropbox、Shopify、Intuit、Slack 等常见工作流
    • 目标:把 9 亿免费用户里的更多小老板变成付费 AI 用户

    背后是一门生意账

    CFO Sarah Friar 一点没藏着对大企业客户的野心。OpenAI 现在估值 8520 亿美元、等着上市,可赚的仍比花的多;反观对手 Anthropic,二季度刚透出要首次盈利的信号。有意思的是,Friar 2024 年加入时说过,ChatGPT 每周 9 亿用户里 95% 一分钱不付,但来自企业的收入占比已经翻倍到大约 40%。把小老板们养成付费的 AI 重度用户,显然是这个缺口的解法之一。

    OpenAI ChatGPT for Small Businesses 计划
    OpenAI 用 ChatGPT Work 智能体帮小企业主把杂活交给 AI

  • Poolside 把 Laguna S 2.1 甩了出来:西方现在最能打的开放权重编程模型

    一家叫 Poolside 的旧金山小实验室,周二把新模型 Laguna S 2.1 端上了台面。这事有意思的地方不在于它有多大,而在于它小到能塞进一台桌面级机器,却把好几款数倍于己的闭源模型比了下去。

    九周造出来的小钢炮

    Laguna S 2.1 总参数 1180 亿,但每次推理只激活 80 亿,上下文窗口拉到了 100 万 token。Poolside 说它从 5 月 22 日才开始预训练,用 4096 张 H200,不到九周就发布了。在长周期编程基准 Terminal-Bench 2.1 上拿到 70.2%,比 1.6 万亿参数的 DeepSeek-V4-Pro-Max(64.0%)和 5500 亿参数的英伟达 Nemotron 3 Ultra(56.4%)都高;SWE-Bench Multilingual 上它拿到 78.5%,SWE-Bench Pro 公开集 59.4%。不到三个月,Poolside 从 M.1 一路连发三款模型,节奏快得不像一家小实验室。

    我们在这版模型上做的,不是堆更多智能,而是改进那些通向更强模型的行为:更多验证、更少想当然、不早早宣告胜利,也更持久。 —— Poolside 应用研究联合负责人 Pengming Wang

    把权重敞开给人看

    最关键的一点是,它是开放权重的,发布当天就挂在 Hugging Face 上,采用 OpenMDW-1.1 许可,连 BF16、FP8、INT4 各种量化版本都给了。模型小到能跑在单台英伟达 DGX Spark 上,也就是说企业可以把高频的编程智能体任务从按量计费的 API 搬到自己掌控的硬件里。

    • 1180 亿总参数、每次只激活 80 亿,上下文窗口 100 万 token
    • 开放权重,发布即上 Hugging Face,可本地跑在单台 DGX Spark
    • 西方近一年来首个有竞争力的开放权重编程模型

    西方的开源空窗

    Poolside 把这个发布摆进了一个更大的叙事里:过去一年,开发者明显转向能下载、能审查、能在自家基础设施上跑的开放权重系统,而这一类里能打的几乎都来自中国实验室——DeepSeek、通义千问、Kimi、智谱、MiniMax、腾讯混元。西方上一次放出开放权重,还是去年 8 月 OpenAI 的 gpt-oss-120b。联合 CEO Jason Warner 的话很直白:西方需要能信任、能运行、能在其上构建的开放权重模型。

    顺带一提,Poolside 把评测的完整轨迹也公开了,算是给开放二字加了点诚意。对政府、国防这类高度监管的客户来说,能自托管意味着敏感代码和数据不出自己的环境,这正是 Poolside 这门生意的根基。

    Poolside Laguna S 2.1 模型发布
    Poolside 发布的 Laguna S 2.1 开放权重编程模型

    📎 原文来源:Poolside 发布 Laguna S 2.1
  • 谷歌一口气发三款Gemini,但最想要的Pro版,又鸽了

    谷歌 DeepMind 在周二丢出了三款新模型:Gemini 3.6 Flash、3.5 Flash-Lite,以及 3.5 Flash Cyber。光看名字像是在挤牙膏,但这次的重心很明确——不跟你卷参数,卷的是便宜、快、稳。

    先说当家花旦 3.6 Flash。谷歌管它叫“主力模型”,在写代码、知识工作和多模态上都有提升,关键是把 token 消耗量砍了最多 17%,比上一代 3.5 Flash 更省钱。3.5 Flash-Lite 则是这个档位里最划算的一个,主打一个“量大管饱还便宜”。

    谷歌说,这一波发布的核心,是给那些“大规模部署 AI 智能体”的客户,交付效率、延迟和可靠性。

    有一款,专门给搞安全的

    三款里最特别的,是 3.5 Flash Cyber。它是为找漏洞、修漏洞专门微调出来的模型,价格也压得不算离谱。但谷歌给它加了道门:这款只面向政府和“可信合作伙伴”,走限量试点,不公开随便用。把安全能力收在门槛后面,既说明了它的分量,也透着谷歌对这类敏感能力的谨慎。

    真正的大招,又没来

    这次发布的看点,一半在发的东西,一半在没发的。所有人都在等的旗舰 Gemini Pro,这次依然缺席。上一次 Pro 更新还是今年二月。这几个月里,对手可没闲着:OpenAI 出了 GPT-5.5,正在铺 GPT-5.6;Anthropic 连发 Claude Opus 4.8、Claude Sonnet 5,还把前沿的 Fable 5 放开了一部分。发布节奏一对比,压力给到了谷歌这边。

    其实谷歌五月就吊过胃口,说 Pro 版“已经在内部用上了,下个月就推”。结果上周彭博社报出来:3.5 Pro 因为达不到内部性能目标,发布被往后拖了。产品负责人 Logan Kilpatrick 周二在 X 上说,3.5 Pro 正在和合作伙伴一起测,“希望很快落地”,顺带还透露团队已经启动了迄今最雄心勃勃的 Gemini 4 预训练。

    谷歌 Gemini 模型
    谷歌这次发的是 Flash 系列,旗舰 Pro 仍缺席(图源:TechCrunch)
    • Gemini 3.6 Flash:主力模型,token 用量最多降 17%,比 3.5 Flash 更便宜
    • Gemini 3.5 Flash-Lite:同档最省,适合高吞吐场景
    • Gemini 3.5 Flash Cyber:专攻漏洞挖掘与修复,仅限政府及可信伙伴试点
    • 旗舰 Pro 继续缺席,3.5 Pro 因内部目标未达成而延期

    所以这一轮,谷歌交出的答卷是“把便宜好用的 Flash 做更便宜更好用”,而真正的王牌 Pro,还在打磨。在对手疯狂刷版本的当下,这种“先发辅料、压着主菜”的节奏,到底是无奈还是策略,可能要等 3.5 Pro 真正落地那天才有答案。

  • 多西带着Buzz杀进协作赛道:人和AI智能体要在同一个群里干活了

    如果你最近觉得公司群聊越来越挤,那杰克·多西(Jack Dorsey)刚刚又给了你一个进群的理由。这位 Twitter 和 Block 的联合创始人,在周二甩出了一个叫 Buzz 的新应用——它瞄准的是 Slack 和 GitHub 的地盘,做的却是一件有点不一样的事:把人和他们手里的 AI 智能体,塞进同一个工作群聊里。

    Buzz 的样子,第一眼看上去就是 Slack 的近亲。左侧频道列表、右侧对话窗、再配上文件和应用,都属于标准配置。但多西在 X 上强调,Buzz 是“模型无关、去中心化、自我主权、开源”的。对一个越来越依赖 AI 智能体干活的公司来说,这一点挺关键——员工不用再在五六个平台之间反复横跳,Buzz 试图把编码、协作、项目管理都收拢到一个窗口里。

    多西在 X 上写道,Buzz 是“model-agnostic, decentralized, self-sovereign, and open source”——模型无关、去中心化、自我主权,并且开源。

    它背后的公司不是什么车库创业,而是多西自己的 Block。Square、Cash App、Afterpay、Tidal 都出自这家公司,Buzz 是它最新的一笔押注。从产品逻辑看,Buzz 想解决的是这样一个尴尬:现在团队用 AI 智能体做任务,但智能体往往散落在不同工具里,人和“数字同事”很难在同一个空间里配合。Buzz 的做法是直接让智能体进驻群聊,你 @ 它一下,它就能在同一个对话里帮你查代码、跑任务、整理信息。

    开源,是它最硬的底牌

    因为代码完全开放,开发者可以把 Buzz 改成最适合自己团队的样子。需要某个功能?自己写、自己部署,不用等厂商排期。这种“自托管”的思路,在企业场景里尤其吃香——数据留在自己手里,权限自己说了算。多西不是唯一盯上这块的人。Paradigm 的合伙人兼 CTO Georgios Konstantopoulos 前不久也开源了一个类似的东西叫 Centaur,他管它叫“虚拟员工”,能跑在 Slack 里,也能通过 API 调用。

    现在上车,可能还早了点

    不过 Buzz 自己也很诚实:它目前还是“早期阶段”。对已经在用 Slack 的成熟团队来说,现在把所有工作流搬过去并不明智。它的免费桌面端已经上线,覆盖 macOS、Windows 和 Linux,代码也传到了 GitHub 上,谁都能去翻、去改。

    Jack Dorsey 与 Buzz 群聊协作平台
    Buzz 把人和 AI 智能体放进同一个工作群聊(图源:TechCrunch)
    • 群聊形态,但原生内置 AI 智能体,而不是事后接个插件
    • 同一窗口里直接管理 GitHub 项目,少切几次屏
    • 开源可自托管,企业能自己把控安全和数据
    • 免费桌面端已上 macOS / Windows / Linux,代码在 GitHub

    说到底,Buzz 想回答的问题其实是:当 AI 智能体变成团队里“编外员工”,我们该把它们安排在哪儿?多西给出的答案是——别另起炉灶,直接进群。至于它能不能真的从 Slack 嘴里抢下肉,现在下结论还太早,但“人和智能体同群办公”这个方向,看起来已经不是会不会发生,而是什么时候普及的事了。

  • 一家叫Natural的初创公司,要替AI智能体重写支付轨道

    Natural 团队
    图片来源:TechCrunch / Natural

    AI 智能体现在已经能帮你找供应商、比价格、联系承运商把货安排妥当。可真到了付钱那一下,它还是得把人类叫过来点头。一家叫 Natural 的初创公司觉得这很别扭,干脆拿了两千万美元(约 3000 万美元)的 A 轮,想从最底层把这套为「人」设计的支付轨道重写一遍。

    问题出在「轨道」本身

    今天金融系统跑的那套基础设施——信用卡、ACH 转账、各种清算网络——每一环都默认有个「人」在授权。可智能体是按机器速度工作的,它没法等月底才出账单,更没办法为了一笔毫秒级的 API 调用去填一张信用卡。支付那一下成了整条自动化链路上唯一的断点。

    Natural 的创始人 Kahlil Lalji 是银行背景出身,本来发誓这辈子不再碰金融——上一家公司卖给了 Earnin,他自称被这个行业「烧」过。但他发现,智能体的进化速度已经甩开了现有的金融架构。「代理式支付会结构性地成为这个赛道里最重要的问题,这一点太明显了,我绕不开它。」

    「世界上发生的支付笔数,可能会比今天多出两三个、甚至四个数量级。」——Natural CEO Kahlil Lalji

    它想做什么,又面临谁

    Natural 把自己定位成一个「智能体编排层」:企业接上它的基础设施,就能让自己的 agent 自主付款、收款,甚至还和其他 agent 互相交易。这轮由 Forerunner 的 Kirsten Green 领投,总融资来到 4000 万美元。团队里已经挖来了曾在 Stripe、Ramp、Square 干过的老兵。

    • 直接对手是 Stripe——它也在抢着给 AI 智能体重做支付轨道,但大公司的转身总归更慢。
    • 其他玩家如 DCVC 支持的 Skyfire,押注用美元稳定币重构这套 backbone;Natural 两条路都接,传统银行支付和稳定币都做。
    • 它不只管「代付」,还打算重新设计纠纷处理这类支付里最麻烦的环节。

  • Hugging Face证实遭入侵:动手的,是个自主AI代理

    Hugging Face 遭入侵
    图片来源:TechCrunch / Anadolu Getty

    上周末,AI 圈里最常被开发者当成「家」的平台之一,被人钻了空子。Hugging Face 在周五承认,他们内部的一部分数据集和服务凭证在一次入侵里失了守。这家托管着海量开源模型和训练数据的平台,到现在还没完全确认有没有客户或合作方的数据被顺走。

    一次从数据流水线发起的入侵

    攻击的起点很不起眼,就藏在 Hugging Face 自己的数据处理管线里。一份被上传的恶意数据集,滥用了两个代码执行路径——一个能远程跑代码的加载器,一个藏在数据集配置里的模板注入——在处理节点上执行了恶意代码。接下来就是教科书式的横向移动:提权到节点级、收割云和集群的凭证、趁着周末悄悄摸进好几个内部集群。

    整场行动不是人敲键盘敲出来的。Hugging Face 把锅甩给了一个「外部 AI 代理」:它在一大堆活不过几分钟的沙盒里跑了几千次独立操作,命令与控制节点还自己迁移到了公共服务上。公司说这正吻合业界预测已久的「代理型攻击者」场景,不过当 TechCrunch 追问证据时,对方没马上拿出来。

    「这正吻合业界此前预测的『代理型攻击者』(agentic attacker)场景。自主、由 AI 驱动的攻击工具不再是理论。」

    讽刺的一幕:防御者被自家模型拦下了

    这次事件最耐人寻味的,是 Hugging Face 怎么把攻击查明白的。它自己的异常检测先发现了动静,然后调了一个 AI 模型去分析记录了整场攻击的服务器日志。有意思的是,它一开始用的是某家商业公司的「前沿模型」,结果分析请求被对方的安全护栏挡了回来——因为要提交大量真实的攻击命令和漏洞载荷,而托管模型的护栏分不清你是防御者还是攻击者。

    最后 Hugging Face 改用自己部署在本地的大模型做取证。这反而带来一个额外好处:敏感的攻击日志和里面提到的凭证,都不用再传到别人的服务器上。换句话说,攻击者被护栏彻底放开手脚,而防御者却被托管模型的护栏卡住了脖子。

    对用户意味着什么

    • 公开、面向用户的模型、数据集和 Spaces 暂未发现被篡改,软件供应链也已验证干净,算不幸中的万幸。
    • Hugging Face 已关闭入口漏洞、重建被感染的节点、轮换了受影响的密钥,并加严了集群准入控制。
    • 平台建议所有用户立刻轮换存在这里的访问令牌,并盯着账户里有没有可疑活动。

  • 腾讯混元放出 Hyra:一个会自己改自己的科研智能体

    腾讯混元 7 月 21 日放出了一个有点特别的东西——Hyra-1.0,全称 Hunyuan Research Agent。说它特别,是因为这是个能自己改进自己的科研智能体,专门冲着那些讲究性能的研究和工程任务去的。

    能自我进化的 AI 科研智能体概念图
    腾讯混元 Hyra:一个会递归自我改进的科研智能体(示意图)

    腾讯说,Hyra 不光能在公开基准上刷分,还能扎进真实的产品系统、AI 研发流水线,甚至自然科学研究和工业场景里边跑边学、边学边进化。这话如果成立,那它就不只是个做题家了。

    “AI 自己改自己”,这一年突然火了

    递归自我改进(RSI)和自动化研究,是过去一年 AI 圈最热闹的前沿话题之一。几个标志性的例子放在一起看就明白热度从哪来:

    • Google DeepMind 的 AlphaEvolve,只用 48 次标量乘法就算完了 4×4 复数矩阵相乘;
    • Together AI 让一群智能体在开放环境里协作,把 11 维 kissing number 的已知下界从 593 推到了 604;
    • Andrej Karpathy 的 autoresearch,用一套精简循环让模型训练研究能自己转起来。

    这些进化型系统一个接一个冒出来,共同点是智能体正在跳出封闭的基准测试,跑到开放的科学发现里去,有些地方已经开始超过人类了。Hyra 想接的就是这一棒。

    框架越轻,动作空间越大

    Hyra 的 Harness 设计遵循 The Bitter Lesson:框架尽量轻、尽量简单,把智能体的动作空间尽量放大。

    具体怎么工作?给它一个任务描述,Hyra 就开始跑一个循环:根据历史经验去探索、提出更好的解法。所谓历史经验,包括过去每个方案跑出来的日志、评估器给的反馈、还有方案本身的源代码。这个循环一直转,直到它自己觉得可以收工,或者预算烧完,最后把历史上最优的那版方案交出来。

    腾讯给了个直观的例子:只给 Hyra 一张 2D 参考图,让它推断物体的三维结构,还得生成一个能直接渲染的 3D 模型。评判用的是基于 rubrics 的 VLM judge,从轮廓、比例、结构完整性、材质、视觉相似度几个维度打分。Hyra 在多轮探索里不断改建模代码、调渲染参数,官方称最后的结果比用 Claude Code 的 goal 模式生成的更贴近参考图,也更符合人的审美。


    从 AlphaEvolve 到 Hyra,能看出一个方向:大厂都在把”让 AI 帮着做研究”往前推。区别在于,腾讯这次强调的是从公开基准走进真实产业场景,让智能体在自家的研发流水线和工业问题上真刀真枪地迭代。这条路能走多远,还得看后面拿出来的活儿。至少 Hyra-1.0 把话说到了这份上。

  • Netflix 5.87 亿美元买下本·阿弗莱克那家藏了三年的 AI 电影公司

    本·阿弗莱克手里那家藏了三年多的 AI 电影公司,到底值多少钱,现在有答案了。Netflix 上周五递交给美国证监会的一份 10-Q 文件里,写着 2026 年 3 月完成的一桩收购,总对价约 5.87 亿美元,全部是现金。文件没点名,但业内一眼就能看出,这说的正是阿弗莱克联合创办的 InterPositive。

    AI 电影后期制作概念图
    Netflix 用 5.87 亿美元买下 AI 电影后期技术公司 InterPositive(示意图)

    收购本身早在 3 月 5 日就官宣了,只是价格一直没公开。彭博当时的报道说,加上业绩对赌,这笔交易最高可能摸到 6 亿美元。RedBird Capital 是 InterPositive 早期的投资方之一。至于阿弗莱克个人到手多少,没人透露。

    它做的不是”凭空生成一部电影”

    很多人一听 AI 拍电影,脑子里冒出来的是输入一段文字、吐出一段视频。InterPositive 偏偏不走这条路。阿弗莱克反复强调,这不是 text-to-video,不是无中生有,而是帮剧组把后期那些又费钱又磨人的活儿做顺。调色、补光、加特效、重新构图、换背景、修穿帮、补缺的镜头——这些原本可能得把演员和剧组重新叫回片场重拍的环节,正是它的主场。

    “我知道自己对同行、对这个行业负有责任,要守住人类创造力的力量,以及创造力背后的人。做 InterPositive,就是想做这件事。”——本·阿弗莱克

    技术上有个挺关键的细节:它的模型只拿每个项目自己的每日拍摄毛片来训练,为的是保持这部片子内部的视觉逻辑和剪辑连贯,而不是拿一堆别人的作品去喂。阿弗莱克 2022 年低调创办这家公司,一支 16 人的工程师、研究员和创意人团队一直闷头干活,这次连人带技术全部并入 Netflix,他本人则出任高级顾问。

    Netflix 已经有 300 个项目在用 AI

    联席 CEO 泰德·萨兰多斯在本周财报电话会上说得很直接:目前大约 300 个片目已经在制作流程里用上了生成式 AI,绝大多数集中在后期,专门啃那些特别复杂的镜头和段落。他举了个例子——汤姆·汉克斯监制的纪录片《美国实验》,里面有 17 分钟是 AI 增强的画面。

    • 这 17 分钟的制作速度是过去的两倍;
    • 成本只有传统方式的一半;
    • 按萨兰多斯的说法,”用老办法根本做不出来的规模,现在做到了”。

    这笔钱花得也不算轻松。Netflix 二季度财报出来后股价一路下挫,周一又跌了 2%,报 67.60 美元,2026 年全年营收指引被收窄到 510 亿到 514 亿美元之间。在这种背景下砸半个多亿美元买一家 AI 公司,说明它对生成式 AV 改造制作流程这件事是真下注了。

    另一边,好莱坞对 AI 的警惕一点没松。阿弗莱克本人是演员工会 SAG-AFTRA 的成员,工会刚跟各大制片厂谈下新合同,专门给生成式 AI 划了红线,明确偏向保护真人表演。就在这个月,一个叫 Tilly Norwood 的 AI”演员”还接到了首个正式角色。让一位以”保住电影的人味儿”为口号的影人来牵头 AI 工具,Netflix 这步棋,多少有点想让创作圈更容易接受 AI 的意思。

  • 英伟达 Agent Toolkit:把 AI 智能体搬上桌面工作站

    英伟达最近给自家最强的台式工作站 DGX Station 塞进了一套新工具:Agent Toolkit。官方说,开发者只要三步、大概半小时,就能在本地把 AI 智能体跑起来——不用连云,模型和数据都留在你自己的机器上。

    本地 AI 智能体工作站概念图
    英伟达把智能体能力带到了桌面级工作站

    DGX Station 本身就不好惹,里面是一颗 GB300「Blackwell Ultra」GPU。Agent Toolkit 的价值,是把原来得靠云 GPU 集群才能玩转的复杂智能体,搬到了桌面端。

    借助 Omniverse 库,智能体可以在本地的安全运行时里调用工具与技能,完全不需要连接互联网。—— NVIDIA

    这一套到底装了什么

    它不是单个软件,而是一整个软件栈:

    • NemoClaw:开源的智能体蓝图,把模型、运行框架和 runtime 打包,方便团队照着自己的业务改
    • Nemotron 3 Ultra:一个 5500 亿参数的开放大模型,专为 DGX Station 优化,可以本地微调
    • Omniverse 库:把智能体接到物理仿真和 3D 工作流,机器人训练、自动驾驶仿真都能本地跑
    • OpenShell:开源的安全运行时,给智能体套上沙箱,按策略管住它碰什么工具、什么数据

    为什么是现在

    硬件底子是 GB300 超级芯片,最高 20 petaflops 的 FP4 算力、748GB 统一内存;网络用 ConnectX-8,带宽到 800GB/s,还能两台 DGX Station 并联扩容。NVIDIA 还拉上 Adobe、Blender、Unreal、Epic、Foundry、Canva 等伙伴做 MCP 接入,让智能体直接进到这些创作工具里干活。

    更关键的是战略转向。当资本市场开始计较 AI 的投资回报,英伟达把 Agent Toolkit 和 Omniverse 绑在一起,等于在说:我不只卖算力硬件,还想在你的工作站上长出一套软件生态。对怕数据出公司、又想快速迭代的企业来说,本地跑智能体确实少了一层顾虑。


  • 索尼再告 Udio:3 万首歌揭开的 AI 音乐版权战

    索尼音乐娱乐这周一在纽约法院又递了一纸诉状,被告是 AI 音乐生成器 Udio。和两年前三大唱片公司联手起诉 Udio、Suno 那场官司不同,这一回索尼把火力对准了一个很具体的数字:超过 3 万首歌。

    AI 音乐版权争议概念图
    AI 音乐生成器的训练数据版权问题持续升温

    从猫王的《Hound Dog》到碧昂丝的《Say My Name》,再到哈里·斯泰尔斯的《As It Was》,索尼列出的清单里既有上个世纪的经典,也有近年的热单。索尼在诉状里直言,这 3 万多首「只是 Udio 侵权作品中的一小部分」。

    索尼称,这份 3 万多首的清单「只是 Udio 所侵权作品中的一小部分」,背后还有更多未被点名的歌曲。

    这些歌是怎么被发现的

    有意思的是,这 3 万首并不是索尼一开始就掌握的。2024 年那场诉讼里,索尼和环球、华纳一起把 Udio 与 Suno 告上法庭。借着证据开示(discovery)的程序,索尼拿到了 Udio 的训练数据,再用一套「音频指纹」技术逐一比对,才揪出这批此前没被点名的歌曲。

    索尼原本想把 3 万多首直接加进原本的案子,但法官驳回了这个请求,原始诉讼的范围因此停留在 333 首。于是索尼换了个打法——单独再提一桩新诉讼。

    对 AI 音乐意味着什么

    这场拉锯把一个老问题又摆到台面:AI 音乐模型到底拿了多少版权音乐当养料。Udio、Suno 这类工具能照着风格生成听起来很「像」的歌,但训练数据是否合规,厂商一直说不清。

    • 2024 年索尼、环球、华纳联手起诉 Udio 与 Suno
    • 证据开示让索尼拿到 Udio 训练数据,音频指纹比对出 3 万首
    • 法官驳回追加请求,索尼改提独立新诉
    • 核心争议仍是 AI 音乐模型的训练数据授权