标签: AI

  • 多西带着Buzz杀进协作赛道:人和AI智能体要在同一个群里干活了

    如果你最近觉得公司群聊越来越挤,那杰克·多西(Jack Dorsey)刚刚又给了你一个进群的理由。这位 Twitter 和 Block 的联合创始人,在周二甩出了一个叫 Buzz 的新应用——它瞄准的是 Slack 和 GitHub 的地盘,做的却是一件有点不一样的事:把人和他们手里的 AI 智能体,塞进同一个工作群聊里。

    Buzz 的样子,第一眼看上去就是 Slack 的近亲。左侧频道列表、右侧对话窗、再配上文件和应用,都属于标准配置。但多西在 X 上强调,Buzz 是“模型无关、去中心化、自我主权、开源”的。对一个越来越依赖 AI 智能体干活的公司来说,这一点挺关键——员工不用再在五六个平台之间反复横跳,Buzz 试图把编码、协作、项目管理都收拢到一个窗口里。

    多西在 X 上写道,Buzz 是“model-agnostic, decentralized, self-sovereign, and open source”——模型无关、去中心化、自我主权,并且开源。

    它背后的公司不是什么车库创业,而是多西自己的 Block。Square、Cash App、Afterpay、Tidal 都出自这家公司,Buzz 是它最新的一笔押注。从产品逻辑看,Buzz 想解决的是这样一个尴尬:现在团队用 AI 智能体做任务,但智能体往往散落在不同工具里,人和“数字同事”很难在同一个空间里配合。Buzz 的做法是直接让智能体进驻群聊,你 @ 它一下,它就能在同一个对话里帮你查代码、跑任务、整理信息。

    开源,是它最硬的底牌

    因为代码完全开放,开发者可以把 Buzz 改成最适合自己团队的样子。需要某个功能?自己写、自己部署,不用等厂商排期。这种“自托管”的思路,在企业场景里尤其吃香——数据留在自己手里,权限自己说了算。多西不是唯一盯上这块的人。Paradigm 的合伙人兼 CTO Georgios Konstantopoulos 前不久也开源了一个类似的东西叫 Centaur,他管它叫“虚拟员工”,能跑在 Slack 里,也能通过 API 调用。

    现在上车,可能还早了点

    不过 Buzz 自己也很诚实:它目前还是“早期阶段”。对已经在用 Slack 的成熟团队来说,现在把所有工作流搬过去并不明智。它的免费桌面端已经上线,覆盖 macOS、Windows 和 Linux,代码也传到了 GitHub 上,谁都能去翻、去改。

    Jack Dorsey 与 Buzz 群聊协作平台
    Buzz 把人和 AI 智能体放进同一个工作群聊(图源:TechCrunch)
    • 群聊形态,但原生内置 AI 智能体,而不是事后接个插件
    • 同一窗口里直接管理 GitHub 项目,少切几次屏
    • 开源可自托管,企业能自己把控安全和数据
    • 免费桌面端已上 macOS / Windows / Linux,代码在 GitHub

    说到底,Buzz 想回答的问题其实是:当 AI 智能体变成团队里“编外员工”,我们该把它们安排在哪儿?多西给出的答案是——别另起炉灶,直接进群。至于它能不能真的从 Slack 嘴里抢下肉,现在下结论还太早,但“人和智能体同群办公”这个方向,看起来已经不是会不会发生,而是什么时候普及的事了。

  • Wigolo:给 AI 编程智能体装上本地优先的「上网」引擎(开源 MCP)

    Wigolo:给 AI 编程智能体装上本地优先的「上网」引擎(开源 MCP)

    Wigolo 演示

    在 Claude Code、Cursor、Codex 这类编码智能体大行其道的今天,一个尴尬的现实是:它们很会写代码,却「看不见」互联网。想查一份报错、一份 API 文档、一个竞品定价,往往得开发者自己复制粘贴喂给模型。Wigolo 要做的,就是给 AI 智能体装上一双「眼睛和手」——一个本地优先、无需 API Key、按查询 0 计费的统一「上网」引擎。

    🦉 项目简介

    WigoloKnockOutEZ 开源的 AI 编程智能体本地优先「上网」引擎:以 MCP 服务器(或 REST / SDK)的形式运行在智能体身边,统一提供 搜索、抓取、爬取、提取、缓存、相似发现、研究、自主收集 等全套 Web 能力。核心理念是 no keys, no cloud, no metered bill——核心工具无需任何 API Key,所有数据留在本地 ~/.wigolo/,用得越多账单也不会涨。

    💻 安装要求与过程

    环境要求:Node.js ≥ 20,约 1.5 GB 空闲磁盘(首次运行会下载浏览器引擎等本地组件)。核心搜索 / 抓取 / 爬取无需任何外部 Key 即可使用;如需 researchagent 等高级研究能力,可选择性配置一个 LLM Provider(如 Gemini)。

    快速安装:

    # 初始化本地引擎(任意系统)
    npx wigolo init
    
    # 初始化并一键接入日常 agent(如 Claude Code + Cursor)
    npx wigolo init --agents=claude-code,cursor
    
    # 以 Docker 方式作为 stdio MCP 服务运行
    docker run -i --rm -v wigolo-data:/data ghcr.io/knockoutez/wigolo
    
    # 在自托管 box 上暴露 HTTP 服务(默认 127.0.0.1:3333)
    wigolo serve
    
    # 在你的应用里用 SDK 嵌入
    npm install wigolo-sdk     # TypeScript
    pip install wigolo         # Python

    常用运维命令:npx wigolo verify(健康检测)、npx wigolo warmup --all(重下引擎)、npx wigolo docto --fix(修复环境)。

    ⚙️ 核心功能

    Wigolo 核心工具全景

    1. 🔍 多引擎搜索 search:内置 18 个直连适配器,ML 重排 + 可解释评分,让智能体拿到「为什么是这条结果」。
    2. 🔗 抓取 & 爬取 fetch / crawl:分层路由获取单页并清洗为 markdown(含 PDF / 鉴权页处理);BFS / DFS / sitemap 多页爬取并自带限流保护。
    3. 🧩 提取 & 缓存 & 相似 extract / cache / find_similar:从页面抽取表格 / JSON-LD / Schema 等结构化数据;本地缓存已见内容,二次查询毫秒即回;关键词 + 语义 + 实时发现相似页面。
    4. 🤖 自主研究 research / agent:把一个问题自动分解成子查询、扇出检索、综合成报告;agent 工具则跑 search→fetch→extract→synthesize 的自主收集循环。
    5. 🔔 变更追踪 diff / watch:检测页面变化并推送 webhook,把「定时盯网页」变成可编排的事件。

    🚀 典型使用场景

    • 场景一 · 编码时实时联网:在 Claude Code / Cursor 里改代码时,智能体直接调用 search / fetch 查文档、查报错、查第三方 API,开发者不再手动复制粘贴;所有命中缓存在 ~/.wigolo/,隐私不出本机。
    • 场景二 · 自托管 Agent 的「联网大脑」:在自托管服务器上 wigolo serve 暴露 REST / MCP 端点,LangChain、CrewAI、n8n 等编排框架或任意 MCP client 统一调用,把分散在各处的抓取逻辑收敛成一个服务。
    • 场景三 · 持续竞品 / 文档监控:用 watch 盯住竞品定价页或文档页,diff 出变化并推 webhook 到飞书 / Slack / 自有系统,第一时间感知变更。

    💡 推荐理由

    我特别看好 Wigolo 的一点,是它真正把「本地优先」做到了极致:零 API Key、零按量账单,直接戳中「想让 agent 上网,却要为每家搜索引擎单独接 key、还要担心账单爆掉」的痛点。统一的 MCP 接口对 Claude Code / Cursor / Codex / Gemini CLI / VS Code / Zed 通吃,接入几乎零心智负担;数据默认留在本地,对重视隐私的开发者很友好;AGPL-3.0 开源、可完全自托管。如果你正想给自己的 coding agent 装上一双「眼睛和手」,Wigolo 是目前最省心的一站式方案。

    Wigolo 四种接入方式与差异化

    🔗 下载地址

  • 一家叫Natural的初创公司,要替AI智能体重写支付轨道

    Natural 团队
    图片来源:TechCrunch / Natural

    AI 智能体现在已经能帮你找供应商、比价格、联系承运商把货安排妥当。可真到了付钱那一下,它还是得把人类叫过来点头。一家叫 Natural 的初创公司觉得这很别扭,干脆拿了两千万美元(约 3000 万美元)的 A 轮,想从最底层把这套为「人」设计的支付轨道重写一遍。

    问题出在「轨道」本身

    今天金融系统跑的那套基础设施——信用卡、ACH 转账、各种清算网络——每一环都默认有个「人」在授权。可智能体是按机器速度工作的,它没法等月底才出账单,更没办法为了一笔毫秒级的 API 调用去填一张信用卡。支付那一下成了整条自动化链路上唯一的断点。

    Natural 的创始人 Kahlil Lalji 是银行背景出身,本来发誓这辈子不再碰金融——上一家公司卖给了 Earnin,他自称被这个行业「烧」过。但他发现,智能体的进化速度已经甩开了现有的金融架构。「代理式支付会结构性地成为这个赛道里最重要的问题,这一点太明显了,我绕不开它。」

    「世界上发生的支付笔数,可能会比今天多出两三个、甚至四个数量级。」——Natural CEO Kahlil Lalji

    它想做什么,又面临谁

    Natural 把自己定位成一个「智能体编排层」:企业接上它的基础设施,就能让自己的 agent 自主付款、收款,甚至还和其他 agent 互相交易。这轮由 Forerunner 的 Kirsten Green 领投,总融资来到 4000 万美元。团队里已经挖来了曾在 Stripe、Ramp、Square 干过的老兵。

    • 直接对手是 Stripe——它也在抢着给 AI 智能体重做支付轨道,但大公司的转身总归更慢。
    • 其他玩家如 DCVC 支持的 Skyfire,押注用美元稳定币重构这套 backbone;Natural 两条路都接,传统银行支付和稳定币都做。
    • 它不只管「代付」,还打算重新设计纠纷处理这类支付里最麻烦的环节。

  • Hugging Face证实遭入侵:动手的,是个自主AI代理

    Hugging Face 遭入侵
    图片来源:TechCrunch / Anadolu Getty

    上周末,AI 圈里最常被开发者当成「家」的平台之一,被人钻了空子。Hugging Face 在周五承认,他们内部的一部分数据集和服务凭证在一次入侵里失了守。这家托管着海量开源模型和训练数据的平台,到现在还没完全确认有没有客户或合作方的数据被顺走。

    一次从数据流水线发起的入侵

    攻击的起点很不起眼,就藏在 Hugging Face 自己的数据处理管线里。一份被上传的恶意数据集,滥用了两个代码执行路径——一个能远程跑代码的加载器,一个藏在数据集配置里的模板注入——在处理节点上执行了恶意代码。接下来就是教科书式的横向移动:提权到节点级、收割云和集群的凭证、趁着周末悄悄摸进好几个内部集群。

    整场行动不是人敲键盘敲出来的。Hugging Face 把锅甩给了一个「外部 AI 代理」:它在一大堆活不过几分钟的沙盒里跑了几千次独立操作,命令与控制节点还自己迁移到了公共服务上。公司说这正吻合业界预测已久的「代理型攻击者」场景,不过当 TechCrunch 追问证据时,对方没马上拿出来。

    「这正吻合业界此前预测的『代理型攻击者』(agentic attacker)场景。自主、由 AI 驱动的攻击工具不再是理论。」

    讽刺的一幕:防御者被自家模型拦下了

    这次事件最耐人寻味的,是 Hugging Face 怎么把攻击查明白的。它自己的异常检测先发现了动静,然后调了一个 AI 模型去分析记录了整场攻击的服务器日志。有意思的是,它一开始用的是某家商业公司的「前沿模型」,结果分析请求被对方的安全护栏挡了回来——因为要提交大量真实的攻击命令和漏洞载荷,而托管模型的护栏分不清你是防御者还是攻击者。

    最后 Hugging Face 改用自己部署在本地的大模型做取证。这反而带来一个额外好处:敏感的攻击日志和里面提到的凭证,都不用再传到别人的服务器上。换句话说,攻击者被护栏彻底放开手脚,而防御者却被托管模型的护栏卡住了脖子。

    对用户意味着什么

    • 公开、面向用户的模型、数据集和 Spaces 暂未发现被篡改,软件供应链也已验证干净,算不幸中的万幸。
    • Hugging Face 已关闭入口漏洞、重建被感染的节点、轮换了受影响的密钥,并加严了集群准入控制。
    • 平台建议所有用户立刻轮换存在这里的访问令牌,并盯着账户里有没有可疑活动。

  • 腾讯混元放出 Hyra:一个会自己改自己的科研智能体

    腾讯混元 7 月 21 日放出了一个有点特别的东西——Hyra-1.0,全称 Hunyuan Research Agent。说它特别,是因为这是个能自己改进自己的科研智能体,专门冲着那些讲究性能的研究和工程任务去的。

    能自我进化的 AI 科研智能体概念图
    腾讯混元 Hyra:一个会递归自我改进的科研智能体(示意图)

    腾讯说,Hyra 不光能在公开基准上刷分,还能扎进真实的产品系统、AI 研发流水线,甚至自然科学研究和工业场景里边跑边学、边学边进化。这话如果成立,那它就不只是个做题家了。

    “AI 自己改自己”,这一年突然火了

    递归自我改进(RSI)和自动化研究,是过去一年 AI 圈最热闹的前沿话题之一。几个标志性的例子放在一起看就明白热度从哪来:

    • Google DeepMind 的 AlphaEvolve,只用 48 次标量乘法就算完了 4×4 复数矩阵相乘;
    • Together AI 让一群智能体在开放环境里协作,把 11 维 kissing number 的已知下界从 593 推到了 604;
    • Andrej Karpathy 的 autoresearch,用一套精简循环让模型训练研究能自己转起来。

    这些进化型系统一个接一个冒出来,共同点是智能体正在跳出封闭的基准测试,跑到开放的科学发现里去,有些地方已经开始超过人类了。Hyra 想接的就是这一棒。

    框架越轻,动作空间越大

    Hyra 的 Harness 设计遵循 The Bitter Lesson:框架尽量轻、尽量简单,把智能体的动作空间尽量放大。

    具体怎么工作?给它一个任务描述,Hyra 就开始跑一个循环:根据历史经验去探索、提出更好的解法。所谓历史经验,包括过去每个方案跑出来的日志、评估器给的反馈、还有方案本身的源代码。这个循环一直转,直到它自己觉得可以收工,或者预算烧完,最后把历史上最优的那版方案交出来。

    腾讯给了个直观的例子:只给 Hyra 一张 2D 参考图,让它推断物体的三维结构,还得生成一个能直接渲染的 3D 模型。评判用的是基于 rubrics 的 VLM judge,从轮廓、比例、结构完整性、材质、视觉相似度几个维度打分。Hyra 在多轮探索里不断改建模代码、调渲染参数,官方称最后的结果比用 Claude Code 的 goal 模式生成的更贴近参考图,也更符合人的审美。


    从 AlphaEvolve 到 Hyra,能看出一个方向:大厂都在把”让 AI 帮着做研究”往前推。区别在于,腾讯这次强调的是从公开基准走进真实产业场景,让智能体在自家的研发流水线和工业问题上真刀真枪地迭代。这条路能走多远,还得看后面拿出来的活儿。至少 Hyra-1.0 把话说到了这份上。

  • Netflix 5.87 亿美元买下本·阿弗莱克那家藏了三年的 AI 电影公司

    本·阿弗莱克手里那家藏了三年多的 AI 电影公司,到底值多少钱,现在有答案了。Netflix 上周五递交给美国证监会的一份 10-Q 文件里,写着 2026 年 3 月完成的一桩收购,总对价约 5.87 亿美元,全部是现金。文件没点名,但业内一眼就能看出,这说的正是阿弗莱克联合创办的 InterPositive。

    AI 电影后期制作概念图
    Netflix 用 5.87 亿美元买下 AI 电影后期技术公司 InterPositive(示意图)

    收购本身早在 3 月 5 日就官宣了,只是价格一直没公开。彭博当时的报道说,加上业绩对赌,这笔交易最高可能摸到 6 亿美元。RedBird Capital 是 InterPositive 早期的投资方之一。至于阿弗莱克个人到手多少,没人透露。

    它做的不是”凭空生成一部电影”

    很多人一听 AI 拍电影,脑子里冒出来的是输入一段文字、吐出一段视频。InterPositive 偏偏不走这条路。阿弗莱克反复强调,这不是 text-to-video,不是无中生有,而是帮剧组把后期那些又费钱又磨人的活儿做顺。调色、补光、加特效、重新构图、换背景、修穿帮、补缺的镜头——这些原本可能得把演员和剧组重新叫回片场重拍的环节,正是它的主场。

    “我知道自己对同行、对这个行业负有责任,要守住人类创造力的力量,以及创造力背后的人。做 InterPositive,就是想做这件事。”——本·阿弗莱克

    技术上有个挺关键的细节:它的模型只拿每个项目自己的每日拍摄毛片来训练,为的是保持这部片子内部的视觉逻辑和剪辑连贯,而不是拿一堆别人的作品去喂。阿弗莱克 2022 年低调创办这家公司,一支 16 人的工程师、研究员和创意人团队一直闷头干活,这次连人带技术全部并入 Netflix,他本人则出任高级顾问。

    Netflix 已经有 300 个项目在用 AI

    联席 CEO 泰德·萨兰多斯在本周财报电话会上说得很直接:目前大约 300 个片目已经在制作流程里用上了生成式 AI,绝大多数集中在后期,专门啃那些特别复杂的镜头和段落。他举了个例子——汤姆·汉克斯监制的纪录片《美国实验》,里面有 17 分钟是 AI 增强的画面。

    • 这 17 分钟的制作速度是过去的两倍;
    • 成本只有传统方式的一半;
    • 按萨兰多斯的说法,”用老办法根本做不出来的规模,现在做到了”。

    这笔钱花得也不算轻松。Netflix 二季度财报出来后股价一路下挫,周一又跌了 2%,报 67.60 美元,2026 年全年营收指引被收窄到 510 亿到 514 亿美元之间。在这种背景下砸半个多亿美元买一家 AI 公司,说明它对生成式 AV 改造制作流程这件事是真下注了。

    另一边,好莱坞对 AI 的警惕一点没松。阿弗莱克本人是演员工会 SAG-AFTRA 的成员,工会刚跟各大制片厂谈下新合同,专门给生成式 AI 划了红线,明确偏向保护真人表演。就在这个月,一个叫 Tilly Norwood 的 AI”演员”还接到了首个正式角色。让一位以”保住电影的人味儿”为口号的影人来牵头 AI 工具,Netflix 这步棋,多少有点想让创作圈更容易接受 AI 的意思。

  • Kimi Code CLI:终端里的下一代 AI 编程智能体(4.3K★,月之暗面开源)

    Kimi Code CLI:终端里的下一代 AI 编程智能体(4.3K★,月之暗面开源)

    Kimi Code CLI 封面

    Kimi Code CLI 是月之暗面(MoonshotAI)开源的终端 AI 编程智能体——它能在命令行里读改代码、执行 shell 命令、搜索文件、抓取网页,并依据反馈自主决定下一步;开箱即用 Kimi 大模型,也可配置接入其它兼容模型。

    一、项目简介

    一个跑在终端里的”AI 同事”。Kimi Code CLI 把代码读写、命令执行、文件检索、网页抓取与多步自主规划统一进一个轻量 TUI,口号是 “The Starting Point for Next-Gen Agents”(下一代智能体的起点)。它脱胎于此前广受关注的 Kimi CLI,把运行时收敛为单文件二进制,启动几乎无感,对 Kimi 大模型用户尤其友好。

    二、安装要求和过程

    环境要求

    • 普通用户无需 Node.js:官方脚本一条命令装好单文件二进制,无 PATH 烦恼、无全局模块冲突;
    • Windows 需先装 Git for Windows:Kimi Code CLI 用内置 Git Bash 作为 shell 环境;若 Git 装在自定义路径,设置环境变量 KIMI_SHELL_PATH 指向 bash.exe 绝对路径;
    • 账号:首次使用需 Kimi 账号(OAuth)或 Moonshot AI 开放平台 API Key;
    • 从源码开发需 Node.js ≥ 24.15.0 + pnpm 10.33.0。

    快速安装

    macOS / Linux:

    curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash

    Windows(PowerShell):

    irm https://code.kimi.com/kimi-code/install.ps1 | iex

    快速开始

    cd your-project
    kimi            # 启动交互式 TUI
    kimi --version  # 验证安装

    首次在会话里执行 /login,选择 Kimi Code OAuth 或 API Key 登录,然后试着让它”看看这个项目,解释下主要目录“。

    三、核心功能

    Kimi Code CLI 核心能力

    1. 单文件分发:一条命令安装,无 Node.js、无 PATH 困扰、无全局模块冲突。
    2. 毫秒级启动:TUI 毫秒就绪,开启会话毫无负担,长时间 Agent 会话也不卡。
    3. 视频输入:把录屏 / 演示片段直接丢进聊天,Agent 逐帧”看懂”画面——把参考片转成 LUT、长视频剪成短片、屏幕录屏变成可运行代码。
    4. AI 原生 MCP:用 /mcp-config 对话式增删与鉴权 Model Context Protocol 服务器,免手改 JSON。
    5. 子智能体并行:内置 coder / explore / plan 子智能体在隔离上下文并行干活,主线对话保持清爽。
    6. ACP 编辑器集成kimi acp 接入 Zed、JetBrains 等任意 Agent Client Protocol 客户端,IDE 里直接驱动。

    四、典型使用场景

    Kimi Code CLI 工作流

    • 日常终端编程搭子:在任意项目目录敲 kimi,让它读代码、跑命令、搜文件、抓网页并自规划下一步,省去来回切窗口。
    • IDE 里的 Agent:在 Zed / JetBrains 配置 kimi acp,用熟悉的编辑器驱动 Agent,一次登录处处可用,开发流不断档。
    • 视频驱动开发:把产品录屏或参考片段丢给 Agent,让它”看懂”后落地为可运行代码或素材(例如把一段参考片转成调色 LUT)。

    五、推荐理由

    Kimi Code CLI 给我最大的惊喜是”“。作为 Kimi CLI 的演进版,它把运行时收敛成单文件二进制,启动几乎无感,TUI 也比不少同类更耐看;视频输入/mcp-config 对话式配置是真正能提升日常效率的巧思,而不是噱头。如果你已经在用 Kimi 大模型、又想要一个不折腾环境、能直接塞进终端和 IDE 的编码 Agent,它非常值得一试。MIT 协议、社区活跃(4.3K+ Stars、当日仍在高频更新),长期主义玩家可以放心上车。

    六、下载地址

  • 英伟达 Agent Toolkit:把 AI 智能体搬上桌面工作站

    英伟达最近给自家最强的台式工作站 DGX Station 塞进了一套新工具:Agent Toolkit。官方说,开发者只要三步、大概半小时,就能在本地把 AI 智能体跑起来——不用连云,模型和数据都留在你自己的机器上。

    本地 AI 智能体工作站概念图
    英伟达把智能体能力带到了桌面级工作站

    DGX Station 本身就不好惹,里面是一颗 GB300「Blackwell Ultra」GPU。Agent Toolkit 的价值,是把原来得靠云 GPU 集群才能玩转的复杂智能体,搬到了桌面端。

    借助 Omniverse 库,智能体可以在本地的安全运行时里调用工具与技能,完全不需要连接互联网。—— NVIDIA

    这一套到底装了什么

    它不是单个软件,而是一整个软件栈:

    • NemoClaw:开源的智能体蓝图,把模型、运行框架和 runtime 打包,方便团队照着自己的业务改
    • Nemotron 3 Ultra:一个 5500 亿参数的开放大模型,专为 DGX Station 优化,可以本地微调
    • Omniverse 库:把智能体接到物理仿真和 3D 工作流,机器人训练、自动驾驶仿真都能本地跑
    • OpenShell:开源的安全运行时,给智能体套上沙箱,按策略管住它碰什么工具、什么数据

    为什么是现在

    硬件底子是 GB300 超级芯片,最高 20 petaflops 的 FP4 算力、748GB 统一内存;网络用 ConnectX-8,带宽到 800GB/s,还能两台 DGX Station 并联扩容。NVIDIA 还拉上 Adobe、Blender、Unreal、Epic、Foundry、Canva 等伙伴做 MCP 接入,让智能体直接进到这些创作工具里干活。

    更关键的是战略转向。当资本市场开始计较 AI 的投资回报,英伟达把 Agent Toolkit 和 Omniverse 绑在一起,等于在说:我不只卖算力硬件,还想在你的工作站上长出一套软件生态。对怕数据出公司、又想快速迭代的企业来说,本地跑智能体确实少了一层顾虑。


  • 索尼再告 Udio:3 万首歌揭开的 AI 音乐版权战

    索尼音乐娱乐这周一在纽约法院又递了一纸诉状,被告是 AI 音乐生成器 Udio。和两年前三大唱片公司联手起诉 Udio、Suno 那场官司不同,这一回索尼把火力对准了一个很具体的数字:超过 3 万首歌。

    AI 音乐版权争议概念图
    AI 音乐生成器的训练数据版权问题持续升温

    从猫王的《Hound Dog》到碧昂丝的《Say My Name》,再到哈里·斯泰尔斯的《As It Was》,索尼列出的清单里既有上个世纪的经典,也有近年的热单。索尼在诉状里直言,这 3 万多首「只是 Udio 侵权作品中的一小部分」。

    索尼称,这份 3 万多首的清单「只是 Udio 所侵权作品中的一小部分」,背后还有更多未被点名的歌曲。

    这些歌是怎么被发现的

    有意思的是,这 3 万首并不是索尼一开始就掌握的。2024 年那场诉讼里,索尼和环球、华纳一起把 Udio 与 Suno 告上法庭。借着证据开示(discovery)的程序,索尼拿到了 Udio 的训练数据,再用一套「音频指纹」技术逐一比对,才揪出这批此前没被点名的歌曲。

    索尼原本想把 3 万多首直接加进原本的案子,但法官驳回了这个请求,原始诉讼的范围因此停留在 333 首。于是索尼换了个打法——单独再提一桩新诉讼。

    对 AI 音乐意味着什么

    这场拉锯把一个老问题又摆到台面:AI 音乐模型到底拿了多少版权音乐当养料。Udio、Suno 这类工具能照着风格生成听起来很「像」的歌,但训练数据是否合规,厂商一直说不清。

    • 2024 年索尼、环球、华纳联手起诉 Udio 与 Suno
    • 证据开示让索尼拿到 Udio 训练数据,音频指纹比对出 3 万首
    • 法官驳回追加请求,索尼改提独立新诉
    • 核心争议仍是 AI 音乐模型的训练数据授权

  • Browser Use:让 AI 像人一样操作浏览器的开源智能体(10.5万+ Star)

    Browser Use:让 AI 像人一样操作浏览器的开源智能体(10.5万+ Star)

    Browser Use 自动填写表单演示

    Browser Use 是一个让 AI 像人一样操作浏览器的开源智能体框架——你用自然语言描述任务,它便自动打开网页、点击按钮、输入文字、填写表单,一站式完成多步骤的网页操作。

    一、项目简介

    🌐 Make websites accessible for AI agents. Automate tasks online with ease.

    Browser Use 把”浏览器”变成 AI Agent 可直接操控的环境。它目前拥有 10.5 万+ Star(Python 编写,MIT 许可),并在 Odyssey 长程网页任务榜上以 87.4% 的平均成功率排名第一,超越了 OpenAI、Anthropic、Google、Microsoft 各自的 computer-use 方案。它既是给现有编码 Agent(Claude Code / Codex / Cursor 等)即插即用的”浏览器技能”,也是可规模化调用的 Python 库。

    二、安装要求与过程

    环境要求:

    • Python ≥ 3.11(官方推荐 3.12,可用 uv 管理)
    • 本地无需额外安装 Chromium,Browser Use 会按需驱动 Playwright 浏览器
    • 一个 LLM API Key(Browser Use 云、OpenAI、Anthropic、Google,或本地 Ollama 模型均可)

    快速安装:

    1. 安装库:
      pip install browser-use  (或 uv add browser-use
    2. .env 中配置 Key:
      BROWSER_USE_API_KEY=your-key  或  ANTHROPIC_API_KEY=... / GOOGLE_API_KEY=...
    3. 运行你的第一个 Agent:
    import asyncio
    from browser_use import Agent, ChatBrowserUse
    
    async def main():
        agent = Agent(
            task="Find the number of stars of the browser-use repo",
            llm=ChatBrowserUse(model="openai/gpt-5.5"),
        )
        history = await agent.run()
    
    asyncio.run(main())

    若你已在使用 Claude Code / Codex / Cursor 等编码 Agent,只需让 Agent 执行一次 browser-use skill install,即可把浏览器能力挂载到现有工作流中,无需自己写代码。

    三、核心功能

    • 自然语言驱动浏览器:自动打开页面、点击、输入、填表、翻页,把”多步骤网页操作”压缩成一句话指令。
    • 双形态接入:CLI 模式配合已有 Agent 即装即用;Python 库模式支持定时、并行、嵌入自有产品,细粒度控制浏览器。
    • 多模型统一接入:ChatBrowserUseprovider/model 前缀即可切换 OpenAI / Anthropic / Google,或走本地 Ollama 模型,一个 Key 通吃。
    • 强扩展能力:支持自定义 Tools、MCP 协议,云端版更提供 1000+ 集成(Gmail、Slack、Notion 等)与持久化记忆。
    • SOTA 级表现:Odyssey 200 项长程网页任务榜第一(87.4%),官方基准在 100 个真实任务上开源可复现。

    四、典型使用场景

    1. 自动填表与办事
    让 Agent 带着你的简历信息自动填写并投递职位申请、注册账号、提交各类在线表单。

    2. 网页数据采集
    从任意网站抽取结构化数据并导出为 CSV,例如”抓取我关注者的资料并整理成表格”。

    Browser Use 网站 QA 自动化演示

    3. 网站 QA 自动化
    对本地站点做可用性、视觉一致性与 Bug 巡检,自动产出测试报告,替代部分人工回归测试。

    五、推荐理由

    作为重度网页操作用户,我对 Browser Use 最大的感受是”把重复劳动还给机器“——订票比价、表单填报、定点抓取这类机械活,原来要人守着点半小时,现在一句话交代清楚就能后台跑。

    它开源免费、本地可控,隐私敏感的任务完全可以在本机跑;遇到强反爬、验证码场景再切到云端(代理轮换 + 隐身指纹 + 验证码破解)。对开发者而言,Python 库 + 自定义 Tools + MCP 的扩展性,让它不只是玩具,而是能真正嵌进产品的浏览器自动化底座。如果你已经在用 Cursor / Claude Code,强烈建议装一下它的 skill 体验。

    六、下载地址

    (本文配图来自项目官方 README,版权归 Browser Use 团队所有。)