作者: hiyoho

  • 英伟达 Agent Toolkit:把 AI 智能体搬上桌面工作站

    英伟达最近给自家最强的台式工作站 DGX Station 塞进了一套新工具:Agent Toolkit。官方说,开发者只要三步、大概半小时,就能在本地把 AI 智能体跑起来——不用连云,模型和数据都留在你自己的机器上。

    本地 AI 智能体工作站概念图
    英伟达把智能体能力带到了桌面级工作站

    DGX Station 本身就不好惹,里面是一颗 GB300「Blackwell Ultra」GPU。Agent Toolkit 的价值,是把原来得靠云 GPU 集群才能玩转的复杂智能体,搬到了桌面端。

    借助 Omniverse 库,智能体可以在本地的安全运行时里调用工具与技能,完全不需要连接互联网。—— NVIDIA

    这一套到底装了什么

    它不是单个软件,而是一整个软件栈:

    • NemoClaw:开源的智能体蓝图,把模型、运行框架和 runtime 打包,方便团队照着自己的业务改
    • Nemotron 3 Ultra:一个 5500 亿参数的开放大模型,专为 DGX Station 优化,可以本地微调
    • Omniverse 库:把智能体接到物理仿真和 3D 工作流,机器人训练、自动驾驶仿真都能本地跑
    • OpenShell:开源的安全运行时,给智能体套上沙箱,按策略管住它碰什么工具、什么数据

    为什么是现在

    硬件底子是 GB300 超级芯片,最高 20 petaflops 的 FP4 算力、748GB 统一内存;网络用 ConnectX-8,带宽到 800GB/s,还能两台 DGX Station 并联扩容。NVIDIA 还拉上 Adobe、Blender、Unreal、Epic、Foundry、Canva 等伙伴做 MCP 接入,让智能体直接进到这些创作工具里干活。

    更关键的是战略转向。当资本市场开始计较 AI 的投资回报,英伟达把 Agent Toolkit 和 Omniverse 绑在一起,等于在说:我不只卖算力硬件,还想在你的工作站上长出一套软件生态。对怕数据出公司、又想快速迭代的企业来说,本地跑智能体确实少了一层顾虑。


  • 索尼再告 Udio:3 万首歌揭开的 AI 音乐版权战

    索尼音乐娱乐这周一在纽约法院又递了一纸诉状,被告是 AI 音乐生成器 Udio。和两年前三大唱片公司联手起诉 Udio、Suno 那场官司不同,这一回索尼把火力对准了一个很具体的数字:超过 3 万首歌。

    AI 音乐版权争议概念图
    AI 音乐生成器的训练数据版权问题持续升温

    从猫王的《Hound Dog》到碧昂丝的《Say My Name》,再到哈里·斯泰尔斯的《As It Was》,索尼列出的清单里既有上个世纪的经典,也有近年的热单。索尼在诉状里直言,这 3 万多首「只是 Udio 侵权作品中的一小部分」。

    索尼称,这份 3 万多首的清单「只是 Udio 所侵权作品中的一小部分」,背后还有更多未被点名的歌曲。

    这些歌是怎么被发现的

    有意思的是,这 3 万首并不是索尼一开始就掌握的。2024 年那场诉讼里,索尼和环球、华纳一起把 Udio 与 Suno 告上法庭。借着证据开示(discovery)的程序,索尼拿到了 Udio 的训练数据,再用一套「音频指纹」技术逐一比对,才揪出这批此前没被点名的歌曲。

    索尼原本想把 3 万多首直接加进原本的案子,但法官驳回了这个请求,原始诉讼的范围因此停留在 333 首。于是索尼换了个打法——单独再提一桩新诉讼。

    对 AI 音乐意味着什么

    这场拉锯把一个老问题又摆到台面:AI 音乐模型到底拿了多少版权音乐当养料。Udio、Suno 这类工具能照着风格生成听起来很「像」的歌,但训练数据是否合规,厂商一直说不清。

    • 2024 年索尼、环球、华纳联手起诉 Udio 与 Suno
    • 证据开示让索尼拿到 Udio 训练数据,音频指纹比对出 3 万首
    • 法官驳回追加请求,索尼改提独立新诉
    • 核心争议仍是 AI 音乐模型的训练数据授权

  • Browser Use:让 AI 像人一样操作浏览器的开源智能体(10.5万+ Star)

    Browser Use:让 AI 像人一样操作浏览器的开源智能体(10.5万+ Star)

    Browser Use 自动填写表单演示

    Browser Use 是一个让 AI 像人一样操作浏览器的开源智能体框架——你用自然语言描述任务,它便自动打开网页、点击按钮、输入文字、填写表单,一站式完成多步骤的网页操作。

    一、项目简介

    🌐 Make websites accessible for AI agents. Automate tasks online with ease.

    Browser Use 把”浏览器”变成 AI Agent 可直接操控的环境。它目前拥有 10.5 万+ Star(Python 编写,MIT 许可),并在 Odyssey 长程网页任务榜上以 87.4% 的平均成功率排名第一,超越了 OpenAI、Anthropic、Google、Microsoft 各自的 computer-use 方案。它既是给现有编码 Agent(Claude Code / Codex / Cursor 等)即插即用的”浏览器技能”,也是可规模化调用的 Python 库。

    二、安装要求与过程

    环境要求:

    • Python ≥ 3.11(官方推荐 3.12,可用 uv 管理)
    • 本地无需额外安装 Chromium,Browser Use 会按需驱动 Playwright 浏览器
    • 一个 LLM API Key(Browser Use 云、OpenAI、Anthropic、Google,或本地 Ollama 模型均可)

    快速安装:

    1. 安装库:
      pip install browser-use  (或 uv add browser-use
    2. .env 中配置 Key:
      BROWSER_USE_API_KEY=your-key  或  ANTHROPIC_API_KEY=... / GOOGLE_API_KEY=...
    3. 运行你的第一个 Agent:
    import asyncio
    from browser_use import Agent, ChatBrowserUse
    
    async def main():
        agent = Agent(
            task="Find the number of stars of the browser-use repo",
            llm=ChatBrowserUse(model="openai/gpt-5.5"),
        )
        history = await agent.run()
    
    asyncio.run(main())

    若你已在使用 Claude Code / Codex / Cursor 等编码 Agent,只需让 Agent 执行一次 browser-use skill install,即可把浏览器能力挂载到现有工作流中,无需自己写代码。

    三、核心功能

    • 自然语言驱动浏览器:自动打开页面、点击、输入、填表、翻页,把”多步骤网页操作”压缩成一句话指令。
    • 双形态接入:CLI 模式配合已有 Agent 即装即用;Python 库模式支持定时、并行、嵌入自有产品,细粒度控制浏览器。
    • 多模型统一接入:ChatBrowserUseprovider/model 前缀即可切换 OpenAI / Anthropic / Google,或走本地 Ollama 模型,一个 Key 通吃。
    • 强扩展能力:支持自定义 Tools、MCP 协议,云端版更提供 1000+ 集成(Gmail、Slack、Notion 等)与持久化记忆。
    • SOTA 级表现:Odyssey 200 项长程网页任务榜第一(87.4%),官方基准在 100 个真实任务上开源可复现。

    四、典型使用场景

    1. 自动填表与办事
    让 Agent 带着你的简历信息自动填写并投递职位申请、注册账号、提交各类在线表单。

    2. 网页数据采集
    从任意网站抽取结构化数据并导出为 CSV,例如”抓取我关注者的资料并整理成表格”。

    Browser Use 网站 QA 自动化演示

    3. 网站 QA 自动化
    对本地站点做可用性、视觉一致性与 Bug 巡检,自动产出测试报告,替代部分人工回归测试。

    五、推荐理由

    作为重度网页操作用户,我对 Browser Use 最大的感受是”把重复劳动还给机器“——订票比价、表单填报、定点抓取这类机械活,原来要人守着点半小时,现在一句话交代清楚就能后台跑。

    它开源免费、本地可控,隐私敏感的任务完全可以在本机跑;遇到强反爬、验证码场景再切到云端(代理轮换 + 隐身指纹 + 验证码破解)。对开发者而言,Python 库 + 自定义 Tools + MCP 的扩展性,让它不只是玩具,而是能真正嵌进产品的浏览器自动化底座。如果你已经在用 Cursor / Claude Code,强烈建议装一下它的 skill 体验。

    六、下载地址

    (本文配图来自项目官方 README,版权归 Browser Use 团队所有。)

  • AMD把「太阳神」搬进机房:Helios机架系统正面刚英伟达

    AMD Helios 机架级 AI 系统
    AMD 首款机架级 AI 系统 Helios,集 GPU、CPU、网络与软件于一体(概念图)

    7月20日,AMD 把憋了好久的一张王牌亮了出来——名叫 Helios 的机架级 AI 系统。名字取自希腊太阳神,摆明是要当算力界的「太阳」。这不是一块显卡,而是一整柜子:GPU、CPU、网络、软件全打包,直接对标英伟达那些动辄几百万美元的 AI 机柜。

    微软带头,巨头排队下单

    最让 AMD 长脸的是客户名单。就在发布当天,微软 CEO 纳德拉亲自表态,要在 Azure 数据中心部署 Helios,还顺手推出两款基于 AMD 新「Venice」CPU 的计算实例。更早之前,Meta 已经承诺逐步部署高达 6 吉瓦的 AMD GPU,其中 1 吉瓦今年就通过 Helios 机架交付;OpenAI 和甲骨文也点头要在年内大规模铺开;印度的塔塔咨询服务也在列。

    这背后是 AMD 十年的翻身账。它靠着三代产品路线图的严格执行,加上收购赛灵思、ZT Systems,一步步把 CPU 和 GPU 都做起来了。现在它敢说,Instinct GPU 已经服务全球前十 AI 公司里的八家,包括 OpenAI 和 SpaceX AI。

    苏姿丰此前放话:Helios 在推理、内存带宽和容量上,相比英伟达的机架系统有「显著优势」。

    算的是总账,不是单项性能

    AMD 数据中心业务负责人 Forrest Norrod 反复强调一个词:TCO,也就是总拥有成本。他说 Helios 追求的是最低的「每 token 综合成本」。道理不复杂——对微软、Meta 这种要养几吉瓦算力的巨头来说,单卡跑分高一点,不如整柜更省电、更便宜。

    不过现实也很骨感。研究机构 Futurum Group 估算,一台 Helios 机柜成本大约 500 万到 550 万美元,比英伟达第二代机架 Vera Rubin 的 350 万到 400 万美元还要贵;而且它重达 7000 磅,个头也更大。更要命的是份额:英伟达占数据中心 GPU 市场超过 95%,AMD 只有约 4.5%。

    • 分析师 Daniel Newman 认为,如果 AMD 执行到位,份额有望冲到 20%–25%,对应数千亿美元收入空间
    • AMD 一季度数据中心营收同比增长 57%,已是公司收入主力
    • 公司预计从 2027 年起,数据中心 AI 年收入将达到数百亿美元,大头来自 Helios

    硬件追上了,软件才是硬仗

    Counterpoint 的分析师 Neil Shah 点破了一层窗户纸:AMD 硬件已经和英伟达站到同一水平,但胜负手在软件生态。英伟达的 CUDA 护城河太深,AMD 这几年猛补 ROCm 开源生态,就是想拆这道墙。


    Helios 的早期部署马上就要展开。接下来一两年,市场会检验一件事:AMD 到底是靠真技术赢,还是仅仅因为英伟达产能紧缺捡了漏。对用算力的公司来说,多一个能打的供应商,怎么都不是坏事。

  • 字节跳动放出 Seed Audio 1.0:给视频配音,AI 不再只会「念稿」

    字节跳动 Seed Audio 1.0 音频创作模型
    Seed Audio 1.0 用统一框架联合建模人声、音效与环境声(概念图)

    做短视频、短剧的人大概都有过这种崩溃:画面拍好了,配一段像样的音效比写脚本还费劲。人声要去录音棚,环境声要现找素材,音效还得一笔笔手动对时间轴。7月20日,字节跳动 Seed 团队丢出一个叫 Seed Audio 1.0 的模型,想把这个流程一口气吞掉。

    它不是拼接,是「一起想」

    过去这类工具大多是各管一摊:一个模型生成人声,一个模型找音效,最后人工混音。Seed Audio 1.0 的卖点在于,它在一个统一框架里同时建模人声、音效和环境声,端到端直接产出一段能拿来叙事的完整声音。官方一句话挺妙:声音不再只是画面的补丁,而是能直接参与讲故事,「听见」即「看见」。

    具体有三个本事。第一是精细的时间编排,按时间线控制对白和音效什么时候进场,精度能到 100 毫秒,做视频配音和广告卡点刚好。第二是音色稳,支持零样本生成和长音频延展,一个角色从头到尾音色不变,还能同一声音演多个角色、带不同情绪。第三是语种全,覆盖中文、英文、日语等 20 多种语言,重音和节奏都按当地习惯来。

    官方评测显示,在影视、短剧、动漫、播客等多数场景里,音频可用率已经跑到 90% 以上;多语言自然度方面,大部分语种 MOS 评分超过 4 分,算优秀水平。

    从「会说」到「会创作」

    这中间的区别挺关键。早几年的语音合成,本质是把文字念出来,语调再自然也还是「读稿」。Seed Audio 1.0 瞄准的是创作——你给一条指令,它自己安排谁说话、什么情绪、背景音怎么铺、什么时候淡入。对短剧和动漫团队来说,这意味着原本要分几个工种、花几天的活,可能压缩到一轮生成。

    • 影视级音频:对白、音效、环境声统一编排,叙事更连贯
    • 可控音色:长音频保持一致,同一声音可演多角色
    • 20+ 语种:自然生成,适配本地表达节奏

    先上体验,后面还有大招

    模型现在已经放在火山方舟体验中心,创作者能直接试。团队放话,接下来会接进视频参考这类多模态输入,还会做可控翻译、长音频和分轨生成,方向是把脑子里的声音构想更快变成能听见的成品。


    大模型从文本、图像一路卷到音频,Seed Audio 1.0 是个信号:AI 音频正从单点工具走向全场景创作平台。对内容创作者,门槛又低了一截;对行业,竞争也从「谁念得真」变成「谁编得巧」。

  • 谷歌悄悄研发新 AI 芯片 Frozen v2:要让 Gemini 省下大笔电费

    Google 自研 AI 芯片相关示意图
    大厂自研 AI 芯片已成趋势,Google 的 Frozen v2 瞄准的是推理能效(图源:TechCrunch)

    Alphabet 正在悄悄搞一颗新的服务器芯片,内部代号叫 Frozen v2,专门用来让自家的 Gemini 模型跑得更省、更稳。消息来自 The Information 的爆料,说这颗芯片大概会在 2028 年前后亮相。

    能效说是现在的六到十倍

    按那篇报道的说法,Frozen v2 的衡量标准是「每消耗一单位电力能生成多少 token」,在这个口径下,它要比 Google 现有的 AI 芯片高效 6 到 10 倍。对此 Google 既没承认也没否认,只给了一句四平八稳的回应。

    「我们的团队一直在研究和试验各种新方案,为用户和客户带来极致的性能与效率。」

    大厂为什么都在自己造芯

    把模型训练和推理从通用 GPU 上挪到自己定制的芯片上,已经成了大厂的共同动作。动机很直白:一是让自家模型跑得更划算,二是摆脱对英伟达的依赖——这家公司长期把持着 AI 芯片市场,也让所有大模型厂商都被它的硬件绑住。

    就在今年 6 月,OpenAI 刚亮出第一颗自研推理芯片 Jalapeño;本月初又有消息说,Anthropic 正在和三星谈新的芯片合作。Google 自己本来就有 TPU 这条线,Frozen v2 像是把这条路继续往下走。

    • 代号 Frozen v2,目标 2028 年前后发布,专供 Gemini 使用。
    • 能效按 token / 单位电力计,号称达现有芯片 6 到 10 倍。
    • 背景是 OpenAI、Anthropic 相继布局自研芯片,全行业试图降低对英伟达的依赖。

    股价先涨为敬

    这类消息背后,其实是投资者的算盘。大家一直担心 Alphabet 为了 AI 基建砸下的天价开支——公司年初说今年要花 1800 亿到 1900 亿美元。钱花出去了,得证明能回本。Frozen v2 一旦坐实,等于给市场一个「我们在把成本压下来」的信号。报道出来后,Google 股价周一上午就涨了大约 3%。

    当推理成本变成卖点,AI 的故事就从「大力出奇迹」变成了「谁更会过日子」。


  • Anthropic 15亿美元版权和解获批:AI训练「合理使用」第一案落槌

    Anthropic 的 Claude 形象
    Anthropic 这场版权和解,给整个行业留下了「训练算合理使用」的定性(图源:TechCrunch)

    上周末,一桩拖了快两年的官司终于画上句号。联邦法官批准了 Anthropic 拿出 15 亿美元,摆平那场由一群作家和图书出版商发起的集体版权诉讼。钱要开始发了,但这件事真正的看点不在钱,而在法官留下的那个判断。

    15 亿到底怎么分

    按照和解方案,大约 50 万部作品每部能拿到 3000 美元,在握有版权的作者和出版商之间分摊。这个数额被认为是美国版权史上最大的一笔和解金。不过,很多写作者并不觉得这是一场胜利,原因得看法院到底是怎么裁的。

    主审法官 Alsup 站在了 Anthropic 这一边:用受版权保护的文本去训练 AI 模型,算「合理使用」。这个判断被不少人视为整个 AI 行业的一个转折点。

    真正踩线的是「怎么拿的书」

    Alsup 虽然点了头,但他没把获取方式也一并放过。Anthropic 的训练书库有两个来源:一部分是买来纸质书自己扫描,这部分没问题;另一部分是直接从 Library Genesis、Pirate Library Mirror 这类盗版站下载,这部分被 Alsup 认定为非法。换句话说,训练本身合法,偷书不合法。

    正因为盗版下载这条单独成立,案子本来可能要上陪审团、赔多少由陪审团定。Anthropic 选择和解,把不确定的风险先掐灭。

    • 和解金约 15 亿美元,按每部作品 3000 美元、覆盖约 50 万部作品分摊。
    • 训练模型被认定为「合理使用」,但盗版下载被单独判定非法。
    • 判决仅为地区法院层级,不构成全国性先例,同类诉讼仍在多州推进。

    为什么作家们高兴不起来

    核心争议是以对 AI 公司有利的方式收尾的。法官认定训练属于合理使用,等于给整个行业发了张准生证。可对于辛苦写书的人而言,自己的作品被拿来喂模型、还只拿到每部 3000 美元,怎么看都不像赢。

    更重要的是,这个判决只是加州北区一个地区法院的决定。Anthropic 一和解,案子就不会上上诉法院,也就没法变成有约束力的先例。别的法官完全可以对别的事实给出别的结论——事实也正在发生。Google、Meta、Midjourney、OpenAI 眼下都还背着各自的版权官司。就在上周,Hachette、Cengage、Elsevier 等出版商加上作家 Scott Turow,又把 Google 告了,理由是 Gemini 拿他们的书训练。


  • mattpocock/skills:把顶级工程师的经验,打包成 AI 编码智能体的「技能库」

    mattpocock/skills:把顶级工程师的经验,打包成 AI 编码智能体的「技能库」

    mattpocock/skills 项目封面

    mattpocock/skills 是 TypeScript 布道师 Matt Pocock 日常使用的「AI 编码智能体技能库」——它不教你写 prompt,而是把数十年的工程经验浓缩成一组小而可组合、跨模型通用/skills 指令,专门修复 Claude Code、Codex 等编码智能体最常犯的四种失败模式。目前已在 GitHub 收获 17.8 万+ Stars,是近期最火的 AI 工程化开源项目之一。

    一、安装要求和过程

    环境要求

    • Node.js 18+(用于 skills.sh 安装器,npx 一行搞定)
    • 一个支持 skills 的编码智能体:Claude Code / Codex / 任意 Agent-Skills 标准 harness
    • 可选:GitHub 或 Linear 账号(/triage 技能需要对接 issue 追踪器)

    方式一 · 可改副本(推荐,想魔改就选它)

    npx skills@latest add mattpocock/skills

    选择要安装的技能与目标 agent,务必勾选 /setup-matt-pocock-skills;随后在 agent 中运行一次该命令完成仓库配置(选择 issue 追踪器、triage 标签、文档存放位置)。

    方式二 · Claude Code 原生插件(只读、常新、省心)

    /plugin marketplace add mattpocock/skills
    /plugin install mattpocock-skills@mattpocock

    装好后再跑一次 /setup-matt-pocock-skills。两种哲学:skills.sh 把技能复制进项目任你改;插件把它们作为只读束订阅更新

    二、核心功能

    整套技能围绕「软件工程基本功」展开,把对齐、TDD、架构、评审变成 Agent 拿来即用的小工具:

    四个失败模式对应技能

    • 对齐优先/grill-me/grill-with-docs——动手前先让 Agent 把你「拷问」一遍,并用 CONTEXT.md 沉淀项目共享语言,从根上消除需求歧义与啰嗦。
    • 测试驱动与诊断/tdd(红-绿-重构循环)、/diagnosing-bugs(复现→最小化→假设→插桩→修复→回归),让 Agent 真正跑起「代码运行反馈」闭环。
    • 架构纪律/to-spec/improve-codebase-architecture/codebase-design——对抗「一坨烂泥」,鼓励深模块、小接口。
    • 流程编排/implement/code-review/research/wayfinder/triage——把需求拆成可追溯的工单与规格,并以并行子智能体做「规范 + 标准」两轴评审。
    • 可组合、跨模型:所有技能与具体模型解耦,Claude Code / Codex / 其他 Agent 都能用;用户主动触发(User-invoked)与 Agent 自动调用(Model-invoked)两类技能分工清晰。

    User-invoked 与 Model-invoked 技能分类

    三、典型使用场景

    • 接手新项目前的「对齐会话」:用 /grill-with-docs 先和 Agent 把需求与领域术语聊透,生成 CONTEXT.md;后续每次对话都更省 token、更精准,变量/函数命名也跟着统一。
    • 写带测试的新功能:用 /implement 驱动 /tdd,先写失败测试再实现,最后 /code-review 把关——提交前质量稳,回归风险低。
    • 拯救腐烂的代码库:定期跑 /improve-codebase-architecture,扫描可深化的模块并生成可视化 HTML 报告,按图索骥重构,避免软件熵增失控。

    四、推荐理由

    这不是又一个「流程框架」(GSD/BMAD/Spec-Kit 那类会把过程控制权收走),而是把工程基本功变成 Agent 拿来即用的小工具——轻量、可改、不绑架你。最让我惊艳的是 CONTEXT.md 共享语言:用一句话把「section 里的 lesson 被 materialize」说清,代码命名、导航、token 消耗全跟着受益。两种安装方式恰好对应两种心态:想魔改就 fork 副本,想省心就装插件订阅更新。17.8 万 Stars、MIT 协议、几乎零上手成本,强烈建议所有用 Claude Code / Codex 的开发者装一套。

    五、下载地址

    许可:MIT | 语言:Shell/Markdown | Stars:178.9K+ | 创建于 2026-02,持续高频更新

  • 中国开源模型 Kimi 搅动美国 AI 圈:特朗普阵营自己先吵翻了

    这个周末,特朗普身边的 AI 人先内讧了。几位现任和前任顾问在公开场合互喷顶尖 AI 公司:刚卸任的 AI 与 crypto「沙皇」David Sacks 说 Anthropic 的模型「像被切了前额叶」「太觉醒」;五角大楼高官 Emil Michael 则骂 OpenAI 新设的战略主管是「头号村傻」。火药味这么冲,源头却是一个中国模型。

    导火索:一个免费的中国模型

    争论的焦点是 Kimi——中国公司 Moonshot 上周刚放出的开源模型,能力已经逼近 OpenAI 和 Anthropic 那些要花钱的对手,而且免费。问题就出在「免费」二字上:每冒出一个够强的中国开源模型,美国企业就少一分理由掏钱买 Anthropic 或 OpenAI。而眼下 AI 热情正撑着美国经济很大一块增长,这等于同时给了特朗普经济和政治两记闷棍,美股也被吓了一跳。

    卡内基国际和平基金会研究员 Anton Leicht 在 X 上写道:这对一个「真不想要更多经济坏消息」的政府来说,本身就是个威胁。

    中美 AI 竞争与开源模型
    中国开源模型的崛起,正把美国 AI 政策圈搅成一锅粥(图:MIT Technology Review)

    白宫转向「管起来」

    Sacks 已经离任,他「开源更好」的论调在政府里渐渐失势,取而代之的是一种新思路:既然模型强到能威胁国家安全,政府就得管住它们怎么用。这直接催生了白宫一套新审查流程——模型发布前先过安全评估。

    前特朗普顾问、如今在 OpenAI 的 Dean Ball 把这叫做「前沿 AI 的事实许可制」,还预测特朗普可能用软权力施压,让美国企业不敢碰 Kimi。Michael 当场反击,强调要走「民主程序,不是深层政府的小算盘」。有意思的是,吵来吵去,没人认真聊过 Kimi 到底是怎么变强的。

    • OpenAI 和 Anthropic 长期抱怨中国公司用「蒸馏」偷师,已请求政府出手;
    • 特朗普松口让英伟达多卖芯片给中国、换政府抽成,出口管制事实上松动;
    • 美方还指控存在芯片走私,Kimi 用的是什么算力至今成谜。

    更大的背景是,Anthropic 自家的 Mythos、Fable 模型上半年接连被扣上「国家安全风险」、遭出口管制,那场「五角大楼文化战争」反而帮了倒忙。法国政客说这是欧洲该醒来的警钟,智谱等中国开源阵营的股价随之飙升。模型越强、越免费,世界就越不情愿把命脉系在几家美国公司身上——这局棋,才刚开局。

  • 模型上下文协议 MCP 迎来大改:AI 接外部工具不再卡脖子

    如果你最近半年听人聊 AI 智能体,十有八九会撞见一个词:MCP。它的全称是 Model Context Protocol(模型上下文协议),可以理解为 AI 世界的「通用插头」。有了它,聊天机器人才能顺手翻你的日历、查你的数据库、调用内部工具,而不用工程师为每个连接单独焊一根管子。

    下周,这套协议就要迎来一次不小的升级。普通用户大概率无感,但它可能实实在在地改变整个生态的玩法。

    卡在哪:一台服务器要记住所有人

    这次改动的核心,是服务器处理「会话 ID」的方式。你可以把它想成服务员手里的桌号:Claude 这类客户端第一次连上服务器时会先「打招呼」,服务器回一个会话 ID,之后每次请求都带着它,服务器才知道「还是刚才那位」。

    Arcade 的 Nate Barbettini 打了个比方:真实部署里,你背后是一台负载均衡器,专门把请求丢给农场里任何一台空闲的机器,有时还跨区。可现在每台机器都得知道「另一台机器发过的那个会话 ID」——不是不能做,但极其折磨人,而且它是在和负载均衡器对着干,而不是配合它。

    换句话说,旧方案默认「一台服务器记住你」,可大公司早把流量摊到几十台互不相通的机器上了。光是为了搞清楚「谁是谁」,今天的 MCP 服务器就得多干一堆活。这也是为什么,尽管今年智能体被吹得火热,真敢上规模、自己兜售 MCP 集成的公司却没几个。

    AI 互操作协议 MCP 概念图
    MCP 要做的事,是给 AI 模型接外部工具铺一条标准通道(图:TechCrunch)

    新方案:把「状态」甩给客户端

    新版本在服务端改走更宽松的「无状态」路线,思路和绝大多数普通网站一样:服务器不再费劲记着你是谁,把状态交给客户端自己带着走。这样一来,整套系统更好维护,理论上大规模跑起来也更便宜。

    • 会话 ID 改为服务端无状态,服务器能轻松躲在负载均衡器后面;
    • 大规模部署的运维成本有望下降,更多公司敢做一手 MCP 集成;
    • 新规范自 5 月就出了候选版,7 月 28 日正式定稿。

    说到底,这件事挺提神:不是所有 AI 进展都在狂奔。模型训练一路加速,可模型脚下的那套基础设施,仍被标准委员会慢悠悠的共识拽着走。变化确实在发生,只是比想象中慢一点。