标签: AI模型

  • 中国AI在网络安全领域追平美国:Z.ai的GLM-5.2让华盛顿睡不着觉

    这几天AI圈有个挺有意思的事:中国的智谱AI(Zhipu AI,也叫Z.ai)发布的开源模型GLM-5.2,在网络安全漏洞查找这个特定领域,居然跟Anthropic的Mythos打得有来有回,有些测试里甚至还胜出了。

    开源模型追上闭源巨头?

    GLM-5.2是智谱AI今年发布的新模型,最大的特点是”开放权重”(open-weight)——意味着任何人都可以下载下来自己跑,不需要经过任何人的批准。

    安全公司Semgrep的测试显示:GLM-5.2在IDOR(不安全的直接对象引用)漏洞检测中,F1得分达到39%,超过了Claude Code的32%,而每次漏洞检测的成本只有约0.17美元。

    智谱AI GLM-5.2网络安全漏洞检测
    GLM-5.2在网络安全领域缩小了与美方模型的差距

    当然,在通用任务上,GLM-5.2还是打不过Claude和GPT系列的。但这不重要——重要的是,在网络安全这个对国家安全至关重要的领域,中国AI公司已经把差距缩小到了”有竞争力”的程度。

    华盛顿的噩梦

    这让华盛顿很头疼。特朗普政府对AI模型出口管制的核心逻辑是:先进的AI模型(特别是能做网络攻防的)不能落到”潜在对手”手里。

    但GLM-5.2是开源的。你没法禁止一个开源模型,就像你没法禁止一个数学公式。任何人都可以从网上下载这个模型,在自己的硬件上跑,没有任何监管能拦得住。

    更麻烦的是,GLM-5.2的表现说明了一件事:中国AI公司不再只是”追赶者”了,在某些细分领域,他们已经开始跟美国公司正面竞争。

    Mythos出口禁令的讽刺

    几个月前,美国政府以”国家安全”为由,禁止Anthropic的Mythos和Fable模型向非美国人开放。当时给出的理由是:这些模型太强了,如果落到坏人手里,可以用来发现软件漏洞、发动网络攻击。

    但现在的局面是:美国的闭源模型被管制了,中国的开源模型却没人管得了。那些本来被禁止用Mythos的安全研究人员,现在可以改用GLM-5.2——效果差不多,还没有使用限制。

    • 出口管制真的能限制住AI技术的扩散吗?还是只是把市场让给了竞争对手?
    • 开源模型和闭源模型,哪种对安全的影响更大?
    • 如果中国AI在更多领域追平美国,华盛顿的下一步会是什么?

    这件事还没有结束。GLM-5.2的开源发布,可能会倒逼美国AI公司重新考虑他们的封闭策略——如果竞争对手用开源抢市场,你还要不要继续闭源?

    同时,这也给全球AI安全研究提了个醒:当你试图用管制来限制技术扩散的时候,技术本身可能不会等你。

  • 一家初创公司声称突破了制约LLM的瓶颈,AI效率竞赛迎来新变量

    一家初创公司声称突破了制约LLM的瓶颈,AI效率竞赛迎来新变量

    大语言模型有个绕不开的数学瓶颈——”二次方爆炸”。处理的文本越长,计算量不是线性增长,而是平方级暴涨。这个瓶颈卡了业界快十年,但现在有家迈阿密的小公司说他们解决了。

    AI模型架构突破
    Subquadratic稀疏注意力机制示意图(AI生成图)

    Subquadratic公司5月从隐身模式走出来,发布了模型SubQ。他们声称用”稀疏注意力”替代了传统Transformer的”密集注意力”,把计算复杂度从二次方降到了——你猜对了——亚二次方。

    “我们希望开启一个效率新时代。几年后,没人会用Transformer搭建模型了。”

    ——Justin Dangel,Subquadratic联合创始人兼CEO

    二次方瓶颈到底卡在哪

    今天所有主流大模型都基于Transformer架构,核心是”密集注意力”机制。处理一段文本时,模型把每个词(token)编码成数字,然后让每个数字和所有其他数字相乘——用来捕捉词与词之间的关系。

    1万个词的文本,要算近5000万次乘法。文本长度翻倍,计算量翻四倍。这就是为什么长文档处理这么烧钱,也是为什么各家公司在拼命堆GPU。

    Subquadratic的思路很简单:不是所有词之间的关系都重要。稀疏注意力只挑重要的词做运算,跳过不相关的。问题难在——怎么判断哪些重要?以前的办法都用固定模式(比如”第1个词总是和第5个词比较”),效果不好。

    SubQ的”秘密酱料”是动态选择——对每段输入的文本,实时判断哪些词之间的关系值得计算。联合创始人Alex Whedon不肯透露具体怎么实现的,只说”这是我们的核心秘密”。

    质疑声:AI界的Theranos?

    第一次发布时,Subquadratic只给了几个自测跑分,没有第三方验证。AI工程师Dan McAteer在X上发文:”SubQ要么是Transformer之后最大突破,要么就是AI界的Theranos。”

    一个月后,Subquadratic找了第三方评测机构Appen来跑分。结果有些惊人:在LiveCodeBench编程测试上,SubQ得分89.7%,和顶级模型在同一个水平线。处理长文本时,SubQ的上下文窗口可达1200万token(主流模型一般是100万)。

    成本数据更夸张。跑同样的测试(从大文档里检索信息),Anthropic的Opus 4.6花了2600美元;SubQ花了8美元。

    但质疑没有完全消散。SubQ的底层权重是用中国开源模型Qwen”启动”的(在Qwen基础上微调),而不是从零训练的。这让一些研究者怀疑:这到底是一个全新架构,还是Qwen的一个高效变种?


    SubQ目前还没开放公测,等候名单上有几万人。在更多人真正用上之前,判断它是突破还是泡沫,还为时过早。但有一点是确定的:效率竞赛已经打响,谁能把大模型的计算成本打下来,谁就掌握了下一个回合的主动权。

  • 英伟达开源MoE微调加速工具,一行import让微调提速3.7倍

    英伟达开源MoE微调加速工具,一行import让微调提速3.7倍

    MoE(混合专家)架构已经成为当前大模型的主流选择。从DeepSeek-V3到Qwen3,再到Google的Gemini,几乎所有最新发布的顶尖模型都在用MoE。但MoE有个麻烦——训练起来比普通Transformer麻烦得多,专家并行、通信融合、kernel优化,这些工程细节没有一个省心的。

    英伟达6月底开源了一个工具,试图让这件事变得简单。叫NeMo AutoModel,基本思路是:站在HuggingFace Transformers v5的肩膀上,不改你原来的代码API,只加一行import,就能把MoE模型的微调速度提升3.7倍,同时把GPU显存占用降低近三分之一。

    英伟达MoE微调加速工具概念图
    英伟达NeMo AutoModel通过一行import实现MoE模型微调加速

    3.7倍加速是怎么来的

    具体数字挺直观的。在单节点8张H100 80GB GPU上,用Qwen3-30B-A3B做微调,原来的Transformers v5每秒每GPU能处理3075个token,换成NeMo AutoModel之后直接拉到11340,提升3.69倍。显存这边,峰值占用从68.2GiB降到48.1GiB,省了29%。

    英伟达 team还测了Nemotron 3 Nano 30B-A3B,结果类似:吞吐提升3.4-3.7倍,显存降低32%。他们甚至拿550B参数的Nemotron 3 Ultra做了全参数微调测试——16个H100节点、128张GPU——这时候Transformers v5已经直接爆显存了,连对比的机会都没有。

    显存省下来的部分不是白给的——你可以拿它去跑更大的batch size,或者处理更长的序列。对于本来就卡显存的大模型训练来说,这两个操作直接决定了你能不能把模型训出来。

    核心技术:三板斧

    NeMo AutoModel在Transformers v5的基础上加了三样东西:专家并行(EP)、DeepEP、TransformerEngine。每一样都针对MoE训练的一个具体瓶颈。

    专家并行解决的是显存问题。MoE模型虽然每次推理只激活部分专家,但训练的时候,所有专家的参数都得放在GPU显存里。专家并行把这些参数分散到多张GPU上,8张GPU就每张只持1/8的专家参数。Qwen3测下来,这项技术能把MoE层的显存占用直接从68.2GiB压到48.1GiB。

    DeepEP解决的是通信开销。MoE训练的时候,每个token得先被路由到对应的专家,这个过程需要跨GPU通信。传统做法是”先分发、再计算”,DeepEP把它融合成了一个优化的GPU内核,”分发”和”计算”在时间上重叠了起来,通信的时间就被藏掉了。

    TransformerEngine提供的是基础运算加速。注意力机制、线性层、RMSNorm这些,都有专门的融合kernel实现。不只加速MoE层,普通Transformer层也能占到好处。

    一行import怎么做到

    用法确实简单。如果你原来就在用Transformers v5,切换到NeMo AutoModel只需要在文件开头加一行:

    • from transformers import AutoModelForCausalLM改成from nemo_automodel import AutoModelForCausalLM
    • 原来的训练代码几乎不用动
    • API完全兼容HuggingFace的接口约定

    这个设计思路很聪明。它不搞”全新框架”,而是在现有生态上做增强。这样用户的迁移成本几乎为零,英伟达那边也能持续从HuggingFace的生态里受益——相当于”我帮你提速,你继续用HuggingFace的接口”。


    为什么这件事值得关注

    MoE架构的普及速度比很多人预期的快。2026年上半年,几乎所有主流大模型发布都用了MoE或者类MoE的稀疏激活架构。原因很简单:在相同参数规模下,MoE的推理成本远低于稠密模型,但训练成本却高得多——因为所有专家的参数都得加载进显存,通信开销也大。

    英伟达这笔账算得很清楚:如果MoE是未来,那么控制MoE训练的工具链,就等于在AI训练基础设施里多插了一脚。HuggingFace占据了模型使用的入口,英伟达则通过NeMo AutoModel占据了”高性能训练”的入口——而且是以兼容HuggingFace的方式,用户几乎没有理由拒绝。

    代码、配置文件和基准测试脚本都已经放在GitHub上了(github.com/NVIDIA-NeMo/AutoModel),文档也在docs.nvidia.com上线了。感兴趣的人现在就能去试试,看看那3.7倍加速在自己的模型上能不能复现。

  • DeepSeek开源提速神器,不换模型就让V4快60%以上






    DeepSeek本月在技术圈投了一枚小炸弹——他们开源了一个叫DSpark的投机解码框架,说可以给现有的DeepSeek-V4模型提速60%到85%,而且不需要换模型、不需要重新训练,提速后的输出质量也无损。

    这件事值得说清楚,因为大多数用户感知不到”推理速度”这个东西,但它其实决定了你用AI产品时等得多久、以及AI公司要花多少钱来跑服务。

    “投机解码把生成拆成两个角色:一个小号的草稿模型先提议一段token,完整的目标模型再一次性验证这段提议。拒绝采样会接受最长有效前缀,再附加一个额外token。因为规则精确保持了目标分布,所以不存在质量损失。”

    AI推理加速概念图
    DeepSeek DSpark推理加速框架概念图

    投机解码是什么东西

    要理解DSpark,得先说清楚”投机解码”(Speculative Decoding)这个技术思路。大语言模型生成内容时,是逐token(可以理解为逐词或逐子词)输出的,每次只生成一个token,这导致推理速度受限于内存带宽,GPU的算力往往吃不满。

    投机解码的思路是:用一个很小的草稿模型,先”猜”一段接下来可能的token(比如一次猜5个),然后让完整的大模型一次性验证这段猜测——对的留下,错的地方截断,再从那个位置继续。因为草稿模型很小,跑得快;大模型验证一串token比逐次生成更快。这样整体速度就提上来了。

    这个技术不是DeepSeek发明的,学术界和工业界已经研究了一阵子。但DSpark的特别之处在于,它解决了一个具体工程问题:草稿模型猜的token,在后半段准确率会快速衰减——前面猜对了,越往后越容易跑偏,导致验证时能接受的长度有限,加速效果打折扣。

    DSpark怎么做的

    DeepSeek团队把草稿生成拆成了两个阶段,这个设计他们叫”半自回归生成”。第一阶段用一个并行的DFlash模块,一次性给每个位置生成基础logits(这是模型内部表示”下一个token可能性”的数值);第二阶段接一个极轻量的顺序头部,在采样每个token之前,加一个依赖前面已采样token的偏置。

    顺序头部默认是”马尔可夫头部”——只往前看一个token,低秩分解让它在词汇量很大的情况下也保持低成本。这个设计让DSpark继承了并行草稿的高首token准确率,又通过顺序头部让接受率在块的深处保持稳定,不会快速衰减。

    另一个工程细节是”置信度调度验证”:DSpark给每个草稿位置输出一个置信度分数,估计这个token通过验证的概率;再结合一个硬件感知的调度器,在GPU空闲时验证更多token,繁忙时验证更少。这个设计减少了高负载下验证被拒绝token造成的算力浪费。

    实际提速多少

    指标分两部分:离线测试和生产环境。

    离线测试里,DSpark在Qwen3各个尺寸模型上的接受长度,比Eagle3高26%到31%,比DFlash高16%到18%。注意这里比较的是”接受长度”(每次验证能接受多少token),不是直接的提速倍数,但因为延迟公式里提速正比于接受长度,所以这个指标直接反映了加速潜力。

    生产环境的数据更有说服力。DeepSeek-V4-Flash和V4-Pro在他们的真实流量下,用DSpark-5配置(5个token的草稿块+马尔可夫头部),相比之前的MTP-1基线(一次猜2个token的固定方案),每用户生成速度分别提升了60%到85%和57%到78%。这个提升是在相同吞吐量(即相同GPU资源)下测得的,意味着用同样的硬件可以服务更多用户,或者同样多的用户等着的时间更短。


    为什么这件事值得关注

    第一,这是”不换模型就能提速”的方案。大多数AI公司提速的思路是训练更大的模型、或者用更多GPU,这都意味着更多的钱。DSpark这种在推理层面做优化的思路,是花小钱办大事——尤其对已经在跑DeepSeek-V4的服务来说,换上DSpark的检查点就能直接提速,不需要重新训练。

    第二,DeepSeek把检查点和训练代码都开源了,用MIT许可证。这意味着其他公司和研究机构可以直接用,也可以基于这个框架做自己的优化。这种开源技术基础设施的打法,和OpenAI、Anthropic的闭源路线形成鲜明对比。

    第三,推理速度的提升会传导到终端用户。AI聊天产品的响应速度、AI编程助手的代码生成延迟、AI搜索的返回时间——这些用户体验指标,背后都是推理速度。DSpark如果被广泛采用,意味着用同等质量的模型,用户能感受到更快的响应。

    最后说一句实际的:DSpark目前是和DeepSeek-V4的权重绑定的,不是通用框架(虽然DeepSpec训练代码库支持在其他模型上训练草稿模块)。如果你想在自己的项目里用,得跑训练——官方配置假设单机8块GPU,目标缓存可能非常大(Qwen3-4B设置下接近38TB),这个门槛不低。但对已经有大模型服务的团队来说,这个方向值得跟进。


  • AI模型发布要经过政府审批——这件事比Anthropic和OpenAI的竞争大多了

    美国政府审批AI模型发布概念图
    美国政府开始逐个审批AI模型发布,整个行业都面临新现实

    两周前,美国政府的手伸进了AI公司的模型发布环节。Anthropic的Fable和Mythos模型被要求下架,OpenAI的GPT-5.6也面临类似的”逐客户审批”模式。整个行业突然意识到,问题已经不是”Anthropic vs OpenAI”那么简单了。

    从竞争到共存:两家公司突然站在了一起

    Russell Brandom在TechCrunch写了一篇文章,标题很直接:”It’s not about Anthropic vs. OpenAI anymore”。他的核心论点是:OpenAI和Anthropic现在面临完全一样的困境,如果这个问题处理不好,整个行业都会受影响。

    具体来说,美国政府现在对前沿AI模型的发布有了实质性的控制权。模型发布前要经过政府审批——这个流程目前没有清晰的标准,也不知道监管者到底在防什么风险。

    GMU研究员Dean Ball(即将入职OpenAI)写了一篇长文,详细解释了这个问题:政府既没有专业能力,也没有足够的人力来做这种级别的模型测试。

    更有意思的是行业内部的反应。很多人都把这件事看成Anthropic搞的”监管捕获”——通过推动政府监管来卡OpenAI的脖子。或者反过来,认为是OpenAI跟特朗普政府走得太近,牺牲Anthropic来换取自己的模型获批。

    问题比”谁搞的”大多了

    但Brandom的论点是,现在纠结”谁搞的”已经没有意义了。因为政府审批这件事,一旦变成制度,对所有AI公司都是一样的。没有哪种方案是”只帮一家公司、不帮另一家”的。

    举个例子:如果政府要求每个前沿模型发布前都要做安全评估,那OpenAI要做,Anthropic要做,Google要做,微软也要做。这套流程的成本和复杂度,最后会拖慢所有人的节奏。

    而且,如果审批标准不透明、流程不可预期,AI公司就没办法做长期研发规划。你花了几个月训练一个新模型,结果政府说”这个不能发”——这种风险会让投资人犹豫,也会让数据中心的融资变难。

    行业需要联手推动合理的监管框架

    那现在最需要的是什么?Brandom认为,是整个行业联手推动一个合理的监管框架。具体来说:

    • 建立由独立机构(而不是政府部门)主导的模型评估流程
    • 明确监管者到底在防什么风险(网络安全?生物风险?对齐问题?)
    • 避免”逐个审批”这种拖死创新的方式

    Dean Ball在他的文章里提了一些具体的建议,比如让独立第三方来做模型安全评估,而不是让某个政府部门说了算。这个思路其实跟其他行业的产品审批逻辑类似——药品要过FDA,但FDA是相对独立的专业机构,不是行政部门随意操控的工具。


    但问题是,AI行业里的很多人并不买账。他们要么觉得政府根本不该管,要么觉得”就算管,也得按我家的利益来管”。这种零和思维恰恰是Brandom最担心的——如果各家AI公司继续把监管问题看成”我赢你输”的竞争工具,最后只会换来一个糟糕的监管框架,所有人都受害。

    AI模型的能力现在已经到了能产生真实政治后果的地步。这意味着,不管AI公司愿不愿意,政府都会管进来。区别只在于,是政府说了算,还是行业能主动推一个合理的方案。接下来的几周,我们就会看到AI行业到底有没有能力坐下来谈这件事。

  • Anthropic的Mythos 5回来了,但只向网络防御者开放——Fable 5还在等

    6月26日,美国商务部部长霍华德·卢特尼克(Howard Lutnick)给Anthropic联合创始人汤姆·布朗(Tom Brown)发了一封信。这封信的日期是6月26日,内容是关于Mythos 5模型的解禁——但只是部分解禁。

    两周过山车

    过去两周,Anthropic一直在和特朗普政府谈判。过程像过山车一样,走走停停,最后勉强谈出了一个折中方案。根据The Verge拿到的政府信件内容,商务部同意”修订许可要求”,理由是Anthropic”近期与美国政府合作,解决了与Mythos 5和Fable 5相关的风险”。

    但这个结果只能说勉强及格。Mythos 5——Anthropic最强的网络安全模型——被允许重新部署给”一小群网络防御者和基础设施提供商”。至于面向公众的Fable 5系列,目前仍处于悬而未决的状态,没有任何上线时间表。

    Anthropic发言人丹妮尔·吉列里(Danielle Ghiglieri)对The Verge表示:”我们已收到美国政府通知,Mythos 5——我们最强的网络安全模型——可以重新部署给一小群网络防御者和基础设施提供商。我们正在努力为获批的提供商群体恢复Mythos 5的访问权限,并继续与政府合作,扩大Mythos 5的访问范围,让Fable 5再次面向大众开放。”

    Anthropic Mythos 5 部分解禁
    Mythos 5经历两周谈判后终于部分恢复访问

    出口管制并没有解除

    需要明确的是,美国政府并没有撤销两周前对Anthropic下达的出口管制令。那道命令禁止任何外国国民访问Mythos 5或Fable 5(包括Anthropic自己的员工)。这次的”修订”本质上是为Mythos 5开了一个口子——允许特定类型的组织访问,方式和之前OpenAI的GPT-5.6被”逐客户审批”如出一辙。

    也就是说,出口管制的大框架还在,只是Mythos 5拿到了一个例外。Fable 5呢?没有任何消息。普通用户想用上Fable 5,恐怕还得等上一段时间。


    中美AI监管的不同路径

    这件事更大的背景是:美国和中国的AI监管路径正在出现明显分化。美国这边,政府直接介入模型发布审批——哪家公司能发什么模型、能卖给谁,商务部说了算。中国那边,监管更多集中在内容安全、数据合规和算法备案上,对模型发布本身没有直接审批机制。

    Anthropic这次的谈判由汤姆·布朗亲自牵头,说明公司高层对这件事的重视程度。毕竟,Mythos 5是Anthropic当前最强的模型,被卡住出口对任何AI公司来说都是重大打击。部分解禁至少让Anthropic能继续服务一部分核心客户,但距离”正常状态”还差得很远。

  • Anthropic被禁出口,中日AI公司趁机推出了自己的平替

    Anthropic被禁出口,中日AI公司趁机推出了自己的平替

    两周前,美国政府一纸禁令,把Anthropic的Mythos和Fable 5模型对非美国人关上了门。这件事在AI圈炸了锅,但很快,中日两国的AI公司就给出了自己的答案——不是抗议,而是直接推出了替代品。

    中国的”神话”对抗”神话”

    本周三,中国网络安全公司360正式发布了”屠龙锋”(Tulongfeng),一款专门用于网络安全领域的AI工具。360的说法很直接:这款工具能和Anthropic的Mythos正面对抗。Mythos是什么?它是Anthropic专门针对网络安全场景打造的AI模型,能力强到让特朗普政府不得不对它实施出口管制。

    亚洲AI公司推出Mythos替代品概念图
    中日AI公司趁Anthropic出口禁令,推出本土化AI模型

    360没止步于此,同时还发布了另一款工具”一天真”(Yitianzhen),专注自动化网络防御和事件响应。360创始人周鸿祎在发布会上说了一句话,挺值得玩味:漏洞发现AI是”国家战略资产”,他担心的是”单向透明”——有些玩家能用上先进的漏洞检测能力,有些则被挡在门外。

    “漏洞发现AI是国家战略资产,我们需要警惕’单向透明’的风险。”
    ——周鸿祎,360创始人

    日本的”河豚”游得挺快

    差不多同一时间,东京的AI初创公司Sakana AI发布了Fugu(日文”河豚”的意思)。这家公司说,Fugu的性能可以”和Anthropic的Fable 5、Mythos Preview肩并肩”。Fugu不只是跟风,它有一个挺有意思的设计思路:编排模型(Orchestration Model)。简单说,它能协调调用多个其他AI模型,通过API把它们的能力串起来,而不是只靠自己。

    Sakana的联合创始人David Ha在X上写了一段话,说出了很多人的心声:”对单一供应商的依赖,是国家基础设施的风险。出口管制让大家意识到,这种风险是真实存在的。访问顶级模型的权利可能一夜之间消失,集体智能才是对抗权力集中的实用对冲。”

    Sakana是哪来的底气?这家公司2023年由前谷歌研究员Ren Ito、Llion Jones和David Ha联合创立,去年11月完成了1.35亿美元B轮融资,估值26.5亿美元。他们的主打方向是便宜好用的生成式AI模型,专门为日语和日本文化优化,在小数据集上也能跑得不错。

    时机”纯属巧合”?

    Sakana对外的说法是,Fugu的发布”纯属巧合”,研发从去年就开始了,相关研究今年春天还在ICLR上发表过。但他们的网站广告语写的是”提供前沿能力,没有出口管制风险”——这话说得挺直白的。

    Sakana的联合创始人Ren Ito上周在G7峰会边会上也谈到了这个话题。他写了一篇专栏文章,呼吁美国联邦政府”把保持盟友的访问权限作为第一优先级”,他的观点是”AI不应该成为一种被囤积的技术,而应该是共同开发的”。


    这两家公司,一个在中国,一个在日本,面对Anthropic的出口禁令,给出了两种不同的回应方式。360是直接硬刚,做一款同场景的替代品;Sakana则是做一个”保险”,让你在失去访问权限的时候还有别的选择。哪种思路更管用,现在还不好说。但有一件事是确定的:Anthropic五月份刚刚宣布年化收入突破470亿美元,其中有多少来自亚洲企业客户,外界不得而知。但禁令生效这几周,东京和北京各有一家公司站出来填了这个空缺。就算哪天禁令取消了,本地替代品已经在这里了,而且它们更懂本地语言和文化。这场博弈,才刚刚开始。

  • AI监管变天:Anthropic和OpenAI突然站在了同一艘船上

    AI监管变天:Anthropic和OpenAI突然站在了同一艘船上

    AI监管变天:Anthropic和OpenAI突然站在了同一艘船上
    文章配图

    这两周AI圈子发生了一件挺有意思的事——Anthropic的Fable和Mythos两个模型被美国政府强制下架,而OpenAI刚准备发布的GPT-5.6,眼看也要走进同一个”审批死角”。

    两家公司打得不可开交,结果现在被同一把剑悬在头顶。竞争格局突然变了。

    审批”死角”到底有多深

    事情要从两周前说起。美国政府对Anthropic施压,导致Fable和Mythos两个模型被撤出一般发布渠道。当时很多人的第一反应是:这是Anthropic自己搞的,还是别人告的?

    现在答案逐渐清晰——不管谁起的头,结果吃亏的是整个行业。OpenAI的GPT-5.6据传只做”有限预览”,而且每一个企业客户要使用,都得政府先批。据The Information报道,这种”逐客户审批”的模式可能会持续几周甚至更久。

    Mythos已经在预览状态卡了好几个月,没有任何迹象表明它会在短期内进入一般发布。哪怕GPT-5.6的延迟只有”几周”,对于砸了几十亿美元训练成本的AI实验室来说,这也是真金白银的损失。

    问题远不止”慢几周”

    模型发布的节奏一旦被打乱,连锁反应会很快传导到数据中心建设、融资计划、甚至整个行业的信心。如果每一个前沿模型的发布都要先过政府这道关,而且没有清晰的审批标准,那AI公司怎么规划产品路线图?

    更棘手的是,美国政府目前根本没有能力做这种审批。GMU研究员、即将入职OpenAI的Dean Ball在一篇分析文章里说得很直白:监管方既没有明确的安全评估框架,也说不清楚到底在防什么风险。

    网络安全、生物风险、模型对齐——这些都是真实存在的关切,但不能靠”先拖几个月再说”来解决。

    行业需要联合,而不是互咬

    这件事最有意思的地方在于:Anthropic和OpenAI突然有了完全相同的利益。之前大家都在看热闹,觉得是不是Anthropic用监管手段打压OpenAI,或者OpenAI跟特朗普政府走得太近、把对手挤出去。

    但现在的情况很清楚——不管你跟政府关系多好,审批的刀随时可能落下来。今天卡的是Anthropic,明天可能就是OpenAI,后天 maybe 是Google。

    Russell Brandom在TechCrunch的文章里说得很明白:这已经不是Anthropic vs OpenAI的故事了,而是整个AI行业跟政府监管之间的博弈。如果行业不联合起来推动一个合理的审批框架,而是各自想着怎么利用监管打击对手,最后大家一起完蛋。


    接下来会怎样

    未来几周,AI公司面临的选择很明确:是继续把安全审查当成竞争工具,还是联手推动一个透明的、可预期的审批流程?

    从商业角度看,后者的难度显然更大——意味着要跟竞争对手合作,意味着要接受某种形式的行业自律。但从整个行业的长期发展来看,这可能是唯一不把大家都拖死的办法。

    AI模型的能力已经强到让政府不得不插手。这是好事还是坏事,取决于行业怎么应对。

  • 这家公司用《堡垒之夜》训练AI Agent,估值23亿美元

    一家纽约创业公司正在把电子游戏变成AI Agent的训练场。General Intuition本周宣布完成3.2亿美元融资,估值23亿美元。它的核心想法听起来像科幻小说:让AI在《堡垒之夜》这类游戏里练级,然后把学到的能力直接搬到右手机器人身上。

    AI Agent在游戏中训练
    General Intuition用游戏数据训练AI Agent,再迁移到真实机器人(图片:AI生成)

    同一个”大脑”,从游戏到现实

    走进General Intuition纽约办公室的研发区,联合创始人兼CEO Pim de Witte(31岁)会让访客看一块显示器。屏幕上有人在玩类似《堡垒之夜》的游戏——但操控它的不是人类,而是一个AI Agent,已经连续跑了100个小时。

    然后你会听到电子脚步声。一台四足机器人走过来,用身上的摄像头”看”到你,绕着你转了一圈,继续在办公室里探索。刚才那个打游戏的AI模型,现在正在驱动这台实体机器人。

    “我们在真实世界的机器人数据上只微调了8分钟,这个模型就能上岗了。而且这些数据是在街上采集的,不是在办公室里。”

    这套打法的关键在于:General Intuition不只是有游戏画面,它还拿到了玩家实际操作的手柄记录——每一个按键、每一次移动,都是带标注的训练数据。创始人de Witte的上一家公司Medal就是做游戏精彩回放分享的,积累了数亿小时的游戏录像,这才是真正的护城河。

    23亿美元的底气

    这一轮融资由Khosla Ventures领投,Jeff Bezos、Eric Schmidt、F1冠军Nico Rosberg都跟进了。Khosla本人说,他看好的是”直觉的涌现”——就像大语言模型涌现推理能力一样,世界模型的下一次跃迁可能是直觉式判断,而游戏里的人类操作数据就是关键燃料。

    钱主要花在算力扩张上。General Intuition跟CoreWeave签了协议,接下来重点跑下一代模型的预训练。今年夏天结束前,他们的API会对更多客户开放。


    不卖公司,也不做武器

    De Witte是荷兰人,团队很大一部分在欧洲,这影响了公司的气质。他明确划定了红线:不会把AI Agent用于伤害人类的场景。”如果我说我们要做致命自主武器,你觉得其他国家会怎么反应?”

    这跟当下硅谷热衷国防科技的氛围有点格格不入。De Witte甚至还挖来了公开辞职抗议Palantir的Brianna Martin担任首席幕僚长。他说:”我不明白硅谷为什么这么做,所以我不在那里。”

    作为从小靠搭建《RuneScape》私服赚到第一桶金(150万美元)的游戏玩家,他也在想游戏从业者的出路。General Intuition刚上线了一个叫Nerve的平台,让游戏玩家用现有设备赚外快——从数据标注慢慢过渡到机器人遥操作。Medal的用户正好是最容易被AI替代的那代人,他想让他们搭上这班车。


    simulation到现实的鸿沟

    这套故事听起来很性感,但质疑声也不少。核心问题是:在游戏里学会的能力,能不能在真实世界里规模化落地?大多数类似路线都需要天量的真实世界数据,采集慢、成本高。General Intuition的赌注是:游戏数据是一条可扩展的捷径。

    投资方愿意赌一把。毕竟,如果这条路真的走通了,General Intuition可能成为AI Agent和机器人领域的”底座级”公司——就像Anthropic或OpenAI那样,不做具体应用,而是把模型能力开放给所有人用。

    De Witte说得很直白:”我们不会自己去造自动驾驶公司,但我们要让下一个人造自动驾驶公司容易10倍。”

  • Claude付费用户悄悄涨了75%,这家”企业向”AI公司正在撬动ChatGPT的消费者地盘

    很多人对Anthropic的印象还停留在”那是家做企业生意的公司”——开发者用Claude Code写代码,公司用它搭AI工作流,消费者市场?那是ChatGPT的地盘。

    一家做信用卡交易数据分析的公司Indagari,最近给出了不太一样的数据。他们分析了约2800万美国消费者的匿名信用卡交易记录,时间跨度从2025年到2026年5月10日,覆盖了订阅付费和API token购买。结论很直接:Claude在消费者端的付费用户,正在稳定增长。

    Claude与ChatGPT消费者市场竞争
    Claude正在消费者市场悄悄追赶ChatGPT

    增长从哪里来

    具体数字Indagari没有披露,但他们看到的趋势是”持续向右上方走”。自2026年1月以来,Claude在这2800万人的样本里,付费消费者收入和用户数增长了大约75%。

    有意思的是,这个增长在三月份还经历过一次跳涨——当时Anthropic公开拒绝让自家的模型被特朗普政府用于大规模监控美国公民和开发自主武器。这件事在消费者圈子里反而成了加分项,之后增长并没有回落,而是继续保持上行。

    Anthropic拒绝配合政府大规模监控这件事,反而让更多普通消费者愿意掏钱订阅Claude。在AI公司争相和政府合作的当下,这个选择挺少见的。

    学Claude的人越来越多了

    另一组数据来自在线教育平台DataCamp。他们有大约2000万用户,教的是AI技能和数据分析。DataCamp说,”Claude”现在已经是他们网站上被搜索次数最多的词,比”AI”这个统称还热门。

    在自费学习的消费者群体里,Claude相关课程的需求量是ChatGPT课程的3倍。过去30天里,Claude课程的需求增长了18倍。不过在企业客户那边,ChatGPT的课程仍然更受欢迎——公司出钱培训员工的时候,还是更认ChatGPT。

    ChatGPT还是老大,但差距在缩小

    当然,把Claude和ChatGPT摆在同一个量级上说,目前还为时尚早。Sensor Tower的数据很清楚:ChatGPT在各个平台上的总用户数和付费用户数,仍然远远领先。只是ChatGPT基数太大,近期的增长率相对平缓,而Claude从较小的基数往上走,增速看起来就更醒目。

    Indagari的数据也印证了这一点——ChatGPT的付费用户绝对数量还是更多,但Claude从消费者口袋里赚到的钱,2026年以来确实在快速追赶。


    麻烦事还没完

    就在数据看起来一片向好之际,Anthropic又碰上了美国政府这道坎。本月早些时候,美国政府禁止Anthropic向非美国公民提供其最强大的网络安全模型Mythos 5和Fable 5,原因是担心模型被滥用。Anthropic的应对是把这两款模型暂时全网下线,目前还没有明确何时恢复。

    这件事对消费者业务的影响目前还看不清楚。政府限制的主要是非美国用户的访问,对美国本土消费者的订阅意愿影响可能有限。而且Anthropic的企业和开发者用户数据也在继续增长,看起来并没有因为这场风波而受到明显冲击。

    眼下OpenAI和Anthropic都站在准备上市的门槛上,外界对这两家公司的业务健康度的好奇心比以往任何时候都强。从目前能拿到的各种数据来看,Anthropic在消费者市场的这波增长,可能不是昙花一现。