标签: AI模型

  • AI模型发布要经过政府审批——这件事比Anthropic和OpenAI的竞争大多了

    美国政府审批AI模型发布概念图
    美国政府开始逐个审批AI模型发布,整个行业都面临新现实

    两周前,美国政府的手伸进了AI公司的模型发布环节。Anthropic的Fable和Mythos模型被要求下架,OpenAI的GPT-5.6也面临类似的”逐客户审批”模式。整个行业突然意识到,问题已经不是”Anthropic vs OpenAI”那么简单了。

    从竞争到共存:两家公司突然站在了一起

    Russell Brandom在TechCrunch写了一篇文章,标题很直接:”It’s not about Anthropic vs. OpenAI anymore”。他的核心论点是:OpenAI和Anthropic现在面临完全一样的困境,如果这个问题处理不好,整个行业都会受影响。

    具体来说,美国政府现在对前沿AI模型的发布有了实质性的控制权。模型发布前要经过政府审批——这个流程目前没有清晰的标准,也不知道监管者到底在防什么风险。

    GMU研究员Dean Ball(即将入职OpenAI)写了一篇长文,详细解释了这个问题:政府既没有专业能力,也没有足够的人力来做这种级别的模型测试。

    更有意思的是行业内部的反应。很多人都把这件事看成Anthropic搞的”监管捕获”——通过推动政府监管来卡OpenAI的脖子。或者反过来,认为是OpenAI跟特朗普政府走得太近,牺牲Anthropic来换取自己的模型获批。

    问题比”谁搞的”大多了

    但Brandom的论点是,现在纠结”谁搞的”已经没有意义了。因为政府审批这件事,一旦变成制度,对所有AI公司都是一样的。没有哪种方案是”只帮一家公司、不帮另一家”的。

    举个例子:如果政府要求每个前沿模型发布前都要做安全评估,那OpenAI要做,Anthropic要做,Google要做,微软也要做。这套流程的成本和复杂度,最后会拖慢所有人的节奏。

    而且,如果审批标准不透明、流程不可预期,AI公司就没办法做长期研发规划。你花了几个月训练一个新模型,结果政府说”这个不能发”——这种风险会让投资人犹豫,也会让数据中心的融资变难。

    行业需要联手推动合理的监管框架

    那现在最需要的是什么?Brandom认为,是整个行业联手推动一个合理的监管框架。具体来说:

    • 建立由独立机构(而不是政府部门)主导的模型评估流程
    • 明确监管者到底在防什么风险(网络安全?生物风险?对齐问题?)
    • 避免”逐个审批”这种拖死创新的方式

    Dean Ball在他的文章里提了一些具体的建议,比如让独立第三方来做模型安全评估,而不是让某个政府部门说了算。这个思路其实跟其他行业的产品审批逻辑类似——药品要过FDA,但FDA是相对独立的专业机构,不是行政部门随意操控的工具。


    但问题是,AI行业里的很多人并不买账。他们要么觉得政府根本不该管,要么觉得”就算管,也得按我家的利益来管”。这种零和思维恰恰是Brandom最担心的——如果各家AI公司继续把监管问题看成”我赢你输”的竞争工具,最后只会换来一个糟糕的监管框架,所有人都受害。

    AI模型的能力现在已经到了能产生真实政治后果的地步。这意味着,不管AI公司愿不愿意,政府都会管进来。区别只在于,是政府说了算,还是行业能主动推一个合理的方案。接下来的几周,我们就会看到AI行业到底有没有能力坐下来谈这件事。

  • Anthropic的Mythos 5回来了,但只向网络防御者开放——Fable 5还在等

    6月26日,美国商务部部长霍华德·卢特尼克(Howard Lutnick)给Anthropic联合创始人汤姆·布朗(Tom Brown)发了一封信。这封信的日期是6月26日,内容是关于Mythos 5模型的解禁——但只是部分解禁。

    两周过山车

    过去两周,Anthropic一直在和特朗普政府谈判。过程像过山车一样,走走停停,最后勉强谈出了一个折中方案。根据The Verge拿到的政府信件内容,商务部同意”修订许可要求”,理由是Anthropic”近期与美国政府合作,解决了与Mythos 5和Fable 5相关的风险”。

    但这个结果只能说勉强及格。Mythos 5——Anthropic最强的网络安全模型——被允许重新部署给”一小群网络防御者和基础设施提供商”。至于面向公众的Fable 5系列,目前仍处于悬而未决的状态,没有任何上线时间表。

    Anthropic发言人丹妮尔·吉列里(Danielle Ghiglieri)对The Verge表示:”我们已收到美国政府通知,Mythos 5——我们最强的网络安全模型——可以重新部署给一小群网络防御者和基础设施提供商。我们正在努力为获批的提供商群体恢复Mythos 5的访问权限,并继续与政府合作,扩大Mythos 5的访问范围,让Fable 5再次面向大众开放。”

    Anthropic Mythos 5 部分解禁
    Mythos 5经历两周谈判后终于部分恢复访问

    出口管制并没有解除

    需要明确的是,美国政府并没有撤销两周前对Anthropic下达的出口管制令。那道命令禁止任何外国国民访问Mythos 5或Fable 5(包括Anthropic自己的员工)。这次的”修订”本质上是为Mythos 5开了一个口子——允许特定类型的组织访问,方式和之前OpenAI的GPT-5.6被”逐客户审批”如出一辙。

    也就是说,出口管制的大框架还在,只是Mythos 5拿到了一个例外。Fable 5呢?没有任何消息。普通用户想用上Fable 5,恐怕还得等上一段时间。


    中美AI监管的不同路径

    这件事更大的背景是:美国和中国的AI监管路径正在出现明显分化。美国这边,政府直接介入模型发布审批——哪家公司能发什么模型、能卖给谁,商务部说了算。中国那边,监管更多集中在内容安全、数据合规和算法备案上,对模型发布本身没有直接审批机制。

    Anthropic这次的谈判由汤姆·布朗亲自牵头,说明公司高层对这件事的重视程度。毕竟,Mythos 5是Anthropic当前最强的模型,被卡住出口对任何AI公司来说都是重大打击。部分解禁至少让Anthropic能继续服务一部分核心客户,但距离”正常状态”还差得很远。

  • Anthropic被禁出口,中日AI公司趁机推出了自己的平替

    Anthropic被禁出口,中日AI公司趁机推出了自己的平替

    两周前,美国政府一纸禁令,把Anthropic的Mythos和Fable 5模型对非美国人关上了门。这件事在AI圈炸了锅,但很快,中日两国的AI公司就给出了自己的答案——不是抗议,而是直接推出了替代品。

    中国的”神话”对抗”神话”

    本周三,中国网络安全公司360正式发布了”屠龙锋”(Tulongfeng),一款专门用于网络安全领域的AI工具。360的说法很直接:这款工具能和Anthropic的Mythos正面对抗。Mythos是什么?它是Anthropic专门针对网络安全场景打造的AI模型,能力强到让特朗普政府不得不对它实施出口管制。

    亚洲AI公司推出Mythos替代品概念图
    中日AI公司趁Anthropic出口禁令,推出本土化AI模型

    360没止步于此,同时还发布了另一款工具”一天真”(Yitianzhen),专注自动化网络防御和事件响应。360创始人周鸿祎在发布会上说了一句话,挺值得玩味:漏洞发现AI是”国家战略资产”,他担心的是”单向透明”——有些玩家能用上先进的漏洞检测能力,有些则被挡在门外。

    “漏洞发现AI是国家战略资产,我们需要警惕’单向透明’的风险。”
    ——周鸿祎,360创始人

    日本的”河豚”游得挺快

    差不多同一时间,东京的AI初创公司Sakana AI发布了Fugu(日文”河豚”的意思)。这家公司说,Fugu的性能可以”和Anthropic的Fable 5、Mythos Preview肩并肩”。Fugu不只是跟风,它有一个挺有意思的设计思路:编排模型(Orchestration Model)。简单说,它能协调调用多个其他AI模型,通过API把它们的能力串起来,而不是只靠自己。

    Sakana的联合创始人David Ha在X上写了一段话,说出了很多人的心声:”对单一供应商的依赖,是国家基础设施的风险。出口管制让大家意识到,这种风险是真实存在的。访问顶级模型的权利可能一夜之间消失,集体智能才是对抗权力集中的实用对冲。”

    Sakana是哪来的底气?这家公司2023年由前谷歌研究员Ren Ito、Llion Jones和David Ha联合创立,去年11月完成了1.35亿美元B轮融资,估值26.5亿美元。他们的主打方向是便宜好用的生成式AI模型,专门为日语和日本文化优化,在小数据集上也能跑得不错。

    时机”纯属巧合”?

    Sakana对外的说法是,Fugu的发布”纯属巧合”,研发从去年就开始了,相关研究今年春天还在ICLR上发表过。但他们的网站广告语写的是”提供前沿能力,没有出口管制风险”——这话说得挺直白的。

    Sakana的联合创始人Ren Ito上周在G7峰会边会上也谈到了这个话题。他写了一篇专栏文章,呼吁美国联邦政府”把保持盟友的访问权限作为第一优先级”,他的观点是”AI不应该成为一种被囤积的技术,而应该是共同开发的”。


    这两家公司,一个在中国,一个在日本,面对Anthropic的出口禁令,给出了两种不同的回应方式。360是直接硬刚,做一款同场景的替代品;Sakana则是做一个”保险”,让你在失去访问权限的时候还有别的选择。哪种思路更管用,现在还不好说。但有一件事是确定的:Anthropic五月份刚刚宣布年化收入突破470亿美元,其中有多少来自亚洲企业客户,外界不得而知。但禁令生效这几周,东京和北京各有一家公司站出来填了这个空缺。就算哪天禁令取消了,本地替代品已经在这里了,而且它们更懂本地语言和文化。这场博弈,才刚刚开始。

  • AI监管变天:Anthropic和OpenAI突然站在了同一艘船上

    AI监管变天:Anthropic和OpenAI突然站在了同一艘船上

    AI监管变天:Anthropic和OpenAI突然站在了同一艘船上
    文章配图

    这两周AI圈子发生了一件挺有意思的事——Anthropic的Fable和Mythos两个模型被美国政府强制下架,而OpenAI刚准备发布的GPT-5.6,眼看也要走进同一个”审批死角”。

    两家公司打得不可开交,结果现在被同一把剑悬在头顶。竞争格局突然变了。

    审批”死角”到底有多深

    事情要从两周前说起。美国政府对Anthropic施压,导致Fable和Mythos两个模型被撤出一般发布渠道。当时很多人的第一反应是:这是Anthropic自己搞的,还是别人告的?

    现在答案逐渐清晰——不管谁起的头,结果吃亏的是整个行业。OpenAI的GPT-5.6据传只做”有限预览”,而且每一个企业客户要使用,都得政府先批。据The Information报道,这种”逐客户审批”的模式可能会持续几周甚至更久。

    Mythos已经在预览状态卡了好几个月,没有任何迹象表明它会在短期内进入一般发布。哪怕GPT-5.6的延迟只有”几周”,对于砸了几十亿美元训练成本的AI实验室来说,这也是真金白银的损失。

    问题远不止”慢几周”

    模型发布的节奏一旦被打乱,连锁反应会很快传导到数据中心建设、融资计划、甚至整个行业的信心。如果每一个前沿模型的发布都要先过政府这道关,而且没有清晰的审批标准,那AI公司怎么规划产品路线图?

    更棘手的是,美国政府目前根本没有能力做这种审批。GMU研究员、即将入职OpenAI的Dean Ball在一篇分析文章里说得很直白:监管方既没有明确的安全评估框架,也说不清楚到底在防什么风险。

    网络安全、生物风险、模型对齐——这些都是真实存在的关切,但不能靠”先拖几个月再说”来解决。

    行业需要联合,而不是互咬

    这件事最有意思的地方在于:Anthropic和OpenAI突然有了完全相同的利益。之前大家都在看热闹,觉得是不是Anthropic用监管手段打压OpenAI,或者OpenAI跟特朗普政府走得太近、把对手挤出去。

    但现在的情况很清楚——不管你跟政府关系多好,审批的刀随时可能落下来。今天卡的是Anthropic,明天可能就是OpenAI,后天 maybe 是Google。

    Russell Brandom在TechCrunch的文章里说得很明白:这已经不是Anthropic vs OpenAI的故事了,而是整个AI行业跟政府监管之间的博弈。如果行业不联合起来推动一个合理的审批框架,而是各自想着怎么利用监管打击对手,最后大家一起完蛋。


    接下来会怎样

    未来几周,AI公司面临的选择很明确:是继续把安全审查当成竞争工具,还是联手推动一个透明的、可预期的审批流程?

    从商业角度看,后者的难度显然更大——意味着要跟竞争对手合作,意味着要接受某种形式的行业自律。但从整个行业的长期发展来看,这可能是唯一不把大家都拖死的办法。

    AI模型的能力已经强到让政府不得不插手。这是好事还是坏事,取决于行业怎么应对。

  • 这家公司用《堡垒之夜》训练AI Agent,估值23亿美元

    一家纽约创业公司正在把电子游戏变成AI Agent的训练场。General Intuition本周宣布完成3.2亿美元融资,估值23亿美元。它的核心想法听起来像科幻小说:让AI在《堡垒之夜》这类游戏里练级,然后把学到的能力直接搬到右手机器人身上。

    AI Agent在游戏中训练
    General Intuition用游戏数据训练AI Agent,再迁移到真实机器人(图片:AI生成)

    同一个”大脑”,从游戏到现实

    走进General Intuition纽约办公室的研发区,联合创始人兼CEO Pim de Witte(31岁)会让访客看一块显示器。屏幕上有人在玩类似《堡垒之夜》的游戏——但操控它的不是人类,而是一个AI Agent,已经连续跑了100个小时。

    然后你会听到电子脚步声。一台四足机器人走过来,用身上的摄像头”看”到你,绕着你转了一圈,继续在办公室里探索。刚才那个打游戏的AI模型,现在正在驱动这台实体机器人。

    “我们在真实世界的机器人数据上只微调了8分钟,这个模型就能上岗了。而且这些数据是在街上采集的,不是在办公室里。”

    这套打法的关键在于:General Intuition不只是有游戏画面,它还拿到了玩家实际操作的手柄记录——每一个按键、每一次移动,都是带标注的训练数据。创始人de Witte的上一家公司Medal就是做游戏精彩回放分享的,积累了数亿小时的游戏录像,这才是真正的护城河。

    23亿美元的底气

    这一轮融资由Khosla Ventures领投,Jeff Bezos、Eric Schmidt、F1冠军Nico Rosberg都跟进了。Khosla本人说,他看好的是”直觉的涌现”——就像大语言模型涌现推理能力一样,世界模型的下一次跃迁可能是直觉式判断,而游戏里的人类操作数据就是关键燃料。

    钱主要花在算力扩张上。General Intuition跟CoreWeave签了协议,接下来重点跑下一代模型的预训练。今年夏天结束前,他们的API会对更多客户开放。


    不卖公司,也不做武器

    De Witte是荷兰人,团队很大一部分在欧洲,这影响了公司的气质。他明确划定了红线:不会把AI Agent用于伤害人类的场景。”如果我说我们要做致命自主武器,你觉得其他国家会怎么反应?”

    这跟当下硅谷热衷国防科技的氛围有点格格不入。De Witte甚至还挖来了公开辞职抗议Palantir的Brianna Martin担任首席幕僚长。他说:”我不明白硅谷为什么这么做,所以我不在那里。”

    作为从小靠搭建《RuneScape》私服赚到第一桶金(150万美元)的游戏玩家,他也在想游戏从业者的出路。General Intuition刚上线了一个叫Nerve的平台,让游戏玩家用现有设备赚外快——从数据标注慢慢过渡到机器人遥操作。Medal的用户正好是最容易被AI替代的那代人,他想让他们搭上这班车。


    simulation到现实的鸿沟

    这套故事听起来很性感,但质疑声也不少。核心问题是:在游戏里学会的能力,能不能在真实世界里规模化落地?大多数类似路线都需要天量的真实世界数据,采集慢、成本高。General Intuition的赌注是:游戏数据是一条可扩展的捷径。

    投资方愿意赌一把。毕竟,如果这条路真的走通了,General Intuition可能成为AI Agent和机器人领域的”底座级”公司——就像Anthropic或OpenAI那样,不做具体应用,而是把模型能力开放给所有人用。

    De Witte说得很直白:”我们不会自己去造自动驾驶公司,但我们要让下一个人造自动驾驶公司容易10倍。”

  • Claude付费用户悄悄涨了75%,这家”企业向”AI公司正在撬动ChatGPT的消费者地盘

    很多人对Anthropic的印象还停留在”那是家做企业生意的公司”——开发者用Claude Code写代码,公司用它搭AI工作流,消费者市场?那是ChatGPT的地盘。

    一家做信用卡交易数据分析的公司Indagari,最近给出了不太一样的数据。他们分析了约2800万美国消费者的匿名信用卡交易记录,时间跨度从2025年到2026年5月10日,覆盖了订阅付费和API token购买。结论很直接:Claude在消费者端的付费用户,正在稳定增长。

    Claude与ChatGPT消费者市场竞争
    Claude正在消费者市场悄悄追赶ChatGPT

    增长从哪里来

    具体数字Indagari没有披露,但他们看到的趋势是”持续向右上方走”。自2026年1月以来,Claude在这2800万人的样本里,付费消费者收入和用户数增长了大约75%。

    有意思的是,这个增长在三月份还经历过一次跳涨——当时Anthropic公开拒绝让自家的模型被特朗普政府用于大规模监控美国公民和开发自主武器。这件事在消费者圈子里反而成了加分项,之后增长并没有回落,而是继续保持上行。

    Anthropic拒绝配合政府大规模监控这件事,反而让更多普通消费者愿意掏钱订阅Claude。在AI公司争相和政府合作的当下,这个选择挺少见的。

    学Claude的人越来越多了

    另一组数据来自在线教育平台DataCamp。他们有大约2000万用户,教的是AI技能和数据分析。DataCamp说,”Claude”现在已经是他们网站上被搜索次数最多的词,比”AI”这个统称还热门。

    在自费学习的消费者群体里,Claude相关课程的需求量是ChatGPT课程的3倍。过去30天里,Claude课程的需求增长了18倍。不过在企业客户那边,ChatGPT的课程仍然更受欢迎——公司出钱培训员工的时候,还是更认ChatGPT。

    ChatGPT还是老大,但差距在缩小

    当然,把Claude和ChatGPT摆在同一个量级上说,目前还为时尚早。Sensor Tower的数据很清楚:ChatGPT在各个平台上的总用户数和付费用户数,仍然远远领先。只是ChatGPT基数太大,近期的增长率相对平缓,而Claude从较小的基数往上走,增速看起来就更醒目。

    Indagari的数据也印证了这一点——ChatGPT的付费用户绝对数量还是更多,但Claude从消费者口袋里赚到的钱,2026年以来确实在快速追赶。


    麻烦事还没完

    就在数据看起来一片向好之际,Anthropic又碰上了美国政府这道坎。本月早些时候,美国政府禁止Anthropic向非美国公民提供其最强大的网络安全模型Mythos 5和Fable 5,原因是担心模型被滥用。Anthropic的应对是把这两款模型暂时全网下线,目前还没有明确何时恢复。

    这件事对消费者业务的影响目前还看不清楚。政府限制的主要是非美国用户的访问,对美国本土消费者的订阅意愿影响可能有限。而且Anthropic的企业和开发者用户数据也在继续增长,看起来并没有因为这场风波而受到明显冲击。

    眼下OpenAI和Anthropic都站在准备上市的门槛上,外界对这两家公司的业务健康度的好奇心比以往任何时候都强。从目前能拿到的各种数据来看,Anthropic在消费者市场的这波增长,可能不是昙花一现。

  • OpenAI GPT-5.6 因政府要求限制发布,监管大幕刚拉开

    OpenAI GPT-5.6 政府监管
    OpenAI 最新模型 GPT-5.6 的发布受到美国政府限制

    OpenAI本周五证实,应美国政府要求,它正在把最新一代模型GPT-5.6的发布范围压缩到”一小群受信任的合作伙伴”。这件事的蹊跷之处在于,政府没有发正式禁令,而是”要求”企业自觉,企业也真的照做了。

    这一代GPT-5.6一共有三个型号:Sol是旗舰,Terra是日常使用的均衡版本,Luna则是速度更快、成本更低的选项。按理说Sol是OpenAI目前最强的模型,但特朗普政府把三个型号的发布全都限了。OpenAI的说法是,预览版只给那些”参与情况已与政府共享”的合作伙伴。

    特朗普政府这波操作不是孤立事件。此前Anthropic发布其最强公开模型Fable 5之后,政府直接下令禁止任何外国国民访问,导致Anthropic不得不把整个模型下线。

    政府到底要干什么

    前白宫AI顾问、即将入职OpenAI的Dean Ball说得很直白:特朗普最近签的那项行政令,要求特定AI公司在发布前最多30天把最先进的模型提交政府审查,这实际上是搞出了一个”事实上的非自愿许可制度”,对前沿AI实施了强力限制。

    Ball还指出一个更棘手的问题:政府并没有拿出明确的安全标准。这意味着什么?模型发布可能被无限期推迟。对中国来说这可能是好消息,对美国那些砸了几十亿美元建AI基础设施的公司来说,这简直是噩梦。

    OpenAI这次虽然照做了,但态度很明确:这不该成为长期默认做法。公司在周五的博客里写得很清楚:”我们不认为这种政府审查流程应该成为长期默认。它让用户、开发者、企业、网络防御者和全球合作伙伴都无法获得最好的工具。”

    GPT-5.6 Sol到底强在哪

    撇开监管风波不谈,GPT-5.6 Sol确实是OpenAI目前最强的模型。根据OpenAI的说法,Sol在编码、生物和网络安全方面的代理能力都有提升,还引入了”max”推理努力模式和”ultra”模式——后者用协调的子代理来解决高度复杂的任务(当然,你的token消耗量也会随之飙升)。

    OpenAI宣称GPT-5.6 Sol在几个基准测试中都表现优异,编码工作流甚至略优于Anthropic的Claude Mythos 5(没错,就是本月也被特朗普政府实际上禁掉的那款)。而且Sol的性价比更高——输出token用量只有Mythos预览版的三分之一。


    安全方面,OpenAI强调Sol搭载了目前最强大的安全堆栈,对对抗性攻击做了深度加固,而且故意优化为优先支持防御性网络安全工作,而不是进攻性渗透。换句话说,这个模型的设计目标就是难被越狱,同时优先教用户怎么防御攻击,而不是怎么入侵系统。

    OpenAI还学乖了——Anthropic的Fable 5当初就是因为过度谨慎栽了跟头。Fable 5上线那短短几天里,只要分类器检测到高风险话题(比如网络安全、生物、化学),它不光会拒绝提示词,还会偷偷把请求路由到一个旧模型。这种过度谨慎的流程和”暗箱降权”引发了大量误报和用户反弹。OpenAI这次把安全护栏直接内置到核心模型行为里,而不是靠上面叠一个独立过滤器。

    定价和开放时间表

    GPT-5.6三个型号的定价分了档:Sol是每百万输入token 5美元、输出token 30美元;Terra正好是一半;Luna则是1美元和6美元。OpenAI还改进了提示词缓存,让重复提示的成本更便宜、也更可预测。

    目前的限制只是”短期步骤”,OpenAI说接下来几周会让GPT-5.6走上更广泛应用之路,同时正与政府合作制定新的行政令框架,涉及网络安全,以及”未来模型发布的可重复流程”。

    话说回来,政府伸手管模型发布这件事,才刚刚开始。Anthropic的Mythos风波还没完全平息,OpenAI又被迫缩小发布范围,接下来轮到谁?谷歌?Meta?这场AI监管大戏,估计还有得演。

  • OpenAI联手博通九个月拿出第一颗自研芯片,Jalapeño能不能撼动英伟达?

    OpenAI联手博通九个月拿出第一颗自研芯片,Jalapeño能不能撼动英伟达?

    6月24日晚上,OpenAI在旧金山和帕洛阿尔托两地同步开发布会,亮出了一颗以墨西哥辣椒命名的芯片——Jalapeño。这是OpenAI成立九年来的第一颗自研芯片,从立项设计到成功流片,只用了九个月。

    OpenAI Jalapeño AI推理芯片
    OpenAI与博通联合发布的首款自研AI推理芯片Jalapeño,从设计到流片仅用时九个月。

    发布会现场,博通CEO陈福阳(Hock Tan)和总裁Charlie Kawwas把首批工程样片交到了OpenAI CEO山姆·奥特曼和总裁格雷格·布罗克曼手里。这个画面挺有象征意义的——一家靠算法和模型起家的AI公司,正式迈进了硬件领域。

    九个月做出一颗芯片,这是什么概念

    正常来说,一颗复杂AI芯片从设计到流片,周期通常是18到24个月。Jalapeño只用了九个月,部分原因是OpenAI自己参与了开发流程——AI帮工程师加快了某些设计工作。

    但更关键的是分工。OpenAI负责芯片的底层架构设计,博通负责硅片实现(代工制造)和网络硬件(包括Tomahawk交换芯片),加拿大电子制造服务商Celestica负责板卡与机架系统集成。这种分工模式让OpenAI能专注于自己最懂的部分——AI模型需要什么样的计算——而把制造和集成交给有经验的人。

    博通CEO陈福阳在接受路透社采访时说,Jalapeño的性能”可与英伟达Blackwell芯片和谷歌TPU相媲美”。他同时透露,这款AI加速器相比传统GPU可节省约50%的成本。

    专门优化的ASIC路线

    Jalapeño不是通用GPU,而是一款面向大语言模型推理场景量身打造的ASIC(专用集成电路)。与英伟达GPU相比,ASIC可编程灵活性更低,但可以针对AI专属任务做深度优化,成本优势显著。

    在架构上,Jalapeño重点优化了数据流,减少数据移动,让计算、内存与网络资源的配置更均衡,实际利用率更接近理论峰值。OpenAI硬件负责人理查德·何(Richard Ho)说,团队围绕”对前沿AI模型最为关键的内核、内存传输、网络以及服务模式”对架构做了全面优化。

    首批工程样片已经在实验室以量产标准的频率和功耗条件下稳定运行机器学习任务,还成功跑通了OpenAI今年2月推出的代码模型GPT-5.3-Codex-Spark。早期测试显示,Jalapeño的每瓦性能(能效比)将显著优于当前业界最先进水平。

    只供内部使用,不对外销售

    一个值得注意的细节:Jalapeño芯片和配套服务器系统均不会对外销售,只供OpenAI内部使用。配套服务器由天弘科技负责生产。

    这意味着OpenAI做这颗芯片,目的不是跟英伟达打擂台卖芯片,而是给自己建一条算力的”后路”——降低对英伟达GPU的依赖,同时压低自己的推理成本。

    这个策略不难理解。OpenAI每年花在算力上的钱是个天文数字,而且英伟达GPU并不总是那么容易拿到。能自己控制供应链,对OpenAI这样的公司来说,战略价值远大于财务账面上省的那点钱。

    部署时间表和后续规划

    按照OpenAI的规划,Jalapeño将在2026年底前开始小规模部署,2027年快速爬坡,2028年上半年实现全面规模化量产。远期规划总耗电量最高将达到10吉瓦,配套建设千兆瓦级数据中心集群。

    OpenAI把Jalapeño定位为”多代计算平台的首个里程碑”。布罗克曼说:”通过自主研发更多底层技术环节,我们可以用更高效率提供智能服务,持续推动前沿人工智能技术实现规模化普惠落地。”

    芯片发布也让人联想到OpenAI的IPO传闻。奥特曼最近表示,公司正考虑”在未来一年内”进行公开上市。Coinbase已经推出了与OpenAI相关的Pre-IPO期货。自己掌握芯片供应链,对于一家准备上市的公司来说,绝对是加分项。


  • 这个AI不直接回答问题,它把Claude和Gemini叫来一起干活

    大多数AI模型的工作方式都很直白:你问问题,它给你答案。但日本AI创业公司Sakana AI最近发布的Fugu Ultra模型,选择了一条完全不同的路——它自己不生产答案,而是充当”调度主任”,把任务派给其他AI模型来完成。

    这个听起来有点”偷懒”的思路, benchmark跑分居然干翻了一众前沿模型。Sakana说Fugu Ultra在编码、推理、科学计算、智能体能力这些硬核测试里,成绩和Anthropic的Fable 5、Mythos Preview基本持平。一个”二传手”凭什么做到这个水平?答案藏在它的架构里。

    Sakana Fugu Ultra AI模型架构示意图
    Fugu Ultra通过调度多个前沿AI模型协同完成任务(配图由AI生成)

    “河豚”的命名来由

    Fugu在日语里是”河豚”的意思。河豚是一道需要极高烹饪技艺的菜——处理得当是美味,处理不好就是毒药。Sakana(日语”鱼”的发音)用这个词命名自己的模型,大概是在暗示:把多个AI模型编排在一起,本身就是一门险中求胜的手艺。

    技术上说,Fugu本身也是一个训练过的语言模型,只是它的专长不是直接回答用户的提问,而是学会了一套”智能体编排”的能力。当你向Fugu发起请求,它先判断这个任务该怎么做:简单的就自己搞定,复杂的就自动组建一个”专家团队”来协同完成。

    Fugu通过训练学会了判断”什么时候该把任务委托出去、智能体之间怎么通信、怎么把多个模型的输出整合成一个可靠的答案”——这整套编排逻辑不是人工写死的规则,而是模型自己学出来的。

    底层调用了哪些模型?

    Sakana没有公开完整名单,但确认Fugu会在合适的任务上调用Claude和Gemini等前沿模型。有意思的是,Fugu不会告诉你它这次具体用了哪个模型——用户看到的是一个统一的回答,底层调度对用户透明。

    这个设计有个很实用的好处:如果某家供应商突然限制访问(比如美国政府某天又说不许某些地区用Claude),Fugu可以自动切换到其他可用模型,不需要用户手动干预。这种”供应商无关”的架构,在当下的地缘政治环境下显得格外有意思。

    • Fugu Ultra针对复杂多步骤任务优化,可调度更深的智能体池
    • 基础版Fugu平衡性能与延迟,支持用户自主排除特定模型(满足数据合规需求)
    • 底层智能体池完全可替换,未来会持续纳入更新的高效模型
    • Sakana强调:未公开可用的闭源模型(如Fable 5)不会被纳入智能体池

    Beta测试用户的真实反馈

    接近500人的Beta测试里,收集到了一些挺有说服力的反馈。一位软件工程师说,Fugu Ultra做代码审查比GPT-5.5更全面,能发现其他工具漏掉的漏洞——别的工具标出3个问题,Fugu能找出20个以上。一位企业平台公司的高管提到,Fugu在长会话里的人格稳定性远超其他模型,不会出现”人格漂移”,这对智能体类产品来说是个关键指标。

    还有一位网络安全工程师的反馈也很典型:只要给Fugu一个范围明确的指令,它能端到端完成信息收集、XSS/SQL注入检测、认证逻辑审查,最后输出一份带证据和复测步骤的完整报告,而且全程不超出指定范围,不会乱执行破坏性操作。

    这会不会是AI的新范式?

    Fugu的出现,触及了一个正在AI圈子里引发越来越多讨论的问题:未来最强大的AI能力,会不会不是来自某个单一的超大模型,而是来自能把各种模型调度好的”元模型”?如果答案是肯定的,那训练和拥有底座大模型的公司,和那些最擅长编排底座模型的上层公司,谁的价值链地位更高?

    Sakana自己当然相信后者。他们在ICLR 2026发表的两篇论文(TRINITY和Conductor)就是在为这个方向做学术背书。Fugu能不能真的跑出来,还需要更多真实场景的验证,但至少它提出了一个值得认真看待的问题:当每个人都在训练更大的模型的时候,也许最聪明的玩法不是造更大的模型,而是把现有的模型用得更聪明。


  • 有人做了个AI”名气排行榜”,你的名字在大模型里有多大分量?

    有人做了个AI”名气排行榜”,你的名字在大模型里有多大分量?

    AI模型名气排行榜
    “In the Weights”网站界面,像素风设计,展示AI模型对人物的”认知强度”

    你上一次在谷歌上搜索自己的名字是什么时候?如果你试过,你可能已经注意到结果和以前不太一样了。这不是你的错觉——随着聊天机器人越来越成为人们获取信息的主要方式,搜索引擎已经不再是那个”权威记录者”了。

    那么问题来了:如果有人想看看自己在AI眼里”存在”吗,该怎么办?

    两个前OpenAI员工做了一个”AI虚荣搜索”

    托马斯·丁森和乔伊·弗林决定解决这个问题。他们做了一个叫”In the Weights”的网站——名字里的”weights”指的是AI模型的参数权重,也就是那些决定模型输出效果的神秘数字。

    这个网站做的事情很简单,但也足够让人上头:它向十几个主流AI模型(包括Grok、Gemini、多个版本的GPT、Claude、Llama)提出一个类似”XXX是谁?给出最多10个结果”的问题,然后给出一个”强度分数”。分数越高,意味着AI模型们越”认识”你。

    “在weights里,意味着你的存在被认为在创造超级人工智能的过程中是重要的。”——In the Weights网站关于页面

    排行榜一直在变

    网站的排行榜是实时变化的——就在我写这篇文章的时候,排名第一的是《小鬼当家》的主演麦考利·卡尔金,他的强度分数是988,和歌剧演唱家卢西亚诺·帕瓦罗蒂咬得很紧。

    TechCrunch的作者安东尼·哈——就是报道这件事的那位记者——在这个网站上的强度分数是641,排在前6%。他承认自己看了一眼同事的分数之后,感觉还能再高一点。

    网站还会标注可能的AI幻觉:显然GPT-5.4 Mini在回答”Anthony Ha是谁”的时候,给出的答案是”这是一个缩写,可能指代多个人”。

    这不只是虚荣心作祟

    丁森在接受TechCrunch采访时说,2026年做谷歌式的”虚荣搜索”已经不对了,因为越来越多的流量在流向大模型。他还说,这个网站的方向某种程度上是被一篇戏谑的博客文章”定调”的——那篇文章用幽默的方式讨论了AI权重和”我们是否只是一堆肉做的”这个经典哲学问题。

    到目前为止,这个网站的”接收情况”已经超出了他们的预期。他们本来以为这会是一个小小的好奇心满足工具,没想到它好像触发了某种神经——人们真的很好奇自己是否能在超级智能里”永垂不朽”。


    In the Weights用一种轻松、怀旧的方式(网站界面是任天堂NES风格的像素风)提出了一个严肃的问题:当AI模型成为人们认知世界的主要中介的时候,被AI”记住”到底意味着什么?你可以去试试看——但友情提醒,分数可能会让你有点在意。