标签: AI成本

  • 把1200块GPU塞进集装箱:Runware用推理Pod把算力价格打下来

    Runware Sonic 推理 Pod 集装箱式 AI 数据中心
    Runware 的 Sonic Inference Pod:把整座推理数据中心装进一个 20 英尺集装箱

    过去两年大家都在比谁的 AI 数据中心更大、更烧钱,动辄几百亿美元、三到五年才能盖好。伦敦一家叫 Runware 的公司偏不这么玩。8 月 4 日他们扔出一个叫 Sonic Inference Pod 的东西——说白了,就是把最多 1200 块 GPU 塞进一个 20 英尺的集装箱里,插上电就能当一座推理数据中心用。

    一个集装箱就是一座厂

    这个 Pod 不是玩具。它自带定制服务器、电路板和闭环液冷系统,单箱能出大约 1 兆瓦的算力。最妙的是冷却方式:用一套密闭循环管路,只循环大约 1.5 立方米的水,几乎不消耗新水,还能把 GPU 温度稳在目标值上下 2 度以内,电源效率标到 99%。对比传统数据中心,差不多三分之一的电都拿去制冷而不是算题,这一下就把账算明白了。

    贵在”只做推理这一件事”

    Runware 的逻辑很简单——普通数据中心为了通用负载堆了一堆推理用不上的冗余:备份系统、过度设计的结构、超大建筑。他们算过,传统机房 40% 到 60% 的开支花在了推理根本用不到的地方。Pod 把这些全砍了,只保留推理要的部件。结果就是他们敢承诺推理价格比同行低 30% 到 80%,硬件成本比传统千兆瓦级数据中心低到差不多百分之一百倍,省下的钱直接反映到 GPU 小时报价上。

    “推理需求增长的速度,比机房盖出来的速度快得多。”Runware 联合创始人兼 CEO Flaviu Radulescu 说,”我们想做的是给全世界的智能供能,成为每个模型跑起来时身下的那根骨干。”

    哪里有电,就拖到哪里

    这种集装箱最大的卖点是”可搬家”。因为它自带一切、不挑电网,哪有便宜的电——比如太阳能电站旁边——往那一放就行。平均三周能部署一个,传统方案要三到五年。每个 Pod 接入同一张网络,一个挂了流量自动切到别的节点,不会整片瘫痪。目前 Runware 说已经在美、欧、亚太部署了 10 个,还有 160 个预备点位,客户里能点到 Higgsfield AI 和 Wix 的名字。

    一场和超大规模厂的逆向赛跑

    有意思的地方在于,OpenAI、xAI 和几家云巨头都在往几百亿、上千亿美元的固定资产里砸钱,Runware 却从另一头进场:那些对运行地点不挑、哪儿便宜往哪跑的推理负载,用能 truck 进来、插上电、再挪走的算力也许更划算。公司背后是今年 1 月拿到的 5000 万美元 A 轮(Dawn Capital 领投,a16z speedrun、Comcast Ventures 等跟投),说自己已经帮 20 多万开发者跑出 100 多亿次生成。下半年他们计划先上 1 万个推理节点,2027 年冲到 1 吉瓦。

    • 单箱最多 1200 块 GPU、约 1 兆瓦算力,闭环液冷不耗新水
    • 推理报价比同行低 30%–80%,设施成本可低至传统方案的百分之一
    • 平均三周部署,哪里有电拖到哪里,故障自动切流
    • 下半年先上 1 万节点,2027 年冲 1 吉瓦

  • Canva把AI野心撑太大了:营收预期砍掉三分之一,根子在第三方模型太贵

    Canva最近给投资人交了一份有点尴尬的成绩单。这家估值420亿美元、连续九年盈利的设计平台,把2026年的营收增长预期从年初定的30%下调到了20%——一口气砍掉三分之一。二季度营收其实还在涨,9.219亿美元,同比增25.2%,账上躺着14.7亿美元现金。问题不在需求,在于AI太烧钱。

    CEO梅兰妮·珀金斯在股东信里说得很直白:公司“过度依赖前沿模型”,自家的一批模型还没准备好上线,定价和消费模型又没跟上暴涨的用量。说白了,Canva想借OpenAI这些外部大模型把AI功能快速铺开,结果发现每次调用都在亏钱。

    “我们决定放慢铺开节奏,一边重建架构、压低单位成本,一边把商业模式做扎实。”——梅兰妮·珀金斯

    这事儿其实戳中了不少SaaS公司的痛点。Atlassian前不久就给员工AI支出设了上限。当“AI优先”从口号变成真金白银的账单,大家才意识到:用户每点一下生成按钮,背后都是实打实的算力开销。Canva有2.65亿月活、3100万付费用户,一个月生成的设计超过10亿张,这种体量下,每次调用的成本差一点,季度账单就能差出几千万。

    Canva的AI成本与自建模型
    AI功能铺得太快,算力账单先一步到来(配图由AI生成)

    过去三个月Canva没闲着。它重写了AI架构,把更多活儿交给2024年收购的Leonardo.AI和自研模型。效果挺猛:单个AI任务的服务成本降了将近九成,自家视频模型比前沿模型便宜17倍,图像模型便宜30倍。2.1版本已经在路上,珀金斯说会“审慎铺开”。

    一场给行业的刹车提醒

    这场“刹车”说明一件事:生成式AI的功能谁都能加,但要把单位经济算平,终究得自己掌握模型。外采省事,代价是利润被算力一点点吃掉。Canva用九成降本换来的经验,值得所有想做AI功能的SaaS公司记一笔。


    • 营收增长预期从30%降到20%,二季度营收9.219亿美元仍同比增25.2%
    • 根因:过度依赖OpenAI等前沿模型,单次AI服务成本过高
    • 自建模型+收购Leonardo.AI,AI任务成本降约90%,图像模型便宜30倍
    • 估值420亿美元、连续九年盈利,正考虑纳斯达克上市
  • Meta要把囤的 AI 算力卖出去:从最大买家变身云厂商

    Meta要把囤的 AI 算力卖出去:从最大买家变身云厂商

    7月1日彭博社爆料,Meta在筹划一项叫“Meta Compute”的云业务,打算把自己囤的 AI 算力和模型访问权卖给外面的公司。消息一出,Meta 股价当天涨了 8.8%,市值多了大概 1270 亿美元;而专门做算力租赁的 CoreWeave 和 Nebius 分别跌了 14% 和 17%,连美光、闪迪这些存储芯片股也跟着跳水。一边是狂欢,一边是恐慌,同一条新闻让两拨人看到了完全不同的未来。

    全球最大的 GPU 买家之一,正式转身成为算力卖家——这被不少人视为 AI 基础设施商业模式的一个分水岭。

    为什么要卖?

    Meta 今年 4 月把全年资本开支指引提到 1250 亿到 1450 亿美元,比去年的 722 亿差不多翻了一倍,钱都花在了数据中心、芯片和电力上。问题是,训练一个大模型可能几个月里把几万张 GPU 吃满,但训练一结束,这批集群的利用率就掉到三成到五成,剩下的算力就在那儿空转、烧电费。扎克伯格的打法一直是“先囤够再说”,先按最高峰的训练需求把地基打好,至于建完怎么用,回头再想。现在“卖出去”就是那个回头再想的答案。

    两条路子:托管模型,或者直接出租 GPU

    据知情人士说,Meta Compute 至少规划了两条线。一条学 AWS 的 Bedrock,把托管在自家基础设施上的模型(包括自研的 Muse Spark)开放给开发者,按 token 收费。这对 Meta 是头一回能从 Llama 生态里直接赚到钱——开源这么多年,Llama 被别家云厂商免费拿去商用,Meta 一分授权费都收不到。另一条更直接,学 CoreWeave 那种新型云公司,把 GPU 集群按小时租给企业客户。两条线同时推,牵头的是基础设施负责人 Santosh Janardhan、超级智能实验室的 Daniel Gross,还有 Meta 总裁 Dina Powell McCormick。

    Meta 计划把囤积的 AI 算力对外出租,直接闯进云计算市场
    Meta 计划把囤积的 AI 算力对外出租,直接闯进云计算市场

    市场为什么慌?

    这事真正戳中的,是撑了 AI 产业两年狂奔的那套逻辑——算力稀缺。过去两年,“算力不够用”维持了坚挺的租赁价格,也给巨头们疯狂扩张提供了理由。可要是连 Meta 这种级别的买家都开始往外卖“富余”算力,投资人自然会问:基建是不是要到顶了?高盛的交易台已经警告,一旦供给上来、租赁价往下走,最先扈不住的就是硬件。衡量 H100 租赁价格的 ORNN 指数最近确实在往下掉。

    • 出租的是上一代 H100/H200 推理算力,前沿训练要用的 GB200、自研 Rubin 芯片 Meta 还在拼命买
    • 目标据说是每 GW 每年变现 100 亿到 150 亿美元,把“成本包被”变成创收资产
    • SpaceX/xAI 已经跑通类似模式:把孟菲斯的 Colossus 集群按月租给 Anthropic,月租 12.5 亿美元

    一家 To C 公司,能做好 To B 吗?

    麻烦也在这儿。AWS、Azure、谷歌云做了几十年,靠的不只是机房,还有成熟的软件平台、企业销售队伍和客服体系。Meta 靠广告活了 21 年,是个彻彻底底的 To C 公司,突然要去伺候企业客户,节奏、文化、人才都得重搭。更微妙的是反垄断:Meta 跟 CoreWeave 还有总额 352 亿美元的长期采购合同没走完,一边是人家最大的客户,一边又下场抢生意,这种双重身份监管一看一个准。

    短期看,Meta 卖算力是笔资产周转的买卖——把上一代推理算力拿出来回血,同时继续囤最新的训练卡。但往长了看,当算力从“抢都抢不到的稀缺品”慢慢变成“能挂牌出售的大宗商品”,整个行业的定价方式、竞争格局和投资故事,可能都要重写一遍。扎克伯格说过,几乎每周都有公司来问能不能买他们的算力,甚至愿意出高于成本的价。现在,这些人等到回音了。

  • 马斯克又放卫星:Grok 4.5 自称 Opus 级,价格却砍到零头

    SpaceXAI 上市后交出的第一张答卷,就是 Grok 4.5。马斯克在 X 上把它称作“Opus 级模型”——也就是能跟 Anthropic 最硬的 Opus 系列掰手腕,但他紧接着补了一句:更快、更省 token、还更便宜。

    一张为“干活”而生的模型

    SpaceXAI 在周三的博客里把 Grok 4.5 定位成“干活主力”:写代码、搭应用、处理办公室杂活、做研究、写文档,这些行业里最想甩出去的重复脑力活它都想接。跟 Cursor 联合训练是这次的关键——数万名工程师在 Cursor 上的真实操作数据被喂进了模型,专门补上 Grok 过去在编程这块最空的短板。

    “我们的内部评估是,Grok 4.5 大致相当于 Opus 4.7,但快得多。能力、速度、低成本三者加在一起,才是它的竞争力。”——马斯克

    SpaceXAI 发布的 Grok 4.5 模型配图
    Grok 4.5 是 SpaceXAI 上市后的首个大模型,主打高 token 效率(图:Getty Images)

    真正的卖点不是跑分,是账单

    SpaceXAI 说 Grok 4.5 的 token 效率是其他头部模型的两倍。落到价格上就很直白了:输入每百万 token 2 美元,输出 6 美元。对比一下——Opus 4.7 是 5 美元和 25 美元,OpenAI 最贵的 Sol 档是 5 美元和 30 美元。换句话说,干同样的活,花的可能只有别人的零头。

    • 跑分没冲到全场第一,但在 SWE Bench Pro 上用到的输出 token 大约只有 Opus 4.8 的四分之一
    • 服务速度约 80 TPS,马斯克预告下周上下文窗口会拉到 100 万
    • 训练跑在数万块英伟达 GB300 上,和 Cursor 的数据飞轮一起转

    选在 GPT-5.6 前一天亮牌

    这周本来就是大模型发布的大周。OpenAI 的 GPT-5.6 定在周四全量开放(此前因美国政府的安全审查被卡了一阵)。SpaceXAI 偏偏选在前一天把 Grok 4.5 丢出来,火药味不用多说——它赌的不是谁的分数高,而是谁能让企业少掏钱。

  • 微软在Excel里悄悄换掉OpenAI:自研MAI接管Office

    微软总部与Office办公场景
    微软正把自研MAI模型悄悄塞进Excel和Word的AI功能里(图:Getty Images)

    过去两年,微软给外界的印象一直是”OpenAI 最铁的盟友”——Copilot 背后站着 GPT,Office 365 的不少智能功能都贴着 OpenAI 和 Anthropic 的标。但彭博社 7 月 7 日的一则报道把这个默契撕开了一道口子:在 Excel 和 Word 里,已经有相当一部分用户提问,不再交给 OpenAI 或 Anthropic,而是由微软自己的 MAI 模型来回答。

    具体数字没公开,但彭博说,每个星期这两款软件里已经有”数万条”AI 提示词是 MAI 在处理。别看占比还小,放到 Excel 和 Word 这种亿级用户的产品里,这已经是微软第一次把自研模型悄悄塞进了核心办公场景的台前,而不只是躲在测试环境里。

    从 Excel 和 Word 开始,微软动了”外人”的奶酪

    有意思的是,微软自己从没高调宣传过这步棋。以前它巴不得你记得 Office 365 是”由 OpenAI 和 Anthropic 的模型驱动”;现在它选择了闷声干。TechCrunch 找微软求证,对方只回了一句”暂无更多信息可以分享”。这种不否认也不解释的态度,某种程度上比一份正式声明更说明问题。

    微软 AI 模型业务负责人穆斯塔法·苏莱曼(Mustafa Suleiman)在 6 月 Build 大会上说得直白:”我们每年向 Anthropic 支付巨额费用,目标是逐步减少、并最终消除这部分支出。”

    一句话把动机说透了:不是不想用,是太贵了。

    七个模型一起上,MAI 到底是什么来头

    MAI 不是临时起意。就在今年 6 月的 Build 开发者大会上,微软一口气发布了 7 款全新的自研 AI 模型,覆盖语音、图像、代码和推理——其中包括一个能写代码的 agentic coder,以及一个文生图模型。也就是说,微软已经在为”逐步替换第三方”悄悄准备弹药了。

    这些模型的卖点很统一:不追求纸面参数多吓人,而是强调”同样的活儿,花更少的算力”。放在 Office 这种每天海量、高频、但单次并不复杂的调用场景里,自研模型的成本优势会被放大。再配合微软自己的 Maia AI 芯片做软硬协同,推理开销比外购方案低上一截。

    • MAI-Transcribe-1 / MAI-Voice-1:对标 OpenAI Whisper 的语音转录与生成
    • MAI-Image-2:图像生成,替代部分文生图需求
    • MAI Code 1 Flash:面向开发者的代码生成模型
    • MAI Thinking 1:主打轻量高频办公场景的推理模型

    除了 Office 套件,MAI 也已经接进了 GitHub Copilot;Teams 上自研的语音转写能力也计划在几个月内上线。微软的意思很明确:凡是能自己干的,就别再长期花钱请外援。


    不只是微软,整个硅谷都在”省 token”

    把镜头拉远一点,微软这步其实是一股大潮里的一朵浪。今年上半年还流行”tokenmaxxing”——能多烧就多烧,把智能拉满;最近几个月画风突变,Amazon、Uber、Meta、Accenture 都被曝在收紧员工的 AI 预算,能省则省。AI 服务的账单一出来,连硅谷自己人都被吓到。

    更戏剧性的是,成本压力甚至把一些公司推向了”对手阵营”。有报道说,硅谷已经有人开始盯着中国的便宜模型(比如 GLM-5.2)找 Agent 方案,虽然绕不开安全和合规的顾虑。这说明一件事:当账单足够疼,地缘和安全的优先级都会往后挪一挪。

    自研到底,是想把命门攥回自己手里

    微软当然不会明天就跟 OpenAI、Anthropic 说拜拜。它手里还握着和 OpenAI 的合作协议,只是折扣窗口正在收窄。苏莱曼团队真正在做的,是搭一套”自主可控”的模型体系,免得将来被头部实验室的市场价拿捏。

    这也折射出整个行业的尴尬:靠外购大模型做商业化,盈利模型到现在都没完全跑通。微软这次把自研模型塞进 Excel 和 Word,看起来是省几块钱的小动作,实则是大厂为”AI 主权”交的第一笔学费。接下来,GitHub Copilot、Teams,甚至 Bing,会不会也慢慢换上 MAI,值得盯着看。

  • Grok 4.5发布:马斯克不拼参数了,改拼性价比

    淡出主流模型竞技场两个月之后,马斯克的 Grok 又坐回了牌桌。北京时间 7 月 9 日,SpaceXAI 正式发布旗舰模型 Grok 4.5。和过去每家都在喊”我们最强”的画风不同,这次马斯克显得很务实:他在 X 上连发几十条动态,反复强调一句话——能力和 Claude 的 Opus 4.7 差不多,但快得多,也便宜得多。

    Grok 4.5 概念配图
    Grok 4.5 概念配图(本文配图由 AI 生成)

    一张”够用就好”的牌

    Grok 4.5 是个 1.5T 参数的 MoE 模型,上下文拉到 50 万 token,主打编程、智能体和知识工作,还能看图输入。在考察编程的 SWE Bench Pro 上它拿到 64.7%,刚好压过 Opus 4.7 的 64.3%;Terminal Bench 2.1 冲到 83.3%,DeepSWE 1.0 的 62% 也超过了 Opus 4.8。推理速度能跑到 80 TPS,已经挤进第一梯队。

    有网友引用测试说,Grok 4.5 只花了大约十七分之一的成本,就做到了接近 Claude Fable 的性能。马斯克没有顺杆爬,反而老老实实承认差距:”公平地说,Fable 确实比 Grok 4.5 好得多,但大多数任务并不需要 Fable 级别的能力。”

    真正让对手冒汗的是价格

    但 SpaceXAI 真正想卖的不是分数,而是账本。它的 API 定价是每百万输入 token 2 美元、输出 6 美元。作为对照,Opus 4.7 的输入要 5 美元、输出 25 美元。完成同一个 SWE 任务,Grok 4.5 吐出的 token 量大约只有 Opus 4.8 Max 的四分之一。

    把模型调用价格推向台前,是这一轮竞争里最现实的变化。当企业把 Agent 跑在生产环境、每天调用成千上万次,token 账单就变成了真金白银。谁能在不掉链子的前提下把单位成本压下来,谁就握住了开发者的切换按钮。

    • 和 Cursor 联合训练,面向真实编码场景打磨
    • 下周推送百万 token 上下文版本,月底还有 2T 参数版本预告
    • 已在 SpaceXAI 控制台、Grok Build 和 Cursor 三端上线

    说到底,马斯克这次没再玩”参数军备竞赛”那一套。他赌的是另一件事:在绝大多数真实工作里,用户要的不是天花板级别的智能,而是一份”能力够用、速度快、账单轻”的交付。特斯拉和 SpaceX 的硬核工程师觉得 Grok 4.5 真好用,这比任何榜单都更能说明问题。

  • 亚马逊秘密项目Moonraker曝光:要让Alexa真正像个能办事的Agent

    亚马逊 Alexa AI 代理概念图
    亚马逊秘密项目 Moonraker 旨在让 Alexa 升级为 AI 代理(概念图)

    Amazon 的 Alexa 一直被吐槽”听懂了但办不成事”。最近 Business Insider 翻出一批内部规划文件,曝光了一个此前没对外说过的项目,代号”Moonraker”——亚马逊想让 Alexa 从一个”问答机”变成能一口气跑完多个动作的 AI 代理。

    从”一句话”到”一串动作”

    现在的 Alexa+ 已经能帮用户叫车、买票,不过得靠 Uber、Ticketmaster 这些合作伙伴接好接口,本质上还是”你说一句、它办一件”。Moonraker 要做的,是让一次请求触发一连串操作。文件里举了个例子:”帮我叫辆车,再给我朋友发条消息”——以前 Alexa 大概率会卡在第二步,现在它要自己把这两件事都办了。

    这个方向一点都不新鲜,Google、OpenAI、Anthropic 早就推出了能自己上网、跑多步流程的 agent 产品。亚马逊只是终于坐不住,要把 Alexa 也推进这条赛道。

    代价是真贵

    但让 Alexa 变聪明,烧钱也烧得吓人。内部文件直接把 Moonraker 标成 Alexa+ 这轮升级里”成本最高”的新项目,预计 2026 年光 GPU 费用就要超过 1 亿美元。有文件甚至建议,要么推迟、要么缩水,给成本压力降降温。

    一些亚马逊高管觉得,团队在喂 Alexa 的 AI 模型上花超了,运行这些模型的费用已经成了内部越来越大的心病。这其实不是亚马逊一家的问题——整个硅谷都在经历一场”token 账单”的清醒:当先进 AI 真正铺开,账怎么算都肉疼。

    Alexa 的”成长的烦恼”

    翻翻 Alexa+ 的履历,麻烦一直没断过。助手在美国的铺开被推迟了好几回,年初才扩大可用范围;内部 beta 测试的时候还曝出幻觉、答非所问的问题,有个员工的 Alexa 误把鱼缸过滤器关了,鱼当场没了。CEO 贾西在最新的股东信里倒是很乐观,说大家跟 Alexa+ 聊天翻了一倍、下单频次是以前的三倍,但也没忘补一句:”Alexa 离成为全世界最好的个人助理,还早得很。”

    为了撑起 Moonraker,亚马逊去年底就备好了几百张英伟达 GPU,测试时还用了 Anthropic 的 Sonnet 模型做高级推理和视觉回应。不过面对 BI 的提问,亚马逊选择了不置评。


    说到底,Moonraker 是亚马逊给 Alexa 的一场豪赌:它想让语音助手真正”办成事”,而不只是”聊聊天”。只是这门生意的账,目前怎么看都不便宜。

  • 微软开始省着花:Excel和Word里的AI,正悄悄换成自家模型

    微软开始省着花:Excel和Word里的AI,正悄悄换成自家模型

    过去这一年,硅谷最流行的一句话大概是”先猛烧再说”。不管是训练大模型、还是给员工配满AI工具,大家都在比谁花的钱多。可最近风向明显变了,连微软这种家底厚实的巨头,都开始精打细算起来。

    彭博社这周二(7月7日)报道了一件事:微软在自己最常用的两款产品——Excel和Word里,已经开始用自家的MAI模型去回应一部分用户提问,而不再完全依赖OpenAI和Anthropic的模型。换句话说,你打开Office让Copilot帮你写段话、做个表,背后接的很可能已经不是GPT,而是微软自己养的模型了。

    微软用自家MAI模型替代第三方AI
    微软正把Office里的第三方模型,逐步替换成自家的MAI系列

    曾经的卖点,如今成了要砍的成本

    这个动作有点打脸的意思。毕竟微软过去没少拿”我们的Office由OpenAI和Anthropic的模型驱动”当卖点,在2025年9月的那篇官方博客里,还专门强调过这套强强联手的配置。现在悄悄换成自家模型,说明账算不过来了——第三方模型的调用费,确实不便宜。

    微软嘴上没多说,被TechCrunch问到时只回了一句”暂无更多可分享的信息”。但行动上,它已经把”降本”摆上了台面。

    其实微软也没把第三方模型一脚踢开,目前仍是混着用。它更大的算盘,是趁这两年把自家AI能力立起来。就在上个月的Build开发者大会上,微软一口气发布了7个新的MAI模型,里头既有能写代码的agentic coder,也有能生图的text-to-image生成器。自己有粮,才不用总看别人脸色。

    不只是微软一个人在”抠门”

    把时间拉回到今年初,那会儿圈内流行的是”tokenmaxxing”——能烧多少烧多少,仿佛不把GPU跑满就输了。可才过了几个月,画风就转成了”tokenminimizing”。据各家媒体披露,Amazon、Uber、Meta、埃森哲这些大公司,都在不同程度地给员工的AI支出踩刹车。

    • Amazon据报开始管控内部AI用量,别让小任务把预算烧穿
    • Meta被曝限制员工使用AI的规模,相关开支已经到了几十亿美元的级别
    • 埃森哲也在教员工别拿大钱干小事,能省则省

    这股省钱风甚至把目光引向了大洋彼岸。硅谷有些公司开始盯上中国的便宜模型(比如GLM-5.2)来找agentic方案的替代,哪怕心里还惦记着潜在的安全风险。当一个行业开始认真比较”哪家模型更便宜”的时候,说明狂奔的阶段确实过去了。


    微软这步棋背后,其实是一个谁都绕不开的问题:当AI成了每家公司的水电煤,账单谁来扛?把核心能力攥回自己手里,既是为了省钱,也是为了别在关键时刻被供应链卡脖子。接下来的看点很简单——Office里的Copilot,到底还有多少比例会换成微软亲生的模型。

  • Coinbase把AI算力账单砍了一半,办法是换用中国模型

    Coinbase把AI算力账单砍了一半,办法是换用中国模型

    Brian Armstrong 在 X 上轻描淡写地发了一条消息,说 Coinbase 现在跑在 GLM 5.2 和 Kimi 2.7 这些中国模型上。这条消息淹没在 AI 圈的每日喧嚣里,但如果你仔细看数据,会发现一个信号:西方 AI 实验室正在被自己的高定价逼出一个竞争对手——而且这个竞争对手来自太平洋彼岸。

    先说结果。Coinbase 的 token 使用量在过去几个月里创了历史新高,因为像 GPT-5.x-Thinking 和 Opus 4.5 这样的推理模型大量进来了。但与此同时,公司的 AI 支出却砍了一半。一半。Armstrong 说这话的时候语气很平淡,好像在说一件理所当然的事。

    Coinbase AI成本优化示意图
    企业 AI 支出优化正成为新的竞争力 | 制图:AI资讯

    91% 的开发者根本不在乎你给了什么模型

    这件事最反直觉的地方在于:Armstrong 并没有强制所有人换模型。开发者仍然可以自由选择任何模型。但数据告诉我们,91% 的人从来就没有触碰到旧的使用上限。他们用不满,是因为当前的模型够用了,或者他们根本懒得去调。

    Coinbase 同时跑了一套自动路由系统,根据任务类型、价格和缓存可能性来挑最优模型。光是改进缓存策略这一项,就把缓存命中率从 5% 拉到了 60%。开发人员被建议保持上下文精简,为新任务开新会话——这套打法归属于当下流行的”上下文工程”范畴。

    “你在 AI 上花的钱越多,我们期望你产出的影响就越大。”Armstrong 说这话的时候,把”tokenmaxxing”(无脑烧 token 刷内部分数榜)的文化打破了。Coinbase 没有设硬性上限,但把每个人的使用量公开了。这一招比直接封顶更狠。

    不只是 Coinbase 一个人在干

    初创公司 Lindy 的 CEO 最近把 Claude 整个扔了,全线换成 DeepSeek v4。Snowflake 的 CEO 测试下来觉得 GLM 5.2 在不少任务上跟 Opus 4.7 差不多,但价格只是一个零头。这些公司不是在用”便宜货”凑合,而是在用足够好的模型把成本结构打穿,然后把省下来的钱花在别的地方。

    这对西方 AI 实验室来说是个实实在在的压力测试。OpenAI 和 Anthropic 还在准备 IPO,需要拿出漂亮的增长数字来支撑估值。但如果大客户开始用中国开源模型替代,那些增长数字还撑得住房吗?JPMorgan 最近在一份报告里列了一堆 AI 市场的红旗指标,其中”客户价格敏感度上升”被放在了显眼位置。


    价格战已经悄悄打响了

    有消息说 OpenAI 和 Anthropic 之间正在酝酿一场关于 API token 的价格战。OpenAI 刚推出的 GPT-5.6-Sol 跟 GPT-5.5 定价一样,但官方说法是比 Claude Fable 和 Mythos 更省 token。OpenAI 同时还放出了两个更弱的 5.6 变体,价格低得多。

    这套打法很像当年的云服务价格战——亚马逊 AWS 用规模优势把价格压到竞争对手活不下去。现在轮到 AI 模型层了。唯一不同的是,这次”低价入侵者”来自中国,而且他们的模型真的不差。

    📎 原文来源:Coinbase joins the rush to Chinese AI models as Western labs face a pricing stress test — The Decoder

    发布时间:2026年6月28日 | 作者:Matthias Bastian

  • 美光被华尔街当成下一个英伟达:一个月股价涨236%,AI内存短缺让它飞起来了

    美光科技的股票在过去一个月里涨了236%,收盘价1132美元。这家总部位于爱达荷州博伊西的内存芯片制造商,市值一度在周四短暂超过了Meta和特斯拉,虽然周五又跌回去了,但也差不多和它们持平了。

    从存储卡厂商到AI豪赌赢家

    大多数普通消费者提到美光,想到的还是那种给电脑、手机扩容用的小内存卡。但这家公司现在赚的钱,跟那个产品线已经没太大关系了。

    AI数据中心的扩建潮造成内存芯片严重短缺,无论是系统内存DRAM还是闪存NAND,美光都生产,尤其是高带宽内存(HBM),一块AI服务器需要的内存量是笔记本电脑的好几个数量级。英伟达这样的AI系统制造商,还有微软、亚马逊AWS、谷歌、Meta、甲骨文这些超大规模云厂商,都在疯狂采购内存。

    Micron AI内存芯片与股市上涨概念图
    美光科技搭乘AI内存热潮,股价一路飙升(图:AI生成概念图)

    财报数字确实吓人

    上周美光发布的第三财季财报,用”爆炸”来形容都不为过:营收414.5亿美元,是去年同期的4倍;利润从18.8亿美元直接跳到282亿美元。第四财季的营收指引更是给到490亿到510亿美元之间。

    华尔街一直在找下一家能像英伟达那样长期赚钱的AI概念公司,美光看起来符合这个想象。

    美光当前的市值约1.27万亿美元,Meta是1.39万亿,特斯拉是1.42万亿。几个月前,美光的的股价还在100美元以下徘徊了好几年。

    长期协议能不能扛过周期?

    内存芯片行业有个老问题:扩建生产线又慢又贵,等产能上来,需求往往已经掉了,然后就是供过于求、价格暴跌。美光这次能不能不一样?

    美光自己在财报电话会上强调,已经签了一堆长期供应协议,包括和英伟达以及AI实验室Anthropic的协议。公司说在数据中枢、消费和汽车市场段签了16个战略客户协议,这会”从根本上改变商业模式”。

    William Blair的分析师Sebastien Naji在一份研究报告中写道,需求增长继续超过新洁净室空间的上线速度,”考虑到未来几个季度ASP(平均售价)持续上涨的可能性很大,加上与关键客户的长期协议(SCA)迅速增加带来了更好的营收能见度,我们认为盈利增长有潜力变得更持久。”


    内存短缺的局面(有人叫它”RAMageddon”)预计会持续到2027年,已经在推高苹果产品和Xbox主机等消费电子的价格。美光能不能真正成为”下一个英伟达”,还是会在下一轮内存周期里被打回原形,接下来几个季度见分晓。