标签: AI基础设施

  • IBM主机业务一季暴跌42%,AI热潮先抬轿又拆了自家现金牛

    IBM刚交出的这份季报,坏得连自己都提前打了招呼。上周CEO阿尔温德·克里希纳破天荒地先给投资人写了封信,说这一季”比我们预想的还差”,让大家有个心理准备。结果财报一出,股票当天就跌了25%,创下这家115岁公司有史以来最惨的单日跌幅。

    这一季IBM进账172亿美元、毛利99亿、净利22亿,毛利率接近58%——放别的公司这是漂亮账本,可拖后腿的是那台曾经最稳的现金牛:大型主机业务同比暴跌42%。

    IBM CEO 阿尔温德·克里希纳
    IBM CEO 阿尔温德·克里希纳 图片来源:TechCrunch

    主机砍单,牵一发动全身

    主机跌四成为什么这么要命?财务负责人吉姆·卡瓦诺在电话会上算了笔账:主机硬件每卖出1美元,背后能带来3美元的软件收入。一台主机动辄几十万到几百万美元,加上维护合同和配套软件,一单就是几百上千万的流水。所以季度里只是”几十家”客户推迟换机,账面上就砸出了一个大窟窿,还顺带把全年的增长预期一起下调了。

    克里希纳和卡瓦诺在会上反复强调,这只是”暂时的波动”,很快会缓过来。可市场显然没那么好哄——毕竟这个业务过去几年一直被AI数据中心的热潮托着往上走,如今说翻脸就翻脸。

    同一波AI热潮,先抬轿后拆台

    这里有个挺讽刺的地方。克里希纳的解释是,那些本该换主机的客户,把预算挪去买别的硬件了。为什么?因为AI大建设把数据中心设备和PC的价格抬到了离谱的地步,涨幅普遍在15%到30%。企业IT预算就那么多,钱先去填了涨价最凶的坑,换主机的计划自然往后排。

    这不是IBM一家的说辞。戴尔、惠普早就警告过,AI抢内存等元器件把成本推高,逼得他们不得不涨价;连苹果都调过Mac和iPad的价格。换句话说,托起IBM这条船的是AI热潮,把船按下去的也是同一波热潮。

    • 季度营收172亿美元、净利22亿,主机业务同比跌42%
    • 主机硬件每1美元销售,带动约3美元软件收入
    • 股价单日跌25%,为IBM史上最大单日跌幅
    • 数据中心设备与PC涨价15%-30%,挤占了客户换机预算

    这回AI真能把主机送走吗

    克里希纳把话说得很满:客户迟早还是要买新主机、续新软件合同的,甚至有一部分本季度已经下单了。”我们没看到任何客户从主机上迁走的迹象。”他这么讲。

    到底是不是暂时的坎,得等下季度见分晓。不过话说回来,”主机要死了”这句话,科技圈已经喊了几十年,从小型机到云计算,一茬接一茬地预言,主机却一直活着。也许这次连AI也未必能让它退场——银行、保险、政府这些跑核心交易的地方,短期内还真找不到能顶替它的东西。IBM赌的正是这份惯性。

  • AMD 豪掷 50 亿美元投资 Anthropic,2GW 的 MI450 显卡就位

    这两天 AI 圈又有笔大钱落了地。AMD 在周三官宣,要往 Anthropic 投最多 50 亿美元,同时帮这家公司把算力盘子做大。作为交换,Anthropic 会用上最多 2 吉瓦(GW)的 AMD Instinct MI450 系列 AI 显卡,跑在 AMD 新推出的 Helios 机架级系统上。

    AMD 与 Anthropic 达成最高 50 亿美元战略合作
    AMD 将向 Anthropic 投资最多 50 亿美元,并部署 MI450 系列 AI 显卡。(图源:The Verge)

    光看数字可能没感觉,拆开说就明白了。2GW 是什么概念?大概相当于两座中等城市全年的用电峰值压进一堆机房里。Anthropic 计划先在 2027 年上半年把第一座 1GW 的集群点亮,剩下的后续铺开。这事儿最早是《华尔街日报》捅出来的,AMD 自己随后发了公告确认。

    “通过与 AMD 在全栈层面合作,我们既锁定了需要的算力容量,又能针对 Claude 的训练和推理做优化。” —— Anthropic 联合创始人、首席计算官 Tom Brown

    为什么是 AMD,而不是老朋友英伟达

    过去提到前沿模型的算力,大家默认就是英伟达的卡。Anthropic 虽然也不是纯英伟达阵营——它之前就搭过 Google 的 TPU、Amazon 的 Trainium——但 AMD 能拿下一家顶级实验室的”主粮”订单,意义不一样。MI450 是 AMD 今年力推的新一代 Instinct,配上 Helios 这种把计算、网络、散热打包好的机架方案,摆明了是要正面啃英伟达的蛋糕。

    对 AMD 来说,这笔买卖不只是一张订单。Anthropic 是当下最能打的大模型团队之一,它的背书等于给 MI450 做了一次硬核实测广告。往后别的公司采购时,心里会多一个”连 Anthropic 都在用”的参照。

    Anthropic 的算力拼图越铺越大

    把这次合作放进水里看,Anthropic 最近在算力上的动作密集得有点吓人。它前面已经和 SpaceX、TeraWulf 签了数据中心协议,又拉着 Google、博通(Broadcom)搞了一笔不小的基建交易,和 Amazon 也有算力方面的合作。甚至有传闻说,它跟 Meta 之间也可能谈成类似的租赁协议。

    一家原本以”安全优先”出名的实验室,现在像在同时下好几盘棋:一边要保证训练和推理用的算力源源不断,一边还得把供应方分散开,别被任何一家芯片厂绑死。2GW 的 AMD 卡,就是这张网里最新、也最显眼的一根线。

    钱之外的那层合作

    这次不是单纯的”我买你股票、你买我显卡”。双方还签了个多年工程协作:AMD 会把 Anthropic 的 Claude 用到自己的软件开发、工程和产品的日常流程里。换句话说,卖卡的人自己先成了重度用户——用 Claude 来写代码、做工程决策,等于把客户的工具嵌进了供应商的研发流水线。

    这种”你用我的模型优化我的芯片,我拿你的算力跑你的模型”的闭环,正在成为大厂之间的新默契。对 Anthropic 而言,多一个强力算力后盾;对 AMD 而言,多一个能帮它把软件生态磨顺的顶级伙伴。

    • AMD 最多投 50 亿美元,Anthropic 部署最多 2GW 的 MI450 显卡;
    • 首批 1GW 计划在 2027 上半年上线,基于 Helios 机架级系统;
    • Anthropic 近期算力合作已覆盖 SpaceX、TeraWulf、Google、博通、Amazon;
    • 双方另有多年工程协作,AMD 将 Claude 引入内部研发流程。

  • AI 数据中心 2035 年或吃下美国五分之一电力,是今天的 4 倍

    一个被低估的数字

    彭博新能源财经(BloombergNEF)刚出的一份报告,算了一笔有点吓人的账:到 2035 年,美国的数据中心可能吃掉全国五分之一的发电量,是现在的 4 倍。撑起这个预测的,是 AI 算力的疯狂扩张——未来十年,数据中心容量会冲到接近 200 吉瓦,其中将近一半用来做模型训练和推理。

    更关键的是,这些算力大部分还挤在美国本土。报告估计,到 2033 年,按电力需求算,全球 64% 的 AI 芯片都会落在美国。

    彭博这次对 2035 年用电量的预测,比它自己去年 12 月的版本高出了 83%。

    这可不是孤例。电力行业非营利机构 EPRI 把 2024 年的预测直接翻了一倍多,标普的预估在半年里也涨了超过三分之一。各大机构对数据中心耗电的判断,几乎都在往上修,原因只有一个:美国建数据中心的速度,比任何人预想的都快。

    电网已经在喊疼

    问题紧接着就来了:未来十年新建的数据中心,大部分要接上本来就紧绷的电网。PJM 互联电网从弗吉尼亚一路覆盖到伊利诺伊,到时要把 34% 的电力分给数据中心;管着得州大半的 ERCOT,也得拿出 22% 的发电容量。

    PJM 自己早就扛不住了。它手里攥着全美大量的数据中心,连接申请一度多到瘫痪,最后干脆把新电源接入的排队冻结了四年。今年 4 月虽然重新开放,但局面已经紧张到有一家公用事业公司(American Electric Power)威胁要退出互联。供需失衡,把电价在一年里推高了 76%。

    • 即便排队拥堵、价格飞涨,数据中心还是拼命想挤进 PJM——最近一次容量拍卖里,它们占了 38% 的费用。
    • 美国之外,数据中心也在狂奔。按激进情景,到 2033 年全球会多出 1935 太瓦时的电力需求,差不多等于印度一年的用电量。

    AI 的账单,最后谁来付

    这份报告点破了一件事:我们整天聊 AI 有多聪明、多便宜、多无处不在,却很少算它背后的电费。每一次模型训练、每一句聊天回复,都在悄悄吃掉电网里的电。当数据中心要占掉一个国家五分之一的电力,涨价的就不只是科技公司,还有普通家庭的账单。

    算力是 AI 的燃料,电是算力的燃料。在大家追逐更大模型、更强智能的时候,这道最底层的约束,可能比算法本身更早撞上天花板。

    数据中心与电力消耗
    图片来源:TechCrunch / Bloomberg via Getty Images

  • 前Google Brain研究员用AI智能体替非英伟达芯片写底层代码

    上个月,Jeremy Nixon 悄悄把一家公司推到了台前。这家叫 Infinity 的初创公司刚宣布拿到 1500 万美元融资,估值 1 亿美元,投资方里除了 Touring Capital、Principal VC,还有来自 OpenAI 和 Anthropic 的研究员个人。Nixon 本人是个有意思的人——他曾在 Google Brain 做研究,也是黑客社区 AGI House 的创始人。真正让外界注意到他的,是他抛出的一个有点狂的念头:AI 系统本身,能不能成为一种「元技术」,自己发明新东西。

    从「自动发明算法」到「自动写芯片代码」

    早在做 Infinity 之前,Nixon 就捣鼓过一个叫 Omega 的机器学习算法。它的特别之处在于,能自己创造出新的机器学习算法,然后在一个反馈回路里自动评估好坏。那次成功让他开始琢磨:这套思路能不能挪到别的地方?他盯上了硬件——自动化系统或许也能生成那些让芯片跑得更高效的底层代码,比如内核(kernel)这一类东西。

    英伟达的护城河,一半是软件

    这里得先说清楚一件事。很多人以为英伟达厉害是因为芯片性能好,这当然没错,但另一半答案藏在 CUDA 里。CUDA 是英伟达的软件层,让原本为图形设计的 GPU 能当通用处理器用,PyTorch、TensorFlow 都建在它上面。开发者用 Python 写应用,默认就跑在英伟达的卡上。问题是,绝大多数应用层公司既没资源也没本事自己写内核、把应用移植到别的芯片上。

    Nixon 想做的,是把 CUDA 这套「让芯片好用」的活儿交给一个 AI 智能体来干,而且不挑芯片——SRAM、GPU、手机芯片、Systolic Array 统统能适配。

    一个会自己改自己代码的智能体

    Infinity 的核心产品叫 Ignition,是个 AI 研究智能体。它的任务很硬核:为那些想挑战英伟达的芯片写 AI 推理所需的底层代码。它会测试、调试,测量硬件在这套代码下跑得快不快,不行就自动重写,直到性能提上去。整个系统是自优化的,会持续学习、自我改进,而且能适应不同的芯片架构,不管对方是不是闭源的。

    不收授权费,只抽性能提升的成

    这种打法听起来很「AI 原生」。Nixon 说,客户里已经包括 AI 芯片公司 D-Matrix——一家立志挑战英伟达的玩家,同时 Infinity 还在和其他大芯片厂、云厂商谈。更妙的是它的收费模式:不收前置授权费,而是从性能提升和成本节省里抽成,衡量的指标很直接,就是每秒令牌数(tokens per second)的变化。在一个案例里,这个智能体把原本可能要花几年或几个月的过程,压缩到了几小时或几天。

    • Infinity 不是第一家想拆英伟达墙角的公司,但它走的是「逐产品蚕食」的软件路线,而不是去造另一块卡。
    • 人类并没有被踢出局,而是给智能体定大方向,繁琐的体力活交给它。
    • 公司目前只有 26 个人,分布在设计、运营和工程岗。

    把视角拉远一点,Infinity 其实是这一波「AI 基础设施去中心化」浪潮里的一朵浪花。当训练和推理不再被绑死在某一家厂商的软件栈上,更多芯片公司才有机会把货卖出去。这条路能不能走通,取决于 Ignition 真能在不同架构上稳定逼近 CUDA 的水平——这是个需要时间验证的承诺,不是今天就能盖棺的事。

    Infinity 创始人 Jeremy Nixon
    Infinity 创始人 Jeremy Nixon(图源:TechCrunch)
  • 英伟达 Agent Toolkit:把 AI 智能体搬上桌面工作站

    英伟达最近给自家最强的台式工作站 DGX Station 塞进了一套新工具:Agent Toolkit。官方说,开发者只要三步、大概半小时,就能在本地把 AI 智能体跑起来——不用连云,模型和数据都留在你自己的机器上。

    本地 AI 智能体工作站概念图
    英伟达把智能体能力带到了桌面级工作站

    DGX Station 本身就不好惹,里面是一颗 GB300「Blackwell Ultra」GPU。Agent Toolkit 的价值,是把原来得靠云 GPU 集群才能玩转的复杂智能体,搬到了桌面端。

    借助 Omniverse 库,智能体可以在本地的安全运行时里调用工具与技能,完全不需要连接互联网。—— NVIDIA

    这一套到底装了什么

    它不是单个软件,而是一整个软件栈:

    • NemoClaw:开源的智能体蓝图,把模型、运行框架和 runtime 打包,方便团队照着自己的业务改
    • Nemotron 3 Ultra:一个 5500 亿参数的开放大模型,专为 DGX Station 优化,可以本地微调
    • Omniverse 库:把智能体接到物理仿真和 3D 工作流,机器人训练、自动驾驶仿真都能本地跑
    • OpenShell:开源的安全运行时,给智能体套上沙箱,按策略管住它碰什么工具、什么数据

    为什么是现在

    硬件底子是 GB300 超级芯片,最高 20 petaflops 的 FP4 算力、748GB 统一内存;网络用 ConnectX-8,带宽到 800GB/s,还能两台 DGX Station 并联扩容。NVIDIA 还拉上 Adobe、Blender、Unreal、Epic、Foundry、Canva 等伙伴做 MCP 接入,让智能体直接进到这些创作工具里干活。

    更关键的是战略转向。当资本市场开始计较 AI 的投资回报,英伟达把 Agent Toolkit 和 Omniverse 绑在一起,等于在说:我不只卖算力硬件,还想在你的工作站上长出一套软件生态。对怕数据出公司、又想快速迭代的企业来说,本地跑智能体确实少了一层顾虑。


  • AMD把「太阳神」搬进机房:Helios机架系统正面刚英伟达

    AMD Helios 机架级 AI 系统
    AMD 首款机架级 AI 系统 Helios,集 GPU、CPU、网络与软件于一体(概念图)

    7月20日,AMD 把憋了好久的一张王牌亮了出来——名叫 Helios 的机架级 AI 系统。名字取自希腊太阳神,摆明是要当算力界的「太阳」。这不是一块显卡,而是一整柜子:GPU、CPU、网络、软件全打包,直接对标英伟达那些动辄几百万美元的 AI 机柜。

    微软带头,巨头排队下单

    最让 AMD 长脸的是客户名单。就在发布当天,微软 CEO 纳德拉亲自表态,要在 Azure 数据中心部署 Helios,还顺手推出两款基于 AMD 新「Venice」CPU 的计算实例。更早之前,Meta 已经承诺逐步部署高达 6 吉瓦的 AMD GPU,其中 1 吉瓦今年就通过 Helios 机架交付;OpenAI 和甲骨文也点头要在年内大规模铺开;印度的塔塔咨询服务也在列。

    这背后是 AMD 十年的翻身账。它靠着三代产品路线图的严格执行,加上收购赛灵思、ZT Systems,一步步把 CPU 和 GPU 都做起来了。现在它敢说,Instinct GPU 已经服务全球前十 AI 公司里的八家,包括 OpenAI 和 SpaceX AI。

    苏姿丰此前放话:Helios 在推理、内存带宽和容量上,相比英伟达的机架系统有「显著优势」。

    算的是总账,不是单项性能

    AMD 数据中心业务负责人 Forrest Norrod 反复强调一个词:TCO,也就是总拥有成本。他说 Helios 追求的是最低的「每 token 综合成本」。道理不复杂——对微软、Meta 这种要养几吉瓦算力的巨头来说,单卡跑分高一点,不如整柜更省电、更便宜。

    不过现实也很骨感。研究机构 Futurum Group 估算,一台 Helios 机柜成本大约 500 万到 550 万美元,比英伟达第二代机架 Vera Rubin 的 350 万到 400 万美元还要贵;而且它重达 7000 磅,个头也更大。更要命的是份额:英伟达占数据中心 GPU 市场超过 95%,AMD 只有约 4.5%。

    • 分析师 Daniel Newman 认为,如果 AMD 执行到位,份额有望冲到 20%–25%,对应数千亿美元收入空间
    • AMD 一季度数据中心营收同比增长 57%,已是公司收入主力
    • 公司预计从 2027 年起,数据中心 AI 年收入将达到数百亿美元,大头来自 Helios

    硬件追上了,软件才是硬仗

    Counterpoint 的分析师 Neil Shah 点破了一层窗户纸:AMD 硬件已经和英伟达站到同一水平,但胜负手在软件生态。英伟达的 CUDA 护城河太深,AMD 这几年猛补 ROCm 开源生态,就是想拆这道墙。


    Helios 的早期部署马上就要展开。接下来一两年,市场会检验一件事:AMD 到底是靠真技术赢,还是仅仅因为英伟达产能紧缺捡了漏。对用算力的公司来说,多一个能打的供应商,怎么都不是坏事。

  • 谷歌悄悄研发新 AI 芯片 Frozen v2:要让 Gemini 省下大笔电费

    Google 自研 AI 芯片相关示意图
    大厂自研 AI 芯片已成趋势,Google 的 Frozen v2 瞄准的是推理能效(图源:TechCrunch)

    Alphabet 正在悄悄搞一颗新的服务器芯片,内部代号叫 Frozen v2,专门用来让自家的 Gemini 模型跑得更省、更稳。消息来自 The Information 的爆料,说这颗芯片大概会在 2028 年前后亮相。

    能效说是现在的六到十倍

    按那篇报道的说法,Frozen v2 的衡量标准是「每消耗一单位电力能生成多少 token」,在这个口径下,它要比 Google 现有的 AI 芯片高效 6 到 10 倍。对此 Google 既没承认也没否认,只给了一句四平八稳的回应。

    「我们的团队一直在研究和试验各种新方案,为用户和客户带来极致的性能与效率。」

    大厂为什么都在自己造芯

    把模型训练和推理从通用 GPU 上挪到自己定制的芯片上,已经成了大厂的共同动作。动机很直白:一是让自家模型跑得更划算,二是摆脱对英伟达的依赖——这家公司长期把持着 AI 芯片市场,也让所有大模型厂商都被它的硬件绑住。

    就在今年 6 月,OpenAI 刚亮出第一颗自研推理芯片 Jalapeño;本月初又有消息说,Anthropic 正在和三星谈新的芯片合作。Google 自己本来就有 TPU 这条线,Frozen v2 像是把这条路继续往下走。

    • 代号 Frozen v2,目标 2028 年前后发布,专供 Gemini 使用。
    • 能效按 token / 单位电力计,号称达现有芯片 6 到 10 倍。
    • 背景是 OpenAI、Anthropic 相继布局自研芯片,全行业试图降低对英伟达的依赖。

    股价先涨为敬

    这类消息背后,其实是投资者的算盘。大家一直担心 Alphabet 为了 AI 基建砸下的天价开支——公司年初说今年要花 1800 亿到 1900 亿美元。钱花出去了,得证明能回本。Frozen v2 一旦坐实,等于给市场一个「我们在把成本压下来」的信号。报道出来后,Google 股价周一上午就涨了大约 3%。

    当推理成本变成卖点,AI 的故事就从「大力出奇迹」变成了「谁更会过日子」。


  • 模型上下文协议 MCP 迎来大改:AI 接外部工具不再卡脖子

    如果你最近半年听人聊 AI 智能体,十有八九会撞见一个词:MCP。它的全称是 Model Context Protocol(模型上下文协议),可以理解为 AI 世界的「通用插头」。有了它,聊天机器人才能顺手翻你的日历、查你的数据库、调用内部工具,而不用工程师为每个连接单独焊一根管子。

    下周,这套协议就要迎来一次不小的升级。普通用户大概率无感,但它可能实实在在地改变整个生态的玩法。

    卡在哪:一台服务器要记住所有人

    这次改动的核心,是服务器处理「会话 ID」的方式。你可以把它想成服务员手里的桌号:Claude 这类客户端第一次连上服务器时会先「打招呼」,服务器回一个会话 ID,之后每次请求都带着它,服务器才知道「还是刚才那位」。

    Arcade 的 Nate Barbettini 打了个比方:真实部署里,你背后是一台负载均衡器,专门把请求丢给农场里任何一台空闲的机器,有时还跨区。可现在每台机器都得知道「另一台机器发过的那个会话 ID」——不是不能做,但极其折磨人,而且它是在和负载均衡器对着干,而不是配合它。

    换句话说,旧方案默认「一台服务器记住你」,可大公司早把流量摊到几十台互不相通的机器上了。光是为了搞清楚「谁是谁」,今天的 MCP 服务器就得多干一堆活。这也是为什么,尽管今年智能体被吹得火热,真敢上规模、自己兜售 MCP 集成的公司却没几个。

    AI 互操作协议 MCP 概念图
    MCP 要做的事,是给 AI 模型接外部工具铺一条标准通道(图:TechCrunch)

    新方案:把「状态」甩给客户端

    新版本在服务端改走更宽松的「无状态」路线,思路和绝大多数普通网站一样:服务器不再费劲记着你是谁,把状态交给客户端自己带着走。这样一来,整套系统更好维护,理论上大规模跑起来也更便宜。

    • 会话 ID 改为服务端无状态,服务器能轻松躲在负载均衡器后面;
    • 大规模部署的运维成本有望下降,更多公司敢做一手 MCP 集成;
    • 新规范自 5 月就出了候选版,7 月 28 日正式定稿。

    说到底,这件事挺提神:不是所有 AI 进展都在狂奔。模型训练一路加速,可模型脚下的那套基础设施,仍被标准委员会慢悠悠的共识拽着走。变化确实在发生,只是比想象中慢一点。

  • Ollama 融了 6500 万美元:14 个人,跑进 85% 的财富 500 强

    有个工具你可能从没听过名字,但它已经悄悄跑进了 85% 的财富 500 强企业里。它叫 Ollama,干的事很纯粹:让开发者在一行命令里,把开源大模型下载下来、在自己的电脑或服务器上跑起来。

    Ollama 创始人 Jeff Morgan(左)与 Michael Chiang(右)
    Ollama 联合创始人 Jeff Morgan(左)与 Michael Chiang(右)。(图源:David Paul Morris / Ollama)

    6500 万美元,钱从哪来

    7 月 9 日,Ollama 宣布完成 6500 万美元 B 轮融资,由 Theory Ventures 领投,Benchmark、8VC、Y Combinator 等跟投。算上早先 Benchmark 领投的 1500 万 A 轮,公司累计融资到了 8800 万美元。创始人兼 CEO Jeff Morgan 向 TechCrunch 确认了这笔交易。

    两个做过 Docker Desktop 的人

    Ollama 这事儿听着耳熟,是因为班底老道。Morgan 和联合创始人 Michael Chiang 早年在 Docker 收购他们的创业项目 Kitematic 后,参与打造了 Docker Desktop——今天超过一千万开发者每天在用的东西。Docker 把应用在不同云之间搬移变得轻松,Ollama 想对 AI 模型做同样的事:把繁琐的环境配置藏起来,让你只管跑。

    “2023 年开源模型刚出来时特别难用,它们是给研究人员准备的,不是给程序员用的,想把模型跑起来费老劲了。”Morgan 说。Ollama 就是冲着这份麻烦去的。

    数字摆出来,挺吓人

    上线三年,Ollama 现在每月有超过 890 万开发者在用,进驻了 85% 的财富 500 强,每周还新增近百万次安装。GitHub 上攒了 17.6 万 star、接近 1.7 万 fork。最夸张的是,撑起这一切的团队只有 14 个人。

    “Jeff 和 Michael 在 Docker 上做出的东西,每天有一千多万开发者在用。能做出一款在开发者里走向普适的产品,这种创造力极其罕见。”——Benchmark 合伙人 Peter Fenton

    为什么企业愿意买单

    对银行、医院这类机构来说,把数据送进第三方大模型 API 是合规上的大忌。在自己硬件上跑 Ollama,数据全程留在防火墙内,这正是它能在监管严格的行业落地的原因。Morgan 把业务的转折点放在今年 1 月前后——那时以 OpenClaw 为代表的智能体助手爆红,开源模型突然能干活了,尤其是写代码这类 agentic 任务。

    Fenton 的看法更直接:开源和闭源不是你死我活,但那些背着高额推理账单的公司,确实有动力把尽可能多的工作迁到开源模型上,只在必要时才调用 Anthropic 这类闭源模型。

    • 一行命令拉起 Llama、Mistral、DeepSeek 等开源权重模型,无需 API key
    • 本地跑不动的大模型,可走 Ollama 云端,按 GPU 时长计费而非按 token
    • 云上托管 Nemotron、GLM、DeepSeek、Kimi、MiniMax 等模型,做到首日上新
    • 免费桌面版不变,云端只是补上家里跑不了的大模型

    开源社区的疑虑

    不是所有人都鼓掌。大约一年前,就有开发者担心 Ollama 把重心偏向付费云、冷落了免费项目,把它列为开发者工具”变味”的例子。Morgan 和 Fenton 都回击说,免费桌面版没动过,云端只是把家里跑不了的大模型递到你手边。


    如果开源模型真如预期那样生成了世界上大部分 AI token,那么”谁把模型跑得稳、跑得安全、跑得便宜”这一层,就成了新的价值高地。Ollama 用 14 个人先占了坑,接下来要看这块地值不值这个价。

  • Reflection 签 10 亿美元算力大单:开源模型商的弹药库焦虑

    Reflection 与 Nebius 10 亿美元算力协议
    算力正在变成 AI 公司的战略物资(图源:TechCrunch)

    开源模型公司 Reflection AI 最近像在囤弹药一样,连续签下大笔算力合同。7 月 14 日,这家估值 250 亿美元的美国初创公司宣布,和欧洲 AI 基础设施厂商 Nebius 签下一份价值 10 亿美元的算力协议。

    拿到的是英伟达最新的芯片

    Nebius 的前身是俄罗斯科技巨头 Yandex 的国际业务,这次它会把英伟达最新一代芯片的使用权交给 Reflection。有意思的是,这已经是 Reflection 几周里第二笔大型算力交易了——上一份是和 SpaceX 拿计算资源。两家公司都在抢同一件东西:训练和部署模型所需要的算力。

    当特朗普政府上个月施压 Anthropic 和 OpenAI 限制最强模型,业界开始担心模型访问权限可能被”一夜收回”。加上中国开源模型越来越能打,主流市场对开源 AI 的兴趣被彻底点燃。

    为什么开源模型商比谁都怕算力断供

    Reflection 由两位前 Google DeepMind 研究员在 2024 年创立,已经从英伟达、红杉、Lightspeed 手里融了近 26 亿美元。它的处境正好戳中当下最热的争论:闭源旗舰模型到底值不值那个价?当数据留存顾虑和政府干预一起涌上来,能自己掌控权重、不受制于单一厂商的开源路线,突然成了香饽饽。

    Nebius 才是幕后那个大赢家

    • 拿到英伟达 20 亿美元投资后,Nebius 转头就和 Meta 签了最高 270 亿美元、为期五年的基础设施协议。
    • 去年它跟微软也签了最高 194 亿美元的多年的协议。
    • 从 Yandex 拆分出来后,Nebius 几乎成了各大 AI 实验室的”算力二道贩子”。

    算力正在变成一种战略物资,谁先把芯片和机房锁死,谁就握住了下一代模型的命门。Reflection 连签两单,表面上是为了训练和部署,底下其实是整个行业对”算力稀缺”的集体焦虑。