标签: AI推理

  • 把1200块GPU塞进集装箱:Runware用推理Pod把算力价格打下来

    Runware Sonic 推理 Pod 集装箱式 AI 数据中心
    Runware 的 Sonic Inference Pod:把整座推理数据中心装进一个 20 英尺集装箱

    过去两年大家都在比谁的 AI 数据中心更大、更烧钱,动辄几百亿美元、三到五年才能盖好。伦敦一家叫 Runware 的公司偏不这么玩。8 月 4 日他们扔出一个叫 Sonic Inference Pod 的东西——说白了,就是把最多 1200 块 GPU 塞进一个 20 英尺的集装箱里,插上电就能当一座推理数据中心用。

    一个集装箱就是一座厂

    这个 Pod 不是玩具。它自带定制服务器、电路板和闭环液冷系统,单箱能出大约 1 兆瓦的算力。最妙的是冷却方式:用一套密闭循环管路,只循环大约 1.5 立方米的水,几乎不消耗新水,还能把 GPU 温度稳在目标值上下 2 度以内,电源效率标到 99%。对比传统数据中心,差不多三分之一的电都拿去制冷而不是算题,这一下就把账算明白了。

    贵在”只做推理这一件事”

    Runware 的逻辑很简单——普通数据中心为了通用负载堆了一堆推理用不上的冗余:备份系统、过度设计的结构、超大建筑。他们算过,传统机房 40% 到 60% 的开支花在了推理根本用不到的地方。Pod 把这些全砍了,只保留推理要的部件。结果就是他们敢承诺推理价格比同行低 30% 到 80%,硬件成本比传统千兆瓦级数据中心低到差不多百分之一百倍,省下的钱直接反映到 GPU 小时报价上。

    “推理需求增长的速度,比机房盖出来的速度快得多。”Runware 联合创始人兼 CEO Flaviu Radulescu 说,”我们想做的是给全世界的智能供能,成为每个模型跑起来时身下的那根骨干。”

    哪里有电,就拖到哪里

    这种集装箱最大的卖点是”可搬家”。因为它自带一切、不挑电网,哪有便宜的电——比如太阳能电站旁边——往那一放就行。平均三周能部署一个,传统方案要三到五年。每个 Pod 接入同一张网络,一个挂了流量自动切到别的节点,不会整片瘫痪。目前 Runware 说已经在美、欧、亚太部署了 10 个,还有 160 个预备点位,客户里能点到 Higgsfield AI 和 Wix 的名字。

    一场和超大规模厂的逆向赛跑

    有意思的地方在于,OpenAI、xAI 和几家云巨头都在往几百亿、上千亿美元的固定资产里砸钱,Runware 却从另一头进场:那些对运行地点不挑、哪儿便宜往哪跑的推理负载,用能 truck 进来、插上电、再挪走的算力也许更划算。公司背后是今年 1 月拿到的 5000 万美元 A 轮(Dawn Capital 领投,a16z speedrun、Comcast Ventures 等跟投),说自己已经帮 20 多万开发者跑出 100 多亿次生成。下半年他们计划先上 1 万个推理节点,2027 年冲到 1 吉瓦。

    • 单箱最多 1200 块 GPU、约 1 兆瓦算力,闭环液冷不耗新水
    • 推理报价比同行低 30%–80%,设施成本可低至传统方案的百分之一
    • 平均三周部署,哪里有电拖到哪里,故障自动切流
    • 下半年先上 1 万节点,2027 年冲 1 吉瓦

  • AMD 买下一家 24 人芯片公司,它想把 AI 模型焊死在硅片里

    这周 AI 芯片圈有个不起眼、但挺有意思的收购:AMD 宣布要买下多伦多初创公司 Taalas。这家公司 2023 年才成立,团队只有二十几人,做的事却相当极端——它不造通用的 GPU,而是把训练好的大模型直接刻进芯片里。

    不是又一颗 GPU

    常规 AI 芯片,无论是英伟达的 GPU 还是 AMD 自家的 Instinct,本质上都是通用处理器。每次推理时,模型权重都要从 HBM 高带宽内存里搬进计算单元,灵活是灵活,代价是巨大的功耗和内存带宽开销。Taalas 把这套逻辑整个翻了过来,它的哲学叫模型即计算机:不再把模型当成随时可换的软件,而是用一套专用设计流程,把模型的数学运算、连线和参数直接固化进 CMOS 逻辑里。公司 CEO Ljubisa Bajic 之前在 AMD 做过芯片架构总监,后来创办了 Tenstorrent,2023 年又拉起 Taalas,想法从头就是围绕模型来造硬件。

    速度有多夸张

    今年 2 月 Taalas 亮出首颗测试芯片 HC1,用台积电 6 纳米工艺,把整个 Llama 3.1 8B 模型装进单颗芯片。公开基准里,它跑这个模型能到每秒约一万六千九百个 token,Taalas 当时称这比英伟达 H200 快了 73 倍,功耗只有对方的十分之一。按硅片面积算,HC1 和 H100 差不多大,约 815 平方毫米。当然,Llama 3.1 放今天已经算老模型了,这颗芯片更多是验证概念。

    我们创立 Taalas,就是为了从零重新思考 AI 推理——围绕模型来构建硬件。——Taalas 联合创始人兼 CEO Ljubisa Bajic

    代价是颗芯片只认一个模型

    把权重烧进硅片,好处是甩掉了可编程逻辑和外置内存搬运,代价是零灵活性:一颗为某模型定制的芯片,就只能跑那一个模型,模型一更新就得重新流片。对此 Taalas 的说法是没那么贵——一百多层电路里只有两层会随模型变化,配合自研工具,流片周期大约两个月。下一代 HC2 目标把参数规模提到 200 亿,更大的模型则靠多颗芯片流水线并行拼起来。

    模型权重烧入硅片的 AI 推理芯片
    把模型刻进硅片:Taalas 的专用推理芯片思路

    为什么是现在,为什么是 AMD

    过去一年,推理市场彻底成了主角,各家都在想办法从专用硅片里榨更多吞吐。英伟达去年底以约 200 亿美元拿下 Groq 的推理技术,AMD 自己此前也和 Cerebras 搞过拆分式推理合作。买下 Taalas,是 AMD 九个月里的第三笔 AI 收购(前有去年 11 月的 MK1、今年 6 月的 Mext,7 月 FastFlowLM 团队也已并入)。AMD 人工智能事业部高级副总裁 Vamsi Boppana 说,目标是给客户为每种 AI 负载匹配最合适的计算方案。

    • Taalas 技术将并入 AMD 的 Instinct 加速器与 Helios 机架级系统
    • 解耦思路:提示词处理留在 GPU,token 生成卸载到 Taalas 专用芯片
    • 不算替换通用 GPU,而是补上高吞吐、模型固定那一块
    • 对反复跑同一批热门开源模型、规模极大的云客户,固定芯片可能比反复搬运权重便宜得多

  • 首笔推理芯片抵押贷落地:4亿美元押注AI算力的下一站

    算力生意的下半场

    训练一个大模型要烧掉天文数字的算力,但模型训好之后真正天天在跑的,是”推理”——也就是你每次提问、它给答案的那一下。最近一笔 4 亿美元的融资,把赌注压在了这块过去被忽视的市场上。

    AI 推理云创业公司 General Compute 拿到了 Upper90 的 4 亿美元贷款。有意思的是,这很可能是第一笔拿”推理专用芯片”做抵押的买卖。所谓推理芯片,专门用来高效跑已经训好的模型,不像训练芯片那么贵、那么吃水和电。

    General Compute 推理芯片
    General Compute 的推理芯片主打低功耗、免水冷(图源:TechCrunch)

    General Compute 的 SN50 芯片来自英特尔支持的 SambaNova,主打省电、不用昂贵的水冷,所以能比 GPU 更快铺进各种数据中心。公司声称推理速度能到 GPU 云的 16 倍。问题只有一个:作为一家新公司,怎么搞到足够多的芯片。

    “我们当年第一批给英伟达 GPU 融资时,市场还很低效,早进场的人能拿到风险补偿。”Upper90 的 Billy Libby 说。

    从 GPU 转向推理层

    这就轮到 Upper90 出场了。它的老板 Billy Libby 是个前高盛量化交易员,2021 年就曾给能源型数据中心创业公司 Crusoe 做 GPU 采购融资——他自称那是第一笔拿高端芯片做抵押的贷款。当时传统银行躲得远远的,怕芯片贬值太快;等 CoreWeave 把这种”芯片抵押”做成生意、还顺手搞出个轰动 IPO,大家才反应过来。

    现在 GPU 行情大家都摸透了,甚至有点买过头,Upper90 就把目光转向了 General Compute 这样的推理层公司。这个转向背后有个判断:不是谁都需要超级计算机,但谁都需要推理。开源模型越来越能打——月之暗面刚发的 Kimi K3 在编程基准上已经逼近 Anthropic 和 OpenAI 的旗舰——跑这些开源模型,便宜的推理芯片就够了。Groq、Cerebras 这类芯片公司也因此被收购方和公开市场盯上。

    General Compute 押注英伟达体系之外的芯片,逻辑和 TensorWave 绑定 AMD 类似:当替代方案越来越多,不被英伟达锁死的计算提供商,反而可能在成本上占优。

    “有一批芯片正在起量,总拥有成本惊人地好,速度也比英伟达快,但买家不多。”CEO Finn Puklowski 说,”和 Upper90 合作,不是’一个酷公司拿到钱买算力’这么简单,这是资本第一次组织起来,去敲碎英伟达的垄断。”

    对普通人来说,这事儿离得有点远。但它决定了你以后用 AI 是贵还是便宜:当推理产能不再被一家芯片厂卡脖子,模型跑起来的成本才会真正降下来。


    一句话看清这笔融资

    • General Compute 获 Upper90 的 4 亿美元贷款,或为首笔以推理芯片为抵押的融资
    • SN50 芯片(SambaNova)主打低功耗、免水冷,推理速度号称 GPU 云 16 倍
    • 资本从 GPU 转向推理层:开源模型崛起让低成本推理需求激增,英伟达之外的芯片有了空间
    📎 原文来源:Why the first GPU financiers are turning to inference chips in a $400 million deal(TechCrunch / Tim Fernholz,2026-07-17)
  • Meta的编程模型Muse Spark 1.1:不晒跑分,4.25美元/百万token抢开发者

    Meta的编程模型Muse Spark 1.1:不晒跑分,4.25美元/百万token抢开发者

    Meta Muse Spark 1.1 智能体编程模型
    Meta 发布面向智能体的多模态推理模型 Muse Spark 1.1

    7 月 9 日,Meta 上线了一个叫 Muse Spark 1.1 的模型。说它”低调”其实不太准确——扎克伯格亲自发帖,马斯克顺手一个转发,12 小时里相关视频被看了 1200 多万次。可翻开发布物料,你会发现一件怪事:没有 SWE-bench 分数,没有技术论文,也没开源。一个号称”编程模型”的东西,连个跑分都不敢晒。

    它到底能干什么

    Muse Spark 1.1 的定位是”给 AI 智能体用的多模态推理模型”。Meta 说它强化了多智能体协作:由一个主智能体负责收集信息、制定计划,再把任务拆给一堆子智能体并行执行,复杂项目的处理时间能明显缩短。上下文也拉长到了 100 万 token,长流程里能记住早先的内容。

    落到具体场景,它能在多个应用之间连续干长活儿,自己判断是该直接点界面、写段脚本自动化,还是一口气把几步操作做完,尽量少麻烦人。写代码这块,它能诊断修复杂 bug、开发新功能,甚至做大规模代码迁移,过程中一直保留关键上下文。Meta 说内部研发和研究员已经每天拿它辅助开发了。

    Meta 强调,Muse Spark 1.1 已按内部《Advanced AI Scaling Framework》完成部署前评估,在化学与生物安全、网络安全以及失控风险等前沿领域”均维持在安全范围内”。

    价格先打到底,基准一个没有

    这边没晒分,那边先把价格摆出来了:输出定价每百万 token 4.25 美元。比 Grok 4.5 还便宜,大概只有 GPT 近段时间价格的一小部分。如果后续基准勉强能看,这个价可能直接成为个人开发者的甜区,给 GitHub Copilot、Cursor 的收费模式施压。

    不过 Meta 自己的内部评估也坦诚,在部分电脑操作、长上下文和代码测试上,Muse Spark 1.1 仍然落后于 GPT-5.5 和 Claude Opus 4.8。它更像是先抛声量、后补证据的发布——在 Meta 今年预计超 650 亿美元资本开支的压力下,这款模型如果不能快速拉出用户规模,很容易又被看成”又一个没结果的尝试”。

    • 零基准发布:没有 SWE-bench、没有论文、没有开源,与 Llama 系列习惯相反
    • 价格战打法:4.25 美元/百万 token 输出,瞄准个人开发者
    • 能力边界:智能体、代码、通用推理有提升,但硬指标仍落后于 GPT-5.5 和 Claude Opus 4.8

  • OpenAI 首颗自研芯片 Jalapeño 出炉,不再只靠英伟达

    OpenAI 首颗自研芯片 Jalapeño 出炉,不再只靠英伟达

    OpenAI 首颗自研推理芯片 Jalapeño
    OpenAI 与博通联合发布首颗自研推理芯片 Jalapeño(图源:TechCrunch)

    OpenAI 一直被看作做模型的,6 月 24 日这天它跨过了那条线——和博通联合发布了一颗叫 Jalapeño(墨西哥辣椒)的芯片,这是 OpenAI 第一颗自己定制的 AI 处理器。合作去年 10 月就官宣了,但真把芯片摆到台前,还是头一回。

    专门为跑模型而生

    Jalapeño 的定位很明确:它是推理芯片,不是训练芯片。说人话就是,它负责把已经训练好的模型跑起来、响应用户指令,而不是从零去炼模型。OpenAI 在公告里特别强调,它在跑实时 coding 模型(比如 Codex)时运营成本很低。像预训练这种更吃算力的重活,短期内还得靠英伟达的 GPU,但光是把推理这一块的成本往下压,对 OpenAI 的账本就已经意义不小。

    我们不只是做前沿模型、在模型上搭产品,我们连底下的基础设施都自己设计了——芯片架构、内存系统、网络、调度、部署,全在一层一层地把同一件事优化到极致。

    AI 参与设计了自己的硬件

    最让我觉得绕的一个细节是:OpenAI 自己的 AI 模型,参与了这颗芯片的设计过程。从架构设计到把版图数据交给晶圆厂(tape-out),整段只用了大约九个月。OpenAI 自己说,这可能是高性能半导体领域有史以来最快的 ASIC 开发周期。硬件负责人 Richard Ho 来头也不小,在谷歌待了快九年,是 Cloud TPU 项目的核心工程师。

    为什么非得自己造?说白了是想少依赖英伟达的 GPU。这条路上谷歌有 TPU、亚马逊有 Trainium,都是同一个思路——用专门加速机器学习的硅,把特定工作负载跑得更快更省。OpenAI 总裁 Greg Brockman 的话很直白:我们太懂这个工作负载了,就去找那些没被伺候好的环节,想办法加速它。

    全栈公司的必然一步

    把视角拉高一点看,造芯是 OpenAI 从模型公司往全栈基础设施公司走的自然一步。模型、产品、数据中心、再到芯片,每一层它都想攥在自己手里。据外界披露,微软还承诺包销了 Jalapeño 首期大约 40% 的产能。芯片计划先以工程样片在实验室跑通 GPT-5.3-Codex-Spark 这类模型,后续再放到吉瓦级别的数据中心里规模部署。

    • Jalapeño 是 OpenAI 首颗自研推理芯片,由博通代工实现、台积电 3nm 制造
    • AI 模型参与芯片设计,九个月走完从设计到流片
    • 目标不是取代英伟达,而是把最贵的推理成本压下来

    这不是要和英伟达掀桌子,而是 OpenAI 想把自己最贵、也最日常的那块成本,从别人手里拿回来一部分。当一家公司的模型每天被几亿人调用,每一分钱的推理开销乘上去都是天文数字——自己造芯,只是时间问题。

  • Grok 4.5发布:马斯克不拼参数了,改拼性价比

    淡出主流模型竞技场两个月之后,马斯克的 Grok 又坐回了牌桌。北京时间 7 月 9 日,SpaceXAI 正式发布旗舰模型 Grok 4.5。和过去每家都在喊”我们最强”的画风不同,这次马斯克显得很务实:他在 X 上连发几十条动态,反复强调一句话——能力和 Claude 的 Opus 4.7 差不多,但快得多,也便宜得多。

    Grok 4.5 概念配图
    Grok 4.5 概念配图(本文配图由 AI 生成)

    一张”够用就好”的牌

    Grok 4.5 是个 1.5T 参数的 MoE 模型,上下文拉到 50 万 token,主打编程、智能体和知识工作,还能看图输入。在考察编程的 SWE Bench Pro 上它拿到 64.7%,刚好压过 Opus 4.7 的 64.3%;Terminal Bench 2.1 冲到 83.3%,DeepSWE 1.0 的 62% 也超过了 Opus 4.8。推理速度能跑到 80 TPS,已经挤进第一梯队。

    有网友引用测试说,Grok 4.5 只花了大约十七分之一的成本,就做到了接近 Claude Fable 的性能。马斯克没有顺杆爬,反而老老实实承认差距:”公平地说,Fable 确实比 Grok 4.5 好得多,但大多数任务并不需要 Fable 级别的能力。”

    真正让对手冒汗的是价格

    但 SpaceXAI 真正想卖的不是分数,而是账本。它的 API 定价是每百万输入 token 2 美元、输出 6 美元。作为对照,Opus 4.7 的输入要 5 美元、输出 25 美元。完成同一个 SWE 任务,Grok 4.5 吐出的 token 量大约只有 Opus 4.8 Max 的四分之一。

    把模型调用价格推向台前,是这一轮竞争里最现实的变化。当企业把 Agent 跑在生产环境、每天调用成千上万次,token 账单就变成了真金白银。谁能在不掉链子的前提下把单位成本压下来,谁就握住了开发者的切换按钮。

    • 和 Cursor 联合训练,面向真实编码场景打磨
    • 下周推送百万 token 上下文版本,月底还有 2T 参数版本预告
    • 已在 SpaceXAI 控制台、Grok Build 和 Cursor 三端上线

    说到底,马斯克这次没再玩”参数军备竞赛”那一套。他赌的是另一件事:在绝大多数真实工作里,用户要的不是天花板级别的智能,而是一份”能力够用、速度快、账单轻”的交付。特斯拉和 SpaceX 的硬核工程师觉得 Grok 4.5 真好用,这比任何榜单都更能说明问题。

  • 把AI数据中心搬进你家:Sunrun付费让110万户屋主托管算力节点

    如果有人付钱,让你把一小块AI数据中心搬进自己家,你干不干?美国最大的家庭光伏储能公司Sunrun,这周就抛出了这么个方案。

    Sunrun分布式AI算力家庭节点示意图
    把算力节点铺进千家万户,而不是盖一座大机房

    Sunrun启动了一个”分布式AI算力”试点:在装了它家太阳能板和储能电池的住宅里,放进一台台小小的算力节点——本质上就是分布式系统里的服务器单元。参与的屋主能拿到报酬,Sunrun则把这些节点汇聚起来的算力,卖给企业级的算力买家,比如AI公司。

    为什么不直接盖数据中心

    因为数据中心现在越来越不受待见。今年5月的一项调查显示,超过70%的美国人反对在自己家附近新建数据中心,理由无外乎污染、噪音、耗水耗电。Sunrun的思路正好反过来:不把算力堆进一座巨型机房,而是打散成无数个小节点,撒到全国各地的房子里。

    “AI公司正在拼命抢电力和算力。近二十年里,我们已经把运营、融资、规模化分布式资产这套本事练熟了。现在我们要用它,把算力搬到离能源和推理更近的地方。”——Sunrun总裁兼首席营收官 Paul Dickson

    这里有个关键区分:AI训练需要成千上万块GPU挤在一起、高度同步,很难分散;而推理不一样,它是模块化的、天然可以按地理位置铺开,而且对延迟很敏感——离用户越近越好。这恰恰是”边缘部署”的用武之地,也正好卡在Sunrun的能力圈里。据McKinsey预测,AI推理需求每年增长约35%,到2030年会超过训练,成为AI算力里占比最大的那部分。

    110万个家庭,就是它的底牌

    Sunrun手里有超过110万现有客户,这是它敢这么玩的底气。传统数据中心从审批、建设到并网,动辄要好几年;而Sunrun的分布式模式,能在很短时间内堆出可观的推理算力。它列出的几个优势也挺实在:

    • 节点装在电表之后,还配了家用电池,即便遇上部分电网停电也能继续跑
    • 省掉了买地、建输电线路、排队等电网接入这些漫长环节
    • 它本来就在为一百多万户家庭的能源设备做监控和维护,现成的运维体系直接能用

    不过资本市场没买账。消息公布当天,Sunrun股价盘前一度走高,开盘后调头下跌6.1%,算上这波,今年以来已经跌了38%。这个AI试点跟它上月宣布的、联合特斯拉和Renew Home把住宅聚成16吉瓦虚拟电厂的计划是分开的两回事。Sunrun说,试点会跑上几个月,评估结果后再决定要不要大规模铺开——目前它已经在跟企业算力客户、公用事业公司和房产开发商聊更大范围推广的事了。

  • Etched走出隐身:50亿美元估值、10亿美元订单,专打AI推理芯片

    一家芯片公司从隐身模式里走了出来

    Etched这家公司以前低调得很,但最近它直接把成绩单摊在了桌上:芯片已经由台积电成功制造出来,累计拿下了10亿美元的系统订单,整体估值也到了50亿美元。它的方向很专注——做Transformer推理专用的芯片和整机系统,专门帮前沿模型更快、更便宜地跑推理。

    所谓推理,就是用户输入问题后模型真正生成答案的那一步。对今天的AI公司来说,这一步既是用户体验的瓶颈,也是最大的成本中心。谁能把推理成本压下去,谁就能让大模型服务更便宜、响应更快。Etched赌的正是这一点。

    Etched已签10亿美元客户订单,累计融资8亿美元,最新一轮由Stripes领投,投后估值50亿美元。

    这家公司2022年成立,创始人Gavin Uberti和Robert Wachen都是哈佛辍学生,后来拿了Peter Thiel的Thiel Fellowship。其实他们早在2024年就跟TechCrunch聊过芯片计划。那时候他们已经从Primary Venture Partners等投资人手里拿到超过1.25亿美元。不过据他们在Patrick O’Shaughnessy的播客里回忆,2023年最初融资时非常艰难,他们拿着30页备忘录讲“AI未来需要专用芯片,而不是通用GPU”,结果几乎每个大投资人都拒绝了。

    投资人名单豪华,但市场考验才刚开始

    现在融资环境完全是另一个世界。Etched披露的累计融资额是8亿美元,其中去年12月那轮未公开的融资由Stripes领投,金额约5亿美元,估值50亿美元。参与方包括VentureTech Alliance、Jane Street、Hudson River Trading、Two Sigma、Ribbit Capital,以及Andrej Karpathy、Geoffrey Hinton、Fei-Fei Li、Arthur Mensch、Scott Wu等AI界名人。Peter Thiel和Stanley Druckenmiller也在股东名单里。

    不过融资热归融资热,芯片能不能真正兑现性能,还需要独立测试。Etched目前在做的是“前沿推理集群”——把芯片、定制机柜和软件打包成一套系统。它说自己比Nvidia的GPU更快、更省电、更便宜,但这些数字来自公司自己,真实世界表现还得等客户大规模部署后才能验证。

    AI推理芯片概念图
    专用AI推理芯片正试图从通用GPU手中抢走推理市场。

    在这个赛道里,Etched不是孤例。Cerebras今年率先IPO,Groq刚刚完成6.5亿美元融资,亚马逊、Google、微软都在做自己的AI芯片,OpenAI也推出了和Broadcom合作的首款定制芯片。推理芯片的竞赛正在升温,每家公司都在赌自己的路线。


    对AI行业来说,推理芯片的稀缺性正在被放大。训练一度是最大难题,但现在越来越多公司发现,真正烧钱的其实是服务用户时的推理。Etched的崛起说明,资本市场已经把这个环节视为下一个主战场。至于它能不能撼动Nvidia,还要看第一批客户订单交付后的实际表现。

  • SambaNova再融10亿美元、估值110亿:AI芯片烧到了银行金库

    SambaNova AI推理芯片与本地数据中心
    SambaNova 押注「本地推理」,把大模型放进企业的自有机柜里(配图由 AI 生成)

    AI 芯片公司 SambaNova 又拿到钱了。这轮 F 轮融资刚完成「首关」,金额 10 亿美元,估值冲到 110 亿美元,领投方是 General Atlantic。公司 CEO 兼联合创始人 Rodrigo Liang 跟 TechCrunch 说,接下来几周还会有更多投资人进来,第二关很快收尾。距离上一轮 3.5 亿美元的 E 轮,才过去五个月。

    这家 2017 年在加州帕罗奥图成立、如今九岁的公司,节奏明显在加快。今年 2 月它刚发布了新一代芯片 SN50,当时顺手拿了 E 轮的钱;现在 F 轮又来了。Liang 对「要不要一直独立」这个问题打起了太极——他说公司一直有人来打听收购,门没关死,但眼前的势头和增长「大概率会把它推向上市」。

    和英特尔越绑越紧

    SambaNova 跟英特尔的关系,比外界以为的更深。英特尔从 C 轮就是股东,这一轮也跟进了,两边还签了多年的合作,基于英特尔的至强(Xeon)芯片一起做 AI 推理产品,共同开发、共同卖。「这让我们能借英特尔的体量,放大自己的技术」,Liang 是这么说的。去年底彭博还报过英特尔想以约 16 亿美元收购 SambaNova 的消息,谈判最后黄了。

    「摩根大通决定用 SambaNova 做推理方案,这是件大事。它给银行业放了句话:是时候别完全依赖云服务了,这些银行想要的是异构的基础设施。」

    这话说的是一桩新买卖:摩根大通选了 SambaNova 当「推理基础设施伙伴」,用它的 SN40L 和 SN50 系统在银行内部跑安全、私有的 AI 推理。在 Liang 看来,像摩根大通这种级别的银行开始自建私有、安全的推理环境,是一个会超出金融业本身的信号——企业和政府「才刚刚踏上 AI 这条路」,之前的增长都集中在模型公司和前沿实验室手里,剩下的「大把收入」还在桌上。

    把万亿参数模型塞进一个机柜

    SambaNova 给自己找的差异化定位是「高端推理」——专门跑最大的模型,而且跑得快。现在的前沿模型动辄上万亿参数,SambaNova 的卖点就是能把多万亿参数的模型装进单个机柜,从而跑出速度。SN40L 在 2023 年 9 月发布,云上和本地都能用;SN50 今年 2 月亮相,计划 2026 年下半年开始给客户发货,软银是它的第一个部署伙伴。


    Liang 把客户分成三类:一是主权云(政府出钱扶本地伙伴建私有云),二是新锐云(neocloud),三是自己搭设施用的企业。除了摩根大通,沙特阿美、英特尔和一些日本企业也在客户名单上。

    这 10 亿美元主要用来两件事:把生意做大规模,以及在这波「难以置信的需求浪潮」里把供应链锁住。Liang 的原话是,钱要用来确保供应链,好兑现订单、买齐未来 12 个月要交付的材料。本轮跟投的名单很长,Seligman Ventures、T. Rowe Price、Capital Group,还有黑石、卡塔尔投资局(QIA)、Vista Equity Partners 等等都在里面。

    看下来,SambaNova 赌的其实是一个正在发生的转向:当云上的通用算力越来越贵、也越让人不放心,大机构开始想把最关键、最敏感的模型搬回自己的机房。芯片、合作、客户订单,都朝着这个方向摆。至于它最后是被收购还是敲钟上市,Liang 留了个活口——但这个市场里,「总有人来敲门」本身就是一种底气。

  • 法国初创ZML发免费工具:让各家AI芯片跑得一样快

    过去几年,只要聊到跑大模型,大家脑子里默认就是英伟达的卡。这种局面短期内还结束不了,但挑战者确实从四面八方冒了出来。最近巴黎一家叫 ZML 的初创公司丢出了一件免费工具,想做的事情挺大胆:让同一套开源大模型,能在英伟达、AMD、谷歌 TPU、苹果 Metal 甚至英特尔 Arc 的芯片上都跑得一样快。

    一个被图灵奖得主点名的小团队

    ZML 的创始人叫 Steeve Morin,圈内人可能更熟悉他上一个作品——Zenly,那个被 Snapchat 在 2017 年砸了九位数美元收购的社交地图应用,Morin 当时是工程副总裁。这家新公司本身规模不大,只有 20 个人,却让图灵奖得主、AI 圈泰斗 Yann LeCun 都公开点过赞。光看阵容,ZML 不像临时起意凑热闹的团队。

    他们刚发布的产品叫 ZML/LLMD,本质上是一个大模型推理服务器。Morin 跟 TechCrunch 说,他们的野心是打破现在各家芯片各自为战的孤岛状态,让不同的芯片都能以自己最快的速度、甚至比原厂还快的速度去跑 AI 任务。

    异构AI芯片在统一软件层上协同推理
    ZML 想用一层软件把不同品牌的 AI 芯片连起来,跑同一套模型

    它到底在解决什么麻烦

    随着 AI 一点点渗进我们的工作和日常,怎么把模型”跑起来”(也就是推理、处理用户提问)这件事,重要性已经悄悄超过了训练模型本身。可现实中这块体验并不顺滑,软件架构的壁垒把大家锁死在单一供应商身上,想换芯片?成本高得劝退。

    Morin 的原话是:想法是”把创造自己系统的权力还给大家,让 AI 真正扩散开,而不是被几家大厂攥在手里”。

    对企业来说,这意味着可以混搭不同类型的芯片——有些更便宜,有些更省电。ZML 这套软件辅助,顺势也能帮一把那些名气没那么响的新锐芯片厂,Morin 一口气点了好几家欧洲的:Axelera、Fractile、Kalray、Q.ANT、SiPearl 等等。对他而言,产地其实没那么重要,关键是 ZML 能和他们一起做”全世界还没人做过的事”。

    为什么大厂都在盯着”推理”这块肥肉

    推理赛道早就是兵家必争之地,有人直接把它叫”推理淘金热”。ZML 的对手不算少:估值冲到 130 亿美元的 Baseten、脱胎于开源项目 vLLM 的 Inferact、背后是 SGLang 的 RadixArk。vLLM 和 SGLang 跟 LLMD 多少有些重叠,但 Morin 的胃口明显更大。

    • 他放话说,ZML 已经走到”和芯片一起做联合设计”的阶段,不只是写上层软件。
    • 团队虽小,钱却不少——早年就融了 2000 万美元,投资方里既有 Harry Stebbings 的 20VC,也有 Xavier Niel 的 Kima Ventures。
    • 股东名单也挺唬人:Docker 创始人 Solomon Hykes、Hugging Face 的 Clément Delangue 和 Julien Chaumond,还有 LeCun 本人。

    有意思的是,Morin 并不唱衰英伟达。他说双方关系其实不错,毕竟英伟达自己也在为推理时代的到来做准备。ZML 想做的是在英伟达之外,给大家多一个不绑死的选择。

    免费,但野心一点不小

    ZML 最早在 2024 年开源过一个机器学习框架,今年三月还更新过。但这次的 LLMD 没有走开源路线,而是以免费产品的形式推出,目的很实在——先看看大家怎么用,再决定怎么赚钱。”我宁愿先量一量,在最有价值的地方收钱,也不想一上来就贪心把增长憋死。”Morin 这么说。

    现在判断 LLMD 什么时候变成付费产品、又能拿下多少用户,显然还太早。但从资本和同行的反应看,欧洲确实开始长出能在家门口做成事的 AI 公司了。Morin 说得很直白:”除了巴黎,我哪儿都做不出 ZML。”