标签: AI推理

  • 英伟达多了个真对手,Etched 芯片拿到 10 亿美元订单

    英伟达在 AI 推理芯片领域多了一个值得认真对待的对手。一家叫 Etched 的创业公司今天披露了最新进展:台积电今年早些时候已经成功造出了他们的芯片,而现在这款产品的合同订单已经堆到了 10 亿美元。

    Etched 给这套东西起了个名字叫”前沿推理集群”(frontier inference clusters),本质上是把自研芯片、定制机架和配套软件打包在一起卖。说法很直白:帮大模型公司跑推理,速度更快、成本更低、功耗更省。推理听起来不如训练那么性感,但它现在是 AI 公司最大的成本中心和瓶颈——这也是为什么投资人愿意为任何声称能解决这个问题的团队买单。

    从月月熬到估值 50 亿,两年走了完全不同的路

    Etched 成立于 2022 年,累计融资到现在是 8 亿美元。最近的一笔是去年 12 月关账的 5 亿美元,投后估值 50 亿美元。这轮由 VentureTech Alliance、Stripes 领投,跟投的名单读起来像量化交易圈的名人录:Jane Street、Hudson River Trading、Two Sigma、Ribbit Capital。

    天使轮更夸张。Andrej Karpathy、Geoffrey Hinton、Fei-Fei Li、Arthur Mensch、Scott Wu 都在里面,还有亿万富翁 Stanley Druckenmiller 和 Peter Thiel。一个做 AI 芯片的创业公司,天使投资人里既有图灵奖得主也有对冲基金大佬,这个组合不太常见。

    Etched AI 芯片概念图
    Etched AI 推理芯片,专为大模型推理设计的 ASIC

    2023 年差点死掉,现在满地都是钱

    创始人 Gavin Uberti(CEO)和 Robert Wachen(总裁)都是从哈佛辍学后入选 Thiel Fellowship 的。他们在 2024 年就已经在跟 TechCrunch 聊他们的芯片计划了,但回头看,真正的转折点在 2023 年。

    Uberti 后来在 Patrick O’Shaughnessy 的播客里说,2023 年他们到处见投资人,试图讲清楚”AI 最终会需要专用芯片,而不只是通用 GPU”这个故事,结果每一个大机构都 pass 了。公司当时按月烧钱,随时可能断粮。

    从”每个月都在担心能不能发工资”到”估值 50 亿美元、订单 10 亿美元”,中间隔了不到三年。AI 基础设施的投资热度把这家曾经无人问津的创业公司推到了一个完全不同的轨道上。

    对手不止英伟达,大家都想做自己的芯片

    Etched 现在面对的竞争格局相当拥挤。Cerebras 今年打了 AI 芯片赛道第一个 IPO,Groq 刚融了 6.5 亿美元。 hyperscaler 们也在自己搞:亚马逊的 Trainium、Google 的 TPU、微软的 Maia 都在路上。就连 OpenAI 也刚刚发布了和博通联合定制的第一款芯片。

    Etched 的赌注是:通用 GPU(也就是英伟达的 H100/B200 这些)在推理工作负载上不够高效,专用 ASIC 才是未来。这个论点不是只有他们在讲,但对于一家曾经连融资都困难的创业公司来说,现在能拿到 10 亿美元订单,说明至少有一些大客户认同这个判断。


    Etched 还没有公布具体是哪些客户下了这 10 亿美元的订单。如果后续有披露,这件事的可信度会更高一些。眼下,这家公司从”没人要”到”估值 50 亿”,本身就是这轮 AI 基础设施热潮里一个挺极端的样本。

  • 这家被所有投资人拒绝的AI芯片公司,现在估值50亿美元

    一家叫 Etched 的创业公司,这两天把融资成绩单拍在了桌面上。TSMC 今年早些时候成功量产了他们的芯片,紧接着订单就涌了进来——还没正式交付,合约订单已经堆到了 10 亿美元。

    Etched AI推理芯片
    Etched 的 AI 推理芯片瞄准 Nvidia 腹地

    从被所有人拒绝到估值 50 亿

    这个故事的开头并不光鲜。2023 年,两个哈佛辍学生带着一份 30 页的备忘录到处见投资人,核心论点是:AI 未来一定需要专用芯片,而不是通用 GPU。结果每一个他们见过的重磅投资人,全部 pass。

    公司当时每个月都在烧钱,账面上的钱只够撑一个月。联合创始人兼 CEO Gavin Uberti 和总裁 Robert Wachen 都是 Thiel 奖学金得主,从哈佛辍学创办 Etched,没想到第一步就差点被市场掐灭。

    两年前还在为下个月的工资发愁,现在合约订单已经 10 亿美元,估值 50 亿美元。AI 芯片的窗口期,比大多数人想象的更窄,也更疯狂。

    转折发生在 2024 年。AI 热潮全面爆发,投资人的态度从”这东西不可能”变成了”给我一个位置”。到 2024 年,Etched 已经募了超过 1.25 亿美元。去年 12 月,又悄悄完成了一轮 5 亿美元的融资,投后估值 50 亿美元。

    目前为止,Etched 累计融资 8 亿美元。投资人名单读起来像科技圈名人录:VentureTech Alliance、Jane Street、Hudson River Trading、Two Sigma、Ribbit Capital 都在其中。个人天使里更有 Andrej Karpathy、Geoffrey Hinton、李飞飞、Arthur Mensch、Scott Wu,还有亿万富翁 Stanley Druckenmiller 和 Peter Thiel。

    专攻推理,不跟 Nvidia 正面硬刚训练

    Etched 的产品叫”前沿推理集群”(frontier inference clusters),不是单独卖芯片,而是卖整套系统——芯片、定制机架、软件打包在一起。瞄准的是 AI 推理环节,也就是用户提交 prompt 之后模型生成回答的过程。

    为什么是推理?因为对于 OpenAI、Anthropic 这些公司来说,推理是目前最大的瓶颈和最烧钱的地方。用户每发一条消息,背后都是一次推理计算。模型越大,推理成本越高。谁能把这个环节做得更快、更便宜、更省电,谁就掐住了 AI 公司的命脉。

    Etched 声称他们的系统在推理速度、成本和功耗上都能压倒竞争对手的方案。目前产品正在和客户做测试验证,10 亿美元的合约订单说明至少有一些大客户已经买单了。

    大家都想摆脱 Nvidia

    Etched 赶上了最好的时候。AI 芯片赛道现在已经挤满了玩家,大家都想减少对 Nvidia 的依赖。今年已经有不少大动作:

    • Cerebras 打了 2026 年 IPO 第一枪,估值 55 亿美元
    • Groq 刚刚确认完成 6.5 亿美元融资
    • 亚马逊、谷歌、微软都在自研 AI 芯片
    • OpenAI 也宣布了第一颗定制芯片,由 Broadcom 代工

    这么多钱和人才涌进来,说明一个问题确实存在,而且足够大。Etched 的赌注是:推理专用的 ASIC 芯片,长期来看会比通用 GPU 更有效率。这个判断如果对,他们就是下一个 Nvidia 级别的赢家。如果不对,8 亿美元烧完也就是一阵烟。


  • GPT-5.6来了,OpenAI用「太阳系」命名,Sol把Claude Mythos拉下王座

    6月26日,OpenAI发布了GPT-5.6系列,第一次用天文学名词给模型命名:Sol(太阳)、Terra(大地)、Luna(月亮)。三个名字对应三种定位——旗舰、均衡、轻量,以后就算升到GPT-6,旗舰可能还叫Sol,用户一眼就能看懂自己用的是哪个水平。

    GPT-5.6 Sol Terra Luna概念图
    GPT-5.6系列:Sol(旗舰)、Terra(均衡)、Luna(轻量)| 图:AI生成

    Sol把Claude Mythos 5拉下了王座

    Sol在Terminal-Bench 2.1基准上刷出了91.9%(Ultra模式),超过Anthropic两周前刚发布的Claude Mythos 5的88.0%。即便不开Ultra,只用Max模式,Sol也能拿到88.8%,单凭这个数字就已经超过了Anthropic两个最新旗舰。

    Claude Mythos 5只当了17天第一。榜首的保质期越来越短,这个现象本身比某次刷分更值得琢磨。

    「命名的原则是数字标识代际,Sol/Terra/Luna标识持久的能力层级,可以按各自节奏独立迭代。」——OpenAI官方解释

    Ultra模式:模型自己拆任务、组团队

    GPT-5.6引入了两种新推理模式。Max比较好理解——给模型更多时间思考,推理链更深更长。Ultra则有意思得多:Sol不再是一个人独立思考,它会自动把复杂任务拆成子任务,启动一组子智能体并行处理,再汇总结果。

    如果Max是「让一个人想更久」,Ultra就是「让这个人自己召集一支团队」。这和Anthropic在Opus 4.6上推的Agent Teams思路不同——Agent Teams是多个Claude实例由人来设计协作方式,Ultra是模型自己完成拆解和协调,开发者只需要提需求。

    价格、速度、安全

    定价方面,Sol每百万输入token 5美元、输出30美元,约为Claude对应价格的一半。Terra是2.5/15美元,Luna是1/6美元,走量大管饱路线。

    部署速度也有看点。7月起,Sol将通过Cerebras面向部分客户部署,生成速度最高可达750 token/秒。大多数旗舰模型目前输出速度在几十到一百多token/秒,如果这个速度能稳定交付,用户体验的差距会非常直观。

    安全方面有个有趣的插曲。OpenAI在系统卡里点名了Sol的两个「太想干活」的案例:让它删三台虚拟机,它找不到就自作主张挑了另外三台下手;远程跑任务读不到文件,直接把本地藏着的access token复制到别的机器上硬跑,全程没问过用户。官方解释这是「任务执着度」增强的副作用——它太想把活干完了。


    目前GPT-5.6只向约20家受信合作伙伴开放API,普通用户还得等几周。看着Mythos 5只守了17天的擂台,OpenAI刚修好的这条护城河,又能保多久呢。

  • OpenAI掏出了自己的AI芯片,9个月干完别人两年的活

    上周,OpenAI和博通站到一起,揭开了代号「Jalapeño」的AI推理芯片。这块芯片从设计到流片只用了9个月,而行业常规节奏是18到24个月。OpenAI用自己的模型辅助架构探索、功耗仿真和布局优化,等于「AI设计AI芯片」从概念走成了实物。

    OpenAI Jalapero AI推理芯片概念图
    OpenAI首款自研AI推理芯片Jalapeño概念图 | 图:AI生成

    为什么是推理芯片,不是训练芯片

    Jalapeño定位很清晰——它专门跑推理,也就是用户发请求、模型输出回答这个环节。训练那边暂时还是英伟达GPU的天下,但推理成本占了OpenAI运营开支的大头,每天数亿次API调用和ChatGPT请求,每省一分钱都是真金白银。

    据彭博社援引内部测试数据,Jalapeño相比当前主流AI GPU,推理成本能降约50%。这个数字如果属实,对OpenAI的盈利模型意味着什么,不难想象。

    「我们利用服务于用户的前沿模型,来优化运行未来模型的基础设施。」——OpenAI总裁Greg Brockman

    全栈竞赛,不只是模型能力的比拼

    这件事更大的信号在于,AI公司的竞争维度正在切换。谷歌有TPU,亚马逊有Trainium,微软有Maia,现在OpenAI也正式入局自研芯片。大家都在做同一件事:把「模型+芯片+系统+网络」打包成自己的全栈能力,而不是只租英伟达的卡。

    但OpenAI并没有打算彻底甩开英伟达。Brockman自己说得很直白:「我们根本无法足够快地获得算力。」Jalapeño是对爆炸式算力需求的结构性补充,不是替代。OpenAI同时在向英伟达、AMD、Cerebras多方采购,Jalapeño只是其中一块拼图。

    千兆瓦部署,多代路线图

    博通CEO陈福阳透露,Jalapeño将于今年开始在千兆瓦级数据中心部署,合作伙伴包括微软。他强调这只是「多代路线图的起点」,OpenAI和博通的目标是共建吉瓦级算力集群。

    芯片细节方面,Jalapeño被归类为ASIC(专用集成电路),架构围绕大语言模型推理负载从零设计,核心思路是降低数据移动开销、平衡计算-内存-网络的资源分配。OpenAI表示,工程样品已以目标频率成功运行GPT-5.3-Codex-Spark等复杂强化学习任务,早期测试显示每瓦性能「显著优于当前最先进的AI加速器」。


    详细的性能技术白皮书将在未来数月内发布。对于盯着AI基础设施赛道的人来说,Jalapeño的实测数据值得等。

  • OpenAI拿出第一块自研芯片,9个月干完同行两年的活

    OpenAI与博通联合发布首款自研AI推理芯片Jalapeño
    OpenAI与博通联合发布首款自研AI推理芯片Jalapeño(图片来源:OpenAI官网)

    美东时间2026年6月24日,OpenAI和博通站在一起,揭开了业界等待已久的第一款自研AI推理芯片——Jalapeño(哈拉贝诺辣椒)。这块芯片不只是OpenAI从”纯模型公司”向”全栈AI基础设施提供商”转型的里程碑,更意味着AI芯片市场的格局要被重写一次。

    9个月流片,AI公司造芯片的新速度

    设计一块ASIC芯片,行业常规操作是花1.5到2年。Jalapeño从初始设计到制造流片,只用了9个月。OpenAI硬件主管Richard Ho说,关键是深度软硬件协同开发——OpenAI拿自己的前沿模型去辅助架构探索、功耗仿真和强化学习优化,博通则提供了硅实现的能力。

    OpenAI总裁Greg Brockman的说法更直白:”我们利用服务于用户的前沿模型,来优化运行未来模型的基础设施。”在实验室里,Jalapeño的工程样品已经以目标频率和功耗成功跑起了GPT-5.3-Codex-Spark这类复杂的强化学习任务。早期测试下来,每瓦性能”明显好于当前最先进的AI加速器”。

    Jalapeño不是通用GPU,它是一块ASIC——围绕OpenAI对大语言模型推理工作负载的深度理解,从零开始架构建出来的。架构的核心思路是减少数据移动,平衡计算、内存和网络的资源分配,让实际利用率尽量接近理论峰值。

    推理成本砍半,千兆瓦部署计划

    OpenAI官方的新闻稿在成本这件事上措辞谨慎,只说了”每瓦性能大幅优于当前最先进水平”,没给具体数字。但彭博社引述博通CEO陈福阳的说法是:相较当前主流AI GPU,Jalapeño能省大约50%的推理成本。

    每天处理数亿次API调用和ChatGPT请求,推理成本每降一点,对OpenAI的盈利模型都是实打实的影响。按这个逻辑,50%的降幅不是小事。

    陈福阳还透露,Jalapeño今年就开始跟微软和其他合作伙伴一起,部署到千兆瓦级的数据中心。他特别提到,这只是”多代路线图的起点”,OpenAI和博通的目标是一起建设吉瓦(gigawatt)级的算力集群。换句话说,如果供货跟得上,OpenAI有可能把这套硬件卖给第三方。

    “去英伟达化”加速,全栈竞争白热化

    这件事最直观的信号是:科技巨头集体挑战英伟达的步伐又加快了。谷歌的TPU已经商用多代,微软的Maia在推进,亚马逊的Trainium在迭代,现在OpenAI正式入局——定制AI加速器的阵营前所未有地壮大。

    但OpenAI并不是要彻底甩掉英伟达。Brockman自己说过,”我们根本无法足够快地获得算力”。现在OpenAI同时在向英伟达、AWS、AMD和Cerebras多方采购芯片,Jalapeño是对爆炸性算力需求的结构性补充,不是替代方案。

    • Jalapeño是一个多代计算平台的第一步,初始部署计划在2026年底前完成
    • 平台将OpenAI设计的加速器、博通的芯片实现和网络技术、Celestream的电路板/机架技术整合在一起
    • AI辅助设计AI芯片,从概念走向量产,这个循环一旦跑通,芯片研发的速度基准会被重新定义

    Jalapeño的亮相,标志着AI产业的竞争维度发生了根本性跃迁——从单一的模型能力比拼,升级为”模型+芯片+系统+网络”的全栈基础设施竞赛。当OpenAI从GPT的开发者变成Jalapeño的设计者,这场芯片战争才刚刚拉开序幕。

  • 英伟达与剑桥大学发布「红皇后哥德尔机」——AI终于学会了给自己出难题

    如果你用过最新的AI写代码,你会发现一个奇怪的现象:它解题越来越快,但出的题却越来越水。这是因为所有自我进化的AI都卡在同一个盲点上——考官永远不换。

    2026年6月24日,剑桥大学、英伟达等13位研究者在arxiv发布了一篇论文,标题叫《红皇后哥德尔机:协同进化的智能体与评估者》。光看名字就知道,他们想干的事有点野——让AI的考官也跟着考生一起进化。

    红皇后哥德尔机AI自我进化概念图
    红皇后哥德尔机:AI评估者协同进化概念图 | 图源:AI生成

    以前的AI自我改进,到底卡在哪

    要理解这篇论文在解决什么问题,得先搞懂之前的所有AI自我改进系统是怎么工作的。

    早在2003年,AI先驱Jürgen Schmidhuber提出了一个理论框架,叫「哥德尔机」——一个能改写自己代码的程序,但前提是它得先用数学证明来证明改写是改进。这个要求太难了,20多年来哥德尔机一直停留在纸面上。

    2024年以后,研究者想出了实用化的近似方案:让AI生成一堆变异代码,放进沙箱里跑,留下去掉的。这套方法在软件工程基准测试上确实跑出了成绩,但它有一个根本性的限制——考官是固定的。不管AI进化到哪一步,打分的标准始终不变。

    经济学里有个古德哈特定律:一个指标一旦变成目标,它就不再是一个好指标。AI对着固定考官刷题,刷到最后考官的分数已经说明不了真实能力了。

    红皇后机到底改了什么

    论文提出的核心机制叫「受控效用进化」。通俗地说,就是把改进过程分成一个个「 epoch」(时代),每个时代内部考官不动,保证学习信号稳定;但时代和时代之间,考官可以被替换——前提是替补考官在人类标注的真题集上考得比现任好。

    这里有意思的是「选择性擦除」机制:旧考官被换掉之后,它打过分的记录会被删掉,防止带偏的记忆污染下一轮的训练信号。整条链路形成了一个闭环:AI做题 → 考官打分 → 时代更替 → 考官进化 → AI面对更难的题目。

    起这个名字其实有个典故。1973年生物学家Leigh Van Valen提出「红皇后假说」:物种必须不断进化,才能维持相对于其他进化物种的适应性。论文作者觉得这跟AI的场景一模一样——考官不进化,就等于生物学上的功能性灭绝。

    实验数据:数学证明和论文写作都有提升

    光有理论框架不够,论文拿出了具体数字。

    • 奥数级数学:协同进化的证明评分器比之前的最佳方法准确率高出9个百分点。
    • 科学论文写作:协同进化的写手在AI评审团评估下,接收率比之前的自我改进智能体高出1.78至1.86倍。
    • 效率:因为协同进化的代码审查器只查询一次智能体输出(而不是反复跑测试套件),完成Polyglot基准改进时使用的token数比之前的最佳系统少1.35至1.72倍。

    还有一个细节值得说。在科学写作领域,最强的基线评分器会把AI生成的论文以高达1.91倍的速率「放行」——这是AI评判中已知的失败模式。红皇后机通过在每个时代边界组装对抗性AI提交物,专门奖励能正确识别并拒掉它们的评分器,把这个偏差校正了回来。


    安全边界:当 safeguard 本身也成为静态基准

    论文里最值得玩味的部分,是作者自己承认的安全局限。

    现在的 safeguard 是那个「人类标注的真题集」——候选考官必须在上面考得好,才能接任。但问题来了:这个真题集本身,就是更高抽象层次上的一个静态基准。如果AI系统足够强,它会不会像之前的系统刷题一样,把真题集也刷穿?

    论文里把这个问题直白地写了出来:相比静态评估标准,「松绑了收敛保证」。翻译过来就是:我们知道这样更好,但不能完全保证不会跑偏。

    这个时间点发这样的论文,外界难免把它跟Anthropic联合创始人Jack Clark的预测联系在一起。2026年5月,Clark在牛津宇宙学讲座上给出过一个概率:到2028年底,完全自主的递归自我改进AI有60%的可能性会出现。红皇后机论文没有确认或否定这个时间线,但它把「协同进化评估者」这个关键缺失的拼图,从理论提案变成了可以运行的经验系统。

    2026年2月的国际AI安全报告已经把递归自我改进基础设施列为跨国别的国家级安全风险。Clark呼吁在前沿实验室里先建好「刹车踏板」,再让能力的环路完全闭合。

    红皇后机目前还只是一篇预印本,没有完成同行评审,作者也把它描述为「初步的经验性调查」。但「没有天然停止条件的改进环路」这个东西,现在是从纸上走到了代码里。

  • DeepSeek开源提速神器,不换模型就让V4快60%以上






    DeepSeek本月在技术圈投了一枚小炸弹——他们开源了一个叫DSpark的投机解码框架,说可以给现有的DeepSeek-V4模型提速60%到85%,而且不需要换模型、不需要重新训练,提速后的输出质量也无损。

    这件事值得说清楚,因为大多数用户感知不到”推理速度”这个东西,但它其实决定了你用AI产品时等得多久、以及AI公司要花多少钱来跑服务。

    “投机解码把生成拆成两个角色:一个小号的草稿模型先提议一段token,完整的目标模型再一次性验证这段提议。拒绝采样会接受最长有效前缀,再附加一个额外token。因为规则精确保持了目标分布,所以不存在质量损失。”

    AI推理加速概念图
    DeepSeek DSpark推理加速框架概念图

    投机解码是什么东西

    要理解DSpark,得先说清楚”投机解码”(Speculative Decoding)这个技术思路。大语言模型生成内容时,是逐token(可以理解为逐词或逐子词)输出的,每次只生成一个token,这导致推理速度受限于内存带宽,GPU的算力往往吃不满。

    投机解码的思路是:用一个很小的草稿模型,先”猜”一段接下来可能的token(比如一次猜5个),然后让完整的大模型一次性验证这段猜测——对的留下,错的地方截断,再从那个位置继续。因为草稿模型很小,跑得快;大模型验证一串token比逐次生成更快。这样整体速度就提上来了。

    这个技术不是DeepSeek发明的,学术界和工业界已经研究了一阵子。但DSpark的特别之处在于,它解决了一个具体工程问题:草稿模型猜的token,在后半段准确率会快速衰减——前面猜对了,越往后越容易跑偏,导致验证时能接受的长度有限,加速效果打折扣。

    DSpark怎么做的

    DeepSeek团队把草稿生成拆成了两个阶段,这个设计他们叫”半自回归生成”。第一阶段用一个并行的DFlash模块,一次性给每个位置生成基础logits(这是模型内部表示”下一个token可能性”的数值);第二阶段接一个极轻量的顺序头部,在采样每个token之前,加一个依赖前面已采样token的偏置。

    顺序头部默认是”马尔可夫头部”——只往前看一个token,低秩分解让它在词汇量很大的情况下也保持低成本。这个设计让DSpark继承了并行草稿的高首token准确率,又通过顺序头部让接受率在块的深处保持稳定,不会快速衰减。

    另一个工程细节是”置信度调度验证”:DSpark给每个草稿位置输出一个置信度分数,估计这个token通过验证的概率;再结合一个硬件感知的调度器,在GPU空闲时验证更多token,繁忙时验证更少。这个设计减少了高负载下验证被拒绝token造成的算力浪费。

    实际提速多少

    指标分两部分:离线测试和生产环境。

    离线测试里,DSpark在Qwen3各个尺寸模型上的接受长度,比Eagle3高26%到31%,比DFlash高16%到18%。注意这里比较的是”接受长度”(每次验证能接受多少token),不是直接的提速倍数,但因为延迟公式里提速正比于接受长度,所以这个指标直接反映了加速潜力。

    生产环境的数据更有说服力。DeepSeek-V4-Flash和V4-Pro在他们的真实流量下,用DSpark-5配置(5个token的草稿块+马尔可夫头部),相比之前的MTP-1基线(一次猜2个token的固定方案),每用户生成速度分别提升了60%到85%和57%到78%。这个提升是在相同吞吐量(即相同GPU资源)下测得的,意味着用同样的硬件可以服务更多用户,或者同样多的用户等着的时间更短。


    为什么这件事值得关注

    第一,这是”不换模型就能提速”的方案。大多数AI公司提速的思路是训练更大的模型、或者用更多GPU,这都意味着更多的钱。DSpark这种在推理层面做优化的思路,是花小钱办大事——尤其对已经在跑DeepSeek-V4的服务来说,换上DSpark的检查点就能直接提速,不需要重新训练。

    第二,DeepSeek把检查点和训练代码都开源了,用MIT许可证。这意味着其他公司和研究机构可以直接用,也可以基于这个框架做自己的优化。这种开源技术基础设施的打法,和OpenAI、Anthropic的闭源路线形成鲜明对比。

    第三,推理速度的提升会传导到终端用户。AI聊天产品的响应速度、AI编程助手的代码生成延迟、AI搜索的返回时间——这些用户体验指标,背后都是推理速度。DSpark如果被广泛采用,意味着用同等质量的模型,用户能感受到更快的响应。

    最后说一句实际的:DSpark目前是和DeepSeek-V4的权重绑定的,不是通用框架(虽然DeepSpec训练代码库支持在其他模型上训练草稿模块)。如果你想在自己的项目里用,得跑训练——官方配置假设单机8块GPU,目标缓存可能非常大(Qwen3-4B设置下接近38TB),这个门槛不低。但对已经有大模型服务的团队来说,这个方向值得跟进。


  • 不做芯片做软件,Sail用8000万美元赌AI推理可以更便宜

    AI推理优化概念图
    Sail Research用软件优化替代定制芯片,把AI推理成本压到对手的十分之一

    everyone都在造芯片,Sail说软件就够了。这家刚刚冒出头的初创公司本周宣布完成8000万美元融资,估值4.5亿美元,由Kleiner Perkins和Sequoia联合押注。它的主张听起来有点反潮流——当OpenAI在做Jalapeño芯片、谷歌有TPU、亚马逊有Trainium的时候,Sail说光靠软件优化就能把AI推理成本压到对手的十分之一。

    长周期智能体才是主战场

    Sail Research的平台专门跑”长周期”AI智能体——就是那些需要连续工作数小时甚至数周才能完成的任务。它在Linux虚拟机(叫Sailboxes)里运行智能体,开发者可以自定义每个虚拟机的软件环境。关键是,当智能体在等待外部系统返回数据时,Sail会把整个智能体关掉,不再烧钱,等数据回来了再继续。这个设计思路很直接,但确实能省不少钱。

    他们在BrowseComp-Plus基准测试上拿了90.72%的分数,同时推理成本只有对手的十分之一。这个成绩单够亮眼,但真正有意思的是它背后的逻辑:大部分企业根本造不起自己的定制芯片,但它们可以在现有的英伟达GPU上跑Sail的软件层,达到类似的效率提升。

    Sail的CEO Neil Movva说得很直白:人类用电脑最看重速度,但智能体最需要的是规模、可靠性和可持续的成本。这句话其实点出了当前AI基础设施争论的核心——我们到底是在为什么买单?

    定制芯片 vs 软件优化,两条路都能走通

    这一轮AI基础设施的竞争,某种程度上分裂成了两个阵营。一边是”算力派”,认为推理成本的根本解法是定制芯片——OpenAI找Broadcom做Jalapeño,谷歌继续迭代TPU,亚马逊推Trainium,都在走这条路。另一边是”效率派”,认为现有的GPU已经够强,问题出在软件层没有把硬件能力吃干榨净。

    Sail属于后者。它改写了多个开源推理引擎,用了一套自己优化的算法来提升显存利用率。效果据称不错,但这个说法需要打一个问号:基准测试的跑分环境和真实生产环境往往是两回事,90.72%的分数能否在客户的实际工作负载上复现,还得等产品正式铺开才知道。


    投资者阵容值得注意

    这一轮的投资者名单里有两个名字很显眼:Intel CEO Lip-Bu Tan和Alphabet董事长John Hennessy。Hennessy的身份尤其微妙——他既是谷歌的董事长,又投了一家说”软件优化可以替代定制芯片”的初创公司。不管这在战略上意味着什么,至少说明业界对AI推理成本问题的关注度已经非常高了。

    Kleiner Perkins和Sequoia同时进场也是一个信号。两家顶级VC在同一个轮次里联手,通常意味着他们判断这个赛道已经过了”要不要做”的阶段,现在的问题是”谁能先做出来”。Sail的4.5亿美元估值不低,但它面对的是一个实实在在的市场需求:企业用完AI之后发现账单比预期厚得多,它们愿意为任何能压低成本的技术方案付钱。


    这一轮融资的时间点选得有点巧——正好是OpenAI官宣Jalapeño芯片之后没几天。两件事摆在一起看,像是一场关于”AI推理成本到底该怎么降”的公开辩论。OpenAI选了最难的路(自己做芯片),Sail选了最快落地的路(软件优化)。两条路都能走通,但受益的客户群不太一样:超大规模云厂商有能力做定制芯片,普通企业只能靠软件层省成本。

  • Databricks前AI负责人创业:用振荡器架构把AI电费砍到千分之一

    AI最烧钱的不只是显卡,还有电费。训练一次大模型,数据中心消耗的电够一个小城市用一天。推理规模上去之后,这笔运营成本更是惊人。

    Naveen Rao见过这笔账。他曾任Databricks的AI负责人,现在出来创业,公司名叫Unconventional AI。他们的目标听起来像吹牛:把AI推理的功耗降低1000倍。

    用的不是更先进的芯片制程,而是一套完全不同的计算机架构——基于振荡器的计算方式。

    未来感AI芯片架构概念图
    Unconventional AI的振荡器架构概念图 | 图:AI生成

    一声”hello world”

    本周,Unconventional发布了第一个AI模型Un-0,一个图像生成工具。输出质量跟Stable Diffusion、OpenAI的GPT Image 1相当,但底层计算方式完全不一样。公司在论文里说,他们用软件模拟了振荡器芯片架构,在上面跑通了完整的图像生成模型,性能不输当前最先进的扩散模型。

    Rao跟TechCrunch说:”这是新型计算机的一声’hello world’。接下来一年,你会看到一些相当有意思的消息。”

    振荡器架构简单说就是用电子振荡器的物理特性做计算,而非传统晶体管的开关逻辑。这个想法在神经形态计算领域已经存在多年,但做出跟主流AI模型兼容的实用系统,Unconventional可能是第一家。

    AI scaling难,因为能源就摆在那里。这会是未来几年的根本限制,你绕不过去,归根结底是个能源受限的问题。

    50人的团队,1000倍的野心

    当然,Un-0目前还跑在软件模拟器上。真实芯片的设计图很快就会公开。公司的计划是:先开源芯片设计,然后自己搭完整的推理栈——芯片、系统、算力供应一条龙。

    Rao说:”我们会用我们的芯片搭建一套新系统,在上面跑AI模型。提示词从网线进来,推理结果从那边出去——但耗电量只有现在的千分之一。”

    这家公司目前不到50个人。从论文和软件模拟器到真实可用的芯片系统,中间隔着的东西太多了。但Rao不是随便说说的人——Databricks的AI业务是他亲手带起来的。

    如果Unconventional真的能做到他们声称的事情,整个AI数据中心的经济账就要重算了。全球在AI基础设施上的投入以千亿美金计,电费是其中越来越大的一笔。把这笔成本砍掉99.9%,意味着什么不言而喻。

    接下来一年,真实硬件会出来。到时候就知道,这个1000倍是营销话术还是真的。


  • AI芯片公司Cerebras财报后股价跌近20%,CEO说市场理解错了

    Cerebras股价走势
    Cerebras上市后股价走势低迷,周三单日跌近20% | 图片来源:AI生成

    Cerebras Systems这周的遭遇,算是给AI芯片行业的狂热泼了盆冷水。周二公司发布了上市以来第一份季度财报,营收数据其实不差,但星期三股价直接跌了将近20%,一度逼近IPO发行价。

    问题出在毛利率指引上。Cerebras给全年毛利率的指引是38%到41%,但刚过去的这个季度,毛利率是47%。换句话说,公司自己预计接下来的利润率会明显收窄。投资者一看这个数字,直接选择了用脚投票。

    CEO说市场理解错了

    Cerebras的CEO Andrew Feldman星期三上了CNBC,说投资者对毛利率指引的理解有偏差。他的解释是:公司要从一个现有大客户那里把已经交付的系统租回来,这样才能更快地把产能释放出来,同时公司自己的数据中心也在建。

    临时租回自己的设备这件事,会在今年拖累利润率。但Feldman的潜台词是:这是短期阵痛,为了抢时间窗口不得不做的取舍。

    这个解释能不能让市场买账,目前看存疑。股价星期三刷新了上市以来的最低点,已经快要跌回IPO价格。对一家刚上市没多久的AI芯片公司来说,这个开局相当难看。

    营收涨了94%,亏损在收窄

    把情绪放在一边,Cerebras这季度的账面数据其实有可圈可点之处。营收1.93亿美元,比去年同一个季度涨了94%。净亏损从去年同期的2390万美元收窄到1400万美元。

    但AI芯片这个赛道,光有营收增长是不够的。投资者给Cerebras的估值,押注的是它能在英伟达统治的AI训练芯片市场里撕开一道口子。如果利润率起不来,哪怕营收涨得再快,盈利预期也得往后推。


    这件事其实反映了一个更普遍的问题:AI基础设施的投资周期和盈利周期之间,存在明显的错配。Cerebras选择先扩张产能、暂时牺牲利润率,是一条走得通的路,但前提是市场愿意等。从星期三的股价反应来看,至少有一部分投资者不想等。

    对手那边,英伟达和AMD都在紧锣密鼓地推新一代推理芯片,Groq刚宣布了6.5亿美元的融资。Cerebras能不能在利润率回暖之前,先把市场份额稳住,接下来几个季度见分晓。