标签: Nvidia

  • TensorRT LLM:NVIDIA 开源的高性能大模型推理引擎,14.2K Star

    TensorRT LLM:NVIDIA 开源的高性能大模型推理引擎,14.2K Star

    项目简介

    TensorRT LLM 是 NVIDIA 开源的高性能大语言模型(LLM)与视觉生成模型推理优化库。它在 NVIDIA GPU 上提供最先进的定制内核、运行时优化和 Python 化高层 API,能把主流开源/自研大模型的推理延迟压到更低、吞吐拉到更高——从单张 RTX 显卡到多机 NVL72 集群都能统一部署。

    TensorRT LLM

    安装要求和过程

    环境要求

    • GPU:NVIDIA GPU(推荐 Ampere / Ada / Hopper / Blackwell 架构)
    • CUDA:CUDA 13.2.1(以 README 当前 badge 为准)
    • Python:3.10 或 3.12
    • PyTorch:2.11.0
    • 系统:Linux(主要支持)、Windows、WSL2

    快速安装

    # 推荐通过 pip 安装最新 release
    pip install tensorrt_llm
    
    # 或使用预编译容器(避免环境踩坑)
    docker pull nvcr.io/nvidia/tritonserver:26.05-trtllm-python-py3
    
    # 验证安装
    trtllm-serve --help

    更复杂的源码编译或多节点部署可参考官方安装指南:Installation Guide

    核心功能

    TensorRT LLM 架构分层

    • PyTorch 原生架构:模型定义直接写 PyTorch,调试、扩展、自定义注意力/量化都更直观。
    • 高层 LLM API:一行代码从 Hugging Face 加载模型,自动编译 TensorRT engine,支持单卡、张量并行、流水线并行、专家并行。
    • State-of-the-Art 内核:针对 Attention、GEMM、MoE 等常见算子手写 CUDA kernel,充分发挥 Tensor Core 算力。
    • 丰富的高级特性:FP8/FP4/INT4 AWQ 量化、KV Cache 复用、投机解码、Prefix Caching、CUDA Graphs、Prefill-Decode 解耦等。
    • 生产级部署生态:原生兼容 NVIDIA Dynamo、Triton Inference Server,也能作为 vLLM、SGLang 等框架的后端。

    典型使用场景

    TensorRT LLM 核心优化技术

    1. 高并发在线服务

    在 H100/H200/B200 集群上部署 Llama、DeepSeek、Qwen 等模型,配合 Tensor Parallelism 和 Disaggregated Serving,把单用户延迟压到百毫秒级,同时保持数千 token/s 的聚合吞吐。

    2. 本地化推理与边缘部署

    通过 INT4/FP4 量化和 Weight-Stripped Engines,在单张 RTX 4090 或 Jetson AGX Orin 上运行 70B 级别模型,满足私有化、低功耗场景需求。

    3. Agent 与长上下文应用

    利用 Prefix Caching 和 chunked context,在多轮工具调用、RAG、代码补全等长上下文场景中显著降低首 token 时延。

    推荐理由

    TensorRT LLM 是 NVIDIA 在大模型推理领域的“官方解法”。它不是简单的封装,而是从 kernel、runtime 到 serving 的垂直优化。2025 年 3 月后项目已完全开源并迁到 GitHub 维护,社区活跃、文档详尽,对追求极致吞吐和成本控制的生产环境尤其友好。虽然硬件门槛是 NVIDIA GPU,但如果你已经在 CUDA 生态里,它基本是目前能把模型跑得最快、最省显存的工具之一。

    下载地址

  • 前Google Brain研究员用AI智能体替非英伟达芯片写底层代码

    上个月,Jeremy Nixon 悄悄把一家公司推到了台前。这家叫 Infinity 的初创公司刚宣布拿到 1500 万美元融资,估值 1 亿美元,投资方里除了 Touring Capital、Principal VC,还有来自 OpenAI 和 Anthropic 的研究员个人。Nixon 本人是个有意思的人——他曾在 Google Brain 做研究,也是黑客社区 AGI House 的创始人。真正让外界注意到他的,是他抛出的一个有点狂的念头:AI 系统本身,能不能成为一种「元技术」,自己发明新东西。

    从「自动发明算法」到「自动写芯片代码」

    早在做 Infinity 之前,Nixon 就捣鼓过一个叫 Omega 的机器学习算法。它的特别之处在于,能自己创造出新的机器学习算法,然后在一个反馈回路里自动评估好坏。那次成功让他开始琢磨:这套思路能不能挪到别的地方?他盯上了硬件——自动化系统或许也能生成那些让芯片跑得更高效的底层代码,比如内核(kernel)这一类东西。

    英伟达的护城河,一半是软件

    这里得先说清楚一件事。很多人以为英伟达厉害是因为芯片性能好,这当然没错,但另一半答案藏在 CUDA 里。CUDA 是英伟达的软件层,让原本为图形设计的 GPU 能当通用处理器用,PyTorch、TensorFlow 都建在它上面。开发者用 Python 写应用,默认就跑在英伟达的卡上。问题是,绝大多数应用层公司既没资源也没本事自己写内核、把应用移植到别的芯片上。

    Nixon 想做的,是把 CUDA 这套「让芯片好用」的活儿交给一个 AI 智能体来干,而且不挑芯片——SRAM、GPU、手机芯片、Systolic Array 统统能适配。

    一个会自己改自己代码的智能体

    Infinity 的核心产品叫 Ignition,是个 AI 研究智能体。它的任务很硬核:为那些想挑战英伟达的芯片写 AI 推理所需的底层代码。它会测试、调试,测量硬件在这套代码下跑得快不快,不行就自动重写,直到性能提上去。整个系统是自优化的,会持续学习、自我改进,而且能适应不同的芯片架构,不管对方是不是闭源的。

    不收授权费,只抽性能提升的成

    这种打法听起来很「AI 原生」。Nixon 说,客户里已经包括 AI 芯片公司 D-Matrix——一家立志挑战英伟达的玩家,同时 Infinity 还在和其他大芯片厂、云厂商谈。更妙的是它的收费模式:不收前置授权费,而是从性能提升和成本节省里抽成,衡量的指标很直接,就是每秒令牌数(tokens per second)的变化。在一个案例里,这个智能体把原本可能要花几年或几个月的过程,压缩到了几小时或几天。

    • Infinity 不是第一家想拆英伟达墙角的公司,但它走的是「逐产品蚕食」的软件路线,而不是去造另一块卡。
    • 人类并没有被踢出局,而是给智能体定大方向,繁琐的体力活交给它。
    • 公司目前只有 26 个人,分布在设计、运营和工程岗。

    把视角拉远一点,Infinity 其实是这一波「AI 基础设施去中心化」浪潮里的一朵浪花。当训练和推理不再被绑死在某一家厂商的软件栈上,更多芯片公司才有机会把货卖出去。这条路能不能走通,取决于 Ignition 真能在不同架构上稳定逼近 CUDA 的水平——这是个需要时间验证的承诺,不是今天就能盖棺的事。

    Infinity 创始人 Jeremy Nixon
    Infinity 创始人 Jeremy Nixon(图源:TechCrunch)
  • 谷歌悄悄研发新 AI 芯片 Frozen v2:要让 Gemini 省下大笔电费

    Google 自研 AI 芯片相关示意图
    大厂自研 AI 芯片已成趋势,Google 的 Frozen v2 瞄准的是推理能效(图源:TechCrunch)

    Alphabet 正在悄悄搞一颗新的服务器芯片,内部代号叫 Frozen v2,专门用来让自家的 Gemini 模型跑得更省、更稳。消息来自 The Information 的爆料,说这颗芯片大概会在 2028 年前后亮相。

    能效说是现在的六到十倍

    按那篇报道的说法,Frozen v2 的衡量标准是「每消耗一单位电力能生成多少 token」,在这个口径下,它要比 Google 现有的 AI 芯片高效 6 到 10 倍。对此 Google 既没承认也没否认,只给了一句四平八稳的回应。

    「我们的团队一直在研究和试验各种新方案,为用户和客户带来极致的性能与效率。」

    大厂为什么都在自己造芯

    把模型训练和推理从通用 GPU 上挪到自己定制的芯片上,已经成了大厂的共同动作。动机很直白:一是让自家模型跑得更划算,二是摆脱对英伟达的依赖——这家公司长期把持着 AI 芯片市场,也让所有大模型厂商都被它的硬件绑住。

    就在今年 6 月,OpenAI 刚亮出第一颗自研推理芯片 Jalapeño;本月初又有消息说,Anthropic 正在和三星谈新的芯片合作。Google 自己本来就有 TPU 这条线,Frozen v2 像是把这条路继续往下走。

    • 代号 Frozen v2,目标 2028 年前后发布,专供 Gemini 使用。
    • 能效按 token / 单位电力计,号称达现有芯片 6 到 10 倍。
    • 背景是 OpenAI、Anthropic 相继布局自研芯片,全行业试图降低对英伟达的依赖。

    股价先涨为敬

    这类消息背后,其实是投资者的算盘。大家一直担心 Alphabet 为了 AI 基建砸下的天价开支——公司年初说今年要花 1800 亿到 1900 亿美元。钱花出去了,得证明能回本。Frozen v2 一旦坐实,等于给市场一个「我们在把成本压下来」的信号。报道出来后,Google 股价周一上午就涨了大约 3%。

    当推理成本变成卖点,AI 的故事就从「大力出奇迹」变成了「谁更会过日子」。


  • Prime Intellect 融了 13 亿美元:企业不想再给大模型厂商”交租”了

    Prime Intellect 创始人团队
    Prime Intellect 把训练 AI 智能体的全套家当打包成”全栈”服务(图源:TechCrunch)

    一家 2024 年才成立的公司,靠帮企业自己训练 AI 智能体,融到了 1.3 亿美元 A 轮,估值直接站上 10 亿美元。投资方名单读起来像一张 AI 圈名人堂——英伟达、英特尔、戴尔的战投都在,还有 Perplexity、Box、Harvey、Cognition 这些公司的创始人以个人身份下注。这轮由 Radical Ventures 领投,光看阵容就知道,芯片和云厂商都想在”谁来训练明天的模型”这件事上占个座。

    一家成立两年的公司,凭什么值 10 亿

    Prime Intellect 做的事说白了就是一句话:别再从 OpenAI 或 Anthropic 那里按 token 租智能了,自己造一个更适合业务的。它把训练 AI 智能体需要的家当打包成一套”全栈”——算力、强化学习框架、评估工具,客户像逛市场一样按需取用,不会被绑死在一套方案上。

    “不应该只有旧金山玻璃大厦里的少数极客才拥有训练 AI 模型的能力,每一家企业、每一个国家都应该拥有这种能力。”——Prime Intellect CEO Vincent Weisser

    为什么这件事忽然有了土壤?几年前,自己训模型还是只有巨头玩得起的游戏。但现在强化学习这套打法成熟了,模型可以在具体任务上反复试错、被奖励、被修正,企业慢慢能当自己的”AI 实验室”。真正的难点在于底层基建太复杂,大多数公司根本凑不齐这套零件——Prime Intellect 就卡在了这个缝里。

    企业为什么不想再”租”智能了

    吸引力来自实打实的结果。金融公司 Ramp 用它做了一个在表格里找答案的 Agent,官方说法是准确率高过前沿模型,速度更快,成本只有零头。更关键的是心态变化:企业越来越不愿意把专有数据喂给 OpenAI 和 Anthropic,也怕哪天模型像上个月 Anthropic 的 Fable 那样说关就关。

    • 把敏感业务数据留在自己手里,而不是交给第三方大模型厂商;
    • 不用担心模型被突然下线,业务连续性更有保障;
    • 在垂直任务上,自训的小模型成本可能远低于调用前沿 API。

    Radical Ventures 的合伙人 David Katz 说得更直白:大家开始琢磨”怎么把企业自己的智能掌握在手里,别冒那些风险”。目前年化收入已经冲到 1 亿美元,Ramp、Zapier 都是付费客户。


    钱正流向训练场,而不是模型

    这轮融资背后藏着一个正在成形的判断——资本正在涌向”训练场”,而不是模型本身。就在五天前,做 Agent 安全训练环境的 Bespoke Labs 也拿了 4000 万美元。两笔加起来的信号很清楚:企业想要的不再是又一份订阅,而是 Agent 这个东西的所有权。英伟达和英特尔同时开出支票,说明连芯片厂也信了这套逻辑——它们不在乎模型最后归谁,只要训练跑在自己的硅上就行。接下来一年要回答的问题是,Prime Intellect 能不能在 OpenAI 和 Anthropic 自己猛攻企业市场时,守住这 1 亿美元的增速。

  • AI芯片又一笔10亿美元:SambaNova估值冲到110亿,摩根大通把算力搬回自家机房

    SambaNova 这家公司,你可能没怎么听过,但在 AI 芯片这条赛道上,它刚干了一件挺有象征意义的事。7 月初,这家 2017 年成立的帕罗奥图创业公司宣布完成 10 亿美元 F 轮融资的第一笔交割,投后估值来到 110 亿美元。领投方是老牌成长基金 General Atlantic,贝莱德、卡塔尔投资局、Intel Capital 等一众机构跟投。

    有意思的是,这笔钱距离它上一次融资只隔了不到五个月。今年 2 月它才拿下 3.5 亿美元 E 轮,同时发布了第五代芯片 SN50。换句话说,资本市场的钱还在疯狂往 AI 基础设施里灌。

    SambaNova 的 CEO Rodrigo Liang 说了一句很直白的话:摩根大通这种级别的银行开始自己搭私有、安全的算力底座来跑推理,这个信号会传到银行业之外。

    它到底造的是什么芯片

    SambaNova 走的是和英伟达不一样的路子。它的芯片不是要取代英伟达,而是贴着英伟达一起用。公司主打”高端推理”——把今天动辄几万亿参数的前沿大模型,塞进一个机柜里跑,而且跑得飞快。Liang 对外说过,SN50 跑推理的解码部分比竞品快五到十倍。

    SambaNova AI 芯片
    SambaNova 的 AI 推理芯片(图源:TechCrunch)

    今年 2 月发布的 SN50 基于数据流架构,计算能力是上一代 SN40 的 5 倍,网络带宽是 4 倍,预计 2026 年下半年开始向客户发货,软银是它的第一个部署伙伴。

    三类客户,和一个 IPO 悬念

    Liang 把客户分成三块:一是主权云,各国政府出钱扶植本地私有云;二是新云(neocloud);三是自建自用的大企业。除了摩根大通,沙特阿美、英特尔以及一些日本企业也在客户名单上。


    • SambaNova 成立以来累计融资规模已相当可观,本轮后现金储备进一步增厚
    • 资金一大用途是锁供应链——在汹涌的需求面前先把产能和物料攥在手里
    • 与英特尔的关系也在加深,双方从投资到联合开发产品一起推向市场

    至于公司未来,Liang 话讲得很活。被问到连续融资是不是意味着铁了心独立,他说”一直有人来找我们”,这扇门在动态的 AI 市场里还开着,但增长势头更可能把公司推向”某天上市”。据 CNBC 报道,他甚至提到了 2027 年 IPO 的可能性,大概率选美国。

    AI 基础设施建设的热度,从这 10 亿美元里就能看出来。当大行都不愿意把最敏感的模型推理完全交给云厂商,像 SambaNova 这样专做”把大模型安全跑在自己地盘上”的芯片公司,就有了存在的理由。

  • Reflection 签 10 亿美元算力大单:开源模型商的弹药库焦虑

    Reflection 与 Nebius 10 亿美元算力协议
    算力正在变成 AI 公司的战略物资(图源:TechCrunch)

    开源模型公司 Reflection AI 最近像在囤弹药一样,连续签下大笔算力合同。7 月 14 日,这家估值 250 亿美元的美国初创公司宣布,和欧洲 AI 基础设施厂商 Nebius 签下一份价值 10 亿美元的算力协议。

    拿到的是英伟达最新的芯片

    Nebius 的前身是俄罗斯科技巨头 Yandex 的国际业务,这次它会把英伟达最新一代芯片的使用权交给 Reflection。有意思的是,这已经是 Reflection 几周里第二笔大型算力交易了——上一份是和 SpaceX 拿计算资源。两家公司都在抢同一件东西:训练和部署模型所需要的算力。

    当特朗普政府上个月施压 Anthropic 和 OpenAI 限制最强模型,业界开始担心模型访问权限可能被”一夜收回”。加上中国开源模型越来越能打,主流市场对开源 AI 的兴趣被彻底点燃。

    为什么开源模型商比谁都怕算力断供

    Reflection 由两位前 Google DeepMind 研究员在 2024 年创立,已经从英伟达、红杉、Lightspeed 手里融了近 26 亿美元。它的处境正好戳中当下最热的争论:闭源旗舰模型到底值不值那个价?当数据留存顾虑和政府干预一起涌上来,能自己掌控权重、不受制于单一厂商的开源路线,突然成了香饽饽。

    Nebius 才是幕后那个大赢家

    • 拿到英伟达 20 亿美元投资后,Nebius 转头就和 Meta 签了最高 270 亿美元、为期五年的基础设施协议。
    • 去年它跟微软也签了最高 194 亿美元的多年的协议。
    • 从 Yandex 拆分出来后,Nebius 几乎成了各大 AI 实验室的”算力二道贩子”。

    算力正在变成一种战略物资,谁先把芯片和机房锁死,谁就握住了下一代模型的命门。Reflection 连签两单,表面上是为了训练和部署,底下其实是整个行业对”算力稀缺”的集体焦虑。

  • 巴黎AI语音公司Gradium拿下英伟达1亿美元,要抢ElevenLabs的活

    AI语音技术概念图
    实时语音AI正在成为人机交互的新入口(图源:TechCrunch / Getty Images)

    你跟AI语音助手说话时,最别扭的瞬间是什么?多半是那种尴尬的停顿——你明明把话说完了,它还在”思考”,过了半秒才接上一句。巴黎一家叫 Gradium 的初创公司,盯上的就是这块短板:让机器说话别再卡顿,像真人一样即问即答。

    从开源实验室里长出来的公司

    Gradium 2025年12月才从隐身状态走出来,它本身是从法国 AI 实验室 Kyutai 分拆出来的。Kyutai 由法国电信大亨 Xavier Niel 支持,走开源路线。Gradium 的联合创始人 Neil Zeghidour 是个老面孔,先后待过 Google Brain、DeepMind 和 Facebook,是生成式音频领域的核心研究者之一。

    “语音AI正在到达一个拐点。” Zeghidour 在融资声明里这么判断——他认为语音会成为人和智能系统之间的主要界面。

    英伟达为什么愿意入局

    7月8日,Gradium 宣布把种子轮追加到 1 亿美元,新加入的投资者里出现了英伟达。它最初在2025年12月就拿了 7000 万美元,投资方名单相当豪华:FirstMark Capital、Eurazeo、DST Global Partners,还有 Eric Schmidt 和 Xavier Niel 个人。芯片巨头亲自下场投语音模型,释放的信号很明确:语音已经被视作 AI 基础设施的关键一环,而不只是应用层的点缀。

    它到底做了什么

    Gradium 做的是一个超低延迟的实时语音栈,核心目标是让 AI 声音几乎即时响应。具体拆开来看,几块能力都挺实在:

    • 新一代实时文本转语音,读缩写、邮箱、电话号码这类内容更准,也更自然;
    • 实时语音识别带”语义轮次检测”——能判断你是真的说完了,还是只是停下来喘口气,而不是靠静音就草草打断;
    • Gradium Translate 超低延迟的语音到语音翻译,还有端侧模型 Phonon,以及开源框架 GradBot,几行代码就能搭出能用的语音 agent。

    去湾区抢人,也抢客户

    这笔钱另一大用途,是在旧金山湾区开办公室。巴黎固然是欧洲 AI 重镇,但 Gradium 直言就是要离 Anthropic、Google、Meta、OpenAI 更近,方便挖人和贴近大客户。竞争当然激烈:做语音的 ElevenLabs 今年2月估值已经到 110 亿美元,Google 的 Gemini 也是语音老手。不过 Gradium 说自己上线几周就有了收入,还拿下了雷诺这样的企业客户。


  • 首笔推理芯片抵押贷落地:4亿美元押注AI算力的下一站

    算力生意的下半场

    训练一个大模型要烧掉天文数字的算力,但模型训好之后真正天天在跑的,是”推理”——也就是你每次提问、它给答案的那一下。最近一笔 4 亿美元的融资,把赌注压在了这块过去被忽视的市场上。

    AI 推理云创业公司 General Compute 拿到了 Upper90 的 4 亿美元贷款。有意思的是,这很可能是第一笔拿”推理专用芯片”做抵押的买卖。所谓推理芯片,专门用来高效跑已经训好的模型,不像训练芯片那么贵、那么吃水和电。

    General Compute 推理芯片
    General Compute 的推理芯片主打低功耗、免水冷(图源:TechCrunch)

    General Compute 的 SN50 芯片来自英特尔支持的 SambaNova,主打省电、不用昂贵的水冷,所以能比 GPU 更快铺进各种数据中心。公司声称推理速度能到 GPU 云的 16 倍。问题只有一个:作为一家新公司,怎么搞到足够多的芯片。

    “我们当年第一批给英伟达 GPU 融资时,市场还很低效,早进场的人能拿到风险补偿。”Upper90 的 Billy Libby 说。

    从 GPU 转向推理层

    这就轮到 Upper90 出场了。它的老板 Billy Libby 是个前高盛量化交易员,2021 年就曾给能源型数据中心创业公司 Crusoe 做 GPU 采购融资——他自称那是第一笔拿高端芯片做抵押的贷款。当时传统银行躲得远远的,怕芯片贬值太快;等 CoreWeave 把这种”芯片抵押”做成生意、还顺手搞出个轰动 IPO,大家才反应过来。

    现在 GPU 行情大家都摸透了,甚至有点买过头,Upper90 就把目光转向了 General Compute 这样的推理层公司。这个转向背后有个判断:不是谁都需要超级计算机,但谁都需要推理。开源模型越来越能打——月之暗面刚发的 Kimi K3 在编程基准上已经逼近 Anthropic 和 OpenAI 的旗舰——跑这些开源模型,便宜的推理芯片就够了。Groq、Cerebras 这类芯片公司也因此被收购方和公开市场盯上。

    General Compute 押注英伟达体系之外的芯片,逻辑和 TensorWave 绑定 AMD 类似:当替代方案越来越多,不被英伟达锁死的计算提供商,反而可能在成本上占优。

    “有一批芯片正在起量,总拥有成本惊人地好,速度也比英伟达快,但买家不多。”CEO Finn Puklowski 说,”和 Upper90 合作,不是’一个酷公司拿到钱买算力’这么简单,这是资本第一次组织起来,去敲碎英伟达的垄断。”

    对普通人来说,这事儿离得有点远。但它决定了你以后用 AI 是贵还是便宜:当推理产能不再被一家芯片厂卡脖子,模型跑起来的成本才会真正降下来。


    一句话看清这笔融资

    • General Compute 获 Upper90 的 4 亿美元贷款,或为首笔以推理芯片为抵押的融资
    • SN50 芯片(SambaNova)主打低功耗、免水冷,推理速度号称 GPU 云 16 倍
    • 资本从 GPU 转向推理层:开源模型崛起让低成本推理需求激增,英伟达之外的芯片有了空间
    📎 原文来源:Why the first GPU financiers are turning to inference chips in a $400 million deal(TechCrunch / Tim Fernholz,2026-07-17)
  • 英伟达开源机器人技能库 ASPIRE:机器人开始像程序员一样,边改 bug 边攒本事

    英伟达开源机器人技能库 ASPIRE:机器人开始像程序员一样,边改 bug 边攒本事

    以前训练机器人,靠的是海量数据反复喂、靠梯度下降一点点更新权重,练完就是一堆定死的浮点数。英伟达刚开源的 ASPIRE 把这套逻辑掀了——它让机器人像程序员改 bug 一样,边干边试错、边试错边把经验攒下来。负责具身智能的 Jim Fan 直接放话:这是训练范式的一次彻底改写。

    机器人持续学习与技能库概念图
    ASPIRE 让机器人把每次操作经验沉淀成可复用的技能库

    ASPIRE 全称是 Agentic Skill Programming through Iterative Robot Exploration,说白了就是物理世界里的机器人版 Coding Agent。背后调用的 GPT 或 Claude 不再直接输出机械动作,而是写出一段可调试、可复现的控制代码;机器人执行时,把感知图像、导航、抓取、碰撞报错、运动轨迹全程记下来。

    任务失败了,AI 就回放这段多模态轨迹,像研究员一样判断哪一步出了问题,改代码、再跑一遍;一旦跑通,就把这套解决办法提炼成标准化的 Skill,存进一个越攒越厚的技能库,下次遇到同类场景直接调用,不用从零再试。

    三个变化,把老路子整个翻了过来

    Jim Fan 把这次转变拆成三条,新旧对比很清楚。训练,从梯度下降变成了不断打磨技能;练出来的东西,不再是一份网络权重文件,而是一座持续扩容的感知运动技能库;至于分布式训练,则变成一群 Agent 各自练不同的技能,再把经验汇总进同一个库里。

    这么做的直接好处,是把机器人开发的数据门槛砍了下来。技能库里已经涵盖抓取、移动、操作这些常见任务的预训练模型,开发者拿来组合、微调就行,不再需要动辄百万级的训练数据从头练。

    对国内厂商是把双刃剑

    开源当然降低了研发门槛,谁都能站在英伟达的肩膀上往前走。但硬币的另一面是,一旦大家都用它的技能库、它的标准,机器人的核心能力就等于被英伟达定义了。这跟当年 CUDA 的路数如出一辙——先把地基铺好、免费给你用,等你离不开了,话语权也就攥在人家手里。

    值得留意的几点:

    • 训练目标从更新权重,变成不断打磨和复用单条技能
    • 技能支持跨机型迁移,能大幅省下仿真复现和重训的成本
    • 为人形、工业机器人的通用自主学习提供了一套开源底座

    从大模型卷参数,到智能体卷能不能真把活干成,再到现在机器人开始攒技能,AI 的竞争重心正一步步从静态的权重,挪向动态的、能持续成长的能力。ASPIRE 未必是终点,但它至少给出了一个方向:让机器人像人一样,把每次踩过的坑都变成下次的本事。

  • OpenAI 首颗自研芯片 Jalapeño 出炉,不再只靠英伟达

    OpenAI 首颗自研芯片 Jalapeño 出炉,不再只靠英伟达

    OpenAI 首颗自研推理芯片 Jalapeño
    OpenAI 与博通联合发布首颗自研推理芯片 Jalapeño(图源:TechCrunch)

    OpenAI 一直被看作做模型的,6 月 24 日这天它跨过了那条线——和博通联合发布了一颗叫 Jalapeño(墨西哥辣椒)的芯片,这是 OpenAI 第一颗自己定制的 AI 处理器。合作去年 10 月就官宣了,但真把芯片摆到台前,还是头一回。

    专门为跑模型而生

    Jalapeño 的定位很明确:它是推理芯片,不是训练芯片。说人话就是,它负责把已经训练好的模型跑起来、响应用户指令,而不是从零去炼模型。OpenAI 在公告里特别强调,它在跑实时 coding 模型(比如 Codex)时运营成本很低。像预训练这种更吃算力的重活,短期内还得靠英伟达的 GPU,但光是把推理这一块的成本往下压,对 OpenAI 的账本就已经意义不小。

    我们不只是做前沿模型、在模型上搭产品,我们连底下的基础设施都自己设计了——芯片架构、内存系统、网络、调度、部署,全在一层一层地把同一件事优化到极致。

    AI 参与设计了自己的硬件

    最让我觉得绕的一个细节是:OpenAI 自己的 AI 模型,参与了这颗芯片的设计过程。从架构设计到把版图数据交给晶圆厂(tape-out),整段只用了大约九个月。OpenAI 自己说,这可能是高性能半导体领域有史以来最快的 ASIC 开发周期。硬件负责人 Richard Ho 来头也不小,在谷歌待了快九年,是 Cloud TPU 项目的核心工程师。

    为什么非得自己造?说白了是想少依赖英伟达的 GPU。这条路上谷歌有 TPU、亚马逊有 Trainium,都是同一个思路——用专门加速机器学习的硅,把特定工作负载跑得更快更省。OpenAI 总裁 Greg Brockman 的话很直白:我们太懂这个工作负载了,就去找那些没被伺候好的环节,想办法加速它。

    全栈公司的必然一步

    把视角拉高一点看,造芯是 OpenAI 从模型公司往全栈基础设施公司走的自然一步。模型、产品、数据中心、再到芯片,每一层它都想攥在自己手里。据外界披露,微软还承诺包销了 Jalapeño 首期大约 40% 的产能。芯片计划先以工程样片在实验室跑通 GPT-5.3-Codex-Spark 这类模型,后续再放到吉瓦级别的数据中心里规模部署。

    • Jalapeño 是 OpenAI 首颗自研推理芯片,由博通代工实现、台积电 3nm 制造
    • AI 模型参与芯片设计,九个月走完从设计到流片
    • 目标不是取代英伟达,而是把最贵的推理成本压下来

    这不是要和英伟达掀桌子,而是 OpenAI 想把自己最贵、也最日常的那块成本,从别人手里拿回来一部分。当一家公司的模型每天被几亿人调用,每一分钱的推理开销乘上去都是天文数字——自己造芯,只是时间问题。