标签: AI

  • Google DeepMind掏了1000万美元,研究AI Agent互相勾兑会出什么乱子

    AI Agent今年是个热门词,各家都在推。但有没有人想过,当几百万个Agent同时在网上跑,还互相打交道,会发生什么?

    Google DeepMind想过。而且它想完了觉得这事值得花1000万美元来研究。

    多Agent系统风险概念图
    数百万AI Agent同时在线交互,风险也在成倍放大(图:AI生成)

    一个还没成形的研究领域

    Rohin Shah是Google DeepMind的AGI安全与对齐研究总监。他的担心是,Agent能自己完成任务,还能接受其他Agent的指令——这种”Agent之间互相打交道”的场景,会带来全新的一类风险。

    为了应对这个,Google DeepMind跟几个机构一起,凑了1000万美元的资金池,专门资助研究人员研究多Agent系统的行为,想办法防止不安全的场景。

    跟Google DeepMind一起出钱的,有施密特科学基金会(Eric Schmidt搞的那个)、英国政府的” moonshot agency”ARIA、非营利研究机构Cooperative AI Foundation,还有Google自己的慈善部门Google.org。

    “现在的问题是没有一个专门研究多Agent安全的领域。我们希望有这样一个领域。”——Rohin Shah,Google DeepMind

    风险在哪里?

    具体有什么风险?Shah和James Fox(施密特科学基金会”可信AI科学”项目的负责人)主要担心的,是现在网上已经有的坏事情被AI Agent”超级加倍”。

    诈骗、提示注入攻击(就是有人给AI Agent喂恶意指令,把它变成自动化的恶意软件)、其他形式的网络攻击——这些事现在人类已经在做了,Agent版的只会更快、更规模化。

    Fox说了一句话:”我们有一个对全社会运作至关重要的数字公共空间,你真的希望这东西不至于跌入彻底的混乱。”

    我问他俩有没有考虑过那种最极端的情况,比如AGI导致经济全面崩溃之类的。Shah说:”如果说的是今年年底之前,那肯定不会。” 才六个月啊!他笑了笑,说:”好吧,那之后的一段时间也不会。”

    模拟,还是模拟

    Shah和Fox都认为,要理解大量多Agent系统互相交互时会发生什么,唯一的办法是跑真实的模拟。把AI Agent扔进沙盒里,观察它们做什么。

    研究单个Agent,甚至研究小群Agent,是没法预测全局的。基于LLM的AI Agent不一定会理性行动,Fox说。真正的复杂度来自于海量交互同时发生。

    有些研究人员(包括Google DeepMind的一个团队)甚至论证过,AGI可能不是来自于单个超级聪明的模型,而是来自于一种Agent”蜂巢思维”——整个的能力大于部分之和。


    不是只有Google在担心

    就在几周前,Anthropic发布了基于”零信任”方法的AI Agent部署指南——这个方法最早来自网络安全领域,基本假设是计算机系统就是有漏洞的,Agent就是攻击者,入侵迟早会发生。

    特拉维夫的网络安全公司Akeyless的联合创始人兼CTO Refael Angel说,过去所有的安全方法都假设机器上跑的是人类写的软件,走的是固定的路径、做固定的事情。”Agent把所有这些假设都打破了。它会推理,它会即兴发挥,而且它可能因为被要求在文档里读一句话——就那一句话——而被劫持。”

    Angel欢迎这1000万美元的新资金。”不应该由某一家实验室来制定其他所有人都要信任的安全标准,”他说。但他也提醒,安全研究人员可能会只顾着研究那些花里胡哨的假想场景,而忽略了已经摆在眼前的、没那么酷的实际问题。

    Fox则说,几年前还只是假想的事情,现在已经很真实了:”未来来得比预想的快。”

  • 数据中心抢电太凶,有人想了个新办法:让它们跟着电网的节奏走

    AI热潮把数据中心的电费账单推到了前所未有的高度,但问题不止是钱。电网自己也开始叫苦了——这么多数据中心同时开工,电网吃不消。

    一场足球赛暴露的问题

    去年12月,英格兰和德国踢了一场足球赛。上半场0:0,数百万英国人集体松了口气,然后去做他们压力大的时候常做的事:烧水喝茶。

    这一波电水壶同时开机,电网的负荷瞬间飙升。但英国国家电网公司(National Grid)早有准备。AI程序在那时候给伦敦的一个数据中心发了指令,让它将部分耗电芯片降速。这一减,正好补上了需求缺口,避免了停电风险。

    数据中心电网灵活性概念图
    数据中心可以根据电网负荷调节用电,而不是一味猛吃电力(图:AI生成)

    对数据中心来说,这种操作是颠覆性的。它们平时可不管别人需不需要电,只管自己猛吃。但现在,有公司在试验一种”灵活用电”的模式。

    数据中心不再是电网的”电老虎”,而是可以成为调节电力供需的弹性资源。这对AI基础设施的可持续发展是个新思路。

    不建电厂,建软件

    现在的头部公司怎么做的?微软、甲骨文这些巨头,做法是自己建天然气发电厂,不靠公用电网。xAI在田纳西州孟菲斯的Colossus数据中心,为了赶进度,直接把燃气轮机拉到现场。结果现在被监管机构和当地居民追着投诉,因为污染排放超标。

    问题是,全世界的燃气轮机加起来都不够满足数据中心的需求。

    GridCare的CEO Amit Narayan说了一句话,我觉得挺有意思。他说:”如果你是一家航空公司,飞机利用率只有30%,你不会去买更多飞机。如果电网的利用率也是30%,那把它提升到60%没有什么科学上的理由不支持。”

    他的依据是斯坦福大学2025年的一项研究,发现北美西部输电线路的传输容量其实有很大冗余。电网的设计思路是”按最高需求建”,但一年里只有很少的时间会达到那个峰值。其余时间,电网的能力其实是闲置的。

    灵活性有三种玩法

    数据中心怎么做到”灵活用电”?目前有三种思路:

    • 自己配储能设备或备用发电机,电网忙的时候用自备电——当然,这得自己掏钱。
    • 通过虚拟电厂(VPP)来调节。电网让参与VPP的用户(可能是工厂,也可能是装了太阳能板的家庭)在这时候少用电,数据中心给他们付钱买这种”灵活性”。
    • 最简单粗暴的办法:高峰时段直接少用电。这听起来数据中心肯定不干,但Emerald AI的首席科学家Ayse Coskun说,现在运营商越来越愿意用一定的灵活性来换取更快的并网速度。”先跑起来”的诱惑,可能比想象的要大。

    AI来帮忙

    GridCare这家硅谷初创公司,做法是把电网的每一个部分——发电厂、输电线路、变电站、家庭用电——都喂进一个生成式AI模型,为不同的电网配置创建”数字孪生”。然后它把结果输入另一个基于电气元件物理规律训练的模型,确保方案是现实可行的。

    这套玩法如果真的跑通,数据中心的上线周期可以大幅缩短。不用等新建电厂,不用跟电网公司扯皮好几年,直接用现有电网的冗余容量,加上智能调度软件,数据中心就能开工。

    杜克大学2026年2月的一项研究发现,灵活性可以让电价降低0.5%到2.8%。数据中心用这种方式摊薄了固定成本,其他电力用户也能跟着沾光。

  • LangExtract:Google 出品的 LLM 结构化信息提取利器,精准溯源让 AI 抽取结果可验证

    LangExtract:Google 出品的 LLM 结构化信息提取利器,精准溯源让 AI 抽取结果可验证

    LangExtract Logo

    📌 项目简介

    LangExtract 是 Google 开源的 Python 库,基于大语言模型从非结构化文本中精准提取结构化信息,并映射到原文精确位置,让 LLM 的信息抽取结果可验证、可溯源。

    ⭐ 36.8K+ Stars
    📝 Apache 2.0
    🐍 Python
    🏢 Google 出品

    ⚙️ 安装要求与过程

    📦 环境要求

    • Python:3.10 及以上版本
    • 依赖:自动安装(pydantic, tenacity, tqdm 等)
    • API 密钥:使用 Gemini 需配置 LANGEXTRACT_API_KEY 环境变量
    • 本地模型:可选,需提前安装 Ollama

    🚀 快速安装(3种方式)

    方式一:PyPI 安装(推荐)

    pip install langextract

    方式二:虚拟环境安装(避免依赖冲突)

    python -m venv langextract_env
    # Linux/Mac:
    source langextract_env/bin/activate
    # Windows:
    langextract_env\Scriptsctivate
    pip install langextract

    方式三:Docker 部署

    docker build -t langextract .
    docker run –rm -e LANGEXTRACT_API_KEY=”你的API密钥” langextract

    🎯 核心功能

    🔍 1. 精准溯源 — 提取结果可验证

    所有提取结果都会映射到源文本中的精确字符位置,支持可视化高亮展示。你可以直观看到每个提取实体在原文中的具体出处,彻底解决 LLM 幻觉问题。

    📐 2. 稳定的结构化输出

    基于用户提供的少样本示例(Few-shot Examples)强制执行输出格式,在 Gemini 等支持约束生成的模型中可保证输出格式 100% 合规,无需繁琐的 Prompt 调试。

    📚 3. 长文档优化 — 解决”大海捞针”

    通过文本分块 + 并行处理 + 多轮抽取的组合策略,有效解决长文档中关键信息难以完整抽取的痛点,大幅提升召回率。支持直接从 URL 读取长文本。

    🖥️ 4. 交互式 HTML 可视化

    自动生成自包含的交互式 HTML 文件,可在浏览器中直观查看数千个提取实体在原文中的高亮上下文,支持点击跳转,让审核效率倍增。

    🌐 5. 多模型支持 — 云端 + 本地全覆盖

    原生支持 Gemini 系列(默认)、OpenAI 系列(需额外安装)、Ollama 本地模型(无需 API 密钥),并通过插件系统支持任意自定义模型后端,真正模型无关。


    💡 典型使用场景

    🏥 场景一:医疗文本结构化

    从自由书写的临床笔记、出院小结中精准提取药物名称、剂量、频次、诊断结果等结构化信息,并溯源到原文位置,辅助医疗信息化系统建设。(注:医疗场景需遵守 Google Health AI Developer Foundations 使用条款)

    📄 场景二:长文档知识抽取

    处理数千页的研究论文、法律合同、财报,自动提取关键实体、关系、事件,生成可交互的 HTML 报告。多轮抽取 + 并行处理让长文档召回率大幅提升。

    🔒 场景三:本地隐私数据提取

    通过 Ollama 接入本地开源模型(如 Gemma 2),在完全离线环境下对敏感文本(法律、金融、个人数据)进行结构化提取,数据不出本地,满足严苛的隐私合规要求。


    🌟 推荐理由

    为什么值得关注?

    作为 Google 官方开源项目,LangExtract 解决了 LLM 信息抽取领域最痛的两个问题:结果不可验证格式不稳定

    它的设计哲学非常务实:

    • 🎯 精准溯源让每次提取都可验证,这在医疗、法律等高风险场景中是刚需
    • 📐 少样本示例驱动,无需微调模型,换个领域只需改示例,极大降低适配成本
    • 🖥️ 交互式 HTML 可视化是杀手级功能,让非技术用户也能直观审核抽取结果
    • 🌐 模型无关设计,从 Gemini 到 Ollama 随意切换,不被任何厂商锁定

    相比同类工具(如原生 LLM API 直接抽取),LangExtract 在准确性、可解释性、工程化落地三个维度都有明显优势。如果你正在做 RAG、知识图谱构建、文档智能处理,LangExtract 应该成为你的标配工具。

    ⭐ 推荐指数:5/5


    📥 下载地址

    📌 许可证:Apache 2.0 | 开发语言:Python | 维护方:Google

  • 你跟ChatGPT聊的记录,现在可以用来定你的罪了

    2025年元旦,洛杉矶帕利塞德丘陵发生特大野火,造成惨重损失。检察官在起诉嫌疑人Jonathan Rinderknecht时,拿出了一份不同寻常的证据——他的ChatGPT对话记录。

    AI成了指控你的证人

    检察官的主张是:Rinderknecht在ChatGPT上问过帕利塞德地区的风速情况,还问过某些化学品的助燃特性。这些查询记录,在检察官眼里,就是”有计划地准备制造最大破坏”的证据。

    OpenAI配合了搜查令,把这位用户的完整对话记录交给了当局。这件事本身就让很多人后背发凉——你跟AI聊的所有内容,理论上都可以被调出来当证据。

    ChatGPT日志成为法庭证据概念图
    ChatGPT对话记录成为法庭证据,AI隐私进入法律灰色地带(图:AI生成概念图)

    跟Google搜索不是一回事

    用Google搜东西,你拿到的是链接。但跟大语言模型对话是另一回事——你会把场景摆出来,追问细节,通过来回问答”搭建”一个想法。检察官在帕利塞德案里用的就是这些对话的结构,试图让法庭相信Rinderknecht对自己的行为后果有充分的认知。

    “我们不再只是搜索信息,而是和一个永远不忘记、永远配合传票的实体大声思考。”——帕利塞德案法律分析师

    第三方法则来了

    这个案子最终以误审告终——陪审员没能就ChatGPT查询记录是否足以证明犯罪事实达成一致。但法庭采纳这份证据的依据,是一个有争议的法律原则:”第三方法则”。

    根据这个法则,公民对自愿分享给第三方的资讯(比如银行、科技公司)”没有合理的隐私期待”。到了AI时代,这意味着你在聊天框里敲下的每一个念头,都属于那家公司,进而可以被当局获取。

    法律分析师警告,这会造成”寒蝉效应”:人们可能因为担心自己的数字足迹在将来的法庭上被用来对付自己,而不敢探索某些想法或提出问题。


    Rinderknecht的案子只是开始。随着AI融入生活的每个角落,这套技术的法律监管还远远落后于现实。当局能不能用你的AI对话记录来定你的罪——这个问题的答案,可能比你想象的更近。

  • 美光被华尔街当成下一个英伟达:一个月股价涨236%,AI内存短缺让它飞起来了

    美光科技的股票在过去一个月里涨了236%,收盘价1132美元。这家总部位于爱达荷州博伊西的内存芯片制造商,市值一度在周四短暂超过了Meta和特斯拉,虽然周五又跌回去了,但也差不多和它们持平了。

    从存储卡厂商到AI豪赌赢家

    大多数普通消费者提到美光,想到的还是那种给电脑、手机扩容用的小内存卡。但这家公司现在赚的钱,跟那个产品线已经没太大关系了。

    AI数据中心的扩建潮造成内存芯片严重短缺,无论是系统内存DRAM还是闪存NAND,美光都生产,尤其是高带宽内存(HBM),一块AI服务器需要的内存量是笔记本电脑的好几个数量级。英伟达这样的AI系统制造商,还有微软、亚马逊AWS、谷歌、Meta、甲骨文这些超大规模云厂商,都在疯狂采购内存。

    Micron AI内存芯片与股市上涨概念图
    美光科技搭乘AI内存热潮,股价一路飙升(图:AI生成概念图)

    财报数字确实吓人

    上周美光发布的第三财季财报,用”爆炸”来形容都不为过:营收414.5亿美元,是去年同期的4倍;利润从18.8亿美元直接跳到282亿美元。第四财季的营收指引更是给到490亿到510亿美元之间。

    华尔街一直在找下一家能像英伟达那样长期赚钱的AI概念公司,美光看起来符合这个想象。

    美光当前的市值约1.27万亿美元,Meta是1.39万亿,特斯拉是1.42万亿。几个月前,美光的的股价还在100美元以下徘徊了好几年。

    长期协议能不能扛过周期?

    内存芯片行业有个老问题:扩建生产线又慢又贵,等产能上来,需求往往已经掉了,然后就是供过于求、价格暴跌。美光这次能不能不一样?

    美光自己在财报电话会上强调,已经签了一堆长期供应协议,包括和英伟达以及AI实验室Anthropic的协议。公司说在数据中枢、消费和汽车市场段签了16个战略客户协议,这会”从根本上改变商业模式”。

    William Blair的分析师Sebastien Naji在一份研究报告中写道,需求增长继续超过新洁净室空间的上线速度,”考虑到未来几个季度ASP(平均售价)持续上涨的可能性很大,加上与关键客户的长期协议(SCA)迅速增加带来了更好的营收能见度,我们认为盈利增长有潜力变得更持久。”


    内存短缺的局面(有人叫它”RAMageddon”)预计会持续到2027年,已经在推高苹果产品和Xbox主机等消费电子的价格。美光能不能真正成为”下一个英伟达”,还是会在下一轮内存周期里被打回原形,接下来几个季度见分晓。

  • 一家初创公司声称突破了制约LLM的瓶颈,AI效率竞赛迎来新变量

    一家初创公司声称突破了制约LLM的瓶颈,AI效率竞赛迎来新变量

    大语言模型有个绕不开的数学瓶颈——”二次方爆炸”。处理的文本越长,计算量不是线性增长,而是平方级暴涨。这个瓶颈卡了业界快十年,但现在有家迈阿密的小公司说他们解决了。

    AI模型架构突破
    Subquadratic稀疏注意力机制示意图(AI生成图)

    Subquadratic公司5月从隐身模式走出来,发布了模型SubQ。他们声称用”稀疏注意力”替代了传统Transformer的”密集注意力”,把计算复杂度从二次方降到了——你猜对了——亚二次方。

    “我们希望开启一个效率新时代。几年后,没人会用Transformer搭建模型了。”

    ——Justin Dangel,Subquadratic联合创始人兼CEO

    二次方瓶颈到底卡在哪

    今天所有主流大模型都基于Transformer架构,核心是”密集注意力”机制。处理一段文本时,模型把每个词(token)编码成数字,然后让每个数字和所有其他数字相乘——用来捕捉词与词之间的关系。

    1万个词的文本,要算近5000万次乘法。文本长度翻倍,计算量翻四倍。这就是为什么长文档处理这么烧钱,也是为什么各家公司在拼命堆GPU。

    Subquadratic的思路很简单:不是所有词之间的关系都重要。稀疏注意力只挑重要的词做运算,跳过不相关的。问题难在——怎么判断哪些重要?以前的办法都用固定模式(比如”第1个词总是和第5个词比较”),效果不好。

    SubQ的”秘密酱料”是动态选择——对每段输入的文本,实时判断哪些词之间的关系值得计算。联合创始人Alex Whedon不肯透露具体怎么实现的,只说”这是我们的核心秘密”。

    质疑声:AI界的Theranos?

    第一次发布时,Subquadratic只给了几个自测跑分,没有第三方验证。AI工程师Dan McAteer在X上发文:”SubQ要么是Transformer之后最大突破,要么就是AI界的Theranos。”

    一个月后,Subquadratic找了第三方评测机构Appen来跑分。结果有些惊人:在LiveCodeBench编程测试上,SubQ得分89.7%,和顶级模型在同一个水平线。处理长文本时,SubQ的上下文窗口可达1200万token(主流模型一般是100万)。

    成本数据更夸张。跑同样的测试(从大文档里检索信息),Anthropic的Opus 4.6花了2600美元;SubQ花了8美元。

    但质疑没有完全消散。SubQ的底层权重是用中国开源模型Qwen”启动”的(在Qwen基础上微调),而不是从零训练的。这让一些研究者怀疑:这到底是一个全新架构,还是Qwen的一个高效变种?


    SubQ目前还没开放公测,等候名单上有几万人。在更多人真正用上之前,判断它是突破还是泡沫,还为时过早。但有一点是确定的:效率竞赛已经打响,谁能把大模型的计算成本打下来,谁就掌握了下一个回合的主动权。

  • 为什么韩国人如此热爱AI?从养老机器人到AI算命,这个国家正在全速押注

    为什么韩国人如此热爱AI?从养老机器人到AI算命,这个国家正在全速押注

    从仁川机场落地的那一刻起,你就感觉到韩国和硅谷的AI叙事完全不同。我在旧金山飞了12小时落地首尔,入境用了无人安检通道,机器扫了一下我的脸和护照,几秒钟就过了。坐地铁进市区,全程5G信号满格,连地下都是。车厢里每个人都低头盯着手机——不是在刷短视频,就是在和AI聊天。

    韩国AI应用
    首尔街头的AI服务机器人(示意图)

    首尔江南区公交站配有互动触摸屏,实时显示车次信息。区政府6月刚宣布要升级成”AI公交站”,配备多语言问答服务。走在街上,轮式机器人等在十字路口,给路人送外卖。互联网咖啡馆里坐满了青少年在打游戏——他们中的很多人梦想成为下一个职业选手。

    “韩国人对AI的热爱不是自发产生的,而是政府几十年来持续灌输的结果。从钢铁到半导体,从宽带到智能手机,每一轮技术革命韩国都押对了注,AI只是最新的一轮。”

    只有16%的韩国人担心AI

    皮尤研究中心2025年调查了25个国家,问”你对AI更多感到兴奋还是担忧”。结果:韩国只有16%的人说”更担忧”——25个国家里最低。美国呢?50%的人更担忧。

    韩国文化体育观光部和商工会议所的调查显示,超过一半的韩国人每天使用AI,要么是当个人助手,要么用来干活。这个渗透率在全球范围内都是顶级的。

    韩国人从小被教育:技术是国家现代化的唯一出路。朝鲜战争结束后,韩国从废墟里爬出来,靠的就是钢铁、造船、半导体、宽带、智能手机——每一波都押对了。现在到了AI这一轮,没人想掉队。

    政府全力押注

    李在明总统2025年上任后,誓言要把韩国带进”全球AI三强”,和美国、中国并列。他成立了总统AI战略委员会,砸钱买算力,还搞了一个”主权AI基础模型”项目,资助韩国公司开发自己的大模型。

    2024年韩国通过了《AI基本法》,是全球最早的综合AI立法之一。重点是促发展,监管很轻。斯坦福2026年AI指数报告显示,70%的韩国人认为通过AI推动科学和医疗进步比用监管保护行业更重要。

    三星和SK海力士两家公司撑起了韩国股市KOSPI指数——2026年两家公司市值都突破了1万亿美元,带动指数创历史新高。全球AI训练用高端内存芯片,大半是这两家造的。

    机器人 monk 和 AI 课本

    韩国人愿意尝鲜,政府也愿意在公共场景里部署AI。福祉中心里有了AI养老机器人,学校里开始试点AI课本(虽然因为错误太多被家长骂了一顿)。

    最出圈的是”机器人僧侣”——一家寺庙部署了人形机器人辅助宗教活动,外国媒体跑去拍了一大堆照片。K-pop领域也有AI虚拟偶像,和真人偶像抢饭吃。

    首尔中央市场晚上去吃炒年糕,我表妹掏出手机给ChatGPT输她的生辰八字,让它算命。她说问工作和感情是她每天最喜欢干的事。韩国Gallup的调查说,46%的20多岁韩国人用过聊天机器人算命。

    她还用ChatGPT问炒股建议,把工资全投进去了。她一边说ChatGPT是她的算命先生和财务顾问,一边又担心自己会被AI抢走工作。现代汽车宣布要部署Atlas人形机器人进工厂的时候,工会直接炸了。


    韩国人对待AI的态度,就像是整个国家在做一场豪赌——赌技术能把他们从内卷和衰退的焦虑里拉出来。AI能不能兑现这个期待,几年之内就能看到答案。

  • 英伟达开源MoE微调加速工具,一行import让微调提速3.7倍

    英伟达开源MoE微调加速工具,一行import让微调提速3.7倍

    MoE(混合专家)架构已经成为当前大模型的主流选择。从DeepSeek-V3到Qwen3,再到Google的Gemini,几乎所有最新发布的顶尖模型都在用MoE。但MoE有个麻烦——训练起来比普通Transformer麻烦得多,专家并行、通信融合、kernel优化,这些工程细节没有一个省心的。

    英伟达6月底开源了一个工具,试图让这件事变得简单。叫NeMo AutoModel,基本思路是:站在HuggingFace Transformers v5的肩膀上,不改你原来的代码API,只加一行import,就能把MoE模型的微调速度提升3.7倍,同时把GPU显存占用降低近三分之一。

    英伟达MoE微调加速工具概念图
    英伟达NeMo AutoModel通过一行import实现MoE模型微调加速

    3.7倍加速是怎么来的

    具体数字挺直观的。在单节点8张H100 80GB GPU上,用Qwen3-30B-A3B做微调,原来的Transformers v5每秒每GPU能处理3075个token,换成NeMo AutoModel之后直接拉到11340,提升3.69倍。显存这边,峰值占用从68.2GiB降到48.1GiB,省了29%。

    英伟达 team还测了Nemotron 3 Nano 30B-A3B,结果类似:吞吐提升3.4-3.7倍,显存降低32%。他们甚至拿550B参数的Nemotron 3 Ultra做了全参数微调测试——16个H100节点、128张GPU——这时候Transformers v5已经直接爆显存了,连对比的机会都没有。

    显存省下来的部分不是白给的——你可以拿它去跑更大的batch size,或者处理更长的序列。对于本来就卡显存的大模型训练来说,这两个操作直接决定了你能不能把模型训出来。

    核心技术:三板斧

    NeMo AutoModel在Transformers v5的基础上加了三样东西:专家并行(EP)、DeepEP、TransformerEngine。每一样都针对MoE训练的一个具体瓶颈。

    专家并行解决的是显存问题。MoE模型虽然每次推理只激活部分专家,但训练的时候,所有专家的参数都得放在GPU显存里。专家并行把这些参数分散到多张GPU上,8张GPU就每张只持1/8的专家参数。Qwen3测下来,这项技术能把MoE层的显存占用直接从68.2GiB压到48.1GiB。

    DeepEP解决的是通信开销。MoE训练的时候,每个token得先被路由到对应的专家,这个过程需要跨GPU通信。传统做法是”先分发、再计算”,DeepEP把它融合成了一个优化的GPU内核,”分发”和”计算”在时间上重叠了起来,通信的时间就被藏掉了。

    TransformerEngine提供的是基础运算加速。注意力机制、线性层、RMSNorm这些,都有专门的融合kernel实现。不只加速MoE层,普通Transformer层也能占到好处。

    一行import怎么做到

    用法确实简单。如果你原来就在用Transformers v5,切换到NeMo AutoModel只需要在文件开头加一行:

    • from transformers import AutoModelForCausalLM改成from nemo_automodel import AutoModelForCausalLM
    • 原来的训练代码几乎不用动
    • API完全兼容HuggingFace的接口约定

    这个设计思路很聪明。它不搞”全新框架”,而是在现有生态上做增强。这样用户的迁移成本几乎为零,英伟达那边也能持续从HuggingFace的生态里受益——相当于”我帮你提速,你继续用HuggingFace的接口”。


    为什么这件事值得关注

    MoE架构的普及速度比很多人预期的快。2026年上半年,几乎所有主流大模型发布都用了MoE或者类MoE的稀疏激活架构。原因很简单:在相同参数规模下,MoE的推理成本远低于稠密模型,但训练成本却高得多——因为所有专家的参数都得加载进显存,通信开销也大。

    英伟达这笔账算得很清楚:如果MoE是未来,那么控制MoE训练的工具链,就等于在AI训练基础设施里多插了一脚。HuggingFace占据了模型使用的入口,英伟达则通过NeMo AutoModel占据了”高性能训练”的入口——而且是以兼容HuggingFace的方式,用户几乎没有理由拒绝。

    代码、配置文件和基准测试脚本都已经放在GitHub上了(github.com/NVIDIA-NeMo/AutoModel),文档也在docs.nvidia.com上线了。感兴趣的人现在就能去试试,看看那3.7倍加速在自己的模型上能不能复现。

  • 领英创始人炮轰xAI是「彻底失败」,还说Cursor的巅峰已经过去了

    领英创始人炮轰xAI是「彻底失败」,还说Cursor的巅峰已经过去了

    LinkedIn联合创始人、Anthropic投资人Reid Hoffman最近在Fortune访谈里说了一些很直接的话。他对xAI的评价是”彻底失败”(complete train wreck),对Cursor的说法是”几个月前还星光熠熠,现在正在地平线上褪色”。这些话出自一个AI行业内部人之口,而且Hoffman本身不是旁观者——Anthropic是他的投资组合公司,所以他的话有立场,这点得先说清楚。

    xAI的11位联合创始人全走了

    xAI的问题不是一天两天了。到2026年5月,最初的那批11位联合创始人已经全部离开。这事儿从2026年2月开始加速,当时被认为是最核心运营负责人的Tony Wu宣布辞职,之后其他人陆续走人。

    Hoffman在访谈里没给xAI留任何面子。他说SpaceX收购Cursor这笔交易,恰恰证明了”这里缺的是AI能力,不是什么收购整合能力”。他的逻辑是:如果SpaceX真的是一家AI公司,它就不该用收购的方式来补AI的课。

    Reid Hoffman评论xAI与Cursor
    LinkedIn联合创始人Reid Hoffman(右)对xAI和Cursor的最新评价引发讨论

    xAI的故事从一开始就是马斯克个人意志的延伸。2023年7月官宣成立,2024年12月Grok-3发布,中间换过好几次技术方向。但真正的问题可能是:一个完全围绕单个人运转的AI实验室,到底能不能留住顶尖人才?11个人全走了,这个答案已经写在墙上了。

    Cursor被收购的时机有点巧

    Cursor的处境更有意思。这款AI编程工具在2025年到2026年初风头正劲,是很多开发者日常使用的工具。但Hoffman的说法是,它的巅峰可能已经过去了——”几个月前还星光熠熠,现在正在地平线上褪色”。

    背景是SpaceX在2026年6月16日以全股票方式、600亿美元估值收购了Cursor的母公司Anysphere。这笔交易宣布的时候,SpaceX的股价还在高位。但紧接着,SpaceX股价在一个交易日内跌了16%。这意味着Cursor股东拿到的股票价值已经大幅缩水,而且由于是全股票交易,这个缩水是实打实的。

    Hoffman对这笔收购的解读是:这更像是”IAC模式”——通过连续收购来聚合能力,而不是靠内生增长。他说SpaceX”不是一家AI公司”,xAI则是”彻底失败”。

    Cursor面临的竞争压力是真实的。2026年以来,Claude Code和OpenAI的Codex都在快速蚕食AI编程工具的市场份额。Claude Code尤其强势,很多原来用Cursor的开发者开始切换到Claude Code,原因是Claude的代码生成质量更稳定,而且直接整合在Claude对话框里,不用切换工具。

    Hoffman的AI竞争格局判断

    Hoffman在访谈里也给出了他对当前AI竞争格局的判断。他认为Anthropic在代码领域很强,而且正在往设计和法律方向扩展。ChatGPT的角色更像是消费者搜索的前端入口,而Codex的能力”被谈论得不够多,考虑到它实际上有多强”。

    这些判断有参考价值,但得带着Hoffman的身份一起看。他是Anthropic的投资人,所以强调Anthropic的优势是意料之中的。他贬低xAI和Cursor,某种程度上也是在为Anthropic的市场地位造势。

    但抛开立场不谈,他说的一些现象是客观存在的。xAI的人才流失速度确实异常,11个联合创始人在不到三年时间里全部离开,这在AI行业里是极少见的。Cursor确实面临着Claude Code和Codex的激烈竞争,而且Spotify和Universal Music的AI音乐授权协议(允许粉丝用AI翻唱)也改变了创作者工具的市场预期——这一切都让Cursor的”AI编程工具第一选择”地位不再稳固。


    这件事更大的意义可能是:AI行业的”护城河”到底在哪里?是模型能力,是产品体验,还是用户习惯?Cursor在产品和用户习惯上曾经领先,但现在看来,模型能力的追赶速度比很多人预期的要快。Claude Code背靠Anthropic的顶尖模型,这种组合的长期竞争力可能被低估了。

  • TimesFM:Google Research 开源时间序列基础预测模型,25.9K Stars 让时序预测变得简单

    TimesFM:Google Research 开源时间序列基础预测模型,25.9K Stars 让时序预测变得简单

    TimesFM:Google Research 开源时间序列基础预测模型,25.9K Stars 让时序预测变得简单

    Google Research Logo
    Google Research 官方博客

    项目简介

    TimesFM(Time Series Foundation Model)是由 Google Research 开发的预训练时间序列基础模型,专门用于时间序列预测任务。不同于传统需要针对每个数据集单独训练的预测模型,TimesFM 作为一个基础模型,经过大规模预训练后可以直接对未见过的时序数据进行零样本(Zero-shot)预测,就像大语言模型(LLM)处理文本一样革命性地简化了时序预测流程。

    该项目已在 Google 多款产品中落地:BigQuery ML(企业级 SQL 时序预测)、Google Sheets(表格预测功能)、Vertex AI Model Garden(Docker 化部署端点),是学术界与工业界共同认可的时序预测新范式。

    安装要求和过程

    环境要求

    • Python:3.9 及以上版本
    • 后端选择:PyTorch 或 Flax/JAX(二选一)
    • 硬件支持:CPU、GPU、TPU、Apple Silicon(M系列芯片)全平台兼容
    • 磁盘空间:模型约 200M 参数,下载后约 800MB

    快速安装步骤

    # 方式一:通过 PyPI 安装(推荐)
    # 安装 PyTorch 版本
    pip install timesfm[torch]
    
    # 安装 Flax 版本(推理速度更快)
    pip install timesfm[flax]
    
    # 需要协变量支持时(引入额外特征辅助预测)
    pip install timesfm[xreg]
    
    # 方式二:本地源码安装
    git clone https://github.com/google-research/timesfm.git
    cd timesfm
    pip install -e .[torch]  # 或 [flax] / [xreg]

    核心功能

    • ⚡ 长上下文时序预测:TimesFM 2.5 支持最长 16K 的时序上下文输入(2.0 版本仅 2048),可输出最长 1K 的预测 Horizon,适配绝大多数工业场景。
    • 📊 概率预测输出:除点预测外,还支持通过可选的 30M 分位数头输出 10%-90% 共 10 个分位数的连续概率预测,让预测结果包含不确定性信息,对风险敏感场景(金融、供应链)尤为重要。
    • 🔀 多后端支持:同时支持 PyTorch 和 Flax 两大深度学习框架后端,用户可按硬件环境自由选择;Flax 版本在 TPU 上推理速度显著提升。
    • 📈 协变量支持(XReg):通过 XReg 模块可引入额外协变量特征(如节假日标记、促销信息等),有效提升复杂业务场景的预测精度,是 2.5 版本重新引入的重要特性。
    • 🎯 灵活预测配置:支持输入归一化、翻转不变性、正数推断、分位数交叉修正等多种预测配置,用户可根据数据特性精细化调整,获得更可靠的预测结果。

    典型使用场景

    • 📦 企业需求预测:零售企业可利用 TimesFM 对商品销量进行多步预测,输入历史销售数据(支持 16K 长度),输出未来 1K 个时间点的销量预测及置信区间,辅助库存决策和供应链优化。相比传统 ARIMA/Prophet 方法,TimesFM 无需手动特征工程,且对新型商品的冷启动预测表现优异。
    • 📊 业务指标异常预警:运维团队可将服务器 CPU 使用率、API 响应延迟、用户活跃度等关键指标输入 TimesFM,预测未来趋势并提前发现异常苗头。结合分位数预测输出的不确定性区间,可以在指标偏离正常范围之前发出预警,实现从”被动响应”到”主动预防”的转变。
    • 💹 金融时间序列分析:量化分析师可使用 TimesFM 对股票价格、汇率、期货价格等金融时间序列进行建模预测。TimesFM 的零样本预测能力使其可以快速适配不同金融产品,而概率预测输出则为风险评估提供了量化依据。Google Research 在预训练数据中包含了 Wikimedia Pageviews 和 Google Trends 数据,使模型对网络流行趋势类时序具有更好的理解。

    推荐理由

    作为 Google Research 的官方开源项目,TimesFM 代表了时间序列预测从”传统统计方法”向”基础模型范式”的重大转变。我推荐它的理由有以下几点:

    首先,真正的零样本预测能力。传统预测方法(ARIMA、ETS、Prophet)需要针对每个时间序列单独拟合模型,数据量不足时效果很差。TimesFM 在包含千亿级时序数据点的预训练语料上训练,习得了时序数据的通用模式,面对全新数据集时无需微调即可预测,大大降低了使用门槛。

    其次,工业级可用性。TimesFM 已在 Google 自家的 BigQuery ML 和 Google Sheets 中作为生产功能提供服务,经过大规模真实场景验证。2.5 版本将参数量从 500M 压缩到 200M,在保持预测精度的同时大幅提升了推理效率,体现了 Google Research 对实用性的高度重视。

    最后,与 LLM 生态的完美类比。TimesFM 之于时间序列,犹如 GPT/BERT 之于自然语言。对于已经熟悉 LLM 应用的开发者,TimesFM 提供了一条将”基础模型革命”延伸到数值预测任务的清晰路径。随着 AI Agent 对工具调用和外部数据感知的需求日益增长,像 TimesFM 这样的专业基础模型将成为 Agent 工具链的重要一环。

    下载地址

    许可证:Apache-2.0(可自由用于商业和个人项目)