标签: AI开源

  • Meta正式下线Llama API,14个月匆匆收场

    7月6日,Meta悄无声息地把Llama API拔了网线。这个2025年5月才上线的服务,前后只活了14个月,连一岁都不到。

    说关就关,开发者怎么办

    Llama API下线后,所有API请求会收到停用提示,同时附上一个迁移指引链接。Meta的官方建议是:转向支持Llama模型的第三方服务平台。当然,Llama模型本身不受影响,想继续用的开发者可以自己去下载模型文件,本地部署或者离线使用。

    至于Meta说的”正在筹备新的开发者支持方案,未来将推出基于Meta AI模型的全新开发工具链”——这话听着耳熟,但具体细节和上线时间一概没说。开发者现在能做的,要么是赶紧迁移,要么是继续等。

    Meta Llama API下线与Muse Spark战略转向
    Meta战略转向:从开放API到闭源Muse Spark

    背后的战略大转向

    这件事之所以值得说,是因为它折射出Meta在AI路线上的一次重要调整。Llama API当初上线,是Meta想亲自下场卖API、跟OpenAI和谷歌抢开发者市场。但14个月下来,这条路显然没走通。

    Meta正在从”亲自下场卖API”向”退居幕后建云、走开源闭源双轨制”转变。Llama API的退出,可能是为集中精力打造更具竞争力的开发者生态铺路。

    同步推出的Muse Spark是Meta超级智能实验室(MSL)成立9个月来的首款核心产品,而且是一款闭源模型。这就很有意思了——Meta一边继续开源Llama,一边推闭源的Muse Spark,形成了”开源Llama+闭源Muse”的双轨制。这个打法,跟谷歌的Gemini(闭源)+ 开源Gemma,以及Anthropic只做闭源Claude,都不太一样。

    为什么是现在

    时机也值得玩味。Llama 4的表现不及预期,而行业竞争已经从”谁的模型强”转向”谁能把AI真正用起来”。Meta选择在这个时候把API服务关掉,把精力集中到模型本身和闭源的Muse Spark上,倒也不难理解。

    对开发者来说,如果你之前依赖Llama API,现在是该认真考虑迁移方案了。第三方平台里,Groq、Together AI、Replicate都支持Llama模型部署,短期内不至于没地方去。但长期来看,Meta的重心显然已经不在”提供API服务”这件事上了。


  • Mistral AI到底是家什么公司?看完这篇你就明白了

    当特朗普下令让Anthropic把最新模型下线,欧洲喊”主权技术”喊得越来越响,一家法国AI公司突然站到了聚光灯下。它就是Mistral AI——经常被叫做”欧洲版OpenAI”,但这个标签其实挺误导的。

    Mistral AI概念图
    Mistral AI:欧洲主权AI的代表力量

    如果你拿”欧洲版OpenAI”的标准去套Mistral,肯定会失望。它的聊天产品Vibe(前身叫Le Chat)品牌认知度远远比不上ChatGPT;就算在巴黎的Station F创业园区里,Claude也比Mistral的模型更受欢迎。

    它在走的其实是Palantir路线

    外界经常忽略一个关键点:这家法国十角兽公司实际上在走一条完全不同的路——它派前端工程师去帮政府和大企业把AI用起来,针对具体用例做定制部署。这个策略也更符合Mistral实际的资源条件。

    营收数据可以说明问题。公司正在融大概35亿美元,估值约231.5亿美元(接近当前估值的两倍)。但相比美国那些前沿AI实验室,这个数字还是低不少。不过增长曲线很猛:2026年2月披露的年度经常性收入(ARR)已经超过4亿美元,而一年前才2000万美元。公司说自己有望今年突破10亿美元ARR。

    Mistral CEO Arthur Mensch说过一句话:”我们的存在是为了确保每个人都能获得最佳AI系统,摆脱国家或企业以集中控制方式部署AI的局面。”

    创始人阵容:DeepMind和Meta老将

    三位创始人都在美国科技巨头巴黎办公室搞过AI研究:CEO Arthur Mensch来自Google DeepMind,CTO Timothée Lacroix和首席科学家Guillaume Lample都来自Meta。这个背景某种程度上解释了为什么他们的策略跟OpenAI截然不同——他们更懂欧洲的监管环境和政府采购逻辑。

    融资历程也挺夸张的。2023年6月才拿种子轮1.13亿美元,估值2.6亿;到2025年9月C轮已经估值138亿美元,融了约20亿美元。总融资额大概40亿美元,而且大部分是债务融资。

    模型、芯片和”主权”野心

    Mistral的模型阵容挺全的:有大语言模型Mistral Small 4,有针对手机等边缘设备优化的”Les Ministraux”系列,部分模型是开放权重的。代码智能体Leanstral也已经开源。

    Mensch承认目前还没有最好的语言模型,但差距在不断缩小。2026年夏天会推出”非常令人兴奋的模型”,是开放权重的,7月开放早期访问。在语音、视觉和文档处理这些对算力要求相对低的领域,Mensch说他们已经有最先进的解决方案了。

    芯片策略方面,Mensch在今年5月接受CNBC采访时说不排除自研芯片的可能性,但目前还是依靠NVIDIA。2026年初收购基础设施初创公司Koyeb,加上宣布在法国和瑞典建设数据中心的45.6亿美元投资战略,”主权”这个色彩贯穿了Mistral的几乎所有动作。


    退出路径方面,Mensch在今年1月达沃斯论坛上明确说了Mistral”不出售”,IPO是计划。考虑到已经融了这么大规模,即便卖给传闻中的潜在买家(比如Apple)也很难提供足够的回报倍数,更何况还有主权问题要考量。

  • ai-hedge-fund:让19位投资大师的AI Agent帮你分析股票,45K+Stars开源AI对冲基金模拟

    ai-hedge-fund:让19位投资大师的AI Agent帮你分析股票,45K+Stars开源AI对冲基金模拟

    🤖 ai-hedge-fund:让 19 位投资大师的 AI Agent 帮你分析股票

    开源 AI 对冲基金团队模拟,用多智能体协作探索量化投资
    MIT 开源
    45K+ Stars
    Python
    多智能体

    📌 项目简介

    ai-hedge-fund 是一个 AI 驱动的对冲基金概念验证项目,由 Virat Singh(virattt)开发。

    项目的核心创意令人拍案:把华尔街最顶尖的 13 位投资大师「人格」训练成 AI Agent,再配上 6 个专业分析 Agent,共同组成一个虚拟对冲基金团队,对指定股票进行多维度分析和决策模拟。

    ⚠️ 重要声明:本项目仅用于教育和研究目的,不应用于实际交易或投资,也不提供任何投资建议。

    🖼️ 项目架构示意图

    ai-hedge-fund Logo

    ai-hedge-fund 项目 Logo(如无法显示请访问 GitHub 仓库)

    ⚙️ 安装要求和过程

    环境要求

    • Python 3.10+
    • Poetry(依赖管理工具)
    • 至少一个 LLM 的 API 密钥(OpenAI / Groq / Anthropic / DeepSeek 等)
    • 金融数据 API 密钥(FINANCIAL_DATASETS_API_KEY)

    快速安装步骤

    1. 克隆仓库

    git clone https://github.com/virattt/ai-hedge-fund.git
    cd ai-hedge-fund

    2. 安装 Poetry(如未安装)

    curl -sSL https://install.python-poetry.org | python3 -

    3. 配置 API 密钥

    cp .env.example .env
    # 编辑 .env 文件,填入你的 API 密钥

    .env 中至少配置一个 LLM 提供商密钥:

    # 选择以下至少一个
    OPENAI_API_KEY=your_key_here
    GROQ_API_KEY=your_key_here
    ANTHROPIC_API_KEY=your_key_here
    DEEPSEEK_API_KEY=your_key_here
    
    # 金融数据 API 密钥(必需)
    FINANCIAL_DATASETS_API_KEY=your_key_here

    4. 安装依赖

    poetry install

    5. 运行

    # CLI 模式 - 分析 AAPL, MSFT, NVDA
    poetry run python src/main.py --ticker AAPL,MSFT,NVDA
    
    # Web 界面模式
    cd app && poetry run chainlit run app.py
    💡 国内用户提示:可以使用 DeepSeek API 替代 OpenAI,成本更低。只需在 .env 中配置 DEEPSEEK_API_KEY 并修改模型配置即可。

    🌟 核心功能

    1. 13 位投资大师 AI Agent

    Warren Buffett
    奥马哈先知 · 价值投资
    Charlie Munger
    只买价格合理的优质企业
    Cathie Wood
    成长投资女王 · 颠覆性创新
    Michael Burry
    大空头 · 逆向深度价值
    Ben Graham
    价值投资之父 · 安全边际
    Peter Lynch
    十倍股猎手 · 日常业务投资
    Stanley Druckenmiller
    宏观传奇 · 非对称机会
    Nassim Taleb
    黑天鹅 · 反脆弱性
    Bill Ackman
    激进投资 · 推动变革
    Phil Fisher
    深度闲聊法调研
    Mohnish Pabrai
    Dhandho · 低风险高回报
    Aswath Damodaran
    估值权威 · 叙事与数据

    2. 6 个专业分析 Agent

    • Valuation Agent:计算股票内在价值,生成买卖信号
    • Sentiment Agent:分析市场情绪(新闻、社交媒{“”}体)
    • Fundamentals Agent:分析财务数据(P/E、P/B、ROE 等)
    • Technicals Agent:分析技术指标(MA、RSI、MACD 等)
    • Risk Manager:计算风险指标,设置仓位限制
    • Portfolio Manager:综合所有意见,做出最终交易决策

    3. 双运行模式

    • CLI 模式:适合自动化脚本和批量分析
    • Web UI:基于 Chainlit 的可视化界面,交互更友好
    • 回测模式:支持对历史数据进行策略回测
    • Ollama 支持:可使用本地 LLM,无需云端 API

    4. 可扩展架构

    • 项目正在重构为「持久化、全天候运行的 AI 对冲基金」
    • 投资者 Agent 将重构为可插拔、可回测的「Alpha 模型」
    • 支持自定义 Agent,添加你自己的投资哲学
    • 完整的愿景文档和路线图(VISION.md / ROADMAP.md)

    📱 典型使用场景

    场景一:学习投资大师的决策逻辑

    运行 poetry run python src/main.py --ticker AAPL,系统会让 13 位投资大师 Agent 分别分析苹果公司,每位大师会从自己的投资哲学出发给出建议。通过对比不同大师的意见,你可以学习到:

    • 价值投资者(Buffett/Munger)关注企业质量和估值
    • 成长投资者(Cathie Wood)关注创新和市场空间
    • 逆向投资者(Michael Burry)关注被市场忽视的风险和机会
    • 宏观投资者(Druckenmiller)关注宏观经济周期和趋势

    场景二:策略回测与验证

    使用回测功能验证投资策略的历史表现:

    poetry run python src/backtester.py --ticker AAPL,MSFT,NVDA --start-date 2024-01-01 --end-date 2024-12-31

    回测结果会显示:

    • 各 Agent 的决策准确率
    • 模拟投资组合的收益率
    • 最大回撤和风险指标
    • 不同市场环境下的表现对比

    场景三:作为 LLM 多智能体协作的学习案例

    如果你是研究 AI Agent 的开发者,这个项目是学习多智能体协作的绝佳案例:

    • 每个 Agent 有独立的 System Prompt 定义投资哲学
    • Agent 之间通过标准化的信号格式通信
    • Portfolio Manager 作为「总经理」汇总决策
    • 完整的 Python 实现,代码结构清晰易懂

    💡 推荐理由

    为什么推荐这个项目?

    1. 创意独特,执行到位
    把投资大师人格化身为 AI Agent 这个点子本身就很有趣,而项目的执行也相当到位——每位大师的 System Prompt 都经过精心设计,体现了其真实的投资哲学。

    2. 教育价值极高
    无论你是投资初学者还是 AI 开发者,都能从这个项目中学到东西。投资者可以了解不同投资风格的差异;AI 开发者可以学习多智能体系统的设计模式。

    3. 代码质量不错
    项目结构清晰,Agent 定义、信号处理、决策流程都有明确的模块化设计。想要添加自己的 Agent 也非常简单。

    4. 活跃的社区
    项目在 GitHub 上获得了大量关注,社区提出了很多有趣的改进建议(比如添加更多投资大师、支持 A 股等),项目正在积极迭代中。

    5. 引发思考
    这个项目最有价值的地方在于:它让我们思考 AI 在金融决策中的边界在哪里?投资是艺术还是科学?多智能体协作能否真的产生超越个体的智慧?

    ⚠️ 风险提示:再次强调,本项目仅用于教育和研究目的。AI Agent 的分析结果不应作为真实投资的依据。投资有风险,决策需谨慎。

    🔗 下载地址


    如果你觉得这个项目有意思,欢迎在 GitHub 上给它一个 ⭐️
    更多 AI 开源项目介绍,请关注本栏目持续更新

  • 一个研究生用12B模型干翻HuggingFace热榜,大厂这次真的有点尴尬

    一个研究生,两款模型,74万次下载

    HuggingFace的Trending模型榜,向来是大厂的秀场——直到逯雨鑫(yuxinlu1)带着他的GGUF量化模型闯了进来。

    这个美国AI方向的在读研究生,用Gemma4-12B做底座,通过蒸馏把Fable 5的编程推理能力「压」进了一个仅需4.5GB显存就能跑的小模型。结果很直接:在HuggingFace趋势榜上,它一度超过了智谱GLM-5.2、百度Unlimited-OCR等大厂作品,两款模型合计下载量突破74万

    个人开发者霸榜HuggingFace概念图
    个人开发者的12B模型在HuggingFace趋势榜超越众多大厂模型

    怎么做到的?数据质量胜过数量

    逯雨鑫的秘诀不算神秘,但很费功夫:他用约1万条高质量、经过验证的训练数据,而不是几百万条噪声数据。具体来说,他用Fable 5生成代码推理链,但只保留「能通过测试用例」的那些——相当于让老师先改作业,再把满分答案给学生做示范。

    两个版本各有侧重:V1 Coder版专注代码生成与解题;V2 Agentic版增加了多步工具调用能力。在tau2-bench telecom子集上,V2得分55%,而基座Gemma4-12B只有15%——提升了约3.5倍。

    「大厂能做得更好,但开源小模型受品牌和API引流目标影响。个人开发者可以更纯粹地解决『好用』问题。」——逯雨鑫

    为什么是现在?本地AI的窗口打开了

    这几年有个矛盾的现象:云端大模型越来越强,但很多人反而开始关心「本地能跑」的模型。原因很实际:隐私(不想把代码发给云端)、成本(不想为API账单发愁)、延迟(本地推理零网络开销)。

    逯雨鑫的模型最小版本(Q2_K)只要4.5GB显存,一张RTX 4060就能跑。对于很多个人开发者和中小团队,这个门槛意味着「不用申请采购、自己的笔记本就能用」。

    作者是个什么样的人?

    逯雨鑫,美国AI方向在读研究生,本科背景是数据与商业分析。他自述患有ADHD,但在快速变化的AI领域,这种「兴趣快速切换」的特质反而成了优势——hyperfocus让他能在模型训练上连续投入40多个小时。

    项目是纯自费的:一张RTX 5090(32GB VRAM)、约96GB本地SSD,没有融资、没有团队。V2版本最耗时的不是训练,而是数据处理——尤其是agentic长序列的裁剪和验证。


    • 模型底座:Google Gemma4-12B(蒸馏Fable 5能力)
    • 量化格式:GGUF(兼容llama.cpp/Ollama/LM Studio)
    • 最小显存:Q2_K约4.5GB(推荐Q4_K_M约6.87GB)
    • 合计下载:超74万(HuggingFace Trending榜一度超越GLM-5.2)
    • 未来计划:V3沿12B路线推进,同时开发基于Qwen3.6-27B的大版本

  • Coinbase把AI算力账单砍了一半,办法是换用中国模型

    Coinbase把AI算力账单砍了一半,办法是换用中国模型

    Brian Armstrong 在 X 上轻描淡写地发了一条消息,说 Coinbase 现在跑在 GLM 5.2 和 Kimi 2.7 这些中国模型上。这条消息淹没在 AI 圈的每日喧嚣里,但如果你仔细看数据,会发现一个信号:西方 AI 实验室正在被自己的高定价逼出一个竞争对手——而且这个竞争对手来自太平洋彼岸。

    先说结果。Coinbase 的 token 使用量在过去几个月里创了历史新高,因为像 GPT-5.x-Thinking 和 Opus 4.5 这样的推理模型大量进来了。但与此同时,公司的 AI 支出却砍了一半。一半。Armstrong 说这话的时候语气很平淡,好像在说一件理所当然的事。

    Coinbase AI成本优化示意图
    企业 AI 支出优化正成为新的竞争力 | 制图:AI资讯

    91% 的开发者根本不在乎你给了什么模型

    这件事最反直觉的地方在于:Armstrong 并没有强制所有人换模型。开发者仍然可以自由选择任何模型。但数据告诉我们,91% 的人从来就没有触碰到旧的使用上限。他们用不满,是因为当前的模型够用了,或者他们根本懒得去调。

    Coinbase 同时跑了一套自动路由系统,根据任务类型、价格和缓存可能性来挑最优模型。光是改进缓存策略这一项,就把缓存命中率从 5% 拉到了 60%。开发人员被建议保持上下文精简,为新任务开新会话——这套打法归属于当下流行的”上下文工程”范畴。

    “你在 AI 上花的钱越多,我们期望你产出的影响就越大。”Armstrong 说这话的时候,把”tokenmaxxing”(无脑烧 token 刷内部分数榜)的文化打破了。Coinbase 没有设硬性上限,但把每个人的使用量公开了。这一招比直接封顶更狠。

    不只是 Coinbase 一个人在干

    初创公司 Lindy 的 CEO 最近把 Claude 整个扔了,全线换成 DeepSeek v4。Snowflake 的 CEO 测试下来觉得 GLM 5.2 在不少任务上跟 Opus 4.7 差不多,但价格只是一个零头。这些公司不是在用”便宜货”凑合,而是在用足够好的模型把成本结构打穿,然后把省下来的钱花在别的地方。

    这对西方 AI 实验室来说是个实实在在的压力测试。OpenAI 和 Anthropic 还在准备 IPO,需要拿出漂亮的增长数字来支撑估值。但如果大客户开始用中国开源模型替代,那些增长数字还撑得住房吗?JPMorgan 最近在一份报告里列了一堆 AI 市场的红旗指标,其中”客户价格敏感度上升”被放在了显眼位置。


    价格战已经悄悄打响了

    有消息说 OpenAI 和 Anthropic 之间正在酝酿一场关于 API token 的价格战。OpenAI 刚推出的 GPT-5.6-Sol 跟 GPT-5.5 定价一样,但官方说法是比 Claude Fable 和 Mythos 更省 token。OpenAI 同时还放出了两个更弱的 5.6 变体,价格低得多。

    这套打法很像当年的云服务价格战——亚马逊 AWS 用规模优势把价格压到竞争对手活不下去。现在轮到 AI 模型层了。唯一不同的是,这次”低价入侵者”来自中国,而且他们的模型真的不差。

    📎 原文来源:Coinbase joins the rush to Chinese AI models as Western labs face a pricing stress test — The Decoder

    发布时间:2026年6月28日 | 作者:Matthias Bastian

  • 中国AI在网络安全领域追平美国:Z.ai的GLM-5.2让华盛顿睡不着觉

    这几天AI圈有个挺有意思的事:中国的智谱AI(Zhipu AI,也叫Z.ai)发布的开源模型GLM-5.2,在网络安全漏洞查找这个特定领域,居然跟Anthropic的Mythos打得有来有回,有些测试里甚至还胜出了。

    开源模型追上闭源巨头?

    GLM-5.2是智谱AI今年发布的新模型,最大的特点是”开放权重”(open-weight)——意味着任何人都可以下载下来自己跑,不需要经过任何人的批准。

    安全公司Semgrep的测试显示:GLM-5.2在IDOR(不安全的直接对象引用)漏洞检测中,F1得分达到39%,超过了Claude Code的32%,而每次漏洞检测的成本只有约0.17美元。

    智谱AI GLM-5.2网络安全漏洞检测
    GLM-5.2在网络安全领域缩小了与美方模型的差距

    当然,在通用任务上,GLM-5.2还是打不过Claude和GPT系列的。但这不重要——重要的是,在网络安全这个对国家安全至关重要的领域,中国AI公司已经把差距缩小到了”有竞争力”的程度。

    华盛顿的噩梦

    这让华盛顿很头疼。特朗普政府对AI模型出口管制的核心逻辑是:先进的AI模型(特别是能做网络攻防的)不能落到”潜在对手”手里。

    但GLM-5.2是开源的。你没法禁止一个开源模型,就像你没法禁止一个数学公式。任何人都可以从网上下载这个模型,在自己的硬件上跑,没有任何监管能拦得住。

    更麻烦的是,GLM-5.2的表现说明了一件事:中国AI公司不再只是”追赶者”了,在某些细分领域,他们已经开始跟美国公司正面竞争。

    Mythos出口禁令的讽刺

    几个月前,美国政府以”国家安全”为由,禁止Anthropic的Mythos和Fable模型向非美国人开放。当时给出的理由是:这些模型太强了,如果落到坏人手里,可以用来发现软件漏洞、发动网络攻击。

    但现在的局面是:美国的闭源模型被管制了,中国的开源模型却没人管得了。那些本来被禁止用Mythos的安全研究人员,现在可以改用GLM-5.2——效果差不多,还没有使用限制。

    • 出口管制真的能限制住AI技术的扩散吗?还是只是把市场让给了竞争对手?
    • 开源模型和闭源模型,哪种对安全的影响更大?
    • 如果中国AI在更多领域追平美国,华盛顿的下一步会是什么?

    这件事还没有结束。GLM-5.2的开源发布,可能会倒逼美国AI公司重新考虑他们的封闭策略——如果竞争对手用开源抢市场,你还要不要继续闭源?

    同时,这也给全球AI安全研究提了个醒:当你试图用管制来限制技术扩散的时候,技术本身可能不会等你。

  • 英伟达开源MoE微调加速工具,一行import让微调提速3.7倍

    英伟达开源MoE微调加速工具,一行import让微调提速3.7倍

    MoE(混合专家)架构已经成为当前大模型的主流选择。从DeepSeek-V3到Qwen3,再到Google的Gemini,几乎所有最新发布的顶尖模型都在用MoE。但MoE有个麻烦——训练起来比普通Transformer麻烦得多,专家并行、通信融合、kernel优化,这些工程细节没有一个省心的。

    英伟达6月底开源了一个工具,试图让这件事变得简单。叫NeMo AutoModel,基本思路是:站在HuggingFace Transformers v5的肩膀上,不改你原来的代码API,只加一行import,就能把MoE模型的微调速度提升3.7倍,同时把GPU显存占用降低近三分之一。

    英伟达MoE微调加速工具概念图
    英伟达NeMo AutoModel通过一行import实现MoE模型微调加速

    3.7倍加速是怎么来的

    具体数字挺直观的。在单节点8张H100 80GB GPU上,用Qwen3-30B-A3B做微调,原来的Transformers v5每秒每GPU能处理3075个token,换成NeMo AutoModel之后直接拉到11340,提升3.69倍。显存这边,峰值占用从68.2GiB降到48.1GiB,省了29%。

    英伟达 team还测了Nemotron 3 Nano 30B-A3B,结果类似:吞吐提升3.4-3.7倍,显存降低32%。他们甚至拿550B参数的Nemotron 3 Ultra做了全参数微调测试——16个H100节点、128张GPU——这时候Transformers v5已经直接爆显存了,连对比的机会都没有。

    显存省下来的部分不是白给的——你可以拿它去跑更大的batch size,或者处理更长的序列。对于本来就卡显存的大模型训练来说,这两个操作直接决定了你能不能把模型训出来。

    核心技术:三板斧

    NeMo AutoModel在Transformers v5的基础上加了三样东西:专家并行(EP)、DeepEP、TransformerEngine。每一样都针对MoE训练的一个具体瓶颈。

    专家并行解决的是显存问题。MoE模型虽然每次推理只激活部分专家,但训练的时候,所有专家的参数都得放在GPU显存里。专家并行把这些参数分散到多张GPU上,8张GPU就每张只持1/8的专家参数。Qwen3测下来,这项技术能把MoE层的显存占用直接从68.2GiB压到48.1GiB。

    DeepEP解决的是通信开销。MoE训练的时候,每个token得先被路由到对应的专家,这个过程需要跨GPU通信。传统做法是”先分发、再计算”,DeepEP把它融合成了一个优化的GPU内核,”分发”和”计算”在时间上重叠了起来,通信的时间就被藏掉了。

    TransformerEngine提供的是基础运算加速。注意力机制、线性层、RMSNorm这些,都有专门的融合kernel实现。不只加速MoE层,普通Transformer层也能占到好处。

    一行import怎么做到

    用法确实简单。如果你原来就在用Transformers v5,切换到NeMo AutoModel只需要在文件开头加一行:

    • from transformers import AutoModelForCausalLM改成from nemo_automodel import AutoModelForCausalLM
    • 原来的训练代码几乎不用动
    • API完全兼容HuggingFace的接口约定

    这个设计思路很聪明。它不搞”全新框架”,而是在现有生态上做增强。这样用户的迁移成本几乎为零,英伟达那边也能持续从HuggingFace的生态里受益——相当于”我帮你提速,你继续用HuggingFace的接口”。


    为什么这件事值得关注

    MoE架构的普及速度比很多人预期的快。2026年上半年,几乎所有主流大模型发布都用了MoE或者类MoE的稀疏激活架构。原因很简单:在相同参数规模下,MoE的推理成本远低于稠密模型,但训练成本却高得多——因为所有专家的参数都得加载进显存,通信开销也大。

    英伟达这笔账算得很清楚:如果MoE是未来,那么控制MoE训练的工具链,就等于在AI训练基础设施里多插了一脚。HuggingFace占据了模型使用的入口,英伟达则通过NeMo AutoModel占据了”高性能训练”的入口——而且是以兼容HuggingFace的方式,用户几乎没有理由拒绝。

    代码、配置文件和基准测试脚本都已经放在GitHub上了(github.com/NVIDIA-NeMo/AutoModel),文档也在docs.nvidia.com上线了。感兴趣的人现在就能去试试,看看那3.7倍加速在自己的模型上能不能复现。

  • DeepSeek开源提速神器,不换模型就让V4快60%以上






    DeepSeek本月在技术圈投了一枚小炸弹——他们开源了一个叫DSpark的投机解码框架,说可以给现有的DeepSeek-V4模型提速60%到85%,而且不需要换模型、不需要重新训练,提速后的输出质量也无损。

    这件事值得说清楚,因为大多数用户感知不到”推理速度”这个东西,但它其实决定了你用AI产品时等得多久、以及AI公司要花多少钱来跑服务。

    “投机解码把生成拆成两个角色:一个小号的草稿模型先提议一段token,完整的目标模型再一次性验证这段提议。拒绝采样会接受最长有效前缀,再附加一个额外token。因为规则精确保持了目标分布,所以不存在质量损失。”

    AI推理加速概念图
    DeepSeek DSpark推理加速框架概念图

    投机解码是什么东西

    要理解DSpark,得先说清楚”投机解码”(Speculative Decoding)这个技术思路。大语言模型生成内容时,是逐token(可以理解为逐词或逐子词)输出的,每次只生成一个token,这导致推理速度受限于内存带宽,GPU的算力往往吃不满。

    投机解码的思路是:用一个很小的草稿模型,先”猜”一段接下来可能的token(比如一次猜5个),然后让完整的大模型一次性验证这段猜测——对的留下,错的地方截断,再从那个位置继续。因为草稿模型很小,跑得快;大模型验证一串token比逐次生成更快。这样整体速度就提上来了。

    这个技术不是DeepSeek发明的,学术界和工业界已经研究了一阵子。但DSpark的特别之处在于,它解决了一个具体工程问题:草稿模型猜的token,在后半段准确率会快速衰减——前面猜对了,越往后越容易跑偏,导致验证时能接受的长度有限,加速效果打折扣。

    DSpark怎么做的

    DeepSeek团队把草稿生成拆成了两个阶段,这个设计他们叫”半自回归生成”。第一阶段用一个并行的DFlash模块,一次性给每个位置生成基础logits(这是模型内部表示”下一个token可能性”的数值);第二阶段接一个极轻量的顺序头部,在采样每个token之前,加一个依赖前面已采样token的偏置。

    顺序头部默认是”马尔可夫头部”——只往前看一个token,低秩分解让它在词汇量很大的情况下也保持低成本。这个设计让DSpark继承了并行草稿的高首token准确率,又通过顺序头部让接受率在块的深处保持稳定,不会快速衰减。

    另一个工程细节是”置信度调度验证”:DSpark给每个草稿位置输出一个置信度分数,估计这个token通过验证的概率;再结合一个硬件感知的调度器,在GPU空闲时验证更多token,繁忙时验证更少。这个设计减少了高负载下验证被拒绝token造成的算力浪费。

    实际提速多少

    指标分两部分:离线测试和生产环境。

    离线测试里,DSpark在Qwen3各个尺寸模型上的接受长度,比Eagle3高26%到31%,比DFlash高16%到18%。注意这里比较的是”接受长度”(每次验证能接受多少token),不是直接的提速倍数,但因为延迟公式里提速正比于接受长度,所以这个指标直接反映了加速潜力。

    生产环境的数据更有说服力。DeepSeek-V4-Flash和V4-Pro在他们的真实流量下,用DSpark-5配置(5个token的草稿块+马尔可夫头部),相比之前的MTP-1基线(一次猜2个token的固定方案),每用户生成速度分别提升了60%到85%和57%到78%。这个提升是在相同吞吐量(即相同GPU资源)下测得的,意味着用同样的硬件可以服务更多用户,或者同样多的用户等着的时间更短。


    为什么这件事值得关注

    第一,这是”不换模型就能提速”的方案。大多数AI公司提速的思路是训练更大的模型、或者用更多GPU,这都意味着更多的钱。DSpark这种在推理层面做优化的思路,是花小钱办大事——尤其对已经在跑DeepSeek-V4的服务来说,换上DSpark的检查点就能直接提速,不需要重新训练。

    第二,DeepSeek把检查点和训练代码都开源了,用MIT许可证。这意味着其他公司和研究机构可以直接用,也可以基于这个框架做自己的优化。这种开源技术基础设施的打法,和OpenAI、Anthropic的闭源路线形成鲜明对比。

    第三,推理速度的提升会传导到终端用户。AI聊天产品的响应速度、AI编程助手的代码生成延迟、AI搜索的返回时间——这些用户体验指标,背后都是推理速度。DSpark如果被广泛采用,意味着用同等质量的模型,用户能感受到更快的响应。

    最后说一句实际的:DSpark目前是和DeepSeek-V4的权重绑定的,不是通用框架(虽然DeepSpec训练代码库支持在其他模型上训练草稿模块)。如果你想在自己的项目里用,得跑训练——官方配置假设单机8块GPU,目标缓存可能非常大(Qwen3-4B设置下接近38TB),这个门槛不低。但对已经有大模型服务的团队来说,这个方向值得跟进。


  • SpaceX把Colossus算力租给Reflection AI,开源阵营终于有大玩家了

    马斯克的SpaceX最近又签了一笔大单。这次的买家是Reflection AI——一家成立才两年的开源AI实验室。合同金额不算夸张,每月1.5亿美元,从今年7月算起,一直签到2029年7月,总价值63亿美元。

    这个数字听起来很大,但放在SpaceX的算力出租业务里只能算中等。Anthropic每月付12.5亿美元,Google每月付9.2亿美元,Reflection的1.5亿连零头都不到。当然,对于一家还没有正式发布产品的创业公司来说,能拿到Colossus 2数据中心的算力配额,本身就是一种背书。

    SpaceX xAI Logo
    SpaceX的Colossus数据中心现在向外部AI实验室开放算力租赁(图源:TechCrunch)

    开源AI的生存逻辑

    Reflection AI的两个创始人都是从Google DeepMind出来的,2024年创业,主打一个”开源对抗封闭”的叙事。他们的逻辑很简单:Anthropic和OpenAI那种黑箱模型,你根本不知道它怎么想的,也不让你改。Reflection要把模型权重公开,让企业和政府自己去部署、去审计、去改。

    这个叙事在政府禁令出来之后突然变得很值钱。美国那边刚把Anthropic的Fable和Mythos两款闭源模型给禁了,理由是”国家安全”。结果这一禁,反而让不少人开始认真看开源替代品。你总不能连开源模型也禁吧?那跟把所有螺丝刀都管制起来没区别。

    Reflection自己的声明说得很直白:”最近的事态说明开源对AI生态有多重要。越来越多的国家和企业意识到,只依赖闭源模型是有风险和成本的。”这话翻译过来就是:谢谢政府的神助攻。

    Colossus到底是谁的?

    这里有个细节挺有意思。Colossus数据中心最早是xAI建的——就是马斯克那家AI公司,Grok的大本营。后来xAI并进了SpaceX,数据中心也就归了SpaceX。所以现在的情况是:SpaceX拿着这批英伟达最新的GB300芯片,自己用不完,也不想全用来训Grok,干脆租给外面的人。

    Anthropic租了,Google租了,现在Reflection也租了。马斯克一边公开骂Anthropic的模型有安全问题,一边收着人家的租金,这个画面多少有点微妙。不过做生意归做生意,马斯克最近公开说那些长期合同”随时可以取消”,这是在向谁表态,大家心里都有数。

    63亿美元能买到什么

    Reflection拿到的是”立即访问权”——Colossus 2数据中心里的最新GB300芯片和配套硬件,从7月1日起就用。合同写了双方都可以在头三个月之后提前90天通知终止,这个条款基本上是照抄Anthropic和Google的合同模板。

    对Reflection来说,这笔钱花得值不值,取决于它能不能在接下来三年里做出真正能打的开源模型。现在开源阵营里最强的是DeepSeek,但DeepSeek是中国公司,在美国市场多少有点尴尬。Reflection如果能在美国做出一个同等水平的开源模型,机会是有的。前提是钱够烧、算力够用、人够聪明。


    63亿美元听起来很多,但摊到三年里,每月1.5亿,也就是每年18亿。Anthropic每年烧的钱比这个只多不少。AI军备竞赛的入场券,就是这么贵。

  • 余承东放话:盘古大模型要做世界第一,华为把底牌全亮出来了

    余承东放话:盘古大模型要做世界第一,华为把底牌全亮出来了

    6月12日,华为开发者大会2026(HDC 2026)在东莞开幕。余承东站上台,扔下了一句话:”在我余承东的字典里只有第一,没有第二。”

    这次他宣布的事情是:盘古大模型2.0(openPangu 2.0)正式发布,开源体系全面升级。从6月30日起,华为计划陆续开源上线7大组件,其中包括之前没有开源过的预训练代码、后训练代码和训练算子。

    华为盘古大模型2.0发布
    余承东在HDC 2026上发布盘古大模型2.0(图源:南方都市报)

    余承东说这话是有背景的。他透露,去年国庆节前夕,公司让他来负责大模型业务。”我会带领团队一路赶超,从中国第一,走向将来的世界第一。”

    他还补了一句:2021年4月,华为发布了全国、全世界第一个大模型——盘古大模型。那时候大家还不知道大模型是什么,华为已经发布了,算是行业先驱者。但后来没做好,不应该。

    “在AI领域,算法、算力、数据三样缺一不可,需要强大的工程能力来支撑和保障。而华为有强大的工程能力,且凝聚了一批优秀的人才,相信不断地创新,就能做好。”

    开源7大组件,这次动真格了?

    openPangu 2.0的开源计划是这套发布的核心。7大组件从6月30日起陆续上线,其中预训练代码、后训练代码和训练算子是新增开源的部分。

    把训练代码开源,意味着华为在向开发者示好:你可以用我的模型,还可以看我是怎么训练的。这在国产大模型里算是比较激进的打法——通常厂商更愿意把训练细节捂在自己手里。

    华为的算盘可能是这样:开源能拉更多开发者进来,生态做大了,盘古的地位就稳了。余承东说要”从中国第一走向世界第一”,没有开发者生态,这句话就是空头支票。

    绕不开的抄袭争议

    盘古大模型不是第一次站在聚光灯下,但上一次的热度来自一场争议。

    2025年7月,GitHub上有人发了一项研究,称华为盘古大模型与阿里通义千问在模型参数结构上存在”惊人一致”。一时间,”华为抄袭阿里”的质疑声四起。同期,网上还流传了一篇署名为内部员工的文章,标题很抓马:《盘古之殇:华为诺亚盘古大模型研发历程的心酸与黑暗》。

    华为诺亚方舟实验室后来发了澄清声明,说法是:盘古Pro MoE开源模型部分基础组件的代码实现参考了业界开源实践,涉及其他开源大模型的部分开源代码,且严格遵循开源许可证要求,在代码中清晰标注了版权声明。

    这份声明的潜台词是:我们用了开源代码,但合规,标注了,符合开源社区规则。这个解释能不能平息质疑,见仁见智。开源社区对”参考”和”抄袭”的界限本来就有不同看法。

    这次盘古2.0大张旗鼓地开源7大组件,多少也有点”用行动回应质疑”的意思。代码摊在阳光下,是不是自己写的,技术圈自会有判断。


    余承东说”只有第一,没有第二”,这话很有他的风格。但大模型这场仗,比手机战场复杂得多。算法、算力、数据、开发者生态、应用落地——每一个都是硬骨头。盘古2.0开源能不能拉起一波开发者,6月30日之后见分晓。