标签: AI

  • 黄仁勋又发新卡了,这次英伟达要把AI芯片塞进你的电脑里

    这两天台北的Computex 2026展会正式开幕,英伟达的CEO黄仁勋又站出来搞事情了。这次他带来的不是普通的显卡,而是专为Agentic AI设计的新一代Vera Rubin芯片,据说OpenAI和Anthropic已经率先决定用了。

    不止是新芯片,还要做PC处理器

    除了Vera Rubin芯片,黄仁勋还宣布要和微软合作,推出基于台积电3nm工艺的ARM架构Windows PC芯片,名字叫RTX SPARK,计划2026年秋季就上市。这意味着英伟达正式进军个人电脑芯片市场,要打破英特尔这么多年的垄断。

    黄仁勋在演讲里说,Agentic AI的时代已经全面到来了,以后的AI不是只能聊聊天,而是能自主完成很多复杂的任务,这就需要更强大的芯片来支持。

    黄仁勋在GTC Taipei 2026大会演讲
    黄仁勋在GTC Taipei 2026大会上发表主题演讲

    其实这几年英伟达在AI芯片领域的优势已经很明显了,这次发布的Vera Rubin芯片专门针对Agentic AI做了优化,处理多任务的能力比之前的芯片强了不少。而RTX SPARK PC芯片更是直接杀入英特尔的腹地,以后我们买电脑的时候,除了英特尔和AMD的处理器,可能还要多一个英伟达的选项了。


    国产芯片也在发力

    就在英伟达发布新芯片的同时,国内的算力芯片也在进步。深圳河套学院最近用昇腾910C集群,完成了1.6万亿参数的DeepSeek-V4-Pro全流程训练,这说明国产芯片已经能支撑世界级的超大参数模型训练了。以后国内做AI训练和推理,用国产芯片也能有不错的效果,不用完全依赖国外的产品。

    • Vera Rubin芯片专为Agentic AI设计,性能大幅提升
    • RTX SPARK PC芯片采用台积电3nm工艺,2026年秋季上市
    • 国产昇腾910C集群已完成万亿参数模型训练,国产算力进步明显
  • 国产大模型又放大招,MiniMax M3编程能力居然超过了GPT-5.5

    最近国产大模型圈又热闹起来了,MiniMax刚发布了新一代的通用模型MiniMax M3,据说编程能力在SWE-Bench Pro基准测试里超过了GPT-5.5和Gemini 3.1 Pro,只比Claude Opus 4.7差一点点。

    自研架构,1M超长上下文

    MiniMax M3是国内首个同时具备前沿编程能力、1M超长上下文、原生多模态三项核心能力的大模型,用的是自研的MiniMax Sparse Attention(MSA)稀疏注意力架构,1M上下文下单token的计算量只有上一代的1/20,处理长文本的时候效率高了很多。

    MiniMax的团队说,M3的编程能力已经能帮开发者完成很多复杂的编程任务,比如调试代码、优化性能、写复杂的算法,能省不少时间。

    MiniMax M3模型发布
    MiniMax正式发布新一代通用模型MiniMax M3

    除了模型本身,MiniMax还推出了配套的AI编程产品MiniMax Code,能自主运行数天不用人工干预,帮开发者完成从写代码到测试的全流程。现在很多开发者都已经用上AI辅助编程了,MiniMax Code这种能自主运行的工具,说不定能把编程的效率再提一个档次。


    国产大模型加速上市

    就在发布M3的同时,MiniMax还启动了A股IPO辅导,目标是在科创板上市。其实之前智谱也已经完成了第四期上市辅导,国产大模型公司现在都在加速上市进程,说明资本对AI落地价值的认可已经回归基本面了。以后我们不仅能用到更好的国产大模型,还能通过投资分享AI发展的红利。

    • M3编程能力超过GPT-5.5,接近Claude Opus 4.7
    • 支持1M超长上下文,自研稀疏注意力架构,效率更高
    • 推出MiniMax Code,可自主运行数天,辅助编程全流程
    • 启动A股IPO辅导,国产大模型加速上市进程
    📎 原文来源:MiniMax推出MiniMax M3模型
  • Ollama:170k Stars!本地LLM运行工具,让AI模型在本地飞速运行

    配图

    Ollama Logo
    Ollama – 本地LLM运行工具

    项目简介

    Ollama 是一个轻量级的本地大语言模型(LLM)运行工具,让你能够在自己的设备上轻松部署和运行各种开源大语言模型,无需将数据发送到外部服务器,完全保护隐私。

    截至2026年,Ollama 已在 GitHub 获得 17万+ Stars,成为最广泛使用的本地LLM运行时,Docker Hub下载量超过1亿次。

    安装要求和过程

    环境要求

    • 操作系统:Linux(Ubuntu 20.04+)、macOS 11+、Windows 10(需WSL2)
    • 内存:8GB以上(运行7B模型),16GB以上(运行13B模型),32GB以上(运行33B+模型)
    • 存储:至少10GB可用空间(用于存放模型文件)
    • GPU:可选,NVIDIA GPU(CUDA)、AMD GPU(ROCm)或苹果M系列芯片可加速推理

    快速安装步骤

    macOS/Linux 一键安装:

    # Linux/macOS
    curl -fsSL https://ollama.com/install.sh | sh
    
    # macOS 也可用 Homebrew
    brew install ollama

    Windows 安装:

    1. 访问 https://ollama.com/download 下载 Windows 安装包
    2. 运行 OllamaSetup.exe,按照提示完成安装
    3. 打开命令提示符或PowerShell,输入 ollama --version 验证安装

    Docker 安装(推荐服务器环境):

    docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama

    核心功能

    1. 一键运行本地模型:支持一键拉取和运行100+开源大语言模型,包括 Llama 3.3、Mistral、Qwen、Phi、DeepSeek R1 等热门模型。
    2. OpenAI API 兼容:原生提供兼容 OpenAI API 格式的 REST API(默认端口11434),可直接对接现有基于 OpenAI 生态开发的应用和工具。
    3. 智能硬件加速:自动适配 NVIDIA(CUDA)、AMD(ROCm)、苹果 M 系列芯片(Metal)的 GPU 加速,大幅提升推理速度。
    4. 模型自定义配置:支持通过 Modelfile 自定义模型参数(温度、上下文长度、系统提示词等),轻松创建专属模型。
    5. 多模态支持:最新版本支持视觉模型(如 Llama 3.2 Vision),可处理图像输入,实现图文混合推理。

    典型使用场景

    场景一:开发者本地 AI 应用开发

    作为开发者,你可以使用 Ollama 在本地运行 LLM,用于:

    • 开发和测试 AI 应用,无需支付 API 费用
    • 对接 Open-WebUI 等前端界面,搭建私有化 AI 聊天助手
    • 通过 API 集成到自己的应用中,实现本地智能推理

    示例:用 Ollama 运行 Llama 3.3 8B 模型,通过 OpenAI 兼容 API 为本地应用添加 AI 能力。

    场景二:企业私有化部署

    对于企业用户,Ollama 提供了:

    • 数据隐私保护:所有推理过程在本地完成,敏感数据无需上传云端
    • 零 API 成本:无需为每次 API 调用付费,适合高频调用场景
    • 离线可用:模型下载后,无需联网即可使用,适合内网环境

    推荐理由

    我个人从2025年开始使用 Ollama,它已经成为我本地 AI 开发的标配工具。推荐理由如下:

    1. 极简体验:一条命令就能安装,一条命令就能运行模型,对新手极其友好。
    2. 生态丰富:支持对接 Open-WebUI、Continue(VS Code 插件)、LangChain 等50+主流工具,可玩性极高。
    3. 性能优秀:支持 4-bit/8-bit 量化,即使在中端笔记本上也能流畅运行 7B 参数的模型。
    4. 活跃社区:GitHub 上40000+社区集成,几乎任何你能想到的工作流,都有人已经做好了集成方案。

    如果你想要一个简单、快速、隐私安全的本地 LLM 运行方案,Ollama 绝对是首选。

    下载地址

  • WWDC 2026:苹果准备再次介绍Siri,这次真的要用上Gemini了

    过去几年,苹果在AI这条路上一直在追赶。但换个角度看,落后未必是坏事。

    周一的WWDC 2026上,苹果准备再次向用户介绍新版Siri。说”再次”,是因为我们早在2024年苹果高调”推出”Apple Intelligence时就见过新Siri了——当时换上了发光边框,提供了不同的语音选项,还具备了把问题转交给ChatGPT的能力。苹果当时承诺Siri的”智能”功能很快上线,结果并没有。

    事实上,苹果围绕Apple Intelligence的宣传如此具有误导性,以至于公司正在和解一起集体诉讼,需要为从未兑现的功能向iPhone用户进行赔偿。

    2024年WWDC上苹果首次曝光AI版Siri
    2024年WWDC上,苹果首次曝光AI版Siri,口号是”AI for the rest of us”。两年过去了,这次得动真格了。

    AI助手竞赛,苹果已经输了

    如果把这事儿当成一场竞赛,苹果已经输得很彻底了。Gemini已经能实现叫Uber、点照烧外卖、查看你的日历并计算你该什么时候出发去机场这类功能。Gemini赢得这场竞赛,实至名归。

    但与此同时,人们对AI的不信任感正在上升,尤其是年轻人。Gemini越强大,给人的感觉就越诡异。要交付真正有用的助手,AI必须做到能预判你的需求,但”希望AI助手预判你的下一步需求”和”亲眼看到它真的这么做了”完全是两回事。

    我自愿授予了Gemini访问我的Google相册和Gmail的权限,但每次听到Gemini大声说出我儿子的名字,我还是会觉得毛骨悚然。

    苹果的新玩法:借力Gemini

    新版Siri将以某种形式基于Gemini构建。苹果无疑会为这项特权支付高昂的费用,但这种”隔了一层”的合作模式也有潜在的好处。

    你知道哪家公司没有和大型不受欢迎的数据中心项目绑定吗?是苹果。谷歌为了在全国各地的社区大规模开工建设数据中心,并没有赢得多少好感。苹果就算付费给谷歌,也不用背负这个负面名声,哪怕它付给谷歌的钱大概率会被投入到庞大的数据中心建设中。

    还有Copilot相关的争议:也就是”到处都是AI按钮”的问题。Siri尝试总结消息的功能既好笑又烦人,但至少Siri不会钻进你每一份工作文档里,非要帮你做总结。

    隐私牌,苹果的老本事

    可以预料,苹果会在WWDC上大谈隐私。私有云计算(Private Cloud Compute)会被再次搬出来,据说这项技术可以让你的数据就像从未离开过你的设备一样安全。新版Siri可能还会提供自动删除聊天记录的选项,而不是默认保留所有数据。

    承诺更私密、更安全的AI体验,可能会吸引那些不愿意向谷歌交出更多个人信息的人。但对于那些已经受够了软件里到处都是AI的人来说,这并没有什么帮助。


    苹果完全可以把AI进展缓慢包装成更负责任的做法。把之前的延迟说成是”花时间把事情做对”,并不是个坏策略。但虚假启动的阶段已经结束了。这次Siri必须要真的兑现承诺;这种第二次机会不会一直有,错过了就不会再来。

  • Meta自己下场做AI点击诱饵,还把已故女王生成了两遍

    Facebook上早就充斥着各种点击诱饵文章,现在Meta干脆自己动手,用AI批量生产这类内容了。

    事情是这样的。Meta的独立AI应用有个”为你推荐”板块,会推送一堆看着就很眼熟的故事卡片——标题党、配图夸张、内容空洞,典型的点击诱饵风格。但问题在于,这些故事从头到尾都是AI生成的,包括话题、配图、正文,一个字都不是人写的。

    AI眼中的英国是什么样

    驻伦敦的记者Robert Hart收到了一堆极具”英国特色”的推送:茶、礼仪、酒吧、王室、足球,还有排队技巧。具体标题大概是这样的:”王室管家终于解决了先加奶还是先加茶的争论”、”不知道原因就加入排队的心理学”、”英式责备的精髓解析”、”逛遍英国所有酒吧的极限运动”。

    他的同事更惨,被算法判定为奢侈品手表爱好者,推送了”我的假劳力士实验”和”劳力士候补名单背后的残酷数学”这类故事。

    Meta AI生成的错误王室图片,出现了两个伊丽莎白二世女王
    AI生成的英国王室图片,里面出现了两个伊丽莎白二世女王——而她已经去世几年了。图片来源:Meta AI

    AI生成的正文基本是凑字数的填充内容,翻来覆去重复提示词的前提,没有任何实质信息,也没有标注任何信息来源。如果你多次点击同一张卡片,每次生成的故事都是同一个主题的不同变体,但内容会略有不同。

    AI生成的内容里甚至出现了真实人物,而且错误百出。一张标题为”2026年谁真的在为王室买单?”的配图里,出现了两个伊丽莎白二世女王——而她已经去世几年了。她旁边还有看起来像是凯特王妃和威廉王子的人物,但面部扭曲、身体比例怪异,是典型的AI生成瑕疵。

    Meta的尴尬回应

    记者联系Meta询问这个功能的目的是什么、输出的内容算新闻还是虚构故事、有什么保障措施、生成真实人物图像是否符合其内容政策。Meta发言人的回应非常简短:”我们的目标是推荐对你最相关的内容——比如健身建议、膳食计划或其他见解——甚至在你提出要求之前。”

    后来这份声明又发了一遍,神秘地删除了”甚至在你提出要求之前”这句话。

    当天晚些时候,第三份声明来了:”这是针对有限数量用户的测试,该功能将被弃用。Meta没有推进该功能的计划。”

    这个回应反而引发了更多疑问:《The Verge》至少有四名记者都能使用这个功能,这算哪门子的”有限测试”?


    说到底,这件事暴露了Meta在AI内容生成上的草率。一个连”先加奶还是先加茶”都搞不清楚的AI,批量生产点击诱饵内容推送给用户,还生成已故王室成员的错误图像——这不是创新,这是 irresponsible。

  • 谷歌每月付SpaceX 9.2亿美元:AI算力军备竞赛打到外太空了

    AI算力不够用,连谷歌都要找SpaceX租显卡了。而且租金贵到离谱——每个月9.2亿美元,签了三年。

    这笔钱到底买了什么

    根据SpaceX在本周公开展露的监管文件,谷歌将从2026年10月开始,到2029年6月为止,每个月向SpaceX支付9.2亿美元。换回来的,是大约11万块英伟达GPU,加上配套的CPU、内存和相关组件的使用权。

    这个规模和Anthropic拿到的相比,大概是打了对折。就在这份文件公开前一周,SpaceX刚宣布和Anthropic签了同类型的协议——Anthropic每个月付12.5亿美元,用掉SpaceX在孟菲斯附近Colossus 1数据中心的全部可用算力。那个数据中心是马斯克早先为了训练xAI模型自己建的,现在xAI并入了SpaceX,这块资产也就顺带进了SpaceX的口袋。

    谷歌与SpaceX算力合作协议
    谷歌每月支付SpaceX 9.2亿美元算力费,为期三年 | 来源:TechCrunch

    谷歌真的缺算力吗

    这事最让人困惑的地方就在这:谷歌是全球公认的AI算力大户,有些估算甚至说它是全球最大的AI算力持有者。它自己有TPU,有谷歌云,为什么还要找马斯克租卡?

    谷歌的官方说法是:最近推出的AI产品需求远超预期,特别是企业级的Agent平台Gemini Enterprise,用户涨得太快,现有算力顶不住了。这个”短期、及时的协议”就是为了补上这段时间的算力缺口,等自己的新数据中心建好就能缓过来。

    “谷歌云和SpaceX是老搭档了。这是一个短期、及时的协议,确保我们有桥接容量来满足Gemini Enterprise代理平台超出预期激增的客户需求。”——谷歌声明

    SpaceX的算盘

    站在SpaceX的角度看,这笔交易一石二鸟。一方面,把原本只给自己xAI用的数据中心腾出一半租给谷歌,每个月净赚9.2亿美元,三年下来超过330亿美元。另一方面,谷歌本来就是SpaceX的早期投资方,IPO之后持股份额预计价值超过1000亿美元——算力租约加上股权收益,两边通吃。

    合同里还有一个取消条款:2026年12月31日之后,双方都可以提前90天通知对方终止协议。谷歌接入数据中心的过程会在9月前”以较低费用逐步 ramp up”。如果SpaceX到2026年9月30日还交不出承诺数量的GPU,谷歌可以选择直接终止协议,或者接受实际提供的数量并相应减少月费。

    SpaceX预计近期就要在纳斯达克挂牌了,目标估值1.75万亿美元。有谷歌这种量级客户排队付租金,这个IPO故事讲出来,投资人应该不难买单。


  • OpenAI上线Lockdown模式:AI时代的数据安全终于有人管了

    前几天OpenAI悄悄上线了一个新功能,名字叫Lockdown Mode(锁定模式)。乍一听像是什么军工级机密功能,其实就是给那些怕自己数据被AI”说漏嘴”的用户,加了一道保险杠。

    提示注入到底有多危险

    这事得从”提示注入攻击”说起。简单讲,就是有人把恶意指令藏在网页内容里,等你去问AI关于这个网页的问题时,那些隐藏指令就被”激活”了。AI会乖乖按照攻击者的意思去执行——比如把你的私人对话内容泄露出去,或者绕过你设好的使用限制。

    这个漏洞不是什么新鲜事,学术界2022年就开始讨论了,但真正让普通用户有感知,还是这两年AI Agent开始大规模联网之后。你的AI助手一旦能读网页、能调用工具、能替你发消息,提示注入就成了实打实的安全威胁。

    OpenAI在公告里说得很直白:开了Lockdown Mode,ChatGPT仍然可能被提示注入攻击——因为攻击可能藏在缓存的网页内容或上传的文件里,还是会影响AI的回复行为或准确性。

    Lockdown模式到底锁了什么

    开了这个模式之后,ChatGPT会做几件事:实时网页浏览直接禁用(只能用缓存内容);从网络检索和展示图片的功能也关了(但AI自己生成图片还能用);深度研究(Deep Research)和代理模式(Agent Mode)一同被禁用。

    换句话说,Lockdown Mode本质上是在”降智”——通过砍掉那些最容易出事的联网功能,来降低敏感数据被泄露的概率。OpenAI说得很清楚:这个功能不是给所有人用的,它是专门为处理敏感数据的个人和组织设计的。

    OpenAI Lockdown Mode安全防护
    OpenAI推出Lockdown模式,防范提示注入攻击 | 来源:TechCrunch

    谁真正需要这个功能

    目前这个功能正在向自助式ChatGPT商业账户,以及符合条件的个人用户推送。如果你只是拿ChatGPT写写周报、翻译点文档,大可不必理会它。但如果你在用AI处理客户数据、商业机密、或者任何不想外泄的信息,Lockdown Mode就是一个值得考虑的选项。

    这件事背后反映出的信号更有意思:AI安全正在从”实验室议题”变成”产品功能”。以前大家讨论AI安全,说的是对齐问题、说的是超级智能失控;现在OpenAI直接把它做成一个开关,放在普通用户的设置页面里。这个转变,值得整个行业想一想。


  • AI代币账单到期:企业花掉全年预算只用了4个月

    Uber今年4月就用完了2026年全年的AI编程预算。这件事听起来像段子,但它是真的。微软在给开发者开放Claude Code权限几个月后,悄无声息地撤销了授权。Priceline的一名员工告诉TechCrunch,Cursor的常规续约合同价格涨了4到5倍。

    AI成本失控
    企业AI支出正在失控(图源:TechCrunch)

    代币账单到期了

    尽管单个token的价格在下降,但AI的普及加上越来越自主的AI智能体,让token消耗量成倍增长。2025年初大量采购”无限量订阅”套餐的企业,现在正手忙脚乱地搞清楚钱都花到了哪里。

    OpenAI企业业务负责人亚历山大·恩比里科斯本周在纽约的一场活动中说得很直白:”六个月前和客户沟通,话题全是’它能做什么?效果够不够好?’现在这些话题根本不会出现了。现在的话题全是’嘿,我们花了太多钱了。你们能提供什么可见性?有什么审计能力?有什么token管控措施?你们的模型效率怎么样?’”

    “这就像可卡因泛滥一样。供应商先让你免费试用,让你上瘾,现在你就被它套牢了。”——Priceline IT财务高级总监 Chris Reed

    新模型让消耗爆炸

    2025年11月发布的新模型——Anthropic的Claude Opus 4.5、OpenAI的GPT-5.1和谷歌的Gemini 3 Pro——大幅提升了智能体工具的能力,也让token消耗量成倍增长。据报道,有一家公司因为忘记给员工设置使用限额,收到了5亿美元的Claude账单。

    工程运营平台Faros AI的CEO维塔利·戈登说,他最近和一位CTO沟通,对方告诉他:”我手下的一个工程师上个月花了4万美元买token,我真的不知道该阻止他,还是该告诉其他人都要像他一样用。”

    生产力提升的说法越来越模糊

    Faros今年4月发布的一项针对2万名开发者、为期两年的研究发现,开发者的产出确实在上升,但bug和返工的情况也在增加。工程管理平台Jellyfish也得出了类似的结论:使用token最多的工程师的生产效率大约是使用AI较少的工程师的2倍,但他们为此消耗的token是后者的10倍。

    Jellyfish的研究负责人尼古拉斯·阿科拉诺说:”极端支出是否值得,最终取决于上线代码带来的实际商业价值,而大多数企业目前还无法衡量这一点。”


    Tokenomics基金会来了

    正是在这样的背景下,Linux基金会本周公布了成立Tokenomics Foundation(代币经济学基金会)的计划。这是一个新的标准机构,目标是给AI token建立类似FinOps给云成本带来的成本管控规范。

    FinOps基金会的执行董事J.R. 斯托门特说:”今年4月和5月,我开始听到企业说:’天呐,我们2026年的全年token预算已经超支3倍了,现在才4月。’我们听到了很多关乎企业存亡的危机。”

    该基金会正在为”代币经济学”建立权威的定义和框架,计划7月正式推出。与此同时,一个市场已经在形成——Ramp、Datadog、New Relic,以及专门的初创公司如Pay-i和Paid,都在争相为企业提供AI成本管控工具。

    高盛预测到2030年全球token使用量将增长24倍。那些已经超支的企业现在就需要解决方案,而该基金会的首个成果还要几个月才能推出。就像戈登说的:”也许我们创造了蒸汽机,但还没有搞清楚装配线怎么建。”

  • 谷歌每月给SpaceX交9.2亿美元,买的到底是什么算力?

    谷歌居然要向SpaceX租GPU,而且一租就是每月9.2亿美元。这笔交易出现在SpaceX提交给SEC的IPO文件中,时限是2026年10月到2029年6月。谷歌拿到的是约11万块英伟达GPU,加上配套的CPU和内存。

    有意思的地方在于,谷歌一直被认为是全球持有AI算力最多的公司之一。它自己有TPU,有谷歌云的数据中心,结果现在还要找SpaceX租算力。原因说起来也简单:Gemini Enterprise的需求比谷歌预期的还要猛,现有的容量跟不上,所以需要一笔”过渡性”的算力来补缺口。

    SpaceX数据中心
    SpaceX的数据中心算力设施(图源:TechCrunch)

    和Anthropic那笔交易比,谷歌拿到的少一半

    几周前SpaceX和Anthropic刚签了一笔每月12.5亿美元的交易,租的是孟菲斯附近Colossus 1数据中心的全部可用算力。谷歌这笔拿到的量大约是Anthropic的一半。SpaceX没有说明谷歌具体用哪个数据中心,但马斯克之前说过Colossus 2会留给xAI自用。

    “这是一份短期、及时的协议,旨在确保我们拥有过渡性的算力容量,以满足客户对Gemini Enterprise的需求,该平台的需求甚至比我们预期的还要高。”——谷歌声明

    两家公司都可以在年底撤

    这份协议有一个终止条款:2026年12月31日之后,任意一方提前90天通知就可以终止。如果SpaceX在2026年9月30日前交不出约定数量的GPU,谷歌可以立刻终止,或者接受已交付的部分并按比例降租金。

    谷歌母公司Alphabet今年已经承诺投入超过1800亿美元的资本支出,而且预计2027年的支出还会”显著增加”。为了支撑这些开支,Alphabet近期宣布了800亿美元的配股计划。在这种情况下还要额外每月花9.2亿美元租算力,说明AI算力的紧缺程度可能已经超出了外界的想象。


    谷歌是SpaceX的长期股东

    这笔交易还有一个背景:谷歌是SpaceX的早期投资者,据估计IPO后谷歌持有的SpaceX股份价值将超过1000亿美元。两家公司还在商谈建设轨道数据中心的事宜,这是SpaceX IPO后未来规划的重要组成部分。SpaceX预计以约1.75万亿美元的估值筹集约750亿美元,这将是史上规模最大的IPO。

    所以这笔算力交易表面上是一笔商业租赁,实际上也可能是谷歌在IPO前夕给SpaceX递的一个大红包,确保这家公司的财务数据在上市前尽可能好看。每月9.2亿美元,三年下来就是超过330亿美元。这笔钱对其他公司来说是天文数字,对谷歌的资产负债表来说,可能只是一笔”战略性支出”。

  • Headroom:16.4k Stars!LLM上下文压缩层,最高省95% token消耗

    Headroom:16.4k Stars!LLM上下文压缩层,最高省95% token消耗

    用AI Agent干活,token消耗像流水。工具输出一多,日志一长,上下文就爆了。Headroom就是来解决这个问题的。

    Headroom

    项目是什么

    Headroom是一个面向AI Agent的上下文压缩层,在内容进入LLM之前先做压缩处理。工具输出、日志、RAG检索结果、代码文件、对话历史,统统可以压。官方数据说能省60-95%的token,而且答案质量不降。

    安装要求和过程

    要求Python 3.10以上。安装本身很简单:

    # 全量安装(推荐)
    pip install "headroom-ai[all]"
    
    # Node.js版本
    npm install headroom-ai
    
    # Docker
    docker pull ghcr.io/chopratejas/headroom:latest
    

    如果你想按需安装,可以只装指定模块:[proxy]、[mcp]、[ml]、[code]、[memory]、[relevance]、[image],不用全量。装完直接 headroom wrap claude 就能把Claude Code包起来用,零代码修改。

    核心功能

    • 三种接入模式:当作Python/TypeScript库直接调用 compress(),或者跑一个本地代理让任意应用零改动接入,或者直接wrap主流AI编码工具(Claude Code、Cursor、Aider、Copilot都支持)。
    • MCP服务器模式:提供了 headroom_compressheadroom_retrieveheadroom_stats 三个工具,可以接进任何MCP客户端。对用Claude Desktop或者Cline的人很方便。
    • 可逆压缩(CCR):原始内容不会删,LLM觉得信息不够的时候可以通过工具调用把原始内容拿回来。不是有损压缩,是”按需取用”。
    • 跨Agent共享内存:多个Agent(Claude、Codex、Gemini)可以共享同一套上下文存储,自动去重。做多Agent协作的人会喜欢这个功能。
    • 自动学习:跑一下 headroom learn,它会去分析失败的会话,把修正规则自动写进 CLAUDE.md / AGENTS.md 这些配置文件。相当于Agent自己进化。

    典型使用场景

    先看数据。官方跑了一些真实工作负载的压缩测试:

    工作负载类型 压缩前token 压缩后token 压缩率
    代码搜索(100条结果) 17,765 1,408 92%
    SRE故障排查 65,694 5,118 92%
    GitHub Issue分类 54,174 14,761 73%

    实际场景里,最爽的是这两个:

    第一,长日志排查。SRE场景里把6万多token的日志压缩到5千多,压缩率92%,而且LLM给出的排查结论和质量没差。这意味着你可以用更便宜的模型、更短的上下文窗口,处理同样复杂的任务。

    第二,RAG场景。把检索回来的大量chunk先压缩再塞给LLM,原本只能放5条chunk的上下文窗口,现在能放20条。检索质量上去了,token消耗反而下来了。

    为什么推荐它

    我试过几个类似的方案,RTK、lean-ctx,还有OpenAI自己出的压缩方案。Headroom最打动我的是”可逆压缩”这个设计。很多压缩方案是单向的,压完原始信息就没了,LLM判断需要细节的时候拿不到原文。Headroom的CCR机制让LLM可以按需取回原始内容,这个设计很聪明。

    另外就是接入成本真的低。如果你用的是Claude Code或者Cursor,一条命令 headroom wrap claude 就搞定,不需要改代码,不需要重新配置,直接生效。对于已经用上这些工具的人来说,几乎是零成本的优化。

    本周Headroom在GitHub周增长榜排第一,新增了13,000+ star。16.4k的总star数不算高,但增长曲线很陡,说明用过的人都在往上加。这种”开发者口碑传播”的项目,通常比营销驱动的项目更值得跟。


    GitHubgithub.com/chopratejas/headroom
    官网文档headroom-docs.vercel.app
    协议:Apache 2.0(可商用)