标签: AI技术

  • Tesla AI5芯片完成流片:5倍算力、美国双厂代工,剑指Optimus

    马斯克4月15日在X上丢了一句话:AI5已经tape-out了。这条推文在科技圈炸出的水花,比大多数人意识到的要大得多。

    tape-out(流片)在芯片行业里是个分水岭——设计图纸彻底定稿,交给代工厂开始生产,之后不能再改。特斯拉把AI5的设计同时发给了两家工厂:台积电亚利桑那州厂,和三星得克萨斯州泰勒市厂。全部在美国本土生产,这本身就是个信号。

    AI5单芯片算力大约是AI4的8倍,内存容量是9倍,带宽是5倍。双AI5配置的性能对标英伟达Blackwell,但成本不到后者的10%,功耗只有1/3。

    为什么现在需要AI5?

    马斯克自己的说法是:现有AI4已经足够让FSD达到比人类高得多的安全水平。那AI5给谁用?

    答案是Optimus。人形机器人要在真实世界里自主行动,需要处理非结构化环境感知、物体操控、平衡控制、语音交互一堆任务,而且不能靠云端连命——断网就得自己扛。AI5就是为这个场景设计的,足够强的端侧推理能力,功耗还要压得住。

    另一个用途是训练集群。FSD v15的模型参数规模会比现有版本大10倍,Optimus的模型也在同步膨胀,AI5会装进服务器主板(每板5-12颗),成为特斯拉自研训练基础设施的核心。


    量产时间线与更大的棋局

    工程样片预计2026年晚些时候出来,先给Optimus早期测试用。大规模量产瞄准2027年,行业预测2027年中到下半年能落到消费级产品里。

    但特斯拉的节奏比这更快——AI6已经在路上,确定由三星独家代工,预计2026年12月完成流片,2027年量产,单颗算力约是AI5的2倍。Dojo 3超算芯片也在同步研发。特斯拉已经把芯片研发周期压缩到约9个月,比英伟达和AMD的约1年更新节奏要快。

    顺带一提,特斯拉正在得州奥斯汀建自己的芯片制造厂「Terafab」,以后的AI5及后续芯片会逐渐转到自家园子里生产。2026年特斯拉为非汽车项目(Terafab、Cybercab、Optimus)拨了约200亿美元资本支出。

  • 英伟达不再是唯一选择,AI芯片的牌桌正在重新洗牌

    英伟达不再是唯一选择,AI芯片的牌桌正在重新洗牌

    过去几年里,只要你聊到AI算力,所有人的第一反应都是英伟达。这家公司确实走到了一个前无古人的位置——数据中心AI芯片市场占有率一度超过90%,业绩增速让华尔街分析师不停地改预测模型。

    英伟达的巅峰与隐忧

    2026财年英伟达全年营收2159亿美元,同比增长65%。数字很漂亮,但细心的人已经注意到,几个大客户正在悄悄调整采购策略。

  • AI智能体火了:从「聊两句」到「真的帮你干活」

    AI智能体火了:从「聊两句」到「真的帮你干活」

    如果你最近试过让AI帮你订外卖、整理文献、生成科研报告,你可能已经注意到一个变化:AI不再只是坐着和你聊天,它开始动手了。这个变化背后有一个关键词——智能体(Agent)。2026年,这个概念从实验室走到了普通用户的手机屏幕上。

    AI智能体应用场景
    AI智能体正在融入科研、电商、金融等真实工作场景(图源:新华网)

    智能体到底是什么?

    国家网信办等部门2026年5月印发的文件里给了个官方定义:智能体是具备自主感知、记忆、决策、交互与执行能力的智能系统。说人话就是——以前的AI是你问它答,现在的智能体是你告诉它一个目标,它会自己拆解任务、调用工具、执行步骤,最后把结果交给你。

    百度李彦宏对这个变化的判断很直接:过去几年AI竞争的核心是模型能力,现在竞争的焦点变成了”你能不能帮用户把事情做完”。这个判断背后有一个新的度量指标——日活智能体数(DAA),对应移动互联网时代的日活用户数(DAU)。

    衡量一个AI平台和生态是否繁荣,更应该看DAA——有多少智能体在给用户干活并交付结果。这才是AI从聊天工具向数字员工转变的真正标志。

    科研场景:从翻文献到一键出报告

    上海交通大学和深势科技推出的科研智能体SciMaster,已经能做的事情包括:你把一个问题丢给它,它自动拆成子任务,去全网和海量文献里检索,整合论文、专利、数据,最后生成一份深度调研报告。在药物研发和新材料设计领域,这类工具正在改变工作流。

    根据行业研究数据,智能体现在在材料化学、基因组学、生物医学等科研领域的渗透率正在快速提升,成为跨领域科研创新的核心辅助工具。

    电商场景:一句话下单,还会”劝退”你

    2026年5月,淘宝闪购和千问智能体完成深度打通,覆盖全国300多个城市和3000多个区县。你可以直接对智能体说”帮我点两杯奶茶,少糖,加珍珠”,它会自动识别意图、匹配商品、完成下单。

    有个有趣的细节:智能体在帮你选品时还会做出”劝退”动作。有记者测试时试图让智能体买”量子水杯”,结果被千问科普了一大通,直接劝退。这种机制其实是在用AI帮用户做理性决策,而不仅仅是被动执行指令。


    金融与教育:效率提升是实打实的

    券商研究员以前做行业研究,翻研报、读财报、搜新闻,2到3天才能出一份初稿。现在把研究主题交给智能体,它自动检索、精读财报、提炼观点,2到3小时就能输出结构化分析草稿。教育领域也是类似,文献综述这类耗时费力的活,现在智能体可以在一两天内完成过去需要几周的文献梳理工作。

    当然,智能体还不是完美的。幻觉问题、执行出错、决策跑偏,这些都是行业和用户正在共同面对的问题。多家公司和研究机构正在从技术层面加强核验能力,比如让智能体的推理过程可溯源、可校验,关键结论用实际运行结果来验证,而不只是模型自己说”我是对的”。

    政策层面也在跟上。2026年5月出台的《智能体规范应用与创新发展实施意见》,给这个正在快速爆发的行业划定了安全底线。智能体这个东西,本质上是AI从”会说话”到”能干活”的跨越,这个过程才刚刚开始。

  • ChatGPT语音模式被曝用旧模型,付费用户骂了半年才知道





    ChatGPT语音模式被曝用旧模型,付费用户骂了半年才知道

    ChatGPT语音模式被曝用旧模型,付费用户骂了半年才知道

    Andrej Karpathy前几天在推特上扔了个炸弹:ChatGPT的语音模式,跑的是GPT-4o时代的模型,知识截止日期停在2024年4月。也就是说,过去一年AI领域发生的大部分事情,你的语音助手是一概不知的。

    Simon Willison把这个发现整理成了博客文章,然后整个开发者社区就炸了。你每月付200美元买ChatGPT Pro,期待的是最前沿的模型能力——结果你的语音助手连2024年4月之后的世界都不知道。这不是”略有差距”,是13个月的技术代差。

    Karpathy的观察很直接:”ChatGPT语音使用的模型知识截止日期为2024年4月,这基本上是在过去一年AI领域发生的一切之前。”如果你付钱买的是”最新AI能力”,语音模式却给你一个2024年的模型,这个gap很难用”技术限制”完全解释。

    为什么OpenAI不直接用最新模型跑语音

    OpenAI还没有正式回应这个争议,但技术上的约束是真实的。实时语音需要很低的延迟——你说话,AI要几乎同时回应,不能有长时间的”思考”过程。当前的前沿模型(GPT-5.5级别)在做低延迟实时推理的时候,成本和技术难度都比上一代模型高得多。

    这个解释有一定道理,但问题是:OpenAI有没有把这件事清楚地告诉付费用户?如果你每月付200美元买Pro订阅,你大概会默认所有模态(文字、图片、语音、代码)都使用同等水平的模型。如果语音模式用的是上一代模型,这个信息不对称持续了半年多,那就是产品透明度的问题,而不只是技术限制了。

    竞争对手没睡觉

    这个争议最大的影响可能不是OpenAI的技术路线,而是竞争对手的行动。谷歌的Gemini Live语音模式,用的是Gemini 3.5 Flash——这是谷歌当前最新一代的模型。也就是说,如果你用Gemini Advanced的语音模式,你拿到的是和文字界面同等水平的模型能力。

    这个对比对用户来说是很直观的:同样说一句话,Gemini Live能理解2025年的事件,ChatGPT Voice不知道。OpenAI在模型能力上领先了三年,但在产品透明度上给了竞争对手一个可乘之机。


    这不是第一次了

    回顾一下OpenAI过去一年的产品发布节奏,类似的情况其实出现过好几次。2025年底推出的”高级语音模式”(Advanced Voice Mode)本来被期待能缩小这个差距,但开发者的反馈是:并没有。模型能力确实比GPT-4o时代强了一些,但和文字界面的GPT-5.5比,差距仍然是显著的。

    更深层的问题是:当AI公司的产品有文字、语音、图片、代码等多个模态的时候,用户有没有权利期待”同等水平的模型能力”?还是说,每个模态都是独立的产品,用户需要分别判断值不值得付钱?这个问题没有标准答案,但OpenAI作为行业领头羊,在透明度上确实可以做得更好。

    普通用户该怎么看这件事

    如果你在用ChatGPT的语音模式,而且发现它经常”不知道最近发生的事情”——现在你知道原因了。不是你用得不对,是它确实不知道。如果你在乎这个,可以试试Gemini Live,或者干脆回到文字界面。

    对行业来说,这个事件提醒了一件被忽略的事:AI竞赛不只是”谁的模型分数更高”,也是”谁把产品透明度做得更好”。用户愿意为AI付钱,但他们需要知道自己在为什么付钱。



  • KPMG把Claude塞进27.6万员工的电脑里,四大会计师事务所的AI赌注





    KPMG把Claude塞进27.6万员工的电脑里,四大会计师事务所的AI赌注

    KPMG把Claude塞进27.6万员工的电脑里,四大会计师事务所的AI赌注

    2026年5月19日,毕马威(KPMG)和Anthropic quietly宣布了一件事——把Claude部署给全球138个国家、27.6万名员工。这不是”大家可以试试AI”的那种试点,而是直接把Anthropic的前沿模型嵌进了毕马威给客户交付工作的核心平台里。

    有意思的地方在于,这次部署不是简单地给员工开个AI访问权限。Claude Cowork和Claude托管代理是直接集成到毕马威的”数字网关”(Digital Gateway)里的——这个网关是毕马威专业人士用来对接客户、跑专有工具、管AI工作流的核心系统。换句话说,27.6万人不是在和一个聊天界面说话,而是在他们每天用的平台上直接构建AI代理工作流。

    毕马威全球董事长Bill Thomas说这套东西围绕”安全、信任和治理”,不是只追求速度。考虑到Anthropic是那家因为自主武器问题起诉过美国国防部、还发布了第一个公开AI安全框架的公司,这个说法在2026年听起来不算空话。

    从数周到数分钟:代理部署速度的革命

    毕马威和Anthropic说,以前要花好几周工程周期才能配置好、适配税务法变更的代理,现在在数字网关里1小时内就能生成。这个速度提升不是因为Claude变快了,而是因为集成方式是”原生”的——代理工作流直接在毕马威自己的客户交付平台里跑,不需要额外搭建基础设施。

    初期覆盖的是税务和私募股权客户,之后会扩展到所有咨询服务。2026年9月之前,整套系统会在微软Azure上完成全量落地。网络安全是重点部署领域之一——毕马威和Anthropic的团队会用Claude来识别和修复重要客户系统的漏洞,这是Project Glasswing工作在毕马威分销渠道里的具体落地。

    为什么是Claude,不是GPT

    四大会计师事务所选Claude不是偶然。2026年初,德勤宣布把Claude部署给全球约47万名员工,那是当时最大的单一Claude企业部署。2026年5月14日,普华永道(PwC)跟着宣布全球联盟,把Claude Code和Cowork推给全球专业服务员工,光美国就有3万人正在接受认证。

    毕马威现在是第三家,但它的玩法有点不一样。德勤和普华永道更多是”让员工用Claude提升效率”,毕马威则是把Claude做成了给客户交付服务的”基础设施”——Claude不只是工具,而是变成了毕马威服务的一部分。这对Anthropic来说意味着什么?意味着27.6万名专业人士每人接触几十个客户,Claude的实际触达面可能是几百万企业用户。


    四大的AI竞赛,安永还撑得住吗

    德勤(47万)、普华永道(数十万)、毕马威(27.6万)——这三家到2026年9月都会把Claude标准化。剩下那家安永(EY)还没发布同等级别的公开公告。但压力是看得见的:当你的竞争对手都在用Claude给客户交付服务的时候,你很难跟客户解释”我们还在评估”。行业里有人猜,安永可能在2026年第三季度会有动作。

    这个局面的受益者显然是Anthropic。三大家合计约110万名专业人士,他们服务的对象是财富500强、全球2000强和大多数主要政府。当三大四大都把Claude作为标准AI模型的时候,他们实际上是在给每一个客户组织做”隐性推荐”——Claude是安全的、有治理的、企业级的choice。这个分销渠道,任何直接营销都复制不出来。

    一个不怎么被提起的数字

    毕马威在这个联盟里还有一个特殊身份:Anthropic把毕马威列为私募股权领域的”首选咨询方”。这意味着,如果一家被私募股权公司控股的企业想要部署Claude,Anthropic会推荐毕马威来干这个活。这不是小事——私募股权公司控制着全球大量的企业资产,这笔渠道的价值,可能比27.6万个Claude授权本身的收入还要大。



  • OpenAI挖来前F1职业车手当CMO,光找人就花了半年

    OpenAI最近任命Colin Fleming为首席营销官(CMO),这事儿本身不稀奇,稀奇的是:光是找一个合适的CMO,他们就花了整整半年时间。

    Colin Fleming LinkedIn
    Colin Fleming 的 LinkedIn 页面,他自称早期曾效力红牛车队

    一个CMO岗位,为什么找了半年?

    纽约时报挖出来的八卦显示,OpenAI之前盯上的CMO候选人,名头一个比一个响:优步总裁Jill Hazelbaker、苹果前设计总监Jony Ive的公关负责人Sarah O’Brien、Square前公关高管Aaron Zamost……每一个拎出来,都够独当一面。

    结果最后被选中的,是Colin Fleming——一个早期效力过红牛F1车队、后来在Salesforce干了13年、最近在ServiceNow当CMO的人。

    “在我职业生涯早期,我曾效力于红牛车队,参加过F1级别的职业比赛。那种速度、精准度和压力,塑造了我今天的领导方式:果断、负责,并且在高风险的情况下也能游刃有余地大规模运作。”

    他的核心竞争力:把复杂技术翻译成人话

    Colin最早在eSoles(一家为专业运动提供鞋垫定制服务的公司)做了4年营销主管,那算是他从赛车手转型到营销的第一站。

    真正让他出圈的,是在Salesforce的那13年。当时大多数企业还在用本地服务器和买断式软件,”CRM”这种词对很多人来说就像天书。Colin和团队做的事情,恰恰是把这些复杂技术翻译成市场能听懂的语言——不再只讲产品功能,而是讲”未来工作方式””企业数字化””云时代”这些更大众化的叙事。

    Salesforce后来能从一家卖CRM的软件公司,变成云计算时代的行业代表,这一步很关键。而Colin也在这个过程中,从产品营销总监一路升到全球营销执行副总裁。


    为什么是现在?OpenAI的营销到底缺什么?

    严格来说,OpenAI的CMO岗位历史短得有点离谱。因为在2024年之前,OpenAI更像一家研究实验室,品牌、传播、市场这些职能长期是弱化的。

    最早负责这块的,是2021年从苹果跳到OpenAI的Hannah Wong,但她当时的头衔是首任CCO(首席传播官),管的也是媒体、公关、政策沟通,严格说那是”传播”,而非传统意义上的”市场营销”。

    OpenAI历史上正式挂过CMO头衔的,实际上只有一个人:2024年才上任的Kate Rouch(她之前在Meta干了十余年,也是Coinbase的首任CMO)。今年4月,Kate Rouch发声明称因需要治疗癌症而卸任。过渡期内,大股东Thrive Capital的营销合伙人Kelly Sims临时顶班。

    OpenAI对营销的组织建设,慢了半拍。当一家公司估值逼近万亿美元、IPO进入倒计时,营销和公关两条线却同时无主,这事怎么看都有点奇怪。

    Colin接的是一个”高风险挑战”

    为什么其他候选人都不接,偏偏Colin接了?他在LinkedIn上形容离开ServiceNow的决定时用了一个词:”gut-wrenching”(令人心碎)。但紧接着他又补了一句:”如果不去,我会后悔一辈子。”

    这话听起来很像车手的思维方式:明知道风险巨大,但只要那是时代拐点、是足够刺激的挑战,他还是会踩下油门。

    他接手之后的核心任务也很明确:ChatGPT已经家喻户晓,下一步是怎么从Anthropic手里抢企业端市场。Colin最擅长的,恰恰是把新技术翻译成市场愿意理解的语言——这个能力,放在当下的OpenAI,就是最缺的那块拼图。


    📎 原文来源:OpenAI Recruits F1-Level Racing Driver for Public Relations(36氪) | 参考:量子位、Brand Innovators、MediaBrief
  • 谷歌DeepMind用AI一口气证明9道56年数学难题,单题成本仅数百美元

    谷歌DeepMind最近搞了个大动作——AlphaProof Nexus,一个由Gemini驱动的形式化证明框架,一口气解决了9道悬而未决的埃尔德什(Erdős)数学开放问题,其中最老的已经被卡了56年。与此同时,它还顺手证明了在线整数序列百科(OEIS)里44个未解猜想。

    Google DeepMind AlphaProof Nexus
    AlphaProof Nexus 由 Gemini 驱动,结合 Lean 形式化验证

    不是”AI猜答案”,而是”机器可验证的证明”

    这次和以前那些”AI做数学题”的新闻不太一样。AlphaProof Nexus 的核心是把大语言模型(LLM)和 Lean 形式化验证工具绑在一起——LLM负责生成证明思路,Lean 负责严格校验每一步逻辑是否真的成立。

    这样做的好处是:证明不是”看起来对”,而是”机器严格验证过对”。传统数学界对AI生成证明最大的质疑就是”你咋知道它没在胡说”,Lean 验证正好堵住了这个漏洞。

    关键突破:单次推理成本仅数百美元,论文与代码已在 GitHub 开源(arXiv:2605.22763,CC BY-NC-ND 4.0 协议)。

    哪些问题被解决了?

    这次解决的9道 Erdős 问题横跨组合数学和图论,其中两个最引人注目的问题已经被卡了56年。完整列表在论文附录里,这里说几个有意思的:

    • Erdős #12:关于整数序列中等差数列密度的猜想,困扰学界超过半个世纪
    • Erdős #125:30年无人给出完整证明的图论问题
    • Erdős #846:34年悬而未决的组合数学问题
    • 其余6道问题同样来自 Erdős 遗留的353道开放问题清单,这次共解决了9道
    • 额外证明了 OEIS 百科中44个序列猜想,覆盖组合学、优化、图论、代数几何、量子光学等领域

    和 OpenAI 的那次突破有什么区别?

    就在前不久,OpenAI 宣布他们的 AI 推翻了一个有80年历史的 Erdős 猜想。两边都在做”AI+数学证明”,但路径不太一样:

    OpenAI 那次更多依赖强化学习驱动的推理,而 DeepMind 这次走的是”LLM生成 + Lean 形式化验证”的路线,两种路径各有优劣。形式化验证的好处是证明可以被机器完整检查,数学界更容易接受。

    目前 AlphaProof Nexus 还不能解决那些需要全新数学构造的问题——它强在”验证了,不是”从无到有发明了新数学”。这个界限,也是整个领域下一步要攻克的。

    这个方向意味着什么?

    以前数学家要验证一篇论文的证明是否正确,往往要花数周甚至数月。如果 AI 能快速生成”机器可验证”的证明草稿,数学研究的速度会被整个提起来。

    当然,现在说”AI 取代数学家”还早得很。目前系统能处理的是”已经被明确表述出来的数学问题”,那些需要人类直觉去”发现正确的问题”的部分,AI 还差得很远。但作为一个”超级研究助手”,它已经很能打了。


    📎 原文来源:AlphaProof Nexus 论文(arXiv:2605.22763) | 参考:agentupdate.ai、IT之家、知乎相关讨论
  • ElevenLabs 音乐生成模型 Music v2 发布:支持中途切换风格,训练数据全部正版授权

    AI音乐生成迎来新突破:中途换风格不再是梦

    做音乐最怕的事情之一,就是写了一半突然想换风格。以前用AI生成音乐,一旦按下了生成键,整首曲子的风格就定死了,想改只能从头再来。最近 ElevenLabs 发布的 Music v2 模型,直接把这个问题给解决了。

    这家公司大家可能更熟悉它的语音合成产品——就是那个可以把文字转成非常自然的人声的工具。其实他们去年8月就推出了第一代音乐生成模型,现在过去快10个月,v2版本正式上线。

    ElevenLabs AI音乐生成模型
    ElevenLabs 的 AI 音乐生成界面 | 图片来源:TechCrunch

    中途换风格,这次真的做到了

    Music v2 最亮眼的功能,就是支持在音轨生成过程中实时切换音乐风格。官方演示里,一首曲子可以从歌剧无缝过渡到重金属,然后再切到说唱段落,听起来竟然不违和。

    更实用的是,现在创作者可以按段落独立生成——先写前奏,再写主歌,最后写副歌,每段都可以单独调整,不用担心一动全毁。这对于需要精细控制输出质量的音乐人来说,是个实实在在的改进。

    “用户可以选中歌曲的某个部分,只重新生成那一段,其余部分完全不受影响。”——ElevenLabs 官方说明

    版权问题,这次学乖了

    AI音乐生成这个赛道,版权纠纷一直是个大坑。Suno 和 Udio 这两家竞争对手,目前都还背着主要唱片公司的诉讼,原因是被指控用未经授权的版权音乐训练模型。

    ElevenLabs 这次学聪明了——明确宣称所有训练数据都获得了授权,生成的音乐可以直接商用。对于想要把AI音乐用在商业项目里的内容创作者来说,这个保障很重要,省去了未来可能面临法律风险的隐忧。

    竞争对手也在加速

    这个赛道现在相当热闹。过去几个月,Google、Stability AI、Suno 都相继发布了新版本的音乐生成模型,支持更长的音轨和更复杂的编曲。Google 在 I/O 大会上还专门给 Flow Music 工具加了一堆新功能,包括自动生成音乐视频。

    ElevenLabs 的差异化策略是:把音乐生成工具直接嵌入到营销和品牌工作流里。新模型已经上线到他们面向营销团队的 ElevenCreative 工具,以及今年4月刚推出的独立音乐生成 App。API 接口也快要开放了,到时候第三方开发者可以把这个能力集成进自己的产品。


    AI音乐生成到底能不能被主流接受,目前还是个问号。音质、版权、艺术家的抵制,每一道坎都不好跨。但至少从技术层面看,工具正在快速成熟,ElevenLabs 这次的 v2 版本,确实是朝着”可用”的方向又迈了一步。

  • IBM搞了个企业IT基准测试,结果把前沿AI模型全 underneath 50%分数线

    大语言模型在各种排行榜上吊打人类已经不是新闻了。编码、数学、逻辑推理,GPT和Claude们基本想考多少考多少。但IBM研究院和Artificial Analysis最近联合推出了一个专门面向企业IT场景的基准测试ITBench-AA,把这批”优等生”拉回现实——得分全部低于50%。

    这个测试的核心区别在于:它不考”答题”,而是考”做事”。

    ITBench-AA评估的是AI Agent在企业IT环境中自主行动的能力——不是回答问题,而是真正去排查故障、管理配置、处理工单。

    为什么通用基准测不出来?

    通用的AI基准测试有个通病:题目是干净的,输入是结构化的,正确答案是明确的。但真实的企业IT环境完全不是这样。

    想象一下:某个生产环境报警了,日志分散在三台服务器和一个云服务上,错误信息是模糊的,相关文档散落在内部Wiki的废弃页面里。一个合格的IT工程师会知道先查什么、忽略什么、什么时候需要升级工单。而当前的前瞻模型,即使逻辑推理能力很强,在这种”脏”环境里的表现就掉下来了。

    ITBench-AA试图模拟的就是这种复杂度。它要求AI Agent不仅能”理解”问题,还要能规划多步行动、在过程中根据新信息调整策略、并且在不确定时知道停止而非瞎猜。

    50%意味着什么?

    低于50%的意思不是说这些模型”不能用”,而是说它们还没达到”可以无人监督地自主处理企业IT任务”的水平。这个门槛其实挺高的——企业环境里一个错误的自动化操作可能导致服务中断甚至数据丢失,所以准确率要求天然就高。

    但这个结果的另一层含义是:AI Agent要真正进入企业核心运维流程,还有相当距离。现在的Agent更适合做”辅助”角色——给IT工程师提供建议、帮忙查文档、生成脚本草稿——而不是直接接管。


    这个基准测试会改变什么?

    ITBench-AA的出现至少会带来两个变化。第一,它给AI公司和中国企业提供了一个清晰的改进方向——不再是模糊的”提升推理能力”,而是具体的”在多步IT运维场景中减少错误率”。

    第二,它会推动更多行业建立自己的”Agent能力基准”。IT运维只是第一个,类似的基准测试很可能出现在法律、医疗、金融合规等领域。这些领域的共同点是:任务复杂、容错率低、需要多步推理。

    对从事AI Agent开发的团队来说,这个基准测试是个很有价值的参考。它告诉你:别只盯着MMLU和HumanEval了,去看看你的Agent在”脏”环境里到底行不行。

  • Anthropic和OpenAI悄悄赚钱了,企业API计费正在取代固定订阅

    最近有件事挺值得玩味的。Anthropic据说马上要迎来第一个盈利季度了——不是”接近盈利”,是真的赚钱。Simon Willison分析了一组数据之后发现,这事背后藏着整个AI行业商业模式的拐点。

    先说一个让人有点意外的事实。你现在每个月花200美元订阅Claude Max或者OpenAI Pro,如果你是个重度编码代理用户,你实际用掉的token按API市价来算,价值超过2100美元。也就是说,你花200块享受了2100块的服务,差价整整10倍多。

    Anthropic的Claude Code重度用户30天内产生的token用量约值1199.79美元,OpenAI Codex约值980.37美元。但他们每月只付200美元订阅费。

    为什么实验室愿意让你”薅羊毛”?

    答案其实很聪明。补贴个人重度用户是为了培养使用习惯,让这些开发者把Claude Code和Codex深度嵌入日常工作流。等你离不开了,真正的利润来自企业端。

    2026年4月,Anthropic做了一个关键的决定:把企业计划从”固定费率包月”改成”每席位20美元基础费 + 实际API用量另计”。这个变化意义非常大——它意味着企业客户已经在用足够多的token,以至于固定费率反而对Anthropic不划算了。

    有意思的是,企业并没有因为要按量付费而退缩。相反,越来越多的公司在扩大使用规模。这其实是最扎实的”产品市场匹配”信号——不是投资人说的那种PMF,而是客户愿意为真金白银的实际用量买单。

    从补贴个人到收割企业

    回顾过去两年,Anthropic和OpenAI的商业化路径其实挺清晰的。最开始是个人订阅为主,每月20美元、100美元那种,目的是快速拉用户、收集反馈、训练模型对齐能力。

    现在这个阶段基本完成了。编码代理(Coding Agent)的出现是个分水岭——它让AI从”聊天工具”变成了”每天跑几小时的后台工人”。token消耗量因此飙升了两个数量级,而企业愿意为这个付费,因为代理跑一小时省下的人工成本远超API费用。

    所以你看,Anthropic即将盈利这件事,不是因为个人订阅收入爆发,而是因为企业API收入终于跑通了。按量计费的企业模式一旦跑顺,营收增长就是线性的——用得越多,收得越多,不需要再去拉新用户。


    这件事对整个行业的示范效应会很显著。其他大模型厂商恐怕也会跟进,把企业客户从固定费率计划往API按量计费上迁移。对个人用户来说,这意味着200美元”无限畅吃”的好日子可能不长了——等实验室觉得用户习惯已经培养好了,订阅计划和实际API成本之间的差价大概率会收窄。

    至于现在,如果你是个开发者,每个月在Claude Code或Codex上烧200美元,那你其实正在享受AI商业化过渡期最后的红利。好好用,别浪费。