分类: AI资讯

聚焦前沿人工智能动态,速览行业热点、技术突破、产业风向与实用 AI 干货,紧跟科技潮流,第一时间掌握 AI 最新趋势。

  • Claude Opus 4.8来了:一口气跑1000个子智能体,代码审查聪明4倍

    昨天(5月28日),Anthropic把Claude Opus 4.8扔了出来。这次更新的重点很明确:让AI在写代码这件事上更像一个能独立工作的资深工程师,而不是一个需要你步步盯着的高级补全工具。

    代码缺陷少4倍,这才是最值钱的地方

    Opus 4.8最核心的改进,是代码质量。Anthropic说,这个模型生成的代码里有缺陷但没被标记出来的概率,比上一代低了大约4倍。对那些把AI辅助编程塞进生产流程的团队来说,这个改进直接等于少掉很多坑——未检测到的代码缺陷,在 downstream 产生的修复成本是 exponentially 增长的。

    基准测试的数据也佐证了这一点:代理编码得分从64.3%爬到了69.2%,使用工具的多学科推理从54.7%提到57.9%,知识工作得分从1753分涨到1890分。数字看起来增幅不大,但在AI模型迭代里,这种全方位的几个百分点提升,往往意味着实际使用中”可用”和”好用”之间的差距。

    Anthropic对Opus 4.8的描述是:”更敏锐的判断力、更诚实地展示其进展,以及比前代模型更长时间独立工作的能力。”这三个点,其实正好对应了企业开发者对AI编码助手最头疼的三个问题:判断不准、爱装懂、干两分钟就得人工介入。

    动态工作流:1000个子智能体一起干活

    这次最炸裂的功能叫”动态工作流”(Dynamic Workflows),目前在research preview阶段。简单说,就是Claude现在可以写编排脚本,生成并管理几十到几百个并行子代理,从任务启动到完成全程自动跑。

    上限是每个运行最多16个并发子代理、总共1000个子代理。实际场景是什么样子?比如你要迁移一个几十万行代码的代码库,以前你得手动拆任务、分配、汇总,现在Opus 4.8可以直接把整个代码库迁移从启动做到生成可合并的拉取请求,中间不用你手动协调。

    这个功能一旦正式上线,对大型代码库维护团队来说是个.game changer。不需要额外写编排逻辑,不需要手动拆解任务,模型自己决定怎么把大任务碎成小任务、怎么并行跑、怎么汇总结果。

    快速模式:快2.5倍,便宜3倍

    Anthropic还把快速模式(Fast Mode)大幅升级了。新版本的快速模式比标准推理快大约2.5倍,而成本只有之前Opus模型快速模式的三分之一。定价是每百万输入token 10美元、每百万输出token 25美元。

    新的”努力控制”(Effort Control)设置也值得提一下:用户可以调整Claude在任务上投入的计算量。Opus 4.8默认是”高努力”,Anthropic认为这对大多数工作负载来说是最佳平衡。如果你要处理的任务比较轻量,可以调低努力级别来省钱。

    已经在哪能用

    从昨天开始,Opus 4.8已经在以下平台可用:

    • Claude API——直接给开发者和平台构建者用
    • Amazon Bedrock——集成到AWS基础设施里
    • Google Cloud Vertex AI——GCP托管AI服务中可用
    • Microsoft Foundry——通过Microsoft的AI开发平台访问

    已经在生产环境跑Opus 4.7的团队,迁移基本无感——模型标识符更新一下就行,价格没变,这也是Anthropic故意做的”升级成本中性”设计。

    下一步:Mythos级模型已经在路上

    Anthropic已经确认正在开发新一代”Mythos级”模型,会在”未来几周内”发布。目前关于架构、能力基准或定价的细节都没披露,但Opus 4.8看起来更像一个短期过渡版本,而不是一个长周期旗舰。这也延续了Anthropic在2025年和2026年加速模型更新的节奏——不再憋大招,而是快速迭代、快速铺开。

    对于每天都在跟AI编码助手打交道的开发者来说,Opus 4.8最直观的感受可能就是:它犯傻的频率低了,能独立跑的时间长了,而你需要手动介入的次数——终于开始明显减少了。


  • OpenAI基金会砸2.5亿美元,帮劳动者应对AI冲击

    前几天OpenAI基金会扔出一个重磅消息:拿出2.5亿美元,专门帮那些被AI波及的劳动者和社区做转型。这笔钱是去年OpenAI重组后,那个控制OpenAI的非营利组织拿到1300亿美元股权之后的第一次大动作。

    1300亿美元的非营利巨头

    去年OpenAI重组的时候,很多人没注意到一个细节——非营利组织保留了OpenAI营利性业务26%的股权,按当时估值大约是1300亿美元。一夜之间,这个原本只是小打小闹的赠款机构,直接变成了科技圈最富有的慈善组织之一。

    今年3月,OpenAI公开承诺未来12个月通过基金会至少投入10亿美元,重点盯住生命科学研究、AI素养、公民建设和经济机会这几个方向。而这次的2.5亿美元,就是这10亿美元承诺里第一批真正拨出去的钱。

    OpenAI基金会在声明里说得很直白:”当前的变化速度意味着我们正确应对的窗口比习惯的要短,而错误应对的代价是巨大的。”这句话背后,是对AI冲击劳动力市场紧迫性的真实认知。

    钱到底花在哪

    基金会把这2.5亿美元拆成了三块,跟传统慈善机构很不一样——他们不仅要给钱,还要自己下场做项目。

    第一块是研究基础设施。他们觉得目前缺的是独立、严谨的劳动力市场影响分析,太多炒作和恐慌,太少实打实的数据。基金会要自己建团队,做中立的预测和研究。

    第二块是直接劳动者支持。目标群体很明确:客服、金融后台运营、入门级软件岗位——这些已经被AI工具大量替代的领域。基金会会资助那些给失业劳动者提供转型培训的组织。

    第三块是AI驱动的经济模拟。说白了就是用计算建模,画出区域经济在国家层面随着AI能力扩展可能发生的变化图谱。产出这些数据,是给政策制定者、教育者和雇主用来规划培训和转型路径的。

    Sam Altman的态度转变

    有个细节挺有意思。Sam Altman今年早些时候还跟伴侣Oliver Mulherin一起签了”捐赠誓言”,但他最近几个月公开表态软化了不少。他承认:”我很高兴我错了——我曾以为到这个时候,入门级白领工作的消失会比实际发生的影响更大。”

    这种软化,跟基金会一边说”失业担忧真实存在”、一边又强调”主动干预窗口正在缩小”的谨慎态度形成了微妙的对照。Altman的个人态度在变,但基金会的行动逻辑没变:先把钱和资源到位,不管AI到底会不会真的消灭大量工作岗位,提前布局总没错。

    现实已经发生了

    基金会这个动作不是凭空来的。最近几个月,已经有一堆公司把裁员和效率措施直接跟AI采用挂钩了。Block和Standard Chartered在近期的裁员公告里明确提到了AI带来的效率提升,说明”AI导致失业”已经不是什么遥远的理论风险,而是正在发生的事。

    这场辩论的核心其实是:AI带来的经济收益,到底会广泛惠及普通劳动者和社区,还是主要归股东和高技能技术人员所有?OpenAI基金会砸这2.5亿美元,等于是在用真金白银表态:他们想成为塑造这个答案的积极参与者,而不只是旁观者。

    接下来的看点就是:这个拥有1300亿美元股权的基金会,能不能真的把规模转化成那些正在经历技术转型的劳动者手上可感知的帮助。首批具体项目公告和合作组织,预计在今年下半年公布。


  • GPT-5.5把316道黑客题做对292道,网络安全评测体系被AI干碎了

    2026年5月27日,澳大利亚研究机构Lyptus Research发布了一份让网络安全圈相当震惊的报告:GPT-5.5在316道进攻性网络安全任务中解出了292道,正确率高达92.4%,直接把这套评测体系干到了”饱和”状态——剩下的24道题不足以支撑有统计意义的能力曲线拟合,评估方法宣告失效。

    换句话说,用来衡量AI黑客有多危险的尺子,先被AI自己弄坏了。

    “我们2025年12月搭建这套测试时,选的还是全球最难的题。2026年3月数据就出现饱和苗头。到5月,饱和已经成为事实。”——Lyptus Research 报告

    316道题,覆盖了黑客的”全科”

    这套评测不是纸上谈兵。316道任务覆盖了7个基准领域,包括漏洞利用、CTF夺旗赛题目、真实CVE漏洞复现三类,每道题都设置了人类安全专家的完成时间作为基线参考。

    GPT-5.5的表现相当于什么水平?Lyptus的评估是:顶级黑客团队的水平。不是脚本小子的水平,是那些能在真实环境中找到零日漏洞、写出可靠利用代码的人的水平。

    更有意思的是Token预算对能力的影响。在最难的基准CyberGym上,GPT-5.5在200万Token预算下正确率只有54.4%;推到5000万Token时,正确率飙升至86.4%——同一个模型,只因为给的算力更充裕,正确率涨了32个百分点。英国人工智能安全研究所(AISI)的独立研究也证实:给到1亿Token时模型能力仍在上涨,还没看到平台期。


    AI黑客能力每5到6个月翻一倍

    Lyptus从2024年开始追踪相关数据,拟合出的增长曲线相当吓人:AI进攻性网络安全能力,每5到6个月翻一倍

    这个”时间地平线”指标衡量的是:一个AI系统完成顶级难度任务平均需要多少时间(通过不断增加算力预算来测量)。2026年初,Claude Opus 4.6的时间地平线是3.2小时,GPT-5.3 Codex是3.1小时。两个月后,GPT-5.5的时间地平线直接拉到了5.1小时——如果放开算力上限让它冲过12小时的测量上限,这条曲线根本画不出来。

    问题在这里:时间地平线方法论原本的假设是,总会有比当前模型能力更难的题来锚定曲线的拐点。但GPT-5.5把所有题都做完了,拐点消失了,曲线无法拟合。评测体系不是被证伪了,是被模型能力的增长速度远远甩在了后面。

    头部厂商已经在”控”了

    意识到这个能力水平意味着什么之后,头部厂商的动作相当迅速:

    • Anthropic:4月发布Claude Mythos Preview,但因为网络安全能力过强,决定不公开发布。配套推出了Project Glasswing,只把模型部署给关键基础设施的防御方使用。
    • OpenAI:给GPT-5.5的网络安全能力评级为”High”(只比最高级”Critical”低一档),所有攻击相关能力均通过”Trusted Access for Cyber”门控,不是谁都能调用。
    • METR独立评估:拟合出Claude Mythos的时间地平线至少为16小时,但无法给出精确点估计——这意味着连独立评估机构都跟不上模型的边界了。

    最麻烦的问题:闭源能力迟早会开源

    Lyptus测量了一个叫”适应缓冲期”的指标:从一个闭源前沿能力首次出现,到同等能力出现在开源模型里,平均时间差是多少。在进攻性网络安全领域,这个数字是5.7到13.1个月

    按当前的速度,Mythos和GPT-5.5级别的攻击能力,2026年年内就可能以开源形式落到任何人手里。到那时候,没有”Trusted Access”门控,没有使用场景限制,只有一块显卡和一点好奇心。

    网络安全圈子里的普遍看法是:防御方本来就需要假设”攻击者拥有无限资源”,但当一个高中生也能在本地跑一个GPT-5.5级别的攻击模型时,”无限资源”的假设就不再是理论讨论了。

    连”最易量化”的领域都跟不上了

    这份报告最让人不安的地方,其实不在92.4%这个数字本身,而在于它暴露了一个结构性困境:网络安全是少数有明确成功判据(漏洞找到了没有?系统打穿了没有?)因而相对容易量化的AI能力领域。连这个领域的评估体系都已经失效了,那些更模糊、更难量化的能力维度——推理、规划、社会工程——的评估困境只会更突出。

    如果AI能力真的按照每6个月翻一倍的速度增长,一年后是当前的4倍,两年后是16倍。在通往AGI乃至ASI的路上,失效的评估体系只会越来越多,而不是逐渐被修好。

    对于安全研究者来说,这份报告给出的信号很直接:静态防御规则已经不够用了。当攻击方可以用AI实时生成针对特定目标环境的漏洞利用代码,防御方也必须用AI来对抗AI——而且是同样聪明、同样快速的AI。

  • 教皇良十四世首发AI通谕:技术从来不是中立的,谁在定义AI规则?

    2026年5月15日,教皇良十四世(Pope Leo XIV)发布了他就任以来的首份通谕《Magnifica Humanitas》,副标题是”在人工智能时代守护人性尊严”。这是天主教会历史上第一份专门讨论人工智能的社会通谕,全文用拉丁文写成,同时提供多语言译本。

    这份文件不是技术文档,也不是AI监管草案。它问的是一个更根本的问题:当算法开始替人类做决定,当机器能生成以假乱真的内容,当自动化系统接管越来越多的工作——人,还剩下什么不可替代的价值?

    “技术从来不是中立的。它承载着设计者、资助者、监管者的价值观和利益取向。”——《Magnifica Humanitas》第二章

    一份”10条核心立场”的AI伦理纲领

    通谕没有给出技术路线图,而是列出了10项核心立场,可以看作是梵蒂冈版的”AI原则宣言”:

    • 人性的本体论优先:人的尊严来自其存在本身,不取决于任何能力、产出或社会地位。AI可以模拟智能,但永远无法拥有人的尊严。
    • 技术非中立性:AI系统反映其开发者、资助者和监管者的价值取向。不能把技术决策伪装成”纯技术问题”。
    • 去人性化风险:不受约束的AI发展有可能把人简化为数据点,剥离掉关系中诞生的意义和精神维度。
    • 治理必须透明且可参与:AI治理不能由科技巨头单方面决定,受影响的社区必须有实质参与权,包括算法透明、数据公平获取和申诉渠道。
    • 真理作为公共品:AI驱动的虚假信息、算法对集体想象的操纵、共享真理的侵蚀,是对民主和社会凝聚力的威胁。
    • 劳动尊严:AI自动化不能只算效率账,必须保护劳动者获得公平报酬、参与经济生活、免于不稳定和被剥削的权利。
    • 自由防御:AI赋能的监控、行为操纵和新型数字依赖,是现代形式的奴役,必须主动抵制。
    • 武器化红线:将AI整合进自主武器系统和数字战争工具,对人类生命和全球和平构成严重威胁。
    • 全球公平:AI的益处必须面向全人类,不能制造新的数字鸿沟,把 marginalized 社区和发展中国家排除在技术进步之外。
    • 信徒的召唤:基督徒和所有善意人士被号召参与AI治理和技术发展,做”共融的建设者”,确保AI服务于人的整体发展而非技术统治。

    “巴别塔”还是”耶路撒冷”?

    通谕用了一个很有张力的比喻:人类在今天面对的根本选择,不是在”要”还是”不要”技术之间做决定,而是在”建造巴别塔”和”重建耶路撒冷”之间做决定。

    巴别塔代表的是:利润崇拜牺牲弱者、同质化抹杀差异、假装有一种单一语言(哪怕是数字语言)能把一切——包括人的奥秘——都翻译成数据和性能指标。通谕警告,这种”技术统治范式”的风险,是建造一个把上帝排除在外、把他人当作手段而非目的的未来。

    “真正的进步永远来自一颗向他人开放的心、一个愿意倾听的理智,以及一种寻求联结而非分裂的意志。我们必须去爱的、天主赋予我们的、并在基督身上完全彰显的人性伟大——是任何机器永远无法替代的。”——《Magnifica Humanitas》

    科技权力的”私有化”隐忧

    通谕有一个相当犀利的观察:今天推动技术发展的主要力量是私有的、往往是跨国的主体,它们拥有的资源和干预能力超过许多政府。这种技术权力因此带上前所未有的”私有”面孔,使得 discern(辨别)、治理和引导这种权力服务于公共福利变得格外困难。

    这份文件援引了已故教皇方济各的警告:那些掌握知识、特别是经济资源的人,已经获得了”对全人类和整个世界的令人印象深刻的统治力”。AI时代,这个警告的分量只增不减。

    数据、算法、平台——新的”公共品”

    通谕提出了一个很有意思的论点:在传统意义上的”土地、房屋、工具”之外,今天属于”全人类共同目的地”范围的物品,还必须包括专利、算法、数字平台、技术基础设施和数据。

    当国家的财富越来越依赖知识和技术,而这些东西集中在极少数人手里、没有足够的分享和获取机制,就会造成一种新的不平衡,直接违背”公共目的地”原则。这个论点,放在今天关于AI垄断、开源模型和算力集中的讨论里,相当有现实意义。


    各方反应:一份迟到的AI伦理坐标

    这份通谕发布后,在科技伦理圈和AI治理领域引发了不少讨论。支持者认为,这是一份难得的、从人文主义而非监管合规角度讨论AI的纲领性文件;批评者则认为,用宗教框架讨论技术问题,对世俗社会和政策制定者的影响力有限。

    不管立场如何,这份文件提出的核心拷问——”谁在定义AI的规则?”——确实是今天全球AI治理辩论里最缺乏实质答案的问题之一。当模型训练数据、算法目标函数、部署决策都掌握在少数公司手里,所谓”AI造福全人类”更像一句口号而非可验证的承诺。

    教皇良十四世在通谕末尾写道:技术人员、哲学家、神学家、政策制定者和每一个受技术影响的人,都需要参与这场关于”我们想要一个什么样的技术未来”的对话。技术可以治愈、联结、教育和保护我们共同的家园,但它也可以分裂、排斥和制造新的不公——取决于谁在掌舵,以及掌舵的人向谁负责。

  • Google I/O 2026:Gemini 3.5发布,AI智能体全面入侵谷歌全产品线

    北京时间5月20日凌晨,谷歌I/O 2026开发者大会开幕。今年发布会的重点不是某一个单一模型或功能,而是一次系统性转向——谷歌正在把AI智能体全面”塞进”所有核心入口。

    从搜索框到Chrome浏览器,从Android手机到智能眼镜,Gemini不再只是一个对话助手,而是一个可以持续运行、跨应用执行任务的AI代理:它能替用户追踪信息、生成内容、调用工具,甚至直接完成下单和操作流程。

    Google I/O 2026
    谷歌I/O 2026大会现场(图源:新浪科技)

    Gemini 3.5 Flash:价格砍半,速度4倍

    谷歌CEO桑达尔·皮查伊在主题演讲中发布了新一代大模型系列Gemini 3.5。首发推出的Gemini 3.5 Flash定位为”迄今最强大的智能体与编程模型”,输出Token速率达到其他前沿模型的4倍,而处理智能体任务的费用不到其他前沿模型的一半

    在GDPval-AA基准(衡量现实世界具有实际经济价值的编程任务)中,Gemini 3.5 Flash取得1656 Elo评分,超过了Gemini 3.1 Pro,也超过了目前公开可查的大部分前沿模型。在Terminal-Bench 2.1(衡量AI在真实终端环境中完成复杂任务的能力)中,得分76.2%——这意味着智能体在执行真实任务时的可靠性,正在从”勉强可用”向”可以依赖”跨越。

    皮查伊在演讲中直言:”Flash的惊人之处在于,它以不到同类前沿模型一半的价格,提供了前沿级别的能力。”当一家巨头愿意用”砍半定价”来推广自己的最前沿模型时,它传达的信号不是”我在让利”,而是”我要把竞争对手挤出市场”。

    视频模型Omni与智能体编程平台Antigravity 2.0

    DeepMind首席执行官德米斯·哈萨比斯登台发布了基于谷歌世界模型技术积累的新型视频生成模型Gemini Omni。该模型可以基于多种输入生成视频,并支持对话式编辑,用户可以通过自然语言修改角色、背景和场景。首款模型Gemini Omni Flash将于今年夏季推出。

    与此同时,谷歌发布了智能体编程平台Antigravity 2.0,直接对标Anthropic的Claude Code和OpenAI的Codex。该平台被谷歌定位为面向AI Agent时代的编程工具,官方称其”毫不掩饰地以智能体为先”。使用Antigravity 2.0及其代理系统从零开始构建一个操作系统,整个过程所消耗的Token成本不到1000美元。

    个人AI助手Gemini Spark与全线产品整合

    谷歌同时发布了全天候运行的个人AI助手Gemini Spark,基于Gemini 3.5,运行在Google Cloud虚拟机上。用户可以通过Gemini应用访问Spark,即便合上笔记本电脑,Spark也可以继续工作。本周将面向受信任测试人员推出,下周面向美国Google AI Ultra订阅用户开放。

    更重要的是,谷歌宣布了全线产品的AI智能体整合计划:

    • 搜索:将推出搜索信息智能体,后台24/7运行,主动发现信息并代为执行操作;Daily Brief Agent将整合用户的邮件、日历与任务,生成个性化晨间摘要。
    • Android:2026年晚些时候推出Android Halo,为用户提供实时智能体任务追踪界面。
    • 硬件:由Gentle Monster、Warby Parker与三星合作推出的Android XR智能眼镜将于2026年秋季上市,支持语音交互和信息投射。
    • 购物:发布由AI智能体驱动的通用购物车Universal Cart,可在Google服务中使用,追踪优惠、监控价格变动、识别兼容性问题。

    规模即壁垒:1800亿美元资本支出背后的逻辑

    皮查伊在演讲中披露了一组震撼数据:谷歌每月处理的Token数量已达到3.2千万亿,同比增长7倍;Gemini App月活跃用户从4亿增长至9亿;搜索AI模式月活跃用户突破10亿

    支撑这一切的,是谷歌2026年预计1800亿至1900亿美元的资本支出。这1800多亿美元的资本支出,本质上是在做一件事:用基础设施的规模化优势,把竞争对手挤出市场。当你的TPU集群规模、Token处理量和用户基数都达到竞争对手无法匹敌的量级时,”速度4倍、价格砍半”就不再是一个促销手段,而是一个结构性壁垒。

    回到根本问题:Gemini 3.5的发布,究竟是一次真正的技术飞跃,还是一次精心包装的战略营销?答案可能是:两者都是。从技术角度看,Gemini 3.5 Flash在基准测试中的表现、推理速度的提升、以及多智能体并行架构的落地,都是真实的进步。但与此同时,这次发布真正值得关注的,不是模型本身,而是谷歌围绕模型构建的全栈壁垒:TPU 8提供算力、Gemini 3.5提供智能、Antigravity 2.0提供平台、Spark和搜索提供触达——这条链条上的每一个环节,谷歌都握有主动权。

  • Anthropic完成650亿美元融资,估值直逼1万亿

    昨天(5月28日)AI圈被一条消息刷了屏——Anthropic宣布完成650亿美元H轮融资,投后估值9650亿美元,距离万亿美元俱乐部只差临门一脚。

    这轮融资里有个细节值得注意:其中150亿美元其实是超大规模云服务商之前已经承诺的投资,包括今年4月亚马逊承诺的50亿美元。换句话说,这次融资有一部分是在”追认”此前已经落地的承诺。但这丝毫不影响市场的兴奋程度——联席领投方阵容相当豪华:Altimeter Capital、Dragoneer、Greenoaks、红杉资本、Capital Group、Coatue、D1 Capital Partners全部在列。

    Anthropic融资
    Anthropic本轮融资估值已接近1万亿美元(图源:TechCrunch)

    融资同日,Opus 4.8来了

    融资消息公布的同时,Anthropic发布了Claude Opus 4.8。新版本在智能体任务和多步骤推理上有明显提升,同时更强调”诚实性”和”自我纠错”能力——这其实是Anthropic一贯的安全叙事在模型能力上的延伸。

    企业客户对Claude Code的需求增长非常猛。Anthropic透露,这款面向开发者的编程工具在过去几个月里推动营收快速拉升。5月初,公司年度经常性收入(ARR)已经突破470亿美元。《华尔街日报》甚至报道说,Anthropic预计营收将激增130%,并实现首个运营盈利季度。

    如果这些数据属实,Anthropic可能是目前头部AI实验室里最先跑通”商业化”的一家。OpenAI和Anthropic都在疯狂烧钱,但Anthropic似乎更早看到了正向现金流的曙光。

    这会是IPO前的最后一轮吗

    9650亿美元的估值,加上”IPO前最后一轮私募融资”的市场预期,让这轮融资有了不同寻常的意味。Altimeter Capital创始人Brad Gerstner在声明里说:”Claude的最新进展推动了全球最苛刻机构的大规模采用,这一势头让Anthropic能够引领AI创新的下一阶段。”

    投资方的构成也很有意思。除了传统VC,三星、SK海力士、美光这些芯片产业链的战略投资方也进来了。这说明Anthropic不仅仅在囤积算力,还在往产业链上游布局——算力、芯片、应用三层同时押注。


    竞争对手在做什么

    OpenAI今年3月完成1220亿美元融资,投后估值8520亿美元,和Anthropic的差距正在缩小。马斯克的SpaceX(已与xAI合并)IPO目标估值更是高达2万亿美元。

    三家的路线已经开始分化:OpenAI押注多模态和消费者应用,Anthropic押注企业级安全和代码助手,xAI押注算力和数据规模。接下来12个月,IPO窗口一旦打开,这场比赛的节奏还会更快。

  • 谷歌DeepMind预言:2026年AI将实现永生

    谷歌DeepMind预言:2026年AI将实现”永生”

    2026年刚开始,谷歌DeepMind研究员就抛出一颗重磅炸弹:持续学习(Continuous Learning)将在2026年取得突破性进展,AI有望实现”自我进化”,不再需要人类反复训练。这个预言如果成真,AI的发展节奏会被彻底改写。

    Google DeepMind AI Continuous Learning
    谷歌DeepMind对持续学习的技术预言 | 来源:新智元

    这个预测不是空穴来风。Jeff Dean在NeurIPS 2025的炉边谈话中就指出,当前大语言模型的核心痛点就是”缺乏持续学习”能力。2025年底,谷歌团队提出的”嵌套化方法”已经增强了LLM的上下文处理能力,实现了持续学习的雏形。


    2026年:持续学习成为AI核心节点

    Anthropic CEO Dario Amodei最近公开表示,持续学习将在2026年落地且可实用化。这个说法不是营销话术——Anthropic的工程师自曝,过去一个月对Claude Code的贡献全部由AI 100%生成代码,非技术程序员Ben Tossell四个月用Claude Code造了50个项目,全程几乎0人工干预。

    持续学习是AI自我改进、能力涌现的核心要素。实现后,模型无需通过重新训练升级,可在自编码过程中不断进化。

    OpenAI研究员Hieu Pham甚至预测,2026年AI将破解一个千禧年难题。这个预测如果成真,意味着AI的推理能力将跨越式提升,不再只是”预测下一个token”,而是真正开始”思考”。

    2030年:全自动编程触发ASI加速

    前OpenAI研究员Daniel Kokotajlo团队用自主开发的AI Futures Model做了个推演:2030年有望实现完全自动化编程,甚至有25%的概率在1年内实现向超级人工智能(ASI)的飞跃。

    这个推演的核心逻辑是:全自动编程(AC)是AGI研发进入自动化加速阶段的”开关”。一旦落地,ASI极有可能快速起飞。这个预测听起来科幻,但推演方法是有依据的——以”能力基准趋势外推”为核心方法,采用ETR的编码时间跨度套件(ETR-HRS)作为基准,推演达到AGI所需的算力与发展路径。

    AI研发自动化分为三个阶段:

    • 阶段1:自动化编程——定义自动化编程器(AC)可完全替代AGI项目的整个程序员团队
    • 阶段2:自动化研究品味——研究品味指确定研究方向、挑选实验、解读结果、提取知识的能力;该阶段预测从AC进化到超人类AI研究员(SAR)的时间
    • 阶段3:智能爆炸——追踪三个里程碑:超智能AI研究员(SIAR)、顶尖专家级AI(TED-AI)、超级人工智能(ASI)

    2050年:诺奖级科研的主力军

    《自然》(Nature)杂志展望:到2050年,AI系统或将成为”诺奖级”科学研究的主力军。这个预测不是瞎猜——《超级智能:路径、危险与策略》作者Nick Bostrom预计AGI将在2050年前后出现,可回答当前大部分原则上可由科学解答的问题。

    伦敦研究与前瞻公司Outsmart Insight联创Alex Ayad提出了一个”黑灯实验室”场景:由AI算法驱动的自主系统结合机器人实验员,可24小时不间断攻克生物技术难题,全程无需人类在场。墨西哥国立自治大学物理学家Juan Carlos Hidalgo预测,在AI辅助下2050年核聚变能源成熟的前景”相当可期”。


    这件事为什么重要

    谷歌DeepMind这个预言的价值在于,它给出了一个明确的技术路线图:2026年持续学习落地 → 2030年全自动编程 → 2050年AI主导诺奖级科研。这个路线图如果成真,人类在科学研发中的角色会被根本性改变。

    现在下结论还太早。持续学习的技术路径还没收敛,全自动编程需要的不仅是代码生成能力,还有”研究品味”这种很难量化的能力。但方向已经清楚了:AI正在从”工具”变成”合作者”,再变成”主导者”。这个过程的节奏,可能比大部分人预期的快。

    对于开发者和企业来说,现在要问的问题不是”AI会不会替代我”,而是”我怎么在AI持续进化的环境里找到自己的位置”。这个答案,2026年可能会有第一部分线索。

  • MIT科技评论2026年AI十大趋势:去伪存真的关键之年

    MIT科技评论2026年AI十大趋势:去伪存真的关键之年

    2026年4月,MIT科技评论首次推出”当下AI领域最重要的10件事”年度清单。这份报告来得正是时候——AI行业喧嚣不断,泡沫和炒作混在一起,能看清方向的声音越来越少。MIT的编辑团队花了大量时间筛选,最终给出这份清单,目的很明确:剔除噪音,找出真正推动AI发展的核心力量。

    MIT Technology Review AI Trends 2026
    MIT科技评论2026年AI十大趋势封面图 | 来源:MIT Technology Review

    这份清单和MIT传统的”10项突破性技术”榜单有所不同。以前的榜单更偏重技术本身,而这一次的视角更宽——它看的是整个AI生态里,哪些力量在真正改变游戏规则,哪些只是昙花一现的炒作。


    一、人形机器人训练数据:教AI理解物理世界

    大语言模型的训练用的是人类文本,而人形机器人的训练数据是什么?是人类的动作视频。这个逻辑很直接——就像文字让模型学会”说话”,视频能让机器人学会”行动”。现在已经有公司在大规模做这件事:建大型训练中心,让工作人员重复做特定任务,采集动作数据;还有的用”傀儡式”操作,让海外人员远程操控机器人,记录每一次移动。

    问题是,这项投入巨大,但结果还没人说得准。机器人能不能真的从视频里学会灵活操作?还是说需要更多维度的数据?这个方向值得盯紧。

    二、大语言模型+:下一站在哪里?

    大模型已经席卷全球,整个行业都在问同一个问题:下一代突破在哪里?基础优化空间越来越小,但大模型本身不会被淘汰。MIT的编辑们认为,这个技术还有很多潜力没挖完,关键是往哪个方向挖。

    大语言模型不会消失,它只是刚刚开始。真正的问题 是:我们能让它做什么更多的事?

    三、升级版诈骗:AI让攻击成本暴跌

    这是清单里最让人不安的一条。AI正在让诈骗和黑客攻击变得前所未有的容易——速度更快、成本更低、操作更简单。以前需要专业技术才能做的攻击,现在门槛被AI砸到了地上。这个趋势在2026年会继续恶化,几乎没有放缓的迹象。

    四、世界模型:AI的下一个前沿

    现在的AI模型能聊天、写代码、生成图片,但它们不理解物理世界的运作规则。世界模型(World Models)要解决的正是这个问题——让AI真正”理解”外部世界,而不只是预测下一个token。如果这个目标实现,AI就能真正进入物理场景落地,而不只是停留在屏幕里。

    五、新型作战指挥室:AI进入军事决策

    算法早就让军事的一些基础工作自动化了,但生成式AI正在进入更高层的决策环节。指挥官开始认真参考AI给出的建议,这个变化正在重塑军队的情报共享方式、和大型科技公司的合作模式,以及致命决策的制定流程。这件事的影响面很广,而且不只是技术问题。

    六、武器化深度伪造:威胁已成现实

    长期以来被预测的”武器化深度伪造”威胁,在2026年已经成为现实。生成式AI技术的进步,加上Grok模型大规模生成非自愿色情图像、美国政府部门用这项技术制作宣传内容,这些事件加在一起,让深度伪造从”潜在风险”变成了”正在发生的事实”。

    七、智能体编排:从单打独斗到团队协作

    第一代AI智能体只能做单一任务——运行浏览器、写几行代码,而且各自为战。下一代智能体的方向是”编排”:多个智能体协作,分工完成复杂的长距离任务。这个变化一旦完成,AI能做的事情会比现在多出一个数量级。

    八、中国的开源押注:免费策略赢得全球开发者

    中国AI实验室把前沿模型免费开放,这个策略为他们赢得了全球开发者的认可和口碑。现在的问题是,这种模式能不能持续?财务上怎么算账?但不管怎样,全球开发者已经开始基于中国的开源模型构建各类应用,这个趋势已经成型了。

    九、人工智能科学家:AI开始做科研

    高校和企业都在开发能自主完成科研任务的AI智能体,把它们当作真正的协作者和科学家来用。有人甚至预测,这类AI科研助手未来有可能做出诺贝尔奖级别的研究成果。这个说法听起来夸张,但研发进度比很多人想象的快。

    十、反AI抵制运动:反弹正在发生

    AI不受限制地发展了这么多年,现在全球范围内出现了强大的反AI抵制浪潮。从保守派到自由派,从艺术家群体到工会,相关活动人士的声音正在扩大,而且已经开始取得一些小范围的胜利。这个趋势在2026年会继续发酵。


    我的看法

    读完这份清单,一个感受很强烈:AI行业正在从”能做什么”转向”应该做什么”。前几年大家都在比参数、比 benchmark,现在开始有人认真问这些问题——AI用在军事上边界在哪里?深度伪造谁来管?开源模式能不能持续?

    这份清单里我最看好”世界模型”和”智能体编排”两条线,这两个方向一旦突破,AI的应用场景会大规模扩展。最担心的当然是”升级版诈骗”和”武器化深度伪造”,这两个方向的技术进步速度远远快于监管跟进的速度。

    至于”反AI抵制运动”,我觉得这是健康的信号。任何技术发展到一定阶段,都需要来自社会的反馈和约束,AI也不例外。

  • 谷歌I/O 2026全记录:Gemini Spark永久在线,智能眼镜今秋开卖

    5月19日,谷歌I/O大会开幕。主题演讲持续了两个小时,核心信息只有一句话:Gemini不再是聊天工具,而是要替你干活。

    这次大会发布的东西不少,但有一条主线贯穿全场——把AI智能体塞进你每天用的所有谷歌产品里:搜索、Gmail、YouTube、Docs、Chrome,一个不落。

    谷歌说现在有9亿人在用Gemini,人们已经用它生成了超过500亿张图像。2026年的目标是让Gemini成为你互联网的”执行层”。

    搜索的25年来最大重构

    搜索框变成了”智能搜索框”——AI代理直接嵌在里面,当天就向全量用户推送。你搜”黑洞”,搜索结果页不是十蓝色链接,而是AI直接生成一个可视化解释视频,嵌在结果页里播放。

    夏天还会上线”生成式UI”功能:搜索结果根据你查的内容类型自动调整布局。查新闻、查视频、查图片,每种场景下搜索结果的呈现方式都不一样,是AI实时生成的界面。

    Gemini Spark:谷歌版OpenClaw

    这是本次大会最值得关注的产品之一。Gemini Spark是一个永久在线的个人AI代理,跑在谷歌云上——就算你关了电脑、手机没电,它还在云端继续跑任务。

    它能读取你的谷歌硬盘文件,知道你的日历安排,理解你的生活节奏。你跟它说”帮我策划街区派对”,它会自己发邮件、追踪采购进度、发跟进邮件,全程不需要你盯着。涉及付款的关键节点才会来问你确认。

    目前Spark只支持谷歌自家服务,夏天会接入Chrome浏览器和第三方服务。这个产品的定位很清晰:跟OpenClaw正面竞争。

    智能眼镜今年秋天就卖

    谷歌联合三星和眼镜品牌Warby Parker、Gentle Monster做两款智能眼镜,属于Android XR平台。

    • 音频版:今年秋季上市,镜腿有扬声器,有摄像头,能看见你看见的东西,支持实时跨语言翻译
    • 带显示屏版:还在研发,上市时间更晚,可以在镜片上显示短信、导航、搜索结果

    两款都支持调用谷歌的图像生成工具Nano Banana——你拍一下眼前的场景,AI可以在画面上叠加虚拟物体或特效,没显示屏的版本会把生成内容推到你的手机或安卓手表上。

    其他值得关注的发布

    Gemini Omni:对标Sora 2的视频生成模型,特色是”真实感”——可以把你拍的自拍视频换背景、换风格、换环境,人物表演保留,场景全部AI重绘。轻量版OmniFlash当天就向Pro和Ultra订阅用户开放了。

    通用购物车:谷歌要做跨网站的购物车,你在不同电商网站逛,把想买的东西都加进这个统一购物车,AI帮你比价、提醒降价、推送新配色。结账时谷歌的安全支付系统可以一次性结清跨店铺订单。

    第八代TPU:训练性能提升3倍,推理专用版本每秒能生成1500个token。谷歌2026年在算力基建上的投入预计达到1900亿美元。


  • DeepSeek V4-Pro永久降价75%,输出token不到1美元

    上个月DeepSeek推出V4-Pro的时候,给了一个75%折扣的促销价,截止日期写在5月31日。业内普遍以为这只是新模型上线的拉新手段,到期后会涨回原价。结果5月22日,DeepSeek直接在官方文档里把折扣价改成了永久定价——没有任何预告,就是悄悄把数字改了。

    新价格出来之后,输出token的成本是每百万0.87美元。作为对比,OpenAI的GPT-5.5输出token定价大概是其34倍。Anthropic的Claude Opus 4.7、谷歌的Gemini 3.5 Flash,在同级别推理能力下,每token价格都比这家中国公司贵出一截。

    DeepSeek-V4-Pro永久降价后,在全球”性价比”排名中直接登顶。输出定价低于1美元/百万token的前沿模型,目前只有这一家。

    为什么敢这么定价?

    背后的技术原因挺直接:V4系列从设计之初就针对华为昇腾950 AI加速器做了优化,不依赖英伟达GPU。DeepSeek在发布V4时就说过,一旦昇腾950超级节点大规模可用,API定价会大幅下降,当时预计是2026年下半年。结果他们提前动了刀,说明对基础设施成本已经看得足够清楚了。

    具体价格表:缓存命中输入0.003625美元/百万token,缓存未命中输入0.435美元/百万token,输出0.87美元/百万token。人民币计价的话,大概是0.025元到6元/百万token的区间。

    行业反应

    彭博社把这件事定义为AI价格战的升级信号。开发者社区的反应更直接——之前犹豫要不要把DeepSeek纳入生产系统的团队,现在可以放心规划了,因为价格的不确定性消除了。

    这件事的另一个影响是:如果每百万token低于1美元的高性能推理成为常态,那么教育、工具类SaaS、小型创业公司这些对成本敏感的场景,AI接入的门槛就彻底打开了。