标签: AI智能体

  • AI 代理正在重塑互联网基础设施,AWS、微软、Cloudflare 纷纷入局

    最近有个变化正在发生,可能很多人还没注意到——互联网的基础设施,正在从为”人”设计,转向为”机器”设计。

    这么说可能有点抽象,具体来看就很有意思了。Cloudflare 的数据显示,过去半年里,非人类流量(主要是爬虫、AI 助手、自动化代理)已经占到整体 HTTP 流量的 31%,其中 AI 爬虫和搜索引擎占了机器人请求的四分之一。Cloudflare 的产品经理 Lai Yi Ohlsen 甚至预测,非人类流量将在 2027 年上半年超过人类流量。

    AI 代理的流量模式,彻底打破了旧规则

    这背后是 AI 代理(agent)的崛起。和人类用户稳定的浏览、点击、滚动行为不同,AI 代理的行为模式完全不同:它们可以在几秒钟内发起数百次数据库查询、文档检索和 API 调用,然后像出现时一样迅速消失。这种”突发式”的流量模式,是传统云基础设施没有设计过的。

    “代理会从实验阶段进入生产环境,它们产生的流量模式是之前的基础设施根本没有设计过的。它们会毫无预警地出现流量峰值,也会毫无征兆地进入空闲状态。” — AWS OpenSearch 总经理 Tia White

    AI agents digital concept
    AI 助手的数字生成图像,象征人工智能系统的分布式与并行处理能力(图片来源:TechCrunch)

    AWS、微软、Cloudflare 都在重新造轮子

    本周 AWS 发布的下一代 OpenSearch Serverless 就是一个典型例子。这个新版本把计算和存储解耦,可以根据代理流量的峰值在几秒内自动扩容,也可以在代理空闲时缩容到零——换句话说,不用为空闲的计算资源付费了。

    用个通俗的比喻:以前的 Serverless 版本就像你无论用不用车,都得付固定停车费;新版更像是按实际停放时间计费的智能停车位。

    类似的动作在整个云行业都在发生。Databricks 和 Snowflake 正在把自己重新定位为企业 AI 数据的”记忆和检索系统”;微软推出了针对 Azure 的更新,专门处理 AI 代理的流量突发并在代理之间共享记忆;Cloudflare 上个月也推出了面向代理的持久化环境和即时扩展能力的基础设施。


    这个趋势值得关注,因为它意味着两件事:一是 AI 代理的规模化部署正在倒逼基础设施升级;二是当这套新基础设施成熟后,代理的部署成本会更低、更容易大规模落地。对于正在考虑用 AI 代理做点什么的公司来说,这是个好消息。

  • AI 代理正在重塑互联网基础设施,AWS、微软、Cloudflare 纷纷入局

    最近有个变化正在发生,可能很多人还没注意到——互联网的基础设施,正在从为”人”设计,转向为”机器”设计。

    这么说可能有点抽象,具体来看就很有意思了。Cloudflare 的数据显示,过去半年里,非人类流量(主要是爬虫、AI 助手、自动化代理)已经占到整体 HTTP 流量的 31%,其中 AI 爬虫和搜索引擎占了机器人请求的四分之一。Cloudflare 的产品经理 Lai Yi Ohlsen 甚至预测,非人类流量将在 2027 年上半年超过人类流量。

    AI 代理的流量模式,彻底打破了旧规则

    这背后是 AI 代理(agent)的崛起。和人类用户稳定的浏览、点击、滚动行为不同,AI 代理的行为模式完全不同:它们可以在几秒钟内发起数百次数据库查询、文档检索和 API 调用,然后像出现时一样迅速消失。这种”突发式”的流量模式,是传统云基础设施根本没有设计过的。

    “代理会从实验阶段进入生产环境,它们产生的流量模式是之前的基础设施根本没有设计过的。它们会毫无预警地出现流量峰值,也会毫无征兆地进入空闲状态。” — AWS OpenSearch 总经理 Tia White

    AI agents digital concept
    AI 助手的数字生成图像,象征人工智能系统的分布式与并行处理能力(图片来源:TechCrunch)

    AWS、微软、Cloudflare 都在重新造轮子

    本周 AWS 发布的下一代 OpenSearch Serverless 就是一个典型例子。这个新版本把计算和存储解耦,可以根据代理流量的峰值在几秒内自动扩容,也可以在代理空闲时缩容到零——换句话说,不用为空闲的计算资源付费了。

    用个通俗的比喻:以前的 Serverless 版本就像你无论用不用车,都得付固定停车费;新版更像是按实际停放时间计费的智能停车位。

    类似的动作在整个云行业都在发生。Databricks 和 Snowflake 正在把自己重新定位为企业 AI 数据的”记忆和检索系统”;微软推出了针对 Azure 的更新,专门处理 AI 代理的流量突发并在代理之间共享记忆;Cloudflare 上个月也推出了面向代理的持久化环境和即时扩展能力的基础设施。


    这个趋势值得关注,因为它意味着两件事:一是 AI 代理的规模化部署正在倒逼基础设施升级;二是当这套新基础设施成熟后,代理的部署成本会更低、更容易大规模落地。对于正在考虑用 AI 代理做点什么的公司来说,这是个好消息。

  • 微软正在打造AI超级应用——把Copilot全家桶装进一个入口

    据《财富》杂志报道,微软正在开发一款AI”超级应用”——把现在散落在各处的AI能力全部整合到同一个入口。具体来说,这款应用会把GitHub Copilot、Copilot聊天机器人、Copilot Cowork,以及一个内部代号为”Autopilot”的新智能体工作流能力,全部塞进一个App里。

    这个思路听起来很熟悉,对吧?OpenAI已经在走这条路了——把对话、搜索、代码、智能体编排全部整合进ChatGPT,让它成为一个真正的”超级应用”入口。现在微软想做同样的事,只不过依托的是自己整个Copilot产品线。

    微软的打法其实很清晰:它拥有全链路的产品布局——从代码编辑器里的Copilot,到Microsoft 365里的Copilot,再到独立发布的Copilot Cowork智能体平台。唯一缺的就是一个把它们串起来的”总控制台”。

    可能在Build大会上亮相

    《财富》的报道推测,这款超级应用可能会在近期举办的Microsoft Build开发者大会上亮相。Build是微软每年最重要的开发者活动,通常是发布重磅AI战略更新的场合。如果这款产品真的在Build上出现,基本等于微软官方确认了”超级应用”战略。

    值得一提的是,微软过去一年在Copilot品牌上投入极大,但用户体验一直是碎片化状态——写代码要用GitHub Copilot,处理文档要用Microsoft 365 Copilot,管理智能体工作流要用Copilot Cowork,三者之间的数据和上下文并不打通。这款超级应用如果成真,最直接的价值就是解决这个问题。

    和OpenAI的超级应用有什么不同?

    OpenAI的”超级应用”路线是围绕ChatGPT构建的——所有能力都收敛到一个对话窗口里,用户跟AI交互的主要方式还是”说话”和”看结果”。微软的路线则更偏向”工作流”——它继承的是Office、Azure、GitHub这套企业生产力生态,AI超级应用更像是一个”智能工作操作系统”。

    两套打法背后的逻辑不太一样。OpenAI是从消费者往上打,微软是从企业往下打。最终谁能先把”超级应用”这件事做成,很大程度上取决于谁能先把多智能体协作、跨应用上下文传递、以及企业数据安全这三个问题解决掉。


    目前微软官方还没有确认这款产品的存在,按照惯例,在Build大会之前所有消息都只是传闻。但如果《财富》的报道方向是对的,这会是微软在AI应用层最重要的一次产品整合,也意味着”Copilot”作为一个独立品牌,正在从”功能”升级为”平台”。

  • 互联网正在为机器重构——AI智能体正在改写整个网络基础设施

    过去二十年,互联网一直是围绕人类行为设计的。人们搜索、点击、滚动、串流,这些动作有规律、可预测。但AI智能体不这么干活。它们能在几秒钟内发起一连串突发请求,同时调出十几个子智能体,疯狂查询数据库、检索文档、调用API,然后突然全部消失。这种流量模式,人类的网络基础设施从来没为它设计过。

    AWS悄悄改写了搜索数据库的底层的

    本周,亚马逊云科技(AWS)发布新一代OpenSearch Serverless——一个专门面向AI智能体负载设计的托管搜索和向量数据库。最核心的变化是:计算和存储解耦了。智能体发起任务时,算力可以在几秒内弹性扩容;智能体 idle 时,算力可以缩到零。客户不用再为空闲的计算资源付费。

    “智能体正从实验阶段走向生产环境,它们产生的流量模式,是之前的基础设施根本没考虑过的。”
    ——Tia White,亚马逊OpenSearch服务总经理

    之前的Serverless版本也有弹性,但存储和计算是绑定的,你至少得保留一个运行中的实例。说白了就是:哪怕你没在用,也得一直付停车费。新一代相当于改成了计时停车位——来了才计费,走了就归零。

    AI智能体概念图
    AI智能体正在改变互联网流量结构(图片来源:Getty Images)

    机器流量已经超过你想象

    Cloudflare的数据很说明问题:过去六个月, bots 流量已经占到整体HTTP流量的31%。其中AI爬虫、搜索引擎和AI助手加起来,约占所有bot请求的25%。Cloudflare高级产品经理Lai Yi Ohlsen预计,2027年上半年,非人类流量就会超过人类流量。

    这不只是在抢带宽。智能体的检索模式跟人类完全不一样——它们会并发查询数百个数据源,对延迟极度敏感,而且流量峰值毫无规律。传统的基础设施假设用户是”逐步浏览”的,但智能体是”瞬间爆发”的。

    整个行业都在跟

    AWS不是唯一一个在干这件事的。Databricks和Snowflake正在把自己重新定位为企业AI内存和检索系统;微软Azure最近也推出了针对AI智能体突发流量和多智能体共享内存的更新;Cloudflare上个月发布了面向智能体的持久化环境和即时扩展基础设施。

    Google I/O上周也释放了信号:用户很快就能把购物研究、行程预订、网页浏览等任务委派给AI系统。不管是面向消费者的AI智能体,还是企业内外部部署的智能体,机器对机器的流量正在指数级增长。


    这场基础设施的重构,本质上是为下一个十年做准备。当智能体成为互联网的主要”用户”,整个堆栈——从数据库到CDN,从API网关到身份认证——都得重新思考。目前看,大的云厂商已经跑起来了,但这一步才刚刚开始。

  • MIT发布2026年AI十大趋势:从人形机器人训练到反AI运动

    人形机器人训练数据:动作捕捉的新战场

    就像人类的文字成了大语言模型的养料,现在连人类怎么动、怎么走路、怎么搬东西,都被大规模收集起来训练人形机器人。这事儿听起来有点怪,但确实在发生——有公司专门建了”训练中心”,让工人一遍遍重复同样的动作,就为了给机器人提供学习素材。还有更离谱的”提线木偶”模式:远方的人类通过远程操控,手把手教机器人怎么做事。

    这种做法投入巨大,但没人能保证一定成功。可资本还是在砸钱,因为这可能是让机器人真正”活过来”的唯一路径。


    大语言模型没有死,它正在进化

    去年大家还在感叹大语言模型”改变了世界”,今年从业者已经在琢磨下一个突破在哪里。容易摘的果子已经摘完了,模型的提升越来越难,但这不意味着LLM要退出历史舞台。

    相反,它正在往两个方向走:一个是把现有的能力压榨到极致,另一个是在寻找全新的架构突破。这条路不好走,但走通了就是下一个时代。


    AI让诈骗变得便宜又高效

    以前想搞网络诈骗,还得学点技术、花点钱买工具。现在有了生成式AI,门槛几乎降到了地板上。黑客可以用AI批量生成钓鱼邮件,连语法错误都不一定有;换脸视频让冒充别人变得轻而易举;甚至连打电话诈骗都有AI语音代劳。

    AI正在让网络犯罪变得更便宜、更快、更容易——这对普通人来说不是什么好消息。


    世界模型:让AI理解物理世界

    大语言模型擅长处理文字,但要让AI进入真实物理世界——比如让机器人知道”杯子掉地上会碎”这种常识——就需要”世界模型”。这类系统试图让AI理解外部世界的运作规律,而不仅仅是预测下一个词。

    如果这条路走通了,AI就不再只是聊天工具,而是能真正在现实世界里做事情的智能体。这可能是下一波AI浪潮最核心的突破点。


    智能体编排:从单打独斗到团队协作

    早期的AI智能体只能干一件事——比如帮你订个外卖,或者写段代码。但现实世界里的问题往往是复杂的,需要多个步骤、多种能力配合。

    现在的方向是”智能体团队”:一个负责搜索、一个负责推理、一个负责执行,像人类团队一样分工协作。这比单个超级智能体更灵活,也更容易落地。很多公司已经在往这个方向押注了。


    中国的开源赌注:免费模型赢来的全球影响力

    DeepSeek、通义千问、智谱……中国实验室过去一年里密集开源了一大批高质量模型,而且真的好用。这让全球开发者突然意识到:原来不用OpenAI也能做出厉害的东西。

    但这种”免费送”的策略能不能持续,没人说得准。训练模型太烧钱了,光靠口碑和开发者好感,账算得过来吗?不管怎样,全世界已经在基于中国的基础模型搞开发了,这本身就已经改变了格局。


    AI科学家:当AI开始做科研

    有些公司已经在开发能自主做科研的AI——不是帮你查文献,而是真的能设计实验、分析数据、甚至提出新假设。支持者说,这种AI合作者有一天可能会达到诺贝尔奖的水平。

    这话听起来夸张,但想想十年前大家也觉得”AI下围棋赢人类”是天方夜谭。科学发现的门槛正在被重新定义。


    反AI运动:当大家开始说”够了”

    过去几年AI基本上是想怎么发展就怎么发展,监管跟不上,大家也沉浸在”新技术好厉害”的兴奋里。但现在这股浪潮遇到了真正的阻力。

    艺术家不满自己的作品被拿来训练模型,工会担心AI抢走工作,保守派和自由派居然在”限制AI”这件事上找到了共同点。这股反对力量还在早期,但已经在一些具体问题上取得了小胜利。AI的无约束时代,可能正在走向终点。


    写在最后

    MIT Technology Review这份清单的价值不在于预测未来,而在于帮我们看清当下——哪些方向是真的在动,哪些只是炒作。人形机器人、世界模型、智能体编排,这些是当前最值得盯着的变化;而AI安全、监管反弹、开源商业化困境,则是这个行业必须面对的考题。

    2026年的AI,已经不再是”能不能做出来”的问题,而是”应该怎么用、谁来管、往哪里去”的问题。

  • Claude Opus 4.8来了:一口气跑1000个子智能体,代码审查聪明4倍

    昨天(5月28日),Anthropic把Claude Opus 4.8扔了出来。这次更新的重点很明确:让AI在写代码这件事上更像一个能独立工作的资深工程师,而不是一个需要你步步盯着的高级补全工具。

    代码缺陷少4倍,这才是最值钱的地方

    Opus 4.8最核心的改进,是代码质量。Anthropic说,这个模型生成的代码里有缺陷但没被标记出来的概率,比上一代低了大约4倍。对那些把AI辅助编程塞进生产流程的团队来说,这个改进直接等于少掉很多坑——未检测到的代码缺陷,在 downstream 产生的修复成本是 exponentially 增长的。

    基准测试的数据也佐证了这一点:代理编码得分从64.3%爬到了69.2%,使用工具的多学科推理从54.7%提到57.9%,知识工作得分从1753分涨到1890分。数字看起来增幅不大,但在AI模型迭代里,这种全方位的几个百分点提升,往往意味着实际使用中”可用”和”好用”之间的差距。

    Anthropic对Opus 4.8的描述是:”更敏锐的判断力、更诚实地展示其进展,以及比前代模型更长时间独立工作的能力。”这三个点,其实正好对应了企业开发者对AI编码助手最头疼的三个问题:判断不准、爱装懂、干两分钟就得人工介入。

    动态工作流:1000个子智能体一起干活

    这次最炸裂的功能叫”动态工作流”(Dynamic Workflows),目前在research preview阶段。简单说,就是Claude现在可以写编排脚本,生成并管理几十到几百个并行子代理,从任务启动到完成全程自动跑。

    上限是每个运行最多16个并发子代理、总共1000个子代理。实际场景是什么样子?比如你要迁移一个几十万行代码的代码库,以前你得手动拆任务、分配、汇总,现在Opus 4.8可以直接把整个代码库迁移从启动做到生成可合并的拉取请求,中间不用你手动协调。

    这个功能一旦正式上线,对大型代码库维护团队来说是个.game changer。不需要额外写编排逻辑,不需要手动拆解任务,模型自己决定怎么把大任务碎成小任务、怎么并行跑、怎么汇总结果。

    快速模式:快2.5倍,便宜3倍

    Anthropic还把快速模式(Fast Mode)大幅升级了。新版本的快速模式比标准推理快大约2.5倍,而成本只有之前Opus模型快速模式的三分之一。定价是每百万输入token 10美元、每百万输出token 25美元。

    新的”努力控制”(Effort Control)设置也值得提一下:用户可以调整Claude在任务上投入的计算量。Opus 4.8默认是”高努力”,Anthropic认为这对大多数工作负载来说是最佳平衡。如果你要处理的任务比较轻量,可以调低努力级别来省钱。

    已经在哪能用

    从昨天开始,Opus 4.8已经在以下平台可用:

    • Claude API——直接给开发者和平台构建者用
    • Amazon Bedrock——集成到AWS基础设施里
    • Google Cloud Vertex AI——GCP托管AI服务中可用
    • Microsoft Foundry——通过Microsoft的AI开发平台访问

    已经在生产环境跑Opus 4.7的团队,迁移基本无感——模型标识符更新一下就行,价格没变,这也是Anthropic故意做的”升级成本中性”设计。

    下一步:Mythos级模型已经在路上

    Anthropic已经确认正在开发新一代”Mythos级”模型,会在”未来几周内”发布。目前关于架构、能力基准或定价的细节都没披露,但Opus 4.8看起来更像一个短期过渡版本,而不是一个长周期旗舰。这也延续了Anthropic在2025年和2026年加速模型更新的节奏——不再憋大招,而是快速迭代、快速铺开。

    对于每天都在跟AI编码助手打交道的开发者来说,Opus 4.8最直观的感受可能就是:它犯傻的频率低了,能独立跑的时间长了,而你需要手动介入的次数——终于开始明显减少了。


  • Google I/O 2026:Gemini 3.5发布,AI智能体全面入侵谷歌全产品线

    北京时间5月20日凌晨,谷歌I/O 2026开发者大会开幕。今年发布会的重点不是某一个单一模型或功能,而是一次系统性转向——谷歌正在把AI智能体全面”塞进”所有核心入口。

    从搜索框到Chrome浏览器,从Android手机到智能眼镜,Gemini不再只是一个对话助手,而是一个可以持续运行、跨应用执行任务的AI代理:它能替用户追踪信息、生成内容、调用工具,甚至直接完成下单和操作流程。

    Google I/O 2026
    谷歌I/O 2026大会现场(图源:新浪科技)

    Gemini 3.5 Flash:价格砍半,速度4倍

    谷歌CEO桑达尔·皮查伊在主题演讲中发布了新一代大模型系列Gemini 3.5。首发推出的Gemini 3.5 Flash定位为”迄今最强大的智能体与编程模型”,输出Token速率达到其他前沿模型的4倍,而处理智能体任务的费用不到其他前沿模型的一半

    在GDPval-AA基准(衡量现实世界具有实际经济价值的编程任务)中,Gemini 3.5 Flash取得1656 Elo评分,超过了Gemini 3.1 Pro,也超过了目前公开可查的大部分前沿模型。在Terminal-Bench 2.1(衡量AI在真实终端环境中完成复杂任务的能力)中,得分76.2%——这意味着智能体在执行真实任务时的可靠性,正在从”勉强可用”向”可以依赖”跨越。

    皮查伊在演讲中直言:”Flash的惊人之处在于,它以不到同类前沿模型一半的价格,提供了前沿级别的能力。”当一家巨头愿意用”砍半定价”来推广自己的最前沿模型时,它传达的信号不是”我在让利”,而是”我要把竞争对手挤出市场”。

    视频模型Omni与智能体编程平台Antigravity 2.0

    DeepMind首席执行官德米斯·哈萨比斯登台发布了基于谷歌世界模型技术积累的新型视频生成模型Gemini Omni。该模型可以基于多种输入生成视频,并支持对话式编辑,用户可以通过自然语言修改角色、背景和场景。首款模型Gemini Omni Flash将于今年夏季推出。

    与此同时,谷歌发布了智能体编程平台Antigravity 2.0,直接对标Anthropic的Claude Code和OpenAI的Codex。该平台被谷歌定位为面向AI Agent时代的编程工具,官方称其”毫不掩饰地以智能体为先”。使用Antigravity 2.0及其代理系统从零开始构建一个操作系统,整个过程所消耗的Token成本不到1000美元。

    个人AI助手Gemini Spark与全线产品整合

    谷歌同时发布了全天候运行的个人AI助手Gemini Spark,基于Gemini 3.5,运行在Google Cloud虚拟机上。用户可以通过Gemini应用访问Spark,即便合上笔记本电脑,Spark也可以继续工作。本周将面向受信任测试人员推出,下周面向美国Google AI Ultra订阅用户开放。

    更重要的是,谷歌宣布了全线产品的AI智能体整合计划:

    • 搜索:将推出搜索信息智能体,后台24/7运行,主动发现信息并代为执行操作;Daily Brief Agent将整合用户的邮件、日历与任务,生成个性化晨间摘要。
    • Android:2026年晚些时候推出Android Halo,为用户提供实时智能体任务追踪界面。
    • 硬件:由Gentle Monster、Warby Parker与三星合作推出的Android XR智能眼镜将于2026年秋季上市,支持语音交互和信息投射。
    • 购物:发布由AI智能体驱动的通用购物车Universal Cart,可在Google服务中使用,追踪优惠、监控价格变动、识别兼容性问题。

    规模即壁垒:1800亿美元资本支出背后的逻辑

    皮查伊在演讲中披露了一组震撼数据:谷歌每月处理的Token数量已达到3.2千万亿,同比增长7倍;Gemini App月活跃用户从4亿增长至9亿;搜索AI模式月活跃用户突破10亿

    支撑这一切的,是谷歌2026年预计1800亿至1900亿美元的资本支出。这1800多亿美元的资本支出,本质上是在做一件事:用基础设施的规模化优势,把竞争对手挤出市场。当你的TPU集群规模、Token处理量和用户基数都达到竞争对手无法匹敌的量级时,”速度4倍、价格砍半”就不再是一个促销手段,而是一个结构性壁垒。

    回到根本问题:Gemini 3.5的发布,究竟是一次真正的技术飞跃,还是一次精心包装的战略营销?答案可能是:两者都是。从技术角度看,Gemini 3.5 Flash在基准测试中的表现、推理速度的提升、以及多智能体并行架构的落地,都是真实的进步。但与此同时,这次发布真正值得关注的,不是模型本身,而是谷歌围绕模型构建的全栈壁垒:TPU 8提供算力、Gemini 3.5提供智能、Antigravity 2.0提供平台、Spark和搜索提供触达——这条链条上的每一个环节,谷歌都握有主动权。

  • 谷歌DeepMind预言:2026年AI将实现永生

    谷歌DeepMind预言:2026年AI将实现”永生”

    2026年刚开始,谷歌DeepMind研究员就抛出一颗重磅炸弹:持续学习(Continuous Learning)将在2026年取得突破性进展,AI有望实现”自我进化”,不再需要人类反复训练。这个预言如果成真,AI的发展节奏会被彻底改写。

    Google DeepMind AI Continuous Learning
    谷歌DeepMind对持续学习的技术预言 | 来源:新智元

    这个预测不是空穴来风。Jeff Dean在NeurIPS 2025的炉边谈话中就指出,当前大语言模型的核心痛点就是”缺乏持续学习”能力。2025年底,谷歌团队提出的”嵌套化方法”已经增强了LLM的上下文处理能力,实现了持续学习的雏形。


    2026年:持续学习成为AI核心节点

    Anthropic CEO Dario Amodei最近公开表示,持续学习将在2026年落地且可实用化。这个说法不是营销话术——Anthropic的工程师自曝,过去一个月对Claude Code的贡献全部由AI 100%生成代码,非技术程序员Ben Tossell四个月用Claude Code造了50个项目,全程几乎0人工干预。

    持续学习是AI自我改进、能力涌现的核心要素。实现后,模型无需通过重新训练升级,可在自编码过程中不断进化。

    OpenAI研究员Hieu Pham甚至预测,2026年AI将破解一个千禧年难题。这个预测如果成真,意味着AI的推理能力将跨越式提升,不再只是”预测下一个token”,而是真正开始”思考”。

    2030年:全自动编程触发ASI加速

    前OpenAI研究员Daniel Kokotajlo团队用自主开发的AI Futures Model做了个推演:2030年有望实现完全自动化编程,甚至有25%的概率在1年内实现向超级人工智能(ASI)的飞跃。

    这个推演的核心逻辑是:全自动编程(AC)是AGI研发进入自动化加速阶段的”开关”。一旦落地,ASI极有可能快速起飞。这个预测听起来科幻,但推演方法是有依据的——以”能力基准趋势外推”为核心方法,采用ETR的编码时间跨度套件(ETR-HRS)作为基准,推演达到AGI所需的算力与发展路径。

    AI研发自动化分为三个阶段:

    • 阶段1:自动化编程——定义自动化编程器(AC)可完全替代AGI项目的整个程序员团队
    • 阶段2:自动化研究品味——研究品味指确定研究方向、挑选实验、解读结果、提取知识的能力;该阶段预测从AC进化到超人类AI研究员(SAR)的时间
    • 阶段3:智能爆炸——追踪三个里程碑:超智能AI研究员(SIAR)、顶尖专家级AI(TED-AI)、超级人工智能(ASI)

    2050年:诺奖级科研的主力军

    《自然》(Nature)杂志展望:到2050年,AI系统或将成为”诺奖级”科学研究的主力军。这个预测不是瞎猜——《超级智能:路径、危险与策略》作者Nick Bostrom预计AGI将在2050年前后出现,可回答当前大部分原则上可由科学解答的问题。

    伦敦研究与前瞻公司Outsmart Insight联创Alex Ayad提出了一个”黑灯实验室”场景:由AI算法驱动的自主系统结合机器人实验员,可24小时不间断攻克生物技术难题,全程无需人类在场。墨西哥国立自治大学物理学家Juan Carlos Hidalgo预测,在AI辅助下2050年核聚变能源成熟的前景”相当可期”。


    这件事为什么重要

    谷歌DeepMind这个预言的价值在于,它给出了一个明确的技术路线图:2026年持续学习落地 → 2030年全自动编程 → 2050年AI主导诺奖级科研。这个路线图如果成真,人类在科学研发中的角色会被根本性改变。

    现在下结论还太早。持续学习的技术路径还没收敛,全自动编程需要的不仅是代码生成能力,还有”研究品味”这种很难量化的能力。但方向已经清楚了:AI正在从”工具”变成”合作者”,再变成”主导者”。这个过程的节奏,可能比大部分人预期的快。

    对于开发者和企业来说,现在要问的问题不是”AI会不会替代我”,而是”我怎么在AI持续进化的环境里找到自己的位置”。这个答案,2026年可能会有第一部分线索。

  • AI智能体火了:从「聊两句」到「真的帮你干活」

    AI智能体火了:从「聊两句」到「真的帮你干活」

    如果你最近试过让AI帮你订外卖、整理文献、生成科研报告,你可能已经注意到一个变化:AI不再只是坐着和你聊天,它开始动手了。这个变化背后有一个关键词——智能体(Agent)。2026年,这个概念从实验室走到了普通用户的手机屏幕上。

    AI智能体应用场景
    AI智能体正在融入科研、电商、金融等真实工作场景(图源:新华网)

    智能体到底是什么?

    国家网信办等部门2026年5月印发的文件里给了个官方定义:智能体是具备自主感知、记忆、决策、交互与执行能力的智能系统。说人话就是——以前的AI是你问它答,现在的智能体是你告诉它一个目标,它会自己拆解任务、调用工具、执行步骤,最后把结果交给你。

    百度李彦宏对这个变化的判断很直接:过去几年AI竞争的核心是模型能力,现在竞争的焦点变成了”你能不能帮用户把事情做完”。这个判断背后有一个新的度量指标——日活智能体数(DAA),对应移动互联网时代的日活用户数(DAU)。

    衡量一个AI平台和生态是否繁荣,更应该看DAA——有多少智能体在给用户干活并交付结果。这才是AI从聊天工具向数字员工转变的真正标志。

    科研场景:从翻文献到一键出报告

    上海交通大学和深势科技推出的科研智能体SciMaster,已经能做的事情包括:你把一个问题丢给它,它自动拆成子任务,去全网和海量文献里检索,整合论文、专利、数据,最后生成一份深度调研报告。在药物研发和新材料设计领域,这类工具正在改变工作流。

    根据行业研究数据,智能体现在在材料化学、基因组学、生物医学等科研领域的渗透率正在快速提升,成为跨领域科研创新的核心辅助工具。

    电商场景:一句话下单,还会”劝退”你

    2026年5月,淘宝闪购和千问智能体完成深度打通,覆盖全国300多个城市和3000多个区县。你可以直接对智能体说”帮我点两杯奶茶,少糖,加珍珠”,它会自动识别意图、匹配商品、完成下单。

    有个有趣的细节:智能体在帮你选品时还会做出”劝退”动作。有记者测试时试图让智能体买”量子水杯”,结果被千问科普了一大通,直接劝退。这种机制其实是在用AI帮用户做理性决策,而不仅仅是被动执行指令。


    金融与教育:效率提升是实打实的

    券商研究员以前做行业研究,翻研报、读财报、搜新闻,2到3天才能出一份初稿。现在把研究主题交给智能体,它自动检索、精读财报、提炼观点,2到3小时就能输出结构化分析草稿。教育领域也是类似,文献综述这类耗时费力的活,现在智能体可以在一两天内完成过去需要几周的文献梳理工作。

    当然,智能体还不是完美的。幻觉问题、执行出错、决策跑偏,这些都是行业和用户正在共同面对的问题。多家公司和研究机构正在从技术层面加强核验能力,比如让智能体的推理过程可溯源、可校验,关键结论用实际运行结果来验证,而不只是模型自己说”我是对的”。

    政策层面也在跟上。2026年5月出台的《智能体规范应用与创新发展实施意见》,给这个正在快速爆发的行业划定了安全底线。智能体这个东西,本质上是AI从”会说话”到”能干活”的跨越,这个过程才刚刚开始。