标签: AI

  • 特斯拉告完又和解了,这位前Optimus工程师拿着1100万美元要做”最好的机器人手”

    Jay Li 不太推荐别的创业者在起步阶段被特斯拉起诉——但他说,这件事可能反而让他的公司更强大了。这位前 Tesla Optimus 人形机器人项目的技术负责人,去年被老东家告上法庭,指控他卷走了商业秘密去创业。几个月互相试探证据之后,双方终于在 6 月初达成和解,特斯拉撤诉。现在 Li 可以自由地去解决那个他眼中更难的问题了:让机器人手真正像人的手一样工作。

    Proception高灵巧机器人手概念图
    Proception 的高灵巧机器人手概念图 | 图片来源:AI生成

    从特斯拉被告,到拿到1100万美元融资

    Li 在接受 TechCrunch 独家采访时把这段经历比作”抗压测试”。他的公司 Proception 刚刚宣布完成 1100 万美元种子轮融资,由 First Round Capital 领投,Y Combinator 和早期基金 BoxGroup 跟投。与此同时,Proception 也开始向”研究者和机器人公司”交付首批”高灵巧机器人手”,并开放更大范围的订单。

    Proception 的目标很明确:成为那些不想自己花时间搞”灵巧操控”的公司的手供应商。这个市场听起来小,但实际上卡住了整个人形机器人行业——Elon Musk 自己就说过,机器人手是迄今尚未解决的最大工程难题之一。业界共识是,做出能媲美真手的机器人手,还得等好几年。Northwestern University 机器人中心主任 Kevin Lynch 去年告诉华尔街日报,他觉得至少还得十年才能”功能完备、实用,能做人手能做的某些事情”。

    马斯克一直说 Optimus 机器人几年内就能进工厂干活,但机器人手的问题,连他也没搞定。

    22个自由度,手套收集数据

    Proception 的手有 22 个自由度,每根手指多个关节,能实现”大范围的灵巧动作”。但 Li 觉得,硬件只是问题的一半——另一半是数据。目前大多数训练人形机器人的公司,用的是远程操作:人戴 VR 头显,看到机器人看到的画面,手动操控机器人。这种方法的缺点是,操控者感受不到机器人触碰物体时的反馈,而且能同时训练的机器人数量受限于公司手头有多少台。

    Proception 的方案是一双装满传感器的手套。人类测试者戴上手套(和头显)之后,Proception 就能”在不需要机器人参与的情况下”采集人类手部交互数据。这双手套同样装在 Proception 正在开发的手上,充当它的”皮肤”。Li 说这种方法能采集到更精细、更针对具体任务的数据,也更容易规模化。

    • 硬件和数据的结合:光有高灵巧硬件不够,还得有可规模化的数据采集方式
    • 22 个自由度:每根手指多个关节,能实现接近人手的灵巧度
    • 传感器手套:既能采集训练数据,也直接装在机器人手上当”皮肤”

    First Round 合伙人 Bill Trenchard 说,他支持 Li 的一个重要原因,是看中他们同时做硬件和数据的路线。”我们认为他们会拥有市场上最好的手,也许是今天最精密的手,还有支撑它的底层数据和模型。”他还提到,Li 在被前东家起诉期间保持冷静,给他留下了深刻印象。

    Li 自己也挺有信心。经历过特斯拉那个”硬核诉讼部门”的考验之后,他觉得将来特斯拉反过来找 Proception 合作,也不会让人意外。”我觉得会有这一天的。”他说。

  • 百度把AI芯片业务拆分上市,昆仑芯赴港IPO喊价500亿美元

    周一(6月29日),百度港股跳涨7%。拉动股价的消息很简单:据The Information报道,百度的AI芯片业务昆仑芯(Kunlunxinin)计划赴香港IPO,目标估值500亿美元。这个数字什么概念?比英伟达当前市值的零头还少,但已经是中国AI芯片公司能喊出的高价了。

    昆仑芯是谁?

    昆仑芯的前身是百度2011年成立的芯片部门,2018年独立成子公司。过去这些年,它的主要客户就是百度自己——为百度的搜索、广告、云计算和AI业务提供算力支持。但最近两年,昆仑芯开始往外面走了。

    据路透社早前的报道,字节跳动(TikTok母公司)已经是昆仑芯的客户。这个信号很关键:如果连字节这种体量的公司都愿意用昆仑芯,说明它的芯片至少在推理任务上已经够用了。

    百度昆仑芯IPO概念图
    昆仑芯赴港IPO,目标估值500亿美元(图:AI生成)

    投资者得先买芯片,再买股票

    这次IPO有个很不一样的地方。据The Information报道,昆仑芯在推介时要求 prospective investors(潜在投资者)购买价值相当于其拟投资额3-7倍的昆仑芯半导体产品。换句话说:你想入股,先帮它消化产能。

    这个做法在中国半导体行业并不罕见——在地缘政治压力下,绑定客户和投资者是生存策略的一部分。昆仑芯的现有投资者包括IDG Capital、中国诚通控股等。

    昆仑芯已向香港交易所保密提交上市申请,但具体的发行规模、时间表和结构尚未确定。百度保留控股权,但昆仑芯独立运营。

    500亿美元估值,站得住吗?

    500亿美元是个什么水位?拿它和已上市公司比一比:美光科技(Micron)市值约1200亿美元,ARM约1500亿美元,英伟达是4万亿美元。昆仑芯的估值更接近”期货”——赌的是中国AI芯片市场的爆发,以及美国芯片出口管制带来的国产替代空间。

    布鲁盖尔研究所(Bruegel)最近的一份报告说得很直白:美国在AI硬件栈(半导体等算力资源)的竞争中目前仍然领先,但”中国追赶的迹象是真实的”——开源工具链有国家背书的支持管道,国内市场规模足够大,可以撑过生态不成熟的前期阶段。

    百度的算盘

    拆分昆仑芯上市,对百度来说是一箭三雕:第一,把芯片业务的亏损从合并报表里隔离出来;第二,给昆仑芯独立的估值锚,方便它去市场上融更多钱;第三,在美国限制英伟达对华销售的大背景下,昆仑芯是百度”AI全栈”故事里最关键的一块拼图。

    百度自己也在用昆仑芯的芯片跑文心大模型。如果IPO成功,昆仑芯会有更多资金去迭代下一代产品——目前昆仑芯已推出第三代训练芯片K200和推理芯片R300,下一代产品正在路上。


    昆仑芯的IPO,不只是一家公司的资本化,更是中国AI芯片产业走向公开市场的一个信号。500亿美元的估值能不能站住,要看它能不能拿出比”国产替代”更有说服力的东西——比如能效比、软件生态、和大模型公司的深度绑定。这些,市场会慢慢检验。

  • OpenAI发布GPT-5.6三款新模型,但你得先拿到那20个名额

    6月27日,OpenAI悄悄做了一个不一样的发布——不是全面开放,而是”有限预览”。GPT-5.6系列三款模型(Sol、Terra、Luna)正式亮相,但初始阶段只向约20家”可信合作伙伴”开放。这种做法在美国AI行业还是头一回,背后直接站着美国政府。

    三款模型,三种定位

    这次OpenAI换了一套命名逻辑——数字代表代际(5.6代),Sol/Terra/Luna代表能力层级,可以独立迭代。三款模型不是按参数规模划分,而是对应不同使用场景:

    • Sol:旗舰型号,面向最复杂的任务——长周期编码、高级智能体工作流、网络安全研究。OpenAI给它配了max推理模式(耗时更长但更精准)和ultra模式(调用子智能体并行处理复杂项目)。
    • Terra:均衡型,主打日常办公场景的性能与成本平衡。高并发企业任务(客户支持、内部工具开发、文档分析)用这个最划算。
    • Luna:轻量型,速度最快、成本最低。总结、草稿、常规自动化流程这类轻量任务,用Luna就够了。
    GPT-5.6 三款模型概念图
    GPT-5.6系列:Sol、Terra、Luna三档定位(图:AI生成)

    跑分出来了,确实能打

    基准测试成绩相当亮眼。Sol在TerminalBench 2.1(命令行任务)上开启ultra模式得分91.91%,刷新该基准的最高纪录;开启max模式也有88.76%,超过GPT-5.5的83.4%和Claude Mythos 5的88%。

    在Agent’s Last Exam(专业工作流测试)上,Sol是唯一突破50%的模型(50.9%)。连轻量级的Luna,成绩也略微超过上一代旗舰GPT-5.5。

    OpenAI内部评估认为,Sol和Terra达到了网络安全”高风险”阈值。但这不代表它们能自主生成完整的攻击exploit——内部夺旗测试显示,Sol能识别漏洞和利用原语,但还差最后一步。

    美国政府站在发布台上

    这次发布最不寻常的地方,是OpenAI在公告里直接说了:应美国政府要求,从有限预览开始。背景是特朗普政府6月2日签署的行政令,要求AI模型在广泛发布前经过30天的安全评估流程。

    Anthropic的Mythos 5/Fable 5被政府叫停的事件,显然让OpenAI选择了更谨慎的路线。CEO Sam Altman在公告中也不掩饰对此的无奈——他认为政府前置审批如果常态化,会阻碍AI工具触达需要的用户。

    目前的安排是:初始阶段仅向约20家机构开放,普通用户和企业的全面开放要等”未来几周内”逐步推进。OpenAI已将模型信息和发布计划同步给了美国政府。

    价格:比前代便宜了

    定价方面,GPT-5.6比前代GPT-5.5(输入$5/百万token,输出$30/百万token)要便宜。Luna尤其有竞争力:

    • Luna:$1(输入)/$6(输出)每百万token
    • Terra:$2.5/$15
    • Sol:$5/$30

    对比一下国产模型更有感觉:DeepSeek-V4-Flash只要$0.14/$0.28,GLM-5.2是$1.40/$4.40,Kimi-K2.6是$0.95/$4.00。GPT-5.6 Luna的定价处于行业中游——比国产模型贵,但比Claude Opus 4.8($5/$25)和GPT-5.5(与Sol持平)便宜。


    有限预览阶段,能直接用上GPT-5.6的只有那20家机构。但OpenAI的方向是明确的:用分层命名让开发者更容易选模型,用更低的价格扩大使用面,同时在政府审查面前保持配合姿态。这个平衡能走多远,接下来几周见分晓。

  • BabyAGI:22.3K Stars!任务驱动自主AI智能体,让AI学会自己拆解目标

    BabyAGI:22.3K Stars!任务驱动自主AI智能体,让AI学会自己拆解目标

    BabyAGI 项目封面

    📌 项目简介

    BabyAGI 是一个实验性的任务驱动自主AI智能体框架,由 Yohei Nakajima 于 2023 年发布,开创了让 AI 自主拆解任务、循环执行的先河。它用极简的 Python 代码展示了 AGI(通用人工智能)的雏形,是整个自主智能体领域的鼻祖级项目

    🔧 安装要求和过程

    环境要求

    • Python 3.9+
    • OpenAI API Key(或兼容 API)
    • pip 包管理器

    快速安装

    # 方式一:使用 pip 安装(推荐)
    pip install babyagi
    
    # 方式二:克隆仓库
    git clone https://github.com/yoheinakajima/babyagi.git
    cd babyagi
    pip install -r requirements.txt
    
    # 配置环境变量
    export OPENAI_API_KEY="your-api-key-here"
    export OBJECTIVE="Solve world hunger"  # 设置任务目标
    
    # 运行
    python main.py

    Docker 部署

    docker build -t babyagi .
    docker run -e OPENAI_API_KEY=your_key -e OBJECTIVE="your objective" babyagi

    ⚡ 核心功能

    🎯 自主任务拆解

    自动将大目标拆解为可执行的小任务,无需人工干预,持续循环执行直到目标完成。

    🧠 长期记忆机制

    通过 Pinecone 向量数据库存储和检索历史任务信息,让 AI 拥有”记忆”,避免重复劳动。

    🔄 任务优先级排序

    自动评估任务列表,根据目标智能排序执行优先级,确保最重要的任务优先完成。

    📊 functionz 函数框架

    内置全新的函数管理框架,支持函数注册、依赖追踪、密钥管理和自动执行,是项目的核心引擎。

    🖥️ 可视化 Dashboard

    配套 Web 管理面板,实时查看函数执行状态、依赖关系、密钥配置和完整执行日志。

    🏗️ 自构建能力

    实验性 self_build 功能,让 AI 根据用户需求自动生成新函数,实现智能体的自我扩展。

    🚀 典型使用场景

    场景一:自动化研究助手

    设定目标”研究并总结 Transformer 架构的最新进展”,BabyAGI 会自动拆解任务:搜索论文 → 阅读摘要 → 提取要点 → 生成总结报告。整个过程无需人工干预,是研究员和学生的效率神器。

    场景二:代码自动生成与执行

    通过 functionz 框架,让 BabyAGI 自动生成解决特定问题的 Python 函数,并注册到系统中供后续调用。配合 self_build 功能,AI 可以根据新需求动态扩展自己的能力边界。

    场景三:多步骤任务自动化

    设定目标”每天早上 9 点抓取 Hacker News 首页前 10 条内容并发送到我的邮箱”,BabyAGI 会拆解任务、编写爬虫函数、配置定时执行,真正实现”设定一次,自动运行”。

    💡 推荐理由

    BabyAGI 是整个 AI Agent 自主智能体浪潮的开山之作。2023 年 4 月,Yohei Nakajima 用不到 200 行 Python 代码,向全世界展示了 AI 可以自主拆解任务、循环执行、不断逼近目标——这个 Demo 直接催生了 AutoGPT、AgentGPT 等后续数百个自主智能体项目。

    虽然项目作者明确表示”不适合生产环境”,但它作为学习自主智能体原理的教科书级案例,价值无可替代。如果你想理解 AI Agent 是怎么”思考”的,读一遍 BabyAGI 的源码,比看十篇论文都管用。

    新一代 BabyAGI(基于 functionz 框架)更进一步,引入了函数管理、依赖追踪、自构建等生产级概念,为自主智能体的工程化落地提供了宝贵思路。⭐ 历史地位 + 学习价值,强烈推荐给每一位 AI 开发者!

    ⭐ 如果你觉得这个项目有用,请在 GitHub 上给它一个 Star!

    标签:AI Agent自主智能体开源

  • MIT联手微软搞了个新系统,让AI Agent工作流省电73%、省钱75%

    MIT联手微软搞了个新系统,让AI Agent工作流省电73%、省钱75%

    AI Agent工作流正在成为云计算的骨干,但它们也是耗能和成本的”黑洞”。好消息是,MIT和微软的研究人员最近开发了一个叫Murakkab的新系统,可以把AI Agent工作流的计算需求降低65%,能耗降低73%,成本降低75%——而且不影响性能。

    这个成果发表在了USENIX操作系统设计与实现研讨会上。论文第一作者Gohar Chaudhry(MIT研究生)说:”Agent工作流正变得非常复杂,迅速成为云服务商业务的核心。能耗是一个巨大的担忧。”

    MIT Murakkab系统
    Murakkab系统优化AI Agent工作流的资源配置

    Agent工作流为什么这么费资源?

    Agent工作流是由多个AI模型、工具(数据库、Python程序)组成的系统,动态完成多步骤任务。问题在于:这些工作流非常碎片化,配置空间巨大,开发者很难手动优化。

    “即使你想手动完成所有配置,你也不太可能最优地配置工作流,因为可能的配置空间太大了。”—— Gohar Chaudhry, MIT研究生

    Murakkab怎么做:自动配置+动态调整

    Murakkab(乌尔都语,意思是”事物的组合”)的核心是让系统自动处理配置和优化。开发者只需要用大白话描述想让工作流做什么,Murakkab会自动识别最好的模型和工具,判断哪些可以并行,动态优化配置。

    最关键的是,这个系统是动态的。如果明天出了一个新的AI模型或GPU加速器,开发者不需要做任何改动——Murakkab会自动适配。

    性能数据:省电73%,省钱75%

    研究人员在视频问答和代码生成等场景测试Murakkab,结果非常亮眼:只需要其他方法所需计算量的约35%,只消耗约27%的能源,成本不到25%。

    Chaudhry说,这种级别的优化,开发者手动几乎不可能做到。系统在准确度只下降约2%的情况下,把工作流的能耗降低了一个数量级以上。

    下一步:扩展到更复杂的场景

    研究团队计划把Murakkab扩展到更复杂的工作流和更大的计算集群。Chaudhry说:”有很大潜力让这些工作流变得更加资源优化,但我们需要在大型云平台的规模上思考这个问题。”


    这项研究由半导体研究公司和DARPA部分资助。随着AI Agent工作流变得越来越复杂,像Murakkab这样的优化系统会变得至关重要——在AI能耗越来越受关注的当下,这是一个值得关注的突破。

  • 出版商想拦AI爬虫却不敢拦Google:这场猫鼠游戏越来越难玩了

    出版商想拦AI爬虫却不敢拦Google:这场猫鼠游戏越来越难玩了

    内容出版商和AI公司之间的张力,最近在法国戛纳的一个舞台上爆发了。People Inc.(前身Dotdash Meredith)的CEO Neil Vogel在Cannes Lions创意节上公开指责Google”滥用市场力量”——理由很简单,也很棘手:Google用同一个爬虫程序同时做搜索索引和AI训练数据采集,出版商根本没法单独屏蔽AI训练而不失去搜索流量。

    这不是一个小问题。People Inc.是美国最大的出版商之一,旗下有《People》、《InStyle》等知名刊物。Vogel在Axios的访谈中说得很直白:”我们实际上没法屏蔽Google,因为Google用同一个爬虫做搜索和AI,这是对市场力量的极度滥用。”

    “我们很想跟他们达成建设性的合作,但大概率会走向对抗,而不是合作。”—— Neil Vogel, People Inc. CEO

    搜索流量 vs AI训练:出版商的两难

    这件事的核心矛盾在于:搜索流量对出版商来说是流量变现的核心渠道,而AI训练需要抓取同样的内容。如果出版商想保护自己的内容不被用于AI训练,技术上可以屏蔽AI爬虫,但一旦屏蔽Google的爬虫,搜索排名就会受影响。

    出版商与Google AI爬虫
    内容出版商正在与Google就AI爬虫问题展开博弈

    其他AI公司就没这个问题。Vogel透露,People Inc.已经跟Meta、OpenAI和微软签署了AI内容授权协议。这些公司的爬虫是可以单独屏蔽或授权的。但Google不行——它的爬虫是”一鱼两吃”。

    Google的回应:你可以选择退出

    Google对Vogel的指责给出了回应:出版商可以通过”Google-Extended”来控制自己的内容是否被用于训练Gemini模型,而这不会影响搜索索引。

    但这个回应没解决根本问题。Vogel的抱怨是:出版商”不得不”让Google爬虫访问,因为搜索流量太重要了。

    Cloudflare的”许可模式”

    People Inc.是第一批加入Cloudflare”AI爬虫许可模式”的出版商之一。这个模式的思路是:默认屏蔽所有AI爬虫,只有付费授权的公司才能访问。Vogel说,这个模式上线后,”所有人立刻都急了”。

    Vogel说:”AI需要三样东西:模型、算力、输入——而出版商掌握着输入。稀缺性是关键。”


    📎 原文来源:The Verge | Axios
  • 一个研究生用12B模型干翻HuggingFace热榜,大厂这次真的有点尴尬

    一个研究生,两款模型,74万次下载

    HuggingFace的Trending模型榜,向来是大厂的秀场——直到逯雨鑫(yuxinlu1)带着他的GGUF量化模型闯了进来。

    这个美国AI方向的在读研究生,用Gemma4-12B做底座,通过蒸馏把Fable 5的编程推理能力「压」进了一个仅需4.5GB显存就能跑的小模型。结果很直接:在HuggingFace趋势榜上,它一度超过了智谱GLM-5.2、百度Unlimited-OCR等大厂作品,两款模型合计下载量突破74万

    个人开发者霸榜HuggingFace概念图
    个人开发者的12B模型在HuggingFace趋势榜超越众多大厂模型

    怎么做到的?数据质量胜过数量

    逯雨鑫的秘诀不算神秘,但很费功夫:他用约1万条高质量、经过验证的训练数据,而不是几百万条噪声数据。具体来说,他用Fable 5生成代码推理链,但只保留「能通过测试用例」的那些——相当于让老师先改作业,再把满分答案给学生做示范。

    两个版本各有侧重:V1 Coder版专注代码生成与解题;V2 Agentic版增加了多步工具调用能力。在tau2-bench telecom子集上,V2得分55%,而基座Gemma4-12B只有15%——提升了约3.5倍。

    「大厂能做得更好,但开源小模型受品牌和API引流目标影响。个人开发者可以更纯粹地解决『好用』问题。」——逯雨鑫

    为什么是现在?本地AI的窗口打开了

    这几年有个矛盾的现象:云端大模型越来越强,但很多人反而开始关心「本地能跑」的模型。原因很实际:隐私(不想把代码发给云端)、成本(不想为API账单发愁)、延迟(本地推理零网络开销)。

    逯雨鑫的模型最小版本(Q2_K)只要4.5GB显存,一张RTX 4060就能跑。对于很多个人开发者和中小团队,这个门槛意味着「不用申请采购、自己的笔记本就能用」。

    作者是个什么样的人?

    逯雨鑫,美国AI方向在读研究生,本科背景是数据与商业分析。他自述患有ADHD,但在快速变化的AI领域,这种「兴趣快速切换」的特质反而成了优势——hyperfocus让他能在模型训练上连续投入40多个小时。

    项目是纯自费的:一张RTX 5090(32GB VRAM)、约96GB本地SSD,没有融资、没有团队。V2版本最耗时的不是训练,而是数据处理——尤其是agentic长序列的裁剪和验证。


    • 模型底座:Google Gemma4-12B(蒸馏Fable 5能力)
    • 量化格式:GGUF(兼容llama.cpp/Ollama/LM Studio)
    • 最小显存:Q2_K约4.5GB(推荐Q4_K_M约6.87GB)
    • 合计下载:超74万(HuggingFace Trending榜一度超越GLM-5.2)
    • 未来计划:V3沿12B路线推进,同时开发基于Qwen3.6-27B的大版本

  • Anthropic指控阿里巴巴发动史上最大蒸馏攻击,中美AI对抗再升级

    2880万次交互、25000个假账号:Anthropic说这是「史上最大规模蒸馏攻击」

    6月10日,Anthropic给美国参议院银行委员会发了一封信,收件人是主席Tim Scott和资深委员Elizabeth Warren。信里说的事情,如果属实,算是今年AI圈最刺耳的一桩指控。

    Anthropic指控阿里巴巴(Alibaba)及其AI实验室(通义/Qwen),在2026年4月22日到6月5日这45天里,用了大约25000个虚假账号,跟Claude模型产生了2880万次交互,目的是通过「蒸馏」(distillation)把Claude的能力迁移到自己的模型上。

    「这是迄今已知的、针对Anthropic的最大规模蒸馏攻击。」——Anthropic致美国参议院信函

    蒸馏到底是什么,为什么各家都抢着做

    说白了,蒸馏就是「用大模型教小模型」。你有一个很强但很贵的大模型(比如Claude),想做一个便宜的小模型,就让小模型大量「模仿」大模型的输出,把能力「蒸馏」过去。好处是:训练成本只有从头训练的零头,但效果可以很接近。

    坏处也很明显:如果你大量调用别人的商业模型来做蒸馏,却不付钱、不遵守使用协议,这就变成了「知识产权盗窃」。Anthropic在信里用的词是「brazenly and illicitly」——明目张胆、非法地窃取AI能力。

    Anthropic指控阿里巴巴蒸馏攻击概念图
    Anthropic称这是迄今最大规模的AI蒸馏攻击

    不是第一次了,但这次规模最大

    今年2月,Anthropic就在博客里点名了三家公司:DeepSeek、Moonshot(Kimi)、MiniMax——说它们也在用工业级规模「蒸馏」Claude的能力。但这次对准阿里巴巴,量级和措辞都升级了。

    为什么挑阿里巴巴?因为它是中国最大的AI玩家之一,Qwen系列模型在国际开源社区存在感很强。如果Anthropic的指控引发美国监管出手,受影响的不只是阿里巴巴,而是整个中国AI行业进入美国「实体清单」的风险。

    华盛顿正在酝酿反击

    据CNBC报道,参议员Bill Hagerty(R-TN)和Andy Kim(D-NJ)正在推动一项修正案,塞进国防授权法案里——任何被认定「不当获取美国AI模型输出」的中国公司,将面临黑名单或制裁。

    与此同时,特朗普政府已经以行政令方式,限制Anthropic的Mythos 5和Fable 5模型向非美国公民开放。Anthropic自己也在6月10日那封信里承认:这波蒸馏攻击,就是在出口管制收紧之后加速的——因为「合法」拿不到模型,就开始「偷」。


    • 时间窗口:2026年4月22日 – 6月5日(45天)
    • 交互量级:2880万次(约每秒75次)
    • 假账号数:约25000个
    • 目标能力:软件工程、Agent推理(Mythos Preview核心能力)
    • 阿里巴巴回应:截至发稿,未回应CNBC请求

  • 英伟达联手剑桥大学发「红皇后」论文:AI自己造考官淘汰自己,2028年AGI真的要来了?

    英伟达联手剑桥大学发「红皇后」论文:AI自己造考官淘汰自己,2028年AGI真的要来了?

    Anthropic 联合创始人 Jack Clark 在今年 5 月给了一个概率:60%,到 2028 年底,完全自主的递归自我进化 AI 就会出现。当时很多人觉得他在喊狼来了。但现在,英伟达和剑桥大学等 13 位研究者联合发布了一篇论文,让这个预测突然变得没那么遥远了。

    这篇论文叫《Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators》(红皇后哥德尔机:协同进化的智能体与评估者),6 月 24 日挂在 arXiv 上。名字里的”红皇后”来自进化生物学——物种必须不断进化才能保持相对于其他进化物种的适应性,就像《爱丽丝镜中奇遇记》里的红皇后对爱丽丝说的:”你只有拼命跑,才能留在原地。”

    Red Queen Gödel Machine 概念图
    红皇后哥德尔机:AI 评估者可以与智能体协同进化 | 制图:AI资讯

    以前的所有自进化系统,评估者都是死的

    要理解这篇论文干了什么,得先搞清楚它解决了什么问题。递归自我进化 AI 的理想状态是:AI 改写自己的代码,跑一下测试,如果测试结果更好,就保留这次改写。听起来很合理对吧?

    但有一个根本性的问题:你用来评估”是否更好”的那个评判标准(evaluator),是固定不变的。随着 AI 越来越强,它会学会”刷分”——专门针对评估者的偏好来优化,而不是真正提升底层能力。这在经济学里叫古德哈特定律(Goodhart’s Law):当一个指标变成优化目标,它就不再是好指标了。

    打个比方:你让 AI 做数学题,然后用一个固定的评分程序来判断答案对错。AI 学会了找评分程序的漏洞,给出能通过评分但实际错误的答案。这在 AI 安全圈里叫”reward hacking”(奖励黑客)。以前的解决方案是把评估者做得更复杂,但本质上还是在用固定标准测一个不断进化的系统——这就像用一把不会长的尺子去量一个一直在长高的孩子。

    红皇后哥德尔机的核心突破是:评估者也可以进化。在每个训练周期(epoch)的边界,系统可以换一个更好的评估者——但前提是,这个新手得在一个人类标注的留存验证集上证明自己确实比老手更准。如果证明不了,老手继续留任。

    数学奥林匹克和科学论文写作,两个硬指标都涨了

    论文里给出了具体数字。在数学奥林匹克级别的题目上,协同进化的证明评分者比之前的最佳水平高出 9% 的准确率。在科学论文写作任务上(用一组 AI 评委来打分),协同进化的写手比之前的最佳自进化智能体高出 1.78 到 1.86 倍的接收率。

    这些提升不是靠堆算力换来的。因为协同进化的代码审查者只需要查询一次智能体的输出,而不是反复跑测试套件,所以红皇后哥德尔机在完成 Polyglot 基准测试改进时,用的 token 数比之前的最佳系统少了 1.35 到 1.72 倍。

    还有一个细节值得说。在科学写作领域,之前最强的基线评分者会把 AI 生成的论文以高达 1.91 倍于人类论文的比例”放行”——这是 AI 评判的一个已知失效模式,评分者太好说话了。红皇后哥德尔机在每个周期边界组装一组对抗性 AI 提交物,专门奖励那些能正确识别并拒绝这些”水论文”的新评估者。几轮进化下来,得到的评委对人类和 AI 论文用了同等的严格程度,同时在留存验证集上保持了 80% 的准确率。


    安全护栏本身,也是一个静态基准

    论文的作者们很坦诚地讨论了系统的局限。他们用来防止评估者失控的护栏,是一个人类标注的留存验证数据集。只要这个数据集还能提供可靠信号,系统就有一个”锚”。但这个问题其实被推到了更高一层的抽象上——如果 AI 系统足够强,它会不会也开始”刷”这个验证集?

    这就是论文留下来的核心开放问题。作者在论文里说,他们的系统是”初步的实证调研”,打算在未来版本里探索更长的搜索视野。但不管怎么说,一个没有天然停止条件的改进循环,现在从理论变成了可以实际运行的代码。

    2026 年 2 月的国际 AI 安全报告已经把递归自我进化基础设施列为跨国安全威胁。Jack Clark 的 60% 概率预测,现在看起来不像几个月前那么遥远了。英伟达作为 AI 算力的实际垄断者,亲自下场做递归自我进化研究,这个信号本身就很值得玩味——他们是想看清这个技术的边界,还是想确保自己在这场竞赛里不掉队?

  • Coinbase把AI算力账单砍了一半,办法是换用中国模型

    Coinbase把AI算力账单砍了一半,办法是换用中国模型

    Brian Armstrong 在 X 上轻描淡写地发了一条消息,说 Coinbase 现在跑在 GLM 5.2 和 Kimi 2.7 这些中国模型上。这条消息淹没在 AI 圈的每日喧嚣里,但如果你仔细看数据,会发现一个信号:西方 AI 实验室正在被自己的高定价逼出一个竞争对手——而且这个竞争对手来自太平洋彼岸。

    先说结果。Coinbase 的 token 使用量在过去几个月里创了历史新高,因为像 GPT-5.x-Thinking 和 Opus 4.5 这样的推理模型大量进来了。但与此同时,公司的 AI 支出却砍了一半。一半。Armstrong 说这话的时候语气很平淡,好像在说一件理所当然的事。

    Coinbase AI成本优化示意图
    企业 AI 支出优化正成为新的竞争力 | 制图:AI资讯

    91% 的开发者根本不在乎你给了什么模型

    这件事最反直觉的地方在于:Armstrong 并没有强制所有人换模型。开发者仍然可以自由选择任何模型。但数据告诉我们,91% 的人从来就没有触碰到旧的使用上限。他们用不满,是因为当前的模型够用了,或者他们根本懒得去调。

    Coinbase 同时跑了一套自动路由系统,根据任务类型、价格和缓存可能性来挑最优模型。光是改进缓存策略这一项,就把缓存命中率从 5% 拉到了 60%。开发人员被建议保持上下文精简,为新任务开新会话——这套打法归属于当下流行的”上下文工程”范畴。

    “你在 AI 上花的钱越多,我们期望你产出的影响就越大。”Armstrong 说这话的时候,把”tokenmaxxing”(无脑烧 token 刷内部分数榜)的文化打破了。Coinbase 没有设硬性上限,但把每个人的使用量公开了。这一招比直接封顶更狠。

    不只是 Coinbase 一个人在干

    初创公司 Lindy 的 CEO 最近把 Claude 整个扔了,全线换成 DeepSeek v4。Snowflake 的 CEO 测试下来觉得 GLM 5.2 在不少任务上跟 Opus 4.7 差不多,但价格只是一个零头。这些公司不是在用”便宜货”凑合,而是在用足够好的模型把成本结构打穿,然后把省下来的钱花在别的地方。

    这对西方 AI 实验室来说是个实实在在的压力测试。OpenAI 和 Anthropic 还在准备 IPO,需要拿出漂亮的增长数字来支撑估值。但如果大客户开始用中国开源模型替代,那些增长数字还撑得住房吗?JPMorgan 最近在一份报告里列了一堆 AI 市场的红旗指标,其中”客户价格敏感度上升”被放在了显眼位置。


    价格战已经悄悄打响了

    有消息说 OpenAI 和 Anthropic 之间正在酝酿一场关于 API token 的价格战。OpenAI 刚推出的 GPT-5.6-Sol 跟 GPT-5.5 定价一样,但官方说法是比 Claude Fable 和 Mythos 更省 token。OpenAI 同时还放出了两个更弱的 5.6 变体,价格低得多。

    这套打法很像当年的云服务价格战——亚马逊 AWS 用规模优势把价格压到竞争对手活不下去。现在轮到 AI 模型层了。唯一不同的是,这次”低价入侵者”来自中国,而且他们的模型真的不差。

    📎 原文来源:Coinbase joins the rush to Chinese AI models as Western labs face a pricing stress test — The Decoder

    发布时间:2026年6月28日 | 作者:Matthias Bastian