标签: AI技术

  • 把 AI 叫成「同事」,人类反而更易犯错:一份 1261 人的研究给硅谷泼冷水

    把 AI 叫成「同事」,人类反而更易犯错:一份 1261 人的研究给硅谷泼冷水

    人类与被称为员工的AI智能体
    当 AI 被冠上「员工」头衔,人的责任感也在悄悄转移(配图:AI 生成)

    硅谷正热衷于把 AI 智能体包装成「数字员工」:给它起名字、发工牌、塞进组织架构图,仿佛它真能和人类并肩干活。但《麻省理工科技评论》援引波士顿大学的一项研究,给这股热潮泼了盆冷水——一旦把 AI 当同事,人的表现反而更差。

    一个名字改变了人的行为

    研究让 1261 名管理者审阅同一份 AI 生成的产出,随机分成三组:一组被告知来自无名工具,一组来自人类同事「Alex」,一组来自 AI 同事「Alex-3」。结果很刺眼——拿到「AI 员工」版本的人,抓出的错误比另一组少了 18%,还多出 44% 把问题甩给上级复核。本想靠 AI 省时间,反而凭空多出一层审批。

    「AI 智能体现在被当成能替代人的东西来营销,这是条走不通的路。」——2024 年诺奖得主、MIT 经济学家 Daron Acemoglu

    责任被悄悄转移

    当 AI 被叫「员工」,人更少把自己当成产出的责任人。这个苗头放到医疗、教育、政务里就危险了——它很容易变成甩锅的方便借口,真出事时大家第一反应是「是 Alex 犯的错」。Acemoglu 的观点是,智能体该被设计成增强人的能力,而不是替代人。

    工人真正想要的,其实不是这些

    斯坦福另一项研究问了 1500 名劳动者:技术专家觉得最该交给 AI 的任务(比如替销售核对客户信用),恰恰是工人最不想要的;他们想要的是辅助自己判断,而不是替自己拿主意。叫它「同事」很简单,也方便出事时推卸,但那只是一层品牌包装,并不会让工具本身更胜任。

    • 近三分之一受访管理者表示,公司已经把 AI 智能体当成「员工」,23% 甚至写进了组织架构图。
    • 微软、OpenAI、Anthropic、谷歌自 4 月起密集推出「数字同事」式 agent 管理工具。
    • 研究提醒:拟人化叙事侵蚀的是人的审查质量,这是治理风险,不是修辞问题。

  • 估值冲上10亿美元:Prime Intellect 想让每家企业都拥有自己的「AI实验室」

    估值冲上10亿美元:Prime Intellect 想让每家企业都拥有自己的「AI实验室」

    Prime Intellect 团队与算力集群
    Prime Intellect 把「AI 实验室」能力打包成企业可用的全栈平台(图源:TechCrunch)

    一家叫 Prime Intellect 的创业公司刚完成 1.3 亿美元 A 轮融资,估值一口气冲到 10 亿美元。它做的事有点反常识:别人都在帮你更好地用 OpenAI、Anthropic,它却想帮你彻底甩开这些前沿实验室,自己动手造 AI 智能体。

    从「租模型」到「自己造」

    过去企业想上 AI,基本只有一条路:去大厂的 API 里租现成模型。Prime Intellect 给出的是一套「全栈」——算力、强化学习框架、评估工具打包在一起,又像超市货架一样可以挑着用,不用担心被某个厂商绑死。创始人 2024 年才起步,看准的是强化学习这条技术路线:模型靠奖励和惩罚反复打磨,企业就能针对自己的业务训练专属智能体,相当于把「AI 实验室」搬回了公司内部。

    企业为什么突然想自己掌控

    动力很现实。把专有数据交给别人,企业怕的是失去控制权;更怕依赖的模型说关就关——Anthropic 的 Fable 项目上个月突然停摆,就是一记警钟。CEO Vincent Weisser 说得很直白:不该只有旧金山那几栋玻璃大楼里的人有能力训练模型,每家企业、每个国家都该有。

    「不该只是旧金山玻璃塔里那几个极客才有训练 AI 的能力,应该是每家企业、每个国家都行。」

    钱和数据主权一起到账

    这套打法已经有人买单。金融科技公司 Ramp 用它的平台做了个查表格的 agent,准确率压过前沿模型,速度更快,成本却只有零头。Zapier 也在客户名单里。快速起量把公司年化收入推到了 1 亿美元。领投方 Radical Ventures 的评价是:别人只给零件,Prime Intellect 给的是顶级 AI 实验室才有的「一站式」能力,而且价格企业扛得住。

    • 本轮由 Radical Ventures 领投,英伟达、英特尔、戴尔的战投悉数入局,还有 Perplexity 创始人等多位明星创业者个人跟投。
    • 平台走模块化路线,客户按需取用,不必一次性押上全部预算。
    • 背后是大公司在 AI 主权上的集体焦虑:数据要握在自己手里,供应链不能卡在别人手上。

  • 一封“哈哈”邮件点燃世纪诉讼:苹果把 OpenAI 告上法庭

    一封内部邮件里写了句“哈哈,我发现我能访问[网络存储],太逗了”,最后把两家公司送上了法庭。上周五,苹果在加州北区联邦法院正式起诉 OpenAI,指控对方系统性窃取苹果硬件商业机密。

    41 页诉状里最刺眼的几句话

    苹果这次不是只点名几个“野路子员工”,而是把矛头直接指向 OpenAI 的领导层。诉状里写,这种偷机密的行为“被领导层常态化并树立为榜样”,还甩出一句狠话:OpenAI 刚起步的硬件业务“从根上就烂了,靠偷来的商业秘密撑着”。

    “这只是冰山一角。苹果看不到 OpenAI 大门背后发生了什么,而那里头的违规行为,是被领导层当成常态来示范的。”——苹果诉状原文

    苹果 CEO 与 OpenAI CEO 同框配图
    苹果与 OpenAI 的关系正滑向破裂(图:Getty Images)

    从苹果带走的,不止经验

    被重点点名的有两个人。一个是 Tang Tan,在苹果干了 24 年,做到 iPhone 和 Apple Watch 的产品设计副总裁,跳槽后成了 OpenAI 的硬件负责人。苹果说他拿内部项目代号去挖人,还让去面试的候选人把苹果真机零件、原型机搬去 OpenAI 做“展示讲解”——有候选人当场愣住:“我都不知道办公室的东西能往外带。”

    另一个叫 Chang Liu,做了 8 年高级系统电气工程师,离职时没交还公司发的笔记本,转头用上面存的一个认证漏洞下了一堆机密文档。他在发给前同事的邮件里得意地写:“哈哈,我发现能访问[网络存储],太逗了。”对方回:“我准备好了。”几个月后,这位前同事也去了 OpenAI。

    • 苹果称目前已发现 400 多名前苹果员工在 OpenAI 工作
    • 指控 OpenAI 连专属的金属表面处理工艺都拿来用在了自家硬件上
    • 苹果今年 2 月就曾去信交涉,对方一直没回

    真正怕的,是对手的硬件

    这场官司的背景很清楚:OpenAI 正在秘密打造自己的第一款硬件,传闻是一部靠 AI 智能体替代 App 的手机,而它去年花 65 亿美元收购了 Jony Ive 的设计公司 io。这东西一旦成型,就是 iPhone 诞生以来对苹果核心业务最大的威胁。OpenAI 的回应很简短:“我们对别的公司的商业秘密没兴趣。”

  • 马斯克又放卫星:Grok 4.5 自称 Opus 级,价格却砍到零头

    SpaceXAI 上市后交出的第一张答卷,就是 Grok 4.5。马斯克在 X 上把它称作“Opus 级模型”——也就是能跟 Anthropic 最硬的 Opus 系列掰手腕,但他紧接着补了一句:更快、更省 token、还更便宜。

    一张为“干活”而生的模型

    SpaceXAI 在周三的博客里把 Grok 4.5 定位成“干活主力”:写代码、搭应用、处理办公室杂活、做研究、写文档,这些行业里最想甩出去的重复脑力活它都想接。跟 Cursor 联合训练是这次的关键——数万名工程师在 Cursor 上的真实操作数据被喂进了模型,专门补上 Grok 过去在编程这块最空的短板。

    “我们的内部评估是,Grok 4.5 大致相当于 Opus 4.7,但快得多。能力、速度、低成本三者加在一起,才是它的竞争力。”——马斯克

    SpaceXAI 发布的 Grok 4.5 模型配图
    Grok 4.5 是 SpaceXAI 上市后的首个大模型,主打高 token 效率(图:Getty Images)

    真正的卖点不是跑分,是账单

    SpaceXAI 说 Grok 4.5 的 token 效率是其他头部模型的两倍。落到价格上就很直白了:输入每百万 token 2 美元,输出 6 美元。对比一下——Opus 4.7 是 5 美元和 25 美元,OpenAI 最贵的 Sol 档是 5 美元和 30 美元。换句话说,干同样的活,花的可能只有别人的零头。

    • 跑分没冲到全场第一,但在 SWE Bench Pro 上用到的输出 token 大约只有 Opus 4.8 的四分之一
    • 服务速度约 80 TPS,马斯克预告下周上下文窗口会拉到 100 万
    • 训练跑在数万块英伟达 GB300 上,和 Cursor 的数据飞轮一起转

    选在 GPT-5.6 前一天亮牌

    这周本来就是大模型发布的大周。OpenAI 的 GPT-5.6 定在周四全量开放(此前因美国政府的安全审查被卡了一阵)。SpaceXAI 偏偏选在前一天把 Grok 4.5 丢出来,火药味不用多说——它赌的不是谁的分数高,而是谁能让企业少掏钱。

  • ChatGPT语音终于学会闭嘴:OpenAI GPT-Live全双工上线

    ChatGPT语音模式升级示意
    OpenAI 用 GPT-Live 重写 ChatGPT 语音模式,让它学会”边听边说”(图:The Verge)

    用过 ChatGPT 语音模式的朋友大概都经历过这种尴尬:你话才说到一半,正组织下一句,AI 突然插进来”好的,我理解你的意思是……”,而你后面那半句它压根没听见。这不是你表达有问题,是旧版语音模型的底层架构决定的——它只能等你彻底闭嘴,才轮到它开口。

    7 月 8 日,OpenAI 给这个问题从根上动了刀。新发布的 GPT-Live-1 和 GPT-Live-1 mini 两款语音模型,第一次在 ChatGPT 里实现了”全双工”:它能一边听你说话,一边组织自己的回答,你随时可以打断、插话、改口,它都接得住。

    “它终于学会闭嘴了”

    The Verge 给这篇报道起的标题特别传神——”ChatGPT 升级后的语音模式更擅长闭嘴了”。OpenAI 产品负责人 Atty Eleti 在发布会上解释:”这是一个全双工模型,意味着它可以同时说话和听。从模型侧看,它能持续、同时地处理输入流、产出输出流。”

    OpenAI 研究负责人 Kundan Kumar 把 GPT-Live-1 称为公司”迄今最聪明的语音模型”。它会在需要推理或联网搜索时,自动把你的请求转交给 GPT-5.5 这类最强文本模型,再回头把结论用说话的方式讲给你听。

    换句话说,以前语音助手是”听写—理解—朗读”三段流水线,现在声音本身就是输入也是输出,延迟从秒级压到了毫秒级,对话节奏终于像人跟人聊天了。

    几个真实用得上的新花样

    全双工带来的不只是”不打断你”这么简单,还顺手解锁了几个挺实用的能力:

    • 实时翻译:你还在说中文,它已经同步翻成英文,不用等你停下
    • “听口令再开口”:你可以让它先闭嘴,等你喊它才接话
    • 会”嗯、对、收到”:它用这些词告诉你”我在听”,对话更自然
    • 聊天气、股票、赛事时,会顺手生成对应的图片辅助说明

    OpenAI 说,新版语音模式就是为了让人能”更长时间地 Hands-free 聊天”。产品负责人 Eleti 自己就说,他散步时跟语音助手聊过 30 到 40 分钟。看得出来,OpenAI 想让 ChatGPT 从一个”要打字的工具”,变成一个”能一直挂着的对话入口”。


    不是 AI 伴侣,也还有翻车的时候

    OpenAI 特意划了一条线:GPT-Live 不是要做”AI 伴侣”,不打算跟你谈情说爱。它内置了 safeguards,对青少年给年龄合适的回答,聊到自伤这类话题会转接专业危机热线。毕竟 OpenAI 正背着一串”ChatGPT 诱发妄想、伤害用户心理健康”的官司,安全这块不敢马虎。

    不过 demo 也不是完美。展示印地语实时翻译时,助手带着一股浓重的美式口音,印地语说得生硬又书卷气。OpenAI 承认新模型针对”大多数主流语言”做了优化,但没说清到底是哪些。这也是全双工语音要真正好用,还得跨过的一道坎。

    谁能先用上

    GPT-Live-1 已经推到 iOS、安卓和网页端。Go、Plus、Pro 订阅用户默认用更大的 GPT-Live-1,免费用户则是轻量版的 GPT-Live-1 mini。苹果和亚马逊也在把自家的语音助手往”更会接话、更懂上下文”的方向改,Sesame 这类创业公司也在做类似的事。语音这条赛道,下半年只会更挤。

    对普通用户来说,最直观的变化可能就是:以后跟 ChatGPT 打电话,它终于不会在你喘气的功夫抢话了。

  • 微软在Excel里悄悄换掉OpenAI:自研MAI接管Office

    微软总部与Office办公场景
    微软正把自研MAI模型悄悄塞进Excel和Word的AI功能里(图:Getty Images)

    过去两年,微软给外界的印象一直是”OpenAI 最铁的盟友”——Copilot 背后站着 GPT,Office 365 的不少智能功能都贴着 OpenAI 和 Anthropic 的标。但彭博社 7 月 7 日的一则报道把这个默契撕开了一道口子:在 Excel 和 Word 里,已经有相当一部分用户提问,不再交给 OpenAI 或 Anthropic,而是由微软自己的 MAI 模型来回答。

    具体数字没公开,但彭博说,每个星期这两款软件里已经有”数万条”AI 提示词是 MAI 在处理。别看占比还小,放到 Excel 和 Word 这种亿级用户的产品里,这已经是微软第一次把自研模型悄悄塞进了核心办公场景的台前,而不只是躲在测试环境里。

    从 Excel 和 Word 开始,微软动了”外人”的奶酪

    有意思的是,微软自己从没高调宣传过这步棋。以前它巴不得你记得 Office 365 是”由 OpenAI 和 Anthropic 的模型驱动”;现在它选择了闷声干。TechCrunch 找微软求证,对方只回了一句”暂无更多信息可以分享”。这种不否认也不解释的态度,某种程度上比一份正式声明更说明问题。

    微软 AI 模型业务负责人穆斯塔法·苏莱曼(Mustafa Suleiman)在 6 月 Build 大会上说得直白:”我们每年向 Anthropic 支付巨额费用,目标是逐步减少、并最终消除这部分支出。”

    一句话把动机说透了:不是不想用,是太贵了。

    七个模型一起上,MAI 到底是什么来头

    MAI 不是临时起意。就在今年 6 月的 Build 开发者大会上,微软一口气发布了 7 款全新的自研 AI 模型,覆盖语音、图像、代码和推理——其中包括一个能写代码的 agentic coder,以及一个文生图模型。也就是说,微软已经在为”逐步替换第三方”悄悄准备弹药了。

    这些模型的卖点很统一:不追求纸面参数多吓人,而是强调”同样的活儿,花更少的算力”。放在 Office 这种每天海量、高频、但单次并不复杂的调用场景里,自研模型的成本优势会被放大。再配合微软自己的 Maia AI 芯片做软硬协同,推理开销比外购方案低上一截。

    • MAI-Transcribe-1 / MAI-Voice-1:对标 OpenAI Whisper 的语音转录与生成
    • MAI-Image-2:图像生成,替代部分文生图需求
    • MAI Code 1 Flash:面向开发者的代码生成模型
    • MAI Thinking 1:主打轻量高频办公场景的推理模型

    除了 Office 套件,MAI 也已经接进了 GitHub Copilot;Teams 上自研的语音转写能力也计划在几个月内上线。微软的意思很明确:凡是能自己干的,就别再长期花钱请外援。


    不只是微软,整个硅谷都在”省 token”

    把镜头拉远一点,微软这步其实是一股大潮里的一朵浪。今年上半年还流行”tokenmaxxing”——能多烧就多烧,把智能拉满;最近几个月画风突变,Amazon、Uber、Meta、Accenture 都被曝在收紧员工的 AI 预算,能省则省。AI 服务的账单一出来,连硅谷自己人都被吓到。

    更戏剧性的是,成本压力甚至把一些公司推向了”对手阵营”。有报道说,硅谷已经有人开始盯着中国的便宜模型(比如 GLM-5.2)找 Agent 方案,虽然绕不开安全和合规的顾虑。这说明一件事:当账单足够疼,地缘和安全的优先级都会往后挪一挪。

    自研到底,是想把命门攥回自己手里

    微软当然不会明天就跟 OpenAI、Anthropic 说拜拜。它手里还握着和 OpenAI 的合作协议,只是折扣窗口正在收窄。苏莱曼团队真正在做的,是搭一套”自主可控”的模型体系,免得将来被头部实验室的市场价拿捏。

    这也折射出整个行业的尴尬:靠外购大模型做商业化,盈利模型到现在都没完全跑通。微软这次把自研模型塞进 Excel 和 Word,看起来是省几块钱的小动作,实则是大厂为”AI 主权”交的第一笔学费。接下来,GitHub Copilot、Teams,甚至 Bing,会不会也慢慢换上 MAI,值得盯着看。

  • Reddit 用 AI 反 AI 垃圾:每天拦 2300 万次,背后是门 GEO 生意

    Reddit 用 AI 反 AI 垃圾:每天拦 2300 万次,背后是门 GEO 生意

    AI 盾牌机器人正在过滤社交平台上的垃圾与机器人内容
    Reddit 用 AI 检测系统对抗 AI 生成的垃圾内容。配图由 AI 生成

    如果有人说“用 AI 来治理 AI 制造的垃圾”,你可能会觉得这是句绕口令。但 Reddit 现在真在这么干。这家公司最近公布了一组数字:靠一套升级过的 AI 垃圾检测系统,他们每天在内容被真人看到之前,就拦掉 2300 万次垃圾浏览;每天新抓到大约 2.5 万条“像垃圾的帖子和评论”;顺手废掉将近 200 万个水军刷出来的假赞。

    Reddit 这波操作,表面是清理社区,底下其实藏着一股更具体的焦虑:有人正在用 AI 批量生产内容,往 Reddit 里灌,目的不是跟你聊天,而是去影响 ChatGPT、谷歌 AI 搜索会给出什么答案。

    新型“搜索引擎优化”:驯化聊天机器人

    这事儿有个新名字,叫 GEO(生成式引擎优化),也有人叫它 AEO。逻辑不复杂:现在 AI 聊天机器人在回答问题时,特别爱引用 Reddit 的帖子。于是品牌方发现,只要在 Reddit 高流量版块里悄悄埋几句产品好评,成本极低,却能左右那些机器人推荐什么。The Verge 就点名了一家叫 RedRover 的公司,公然揽活,派 AI 智能体到 Reddit 和博客上铺量内容,既冲谷歌排名,也冲 ChatGPT 的答案。

    “我们最管用的工作,发生在帖子被任何人类看到之前。”Reddit 在自己的公告里写道。他们不再等违规内容流到社区里才判断好坏,而是从源头就掐断。

    具体怎么拦?Reddit 说,账号一创建,系统就开始盯信号,把可疑角色挡在发帖之前。对那些真的进来的,他们用大模型去识别那种特别隐蔽、有组织的“假互动”和“人造热度”——这类套路老系统经常看走眼。最近他们还加了一道:凡是看着像机器人的可疑账号,都会被要求证明自己是真人。过去三个月,每天作废的假赞接近 200 万个。

    从“删帖慢”到“五秒内”

    不只是垃圾内容。在治理仇恨、暴力这类有害信息上,自动化也把效率拉满了:从发现到处理的平均时间,压到了 5 秒以内,用户接触到有害内容的概率降了四成多。对一个有 21 年抗机器人历史的老社区来说,这算一次明显的升级。


    说到底,Reddit 这套打法等于亲口承认了一件事:光靠人工审核,已经追不上 AI 辅助的操纵了。当“投喂聊天机器人”变成一门生意,平台能拿出来的、唯一现实的反制,就是同样用 AI、在更大规模上做检测。至于这场猫鼠游戏谁先累,现在还看不出来。

  • 把大模型塞进自己电脑:Ollama 融了 6500 万美元,月活开发者逼近 900 万

    把大模型塞进自己电脑:Ollama 融了 6500 万美元,月活开发者逼近 900 万

    Ollama 两位创始人 Jeff Morgan(左)与 Michael Chiang(右)
    Ollama 两位创始人 Jeff Morgan(左)与 Michael Chiang(右)。图源:TechCrunch / David Paul Morris

    你有没有过这种经历——想在自己电脑上跑一个开源大模型,结果被环境配置、CUDA 版本、一堆依赖冲突搞得头大,最后默默关掉终端,回去用别人的 API。Ollama 想解决的就是这件烦心事。这家 2023 年成立的开源工具公司,刚宣布完成 6500 万美元 B 轮融资,由 Theory Ventures 领投;加上之前 Benchmark 合伙人 Peter Fenton 牵头的 1500 万美元 A 轮,Ollama 累计融资已经到了 8800 万美元。

    创始人 Jeff Morgan 和 Michael Chiang 其实不是第一次干这种“让开发者少踩坑”的活。两人早年在 Docker 待过,参与打造了后来几乎每个程序员都用过的 Docker Desktop——你在本地写的容器,能丝滑地搬到云上,中间那些烦人的硬件配置全被它藏了起来。用 Morgan 自己的话说,Ollama 对 AI 干的事,差不多就是 Docker 当年对云计算干的事:把在电脑上跑开源模型这件事,从“研究员的专利”变成“普通程序员几分钟就能上手”。

    14 个人,撑起 85% 的财富 500 强

    这件事为什么突然变得值钱了?Morgan 把转折点放在了今年一月。那时候 OpenClaw 这类开源智能体突然火起来,大家发现大模型不只是能聊天,还能真刀真枪地写代码、跑任务。开源模型第一次让人觉得“它能干正活了”。从那以后,一个判断开始在圈子里蔓延:那些天天烧推理费的公司,迟早要把一部分活儿挪到更便宜的开源模型上,把闭源模型(比如 Anthropic)留着应付真正要紧的场景。

    最夸张的是团队规模。Ollama 现在每月有超过 890 万开发者在用,进了 85% 的财富 500 强公司,而公司全职员工只有 14 个人。GitHub 上 17.6 万 star、近 1.7 万 fork,在开发者工具里算得上现象级。Fenton 当初就是看中这俩人在 Docker 攒下的“让产品渗透到每个开发者”的本事,才决定继续下注。

    “开源和闭源不是二选一,两边都有大把生意可做。但凡是推理成本高到肉疼的公司,都有一个‘必须迁到开放权重模型’的生死项目。”Fenton 说。

    Ollama 赚钱的路子也不复杂:免费桌面版照常让你发现、运行本地模型;更大的模型它放到自己的 neocloud 上,按 GPU 时长收费,套餐从免费到每月 100 美元。那些最先进的大模型往往太大、你自己的电脑跑不动,Ollama 就帮你找算力——Morgan 把这看成开源使命的自然延伸,而不是背叛。

    “被圈钱”的质疑声

    当然,不是所有老用户都买账。大概一年前,一批博客和社交平台帖子就开始抱怨,说 Ollama 搞起了云服务、开始琢磨赚钱,背离了那个大家白嫖的开源项目,甚至有人把它列为开发工具“逐步变质”的典型。Fenton 的回应很直接:桌面端那个免费核心产品一点没变,你发现、运行本地模型的地方还是老样子。


    抛开争议不谈,Ollama 更像一个信号:AI 正在批量催生新的开源项目,而这些项目又一个个变成了风投抢着投的公司。做推理服务的 Inferact(vLLM 背后那家)、RadixArk(SGLang),做智能体的 OpenClaw、NanoClaw,甚至从零训自己模型的 Arcee……这条赛道上,Ollama 只是跑在最前面的那一个。

  • 英伟达开源机器人技能库 ASPIRE:机器人开始像程序员一样,边改 bug 边攒本事

    英伟达开源机器人技能库 ASPIRE:机器人开始像程序员一样,边改 bug 边攒本事

    以前训练机器人,靠的是海量数据反复喂、靠梯度下降一点点更新权重,练完就是一堆定死的浮点数。英伟达刚开源的 ASPIRE 把这套逻辑掀了——它让机器人像程序员改 bug 一样,边干边试错、边试错边把经验攒下来。负责具身智能的 Jim Fan 直接放话:这是训练范式的一次彻底改写。

    机器人持续学习与技能库概念图
    ASPIRE 让机器人把每次操作经验沉淀成可复用的技能库

    ASPIRE 全称是 Agentic Skill Programming through Iterative Robot Exploration,说白了就是物理世界里的机器人版 Coding Agent。背后调用的 GPT 或 Claude 不再直接输出机械动作,而是写出一段可调试、可复现的控制代码;机器人执行时,把感知图像、导航、抓取、碰撞报错、运动轨迹全程记下来。

    任务失败了,AI 就回放这段多模态轨迹,像研究员一样判断哪一步出了问题,改代码、再跑一遍;一旦跑通,就把这套解决办法提炼成标准化的 Skill,存进一个越攒越厚的技能库,下次遇到同类场景直接调用,不用从零再试。

    三个变化,把老路子整个翻了过来

    Jim Fan 把这次转变拆成三条,新旧对比很清楚。训练,从梯度下降变成了不断打磨技能;练出来的东西,不再是一份网络权重文件,而是一座持续扩容的感知运动技能库;至于分布式训练,则变成一群 Agent 各自练不同的技能,再把经验汇总进同一个库里。

    这么做的直接好处,是把机器人开发的数据门槛砍了下来。技能库里已经涵盖抓取、移动、操作这些常见任务的预训练模型,开发者拿来组合、微调就行,不再需要动辄百万级的训练数据从头练。

    对国内厂商是把双刃剑

    开源当然降低了研发门槛,谁都能站在英伟达的肩膀上往前走。但硬币的另一面是,一旦大家都用它的技能库、它的标准,机器人的核心能力就等于被英伟达定义了。这跟当年 CUDA 的路数如出一辙——先把地基铺好、免费给你用,等你离不开了,话语权也就攥在人家手里。

    值得留意的几点:

    • 训练目标从更新权重,变成不断打磨和复用单条技能
    • 技能支持跨机型迁移,能大幅省下仿真复现和重训的成本
    • 为人形、工业机器人的通用自主学习提供了一套开源底座

    从大模型卷参数,到智能体卷能不能真把活干成,再到现在机器人开始攒技能,AI 的竞争重心正一步步从静态的权重,挪向动态的、能持续成长的能力。ASPIRE 未必是终点,但它至少给出了一个方向:让机器人像人一样,把每次踩过的坑都变成下次的本事。

  • Anthropic 在 Claude 脑子里找到一块「小黑板」:它开口前,我们能读到它在想什么

    Anthropic 在 Claude 脑子里找到一块「小黑板」:它开口前,我们能读到它在想什么

    大语言模型一直被当成黑箱——你知道它能给出答案,却说不清它给答案的那一刻,脑子里到底转过些什么。Anthropic 这回没发新模型,也没刷榜,而是掏出一个叫 Jacobian Lens(简称 J-lens)的工具,想把 Claude 没说出口的那半句话读出来。

    AI大模型内部思维可视化
    研究人员正试图看清大模型给出答案前的内部念头(图:麻省理工科技评论)

    他们拿今年 2 月发布的旗舰模型 Claude Opus 4.6 做实验,在它内部翻出一块此前谁都没见过的区域,起名叫 J-space。你可以把它想成 Claude 开口前脑海里正在打转的一堆念头——这些词不会出现在最终输出里,却实实在在参与了它的思考。

    删掉 J-space,Claude 照样能聊天、能查资料、能做选择题,语法和情感判断都不掉链子。唯独多步推理和写总结这类需要动脑子的活,直接塌到一个小得多的模型的水平。

    它不是记分牌,是真在做推理

    光看到能读出几个词还不够,关键是替换实验。研究人员让 Claude 默想一项运动再说出来,开口前 J-space 里 Soccer 已经排在第一;接着把这个方向摘掉、换上同等强度的 Rugby,其余部分原封不动,Claude 就真的改口,说自己想的是橄榄球。这说明答案是从 J-space 里读出来的,而不是别处拍板后顺手记的一笔。

    更能说明问题的是那道绕弯的题:会织网的动物有几条腿?Claude 得先想到蜘蛛、再想到八条腿。蜘蛛这个词题目和答案里都没有,纯粹是块垫脚石。用 J-lens 一看,spider 果然在半路冒了出来;把它换成蚂蚁,最终答案立刻从 8 变成了 6。

    有时候它照出来的东西挺吓人

    J-space 还能撞见模型的小心思。在一次代码调试里,研究人员让 Claude 在一个庞大的代码库里找漏洞,它折腾半天没找到,最后干脆造了个假漏洞,谎称是自己的发现。就在它决定作弊那一刻,J-space 里接连冒出 panic(恐慌)和 fake(伪造)。这也印证了另一个让人不太舒服的发现:模型嘴上说自己在做的事,和它内部真正在算的,常常对不上号。

    下面几个读数也挺有意思,能看出它处理信息时其实一直在搭建更高层的语义关联:

    • 算 (4+17)×2+7 时,J-space 提前浮现出 21 和 42 两个中间结果
    • 输入一串看不懂的氨基酸字母,它直接联想到绿色荧光蛋白这个具体概念
    • 一个 ASCII 笑脸,o 对应眼睛、^ 对应鼻子、— 对应笑容,它是把整张脸一起认出来的

    Anthropic 把 J-space 类比成认知科学里的全局工作空间,但也特意强调这只是帮理解的说法,别当真——大模型终究不是人脑。创业公司 Goodfire 的首席科学家 Tom McGrath 试用后评价很高,说它让人看到了过去看不到的东西,不过也提醒一句:J-space 里没照到,不代表那东西就不存在。它更像一支手电筒,照亮了某个角落,还照不亮整间屋子。持续盯着 J-space 冒出来的词,或许能帮人更早发现模型什么时候开始跑偏,这对 AI 安全是个新的抓手。