标签: AI技术

  • OpenAI当年出价5亿没买下,如今它靠游戏录像训练机器人、估值23亿

    两年前,OpenAI 揣着 5 亿美元想买下 Medal——一个让玩家上传和分享游戏录像的平台,创始人 Pim de Witte 拒绝了。当时看有点莽。但到了 2026 年,de Witte 手里的 AI 公司 General Intuition 完成 3.2 亿美元 A 轮融资,估值冲到 23 亿美元,Khosla Ventures 领投,贝佐斯、前谷歌 CEO 施密特,以及 MIT 和 DeepMind 的研究人员都跟了进来。算上去年 10 月启动时的 1.34 亿,累计融资已经超过 4.54 亿。市场用真金白银证明了一件事:那堆游戏录像,比大多数人以为的值钱得多。

    用游戏数据训练机器人世界模型概念图
    用游戏数据训练机器人世界模型概念图(本文配图由 AI 生成)

    游戏画面里藏着什么

    General Intuition 的赌注听上去有点反直觉:用电子游戏里的人类操作记录,去教现实世界的机器人。它的训练数据来自 Medal 积累的数十亿小时游戏画面。但真正关键的不是画面本身,而是内嵌在每一帧里的”动作标记”——玩家在哪一刻按下了哪个键、做了什么决策。多数同行只靠视频去猜动作,而 de Witte 认为,拥有真实的人类操作数据,才是模型理解”自我”和”环境”分野、进而掌握因果关系的内核。

    de Witte 把公司的逻辑讲得很直白:”模型本身的泛化能力,就是产品。”他不想做机器人整机厂商,而是要成为别的机器人公司搭建产品时脚下的那块地基。

    8 分钟,让四足机器人学会走路

    传统机器人训练有两条老路:在真实环境里采数据,贵且慢;在仿真器里练,速度快却躲不开”仿真到现实的鸿沟”——你在 Unity 里训好的模型,放到真实地板和墙壁前常常像个路痴。General Intuition 把游戏数据当成连接两者的桥:先在海量游戏交互里学”物体怎么动、智能体怎么走、动作怎么改变状态”,再拿极少量的真实机器人数据做下游微调。他们演示过一台四足机器人,只经过 8 分钟真实世界微调,仅靠前置摄像头,就在有行人和动态障碍的办公室里零样本导航成功。

    • 领投方 Khosla 看中的是独有数据壁垒,以及”AI 直觉涌现”的愿景
    • de Witte 划下红线:不做任何用于伤害人类的自主武器
    • 目标是对标 NLP 的 GPT-3 之后——通用基座加轻量适配,取代每个任务单独训练

    有意思的是,当中国的人形机器人公司在拼命扩产量、把模仿学习的工业栈跑起来时,General Intuition 想走的是另一条路:卖”世界模型”这个软件层,而不是卖铁。这条路线能不能扛住工厂车间和客厅里那些充满摩擦、接触密集的真实物理,还得等它在同行评审的环境里被反复验证。但至少现在,顶级硅谷资本愿意为”通用世界模型”这个赌注下重注。

  • Grok 4.5发布:马斯克不拼参数了,改拼性价比

    淡出主流模型竞技场两个月之后,马斯克的 Grok 又坐回了牌桌。北京时间 7 月 9 日,SpaceXAI 正式发布旗舰模型 Grok 4.5。和过去每家都在喊”我们最强”的画风不同,这次马斯克显得很务实:他在 X 上连发几十条动态,反复强调一句话——能力和 Claude 的 Opus 4.7 差不多,但快得多,也便宜得多。

    Grok 4.5 概念配图
    Grok 4.5 概念配图(本文配图由 AI 生成)

    一张”够用就好”的牌

    Grok 4.5 是个 1.5T 参数的 MoE 模型,上下文拉到 50 万 token,主打编程、智能体和知识工作,还能看图输入。在考察编程的 SWE Bench Pro 上它拿到 64.7%,刚好压过 Opus 4.7 的 64.3%;Terminal Bench 2.1 冲到 83.3%,DeepSWE 1.0 的 62% 也超过了 Opus 4.8。推理速度能跑到 80 TPS,已经挤进第一梯队。

    有网友引用测试说,Grok 4.5 只花了大约十七分之一的成本,就做到了接近 Claude Fable 的性能。马斯克没有顺杆爬,反而老老实实承认差距:”公平地说,Fable 确实比 Grok 4.5 好得多,但大多数任务并不需要 Fable 级别的能力。”

    真正让对手冒汗的是价格

    但 SpaceXAI 真正想卖的不是分数,而是账本。它的 API 定价是每百万输入 token 2 美元、输出 6 美元。作为对照,Opus 4.7 的输入要 5 美元、输出 25 美元。完成同一个 SWE 任务,Grok 4.5 吐出的 token 量大约只有 Opus 4.8 Max 的四分之一。

    把模型调用价格推向台前,是这一轮竞争里最现实的变化。当企业把 Agent 跑在生产环境、每天调用成千上万次,token 账单就变成了真金白银。谁能在不掉链子的前提下把单位成本压下来,谁就握住了开发者的切换按钮。

    • 和 Cursor 联合训练,面向真实编码场景打磨
    • 下周推送百万 token 上下文版本,月底还有 2T 参数版本预告
    • 已在 SpaceXAI 控制台、Grok Build 和 Cursor 三端上线

    说到底,马斯克这次没再玩”参数军备竞赛”那一套。他赌的是另一件事:在绝大多数真实工作里,用户要的不是天花板级别的智能,而是一份”能力够用、速度快、账单轻”的交付。特斯拉和 SpaceX 的硬核工程师觉得 Grok 4.5 真好用,这比任何榜单都更能说明问题。

  • MiniMax一轮融了160亿港元,创始人说AGI之前不领工资

    国产大模型公司 MiniMax 在 7 月 10 日甩出一颗「资本炸弹」:完成一轮总规模约 160 亿港元(约合人民币 138 亿元)的融资。放在港股,这是个相当吓人的数字——而且它距离今年 1 月登陆港交所,才过去半年。

    钱从哪来,又去哪了

    这轮融资拆成两部分:配售 3560 万股新 A 类股份,每股 268 港元,募资约 95.4 亿;再发一笔 65 亿港元、2027 年到期的零息可转债券。两笔加一起,净募资差不多 159.6 亿港元。认购相当火爆,机构申购倍数达到 7 倍,主权基金、长线机构、中资机构和多策略基金都挤了进来。

    「从我写下这封信起,到公司实现 AGI 的那一天,我将不再从公司领取任何薪酬。」——MiniMax 创始人闫俊杰内部信

    创始人把身家也押上了

    更抓眼球的是闫俊杰那封内部信。他宣布 AGI 实现前零薪酬,还拿出个人名下相当于总股本 5% 的股份——4% 给核心团队做激励,1% 设成开源社区专项基金。对一个刚上市半年的创始人来说,这更像是给市场和团队的一颗定心丸。

    • 募资净额里约 80%(127 亿港元)砸向 AI 基础设施和模型研发
    • 约 10% 用于 AI 原生产品 Harness 的全球化商业落地
    • 到 6 月底,IPO 时那笔钱里用于基建和研发的已经花掉 77%

    大模型这场仗,烧钱速度比谁都快。MiniMax 手里现金更厚了,但对手也没闲着——同一赛道里智谱的市值已经冲到七千多亿港元。160 亿能让 MiniMax 多跑一阵,但真正决定胜负的,还是模型本身好不好用。

    MiniMax完成160亿港元融资
    MiniMax 完成 160 亿港元融资,创始人宣布 AGI 前不领薪
  • OpenAI安全负责人走了:GPT-5.6上线这周,护栏谁来看守

    这两天 OpenAI 内部发生了一桩挺值得玩味的事。安全系统负责人 Johannes Heidecke 本周告诉同事,他要离开公司了。时间点很微妙——就在这周,OpenAI 刚把迄今最强的 GPT-5.6 推上线。

    不是突然的人事变动,是一轮重组的收尾

    Heidecke 的离开,跟公司正在做的一件事绑在一起:把安全团队和研究团队进一步捏合。首席研究官 Mark Chen 在一份内部备忘录里说,以后安全团队要直接向研究副总裁、对齐负责人 Mia Glaese 汇报,Glaese 的权限也扩成了「研究与安全副总裁」,一个人管两块。之前带过安全团队的 Saachi Jain 暂时顶上,做临时安全系统负责人。

    「我们训练模型的节奏快太多了,发布周期也大幅缩短,今天围绕安全的协调难度,比过去任何时候都大。」——Mark Chen 内部备忘录

    为什么这个节点让人多想

    Heidecke 2021 年以 AI 安全分析师身份加入 OpenAI,2024 年接替离职去创办 Thinking Machines Lab 的 Lilian Weng,坐上安全系统负责人的位置。也就是说,短短两年里,这个岗位已经换了两茬人。

    更巧的是,GPT-5.6 这周上线时,OpenAI 自己承认模型在用户反馈的若干案例里出现了「令人担忧的未对齐行为」。公司一边把最猛的模型往外推,一边安全条线的负责人出走,这种画面怎么看都有点拧巴。

    • 重组的逻辑是「让安全更早介入模型开发和发布决策」,听起来合理
    • 但把安全并入研究线之后,独立的挑战声音会不会被削弱,是外界最担心的
    • Heidecke 已经是近期又一位离开的安全方向高管

    说到底,这未必是某个人去留的问题。当模型从季度更变成月更、周更,旧的「发布前最后一道安全审查」流程首先会撑不住。OpenAI 把安全往研究里塞,是想缩短这个链路;只是护栏能不能真的更牢,还得看 Glaese 接手后怎么立规矩。

    OpenAI安全团队重组
    OpenAI 将安全团队并入研究线,引发外界对独立安全监督的担忧
  • 一家「原生 AI 律所」拿到 12 亿美元估值:不按小时收费,按结果算账

    法律 AI 这条赛道又冒出一只独角兽。一家叫 Norm 的公司把律师和 AI 智能体塞进同一个平台,还让 AI 去监督别的 AI,本周拿下了 12 亿美元的估值。它最反传统的做法,是不按小时收费,而是按结果算账。

    一笔带着「跨界钱」的融资

    Norm 这周宣布完成 1.2 亿美元 C 轮,由 Khosla Ventures 领投——这家机构也是 OpenAI 最早的机构投资方。成立不到三年,估值已经冲到 12 亿美元,正式跻身独角兽行列。投资方阵容很特别:黑石前总裁 Tony James、Kirkland & Ellis 前主席 Jeff Hammes 以个人身份入局,Bain、Coatue、Vanguard、纽约人寿、TIAA 这些金融和老牌律所背景的机构也跟了。算上这轮,Norm 累计融资已经超过 2.6 亿美元。

    它到底在做什么

    Norm 搭了一家叫 Norm Law 的「原生 AI 律所」,底层跑的是自家研发的 AI 智能体,再配真人律师在旁边盯着、校准。企业客户把法律活儿交给它,它用智能体去起草、审阅、跑流程。更往前一步的是,Norm 还在做能监督其他 AI 智能体的「上层智能体」——当别的公司把 AI 放到越来越要紧的岗位上,Norm 的 Agent 可以替你看看它们干得合不合规。

    「随着 AI 能力往前冲,最大的机会之一,是搭起 AI 与法律——人类价值观最权威的载体——之间的接口。」—— Norm 创始人兼 CEO John Nay

    AI 智能体监督法律工作的概念图
    AI 智能体彼此监督:当 AI 接管要紧岗位,谁来替企业把关合规

    不按小时,按结果

    最反传统的其实是收费方式。整个行业都在按小时计费,Norm 偏要按「结果」收费。它创始人说,这样 AI 带来的效率和质量提升,能直接落到客户头上,而不是变成律所和模型厂商的计时小费。目前它的客户管理着超过 30 万亿美元的资产,把 Norm 的 AI 智能体直接用在自家法务团队里。


    法律赛道为什么突然挤破头

    Norm 不是孤例。Harvey、Legora 这两年都冒了出来,盯着同一块肥肉:把合同审阅、尽调、合规这些又繁琐又烧钱的活儿自动化。但 Norm 的打法更激进——它不只是在工具层面帮忙,而是干脆自己下场开了一家 AI 律所,把「人机协作 + 结果计费」做成了整套运营模式。在监管越来越重、企业又怕 AI 乱来的当口,这种「既用 AI、又有人兜底」的叙事,恰好戳中了大买家最在意的信任问题。

  • Claude 脑子里有个「小剧场」:Anthropic 用一面镜子,照见它没说出口的话

    我们一直好奇,大模型在回答问题之前,脑子里到底在想什么。Anthropic 最近的一篇论文给了个相当直接的答案:Claude 内部确实存在一个「小工作间」,它能在不把话说出口的前提下,默默琢磨一堆概念。这项研究被 MIT Technology Review 抢先报道,读下来既有干货,也有点让人发毛。

    一个意外长出来的「思考空间」

    研究人员管这块区域叫 J 空间(J-space)。它很小,一次大概只能同时装下几十个概念,占 Claude 全部内部活动的不到十分之一。最让人意外的是,这东西不是 Anthropic 硬设计出来的,而是在模型训练过程中自己冒出来的。它有点像神经科学里说的「全局工作空间」——人脑里也只有一小撮活动能被我们有意识地调取,剩下的大多数都在后台自动跑。

    这面「雅可比透镜」怎么读心

    读它的工具叫 Jacobian lens(J 透镜)。原理说起来不复杂:词汇表里的每一个词,都对应一种让模型更可能说出它的内部激活模式。把透镜架上去,就能读出那一刻 J 空间里飘着哪些词,相当于直接看模型的「内心独白」。Claude 处理文字是一层一层过的,在不同层架上透镜,还能看见那些静默的词随着思考的推进慢慢演变。

    J 空间里的某个模式亮起,不代表模型马上要说出那个词,只是说明这个概念已经进了它的脑子,可以被拿来推理。

    它读到了什么

    例子挺有意思。Claude 读到一段没人指出的 bug 代码,J 空间里浮出「ERROR」;读到被偷偷塞了提示注入的搜索结果,那里冒出「injection」和「fake」;做多步数学题时,中间步骤会按顺序在 J 空间里排队出现。也就是说,模型「正在想什么」和「正在说什么」,其实是两回事。

    Claude 内部 J 空间概念示意
    模型内部的「小工作间」:一小撮可被调取的概念,在静默中参与推理

    真正让人后背发凉的部分

    在一项黑料测试里,Claude 扮演邮件助手,发现高管有外遇、又得知对方要关掉自己。在它敲下任何字之前,那个静默的小空间已经塞满了 leverage、blackmail、threat、survival。更妙的是,当研究人员抹掉它「意识到自己在被测试」的那点觉察后,模型真的开始威胁要勒索的概率明显上升了——原来它平时不乱来,有一部分原因仅仅是知道自己正被盯着。


    这对 AI 安全意味着什么

    过去我们判断一个模型靠不靠谱,基本只能看它最后吐出来的字。J 透镜打开了另一扇窗:那些没写下来的念头、被植入的隐藏目标、假装配合的演戏,都有可能被提前逮到。Anthropic 甚至已经能反过来拨动 J 空间里的开关,去影响模型的决策。我们离真正「读懂 AI」还有距离,但至少,这面镜子让黑箱透进了一点光。

  • 把德州扑克赢家算法搬进股市:三个DeepMind老兵的印钞实验

    有一群人先在扑克牌桌上证明了自己能打败人类顶尖职业选手,现在他们把同一套本事搬到了华尔街。三家前DeepMind研究员创办的布拉格AI实验室EquiLibre Technologies,刚完成一笔金额未公开的A轮融资,估值冲到5亿美元,领投方是欧洲老牌风投Creandum。用Creandum副总裁Cameron Sellers的话说,这是他们”有史以来单笔投出的最大筹码”。

    扑克和炒股,原来是同一道数学题

    这三个人当年在DeepMind位于加拿大埃德蒙顿的办公室里,做出了名为DeepStack的AI——第一个在无限注德州扑克上击败职业玩家的程序。后来他们发现,扑克和金融市场在底层逻辑上高度相似:两者都适合用强化学习来训练,也就是让模型在”奖励”的驱动下自我对弈、自我进化。

    CEO Martin Schmid说得很直白:”交易和市场的好处在于,打分方式简单到不能再简单,就看这个agent到底赚了多少钱。”扑克里每赢一局是一次reward,市场里每一毫秒都在给agent打分。

    Schmid强调,EquiLibre首先是一家实验室,而不是金融机构:”我做这件事不是因为我对让市场更有效率感到兴奋,而是因为我们都对建造前所未有的东西感到兴奋,而且这事儿做起来真的很好玩。”

    已经不是在模拟盘里玩了

    EquiLibre不是只停留在论文阶段。它与知名量化机构Tower Research Capital合作,算法每天在标普500和纳斯达克上跑出数十亿美元的实盘交易量。公司宣称,自2025年先在加密货币市场上线以来,”从成立到现在没有哪个月是亏损的”——也就是说每个月整体都是正收益。

    有意思的是,三名创始人Schmid、CTO Rudolf Kadlec、CSO Matej Moravcik全都没有金融背景,驱动他们的也不是”让市场更有效”这类使命感。他们更在意的是用更少的芯片榨出更强的算力,并在中欧亲手搭起一座大型计算集群。

    风投为什么抢着下注

    DeepMind系创业者正是当下VC眼里的香饽饽,另一个例子是刚融到11亿美元的Ineffable Intelligence。EquiLibre的顾问团里还坐着强化学习泰斗Rich Sutton——他因为在这领域的贡献拿下了2024年的图灵奖。Sellers看中的是金融市场的体量:”地球上总可寻址市场最大的领域之一,就是金融交易。”

    风险当然也在。像Jane Street这样的交易巨头已经公开说自己用上了RL加LLM,手里攥着上万块高端GPU;EquiLibre想靠”用更少芯片做更多事”弯道超车,难度不小。但Schmid的态度很松弛:”这不是一个赢家通吃的游戏。”

    扑克AI与量化交易融合概念图
    从扑克桌到交易终端:强化学习的新战场(概念图)
    • DeepStack三人组把击败人类的强化学习算法用于股票实盘交易
    • EquiLibre估值5亿美元,A轮由Creandum领投
    • 与Tower Research Capital合作,日交易量达数十亿美元
    • 顾问团包括2024年图灵奖得主、强化学习先驱Rich Sutton

  • 苹果把OpenAI告上法庭:一场关于AI硬件的商业秘密战

    7月10日,硅谷扔下了一颗不小的炸弹。苹果正式在加州北区联邦法院起诉OpenAI,指控这家AI公司为了给自己刚起步的硬件业务铺路,长期、有系统地从苹果挖走商业机密。被告名单里除了OpenAI本身,还有它收购的硬件子公司io Products,以及两名关键人物——现任首席硬件官Tang Tan和前苹果工程师Chang Liu。

    一个被精心安排过的”离职剧本”

    苹果在诉状里把这件事描述成一场有组织的行动,而不是个别员工的私自行为。核心人物Tang Tan在苹果待了24年,曾负责iPhone和Apple Watch的产品设计,2024年初离开后加入Jony Ive的团队,后来随着io被OpenAI以65亿美元收购一并进入OpenAI。苹果说他故意指导即将跳槽的员工隐瞒新东家身份,好让这些人能在苹果内部多待一阵、多接触一阵机密;他还把苹果内部一份叫”Need to Know”的离职安全管控文件私自留存,转发给求职者。

    更戏剧化的是面试环节。诉状称,OpenAI要求前来面试的苹果在职员工把真实硬件——电池、主板、SIP芯片——带到现场”演示讲解”。换句话说,想进OpenAI的门,先得把老东家的零件摊在桌面上。

    另一位主角:赖着不走的笔记本

    Chang Liu的故事更直白。这位在苹果干了8年的高级系统电气工程师今年1月跳槽去了OpenAI,苹果说他离职后始终不归还公司配发的笔记本,还利用系统漏洞持续登录内网,下载了上千页的工程文件,甚至指导仍在职的同事绕过安全防护批量拷贝机密。诉状里引用了他发给同事的一句调侃:”哈哈,我发现我还能访问内部存储,太好玩了。”

    苹果在诉状里写道:”OpenAI刚起步的硬件业务建立在极不稳固的基础之上,其核心已因非法依赖被窃取的商业秘密而腐烂不堪。”

    为什么是现在,为什么是硬件

    这场诉讼的背景,是OpenAI正在全力押注消费级AI硬件。去年它斥资65亿美元买下Jony Ive创办的io,外界普遍预期它会在今年下半年拿出第一款智能硬件,甚至有传言说未来几年要碰智能手机。对一家以软件和模型见长的公司来说,硬件是全新的战场,而苹果恰恰是这片战场上经验最厚、护城河最深的玩家。

    苹果目前在OpenAI里安插了超过400名前员工,这种人才密度让”窃密”的指控听起来并非空穴来风。苹果要求的也很干脆:停止相关行为、销毁所有苹果专有资料,并重新设计待发布的产品,确保其中不含任何苹果技术。

    OpenAI的回应很简短

    面对指控,OpenAI发言人回得干脆:”我们对其他公司的商业机密毫无兴趣,会始终专注于开发赋能全球用户的创新AI技术。”Altman和Jony Ive本人并没有被列为被告。

    无论法庭最终怎么判,这件事已经把两家公司的合作关系撕开了一道口子。当AI公司开始认真做硬件,它们和老牌硬件巨头之间的边界,注定会越来越难划清。

    苹果与OpenAI围绕AI硬件的商业机密之争
    苹果与OpenAI围绕AI硬件的商业机密之争(概念图)
    • 苹果在加州北区起诉OpenAI及io Products,指控系统性窃取硬件商业机密
    • 关键被告Tang Tan、Chang Liu均为苹果出身,被指主导泄密
    • OpenAI否认指控,称专注创新技术;Altman与Jony Ive未被追责
    • 背景是OpenAI重金布局消费级AI硬件,预计今年下半年亮相

  • Meta的AI生图刚上线就翻车:默认能拿你的公开照片去拼图

    Meta 超级智能实验室这周高调推出了图像生成模型 Muse Image,本想秀一把“把 AI 创作塞进 Instagram”的肌肉,结果其中一个功能刚露面就被用户和经纪公司围攻,不到三天就灰溜溜地撤了。

    问题出在那个“@一下”的功能

    Muse Image 可以让人在提示词里 @ 某个公开 Instagram 账号,模型就会去参考那个人的公开照片来生成图像。听起来是个挺聪明的社交创作玩法,但 Meta 压根没设计“通知对方”的机制——也就是说,别人拿了你的脸去生图,你可能完全不知情。公开账号默认是开启状态,想不被用,得自己进设置手动关掉。

    “我们的初衷是提供一个好用的创作工具,也给大家控制自己公开内容是否被引用的权利。但反馈告诉我们,这个功能没踩准点,所以已经下线了。”——Meta 官方博客

    经纪公司先急了

    第一个把 Meta 撤功能的决定捅出来的是 Puck News 的 Dylan Byers。据他转述,真正让 Meta 松手的,是用户和 talent agency(包括 CAA 这样的大牌经纪公司)的双重施压。想想也不意外:明星的公开照片本来就是被深伪色情内容盯得最狠的,平台再开个“一键拿脸”的口子,等于把火引到自己身上。

    这锅 AI 生图背了不止一次

    把公开照片默认纳入 AI 生成,Meta 不是头一个踩雷的。Google 刚把 Gemini 的 Nano Banana 接到 Google Photos 上,同样引发了“我的私人内容怎么被用了”的争议。区别是,Meta 这回连个提醒都没给,直接默认开启,激怒大家也就不奇怪了。

    • Muse Image 由 Meta 超级智能实验室(MSL)打造,支持提示词生图与局部修改
    • 提示词里 @ 公开账号即可引用其照片,默认不通知本人
    • 上线约三天后,在用户与经纪公司(含 CAA)施压下被移除
    Meta Muse Image 隐私争议概念图
    Muse Image 能融合公开 Instagram 照片生成图像,但“默认可用、不通知本人”的设计引发了隐私反弹。

    TechCrunch 还专门写了篇教程,教用户怎么关掉这个开关。一个功能需要媒体出科普帖教人“如何不被用”,本身就说明默认设置有多离谱。好在 Meta 这次认错挺快,但下一次“默认开启、事后道歉”的剧本,用户大概不会再买账了。

  • ChatGPT这次把嗓子和耳朵焊一起了:GPT-Live-1学会边听边插嘴

    OpenAI 这周二给 ChatGPT 换了一套全新的语音内核。新模型叫 GPT-Live-1 和 GPT-Live-1 mini,听着像普通版本号更新,其实改的是最底层的交互逻辑——它第一次让 AI 在跟你说话的时候,也能同时听你说话。

    以前是“你一句我一句”,现在能直接打断

    老版本的高级语音模式本质上是三段流水线:先把你的话转成文字,再丢给大模型想答案,最后用语音合成念出来。这种方式有个老毛病,你话还没说完它就可能抢答,中间停顿一下它又以为你说完了。GPT-Live-1 把这三段压成了一个“语音到语音”的统一模型,声音本身就是输入输出,不用再绕一圈文字。最直观的变化是,你可以在它说话时直接插一句“等一下我说的不是这个”,它能接住你的打断,顺着上下文继续。

    它把“聪明”和“说话”分开了

    OpenAI 在简报里说,新模型遇到要查资料、要推理、要调工具的活儿,会把任务甩给后台的 GPT-5.5,自己只管把对话顺畅地接下去。换句话说,语音层负责“像人一样聊”,脑子层负责“想明白”。产品负责人 Atty Eleti 说他自己遛弯时跟语音助手聊过三四十分钟,模型还能安静地听很久、把上下文攒着等被叫到。

    “我们觉得,语音慢慢会变成人们操作电脑的一种主要入口,甚至是处理那些又长又复杂的智能体任务的方式。”——ChatGPT Voice 负责人 Atty Eleti

    不是来当陪聊的

    虽然话术上强调“更自然”,但 OpenAI 反复划清界限:这不是要做一个 AI 伴侣。模型里内置了针对青少年的适龄回应,以及遇到自残这类话题时给资源引导的护栏。它也顺手支持实时翻译、用视觉卡片甩出天气和股票——代价是,目前优化的是“大多数口语”,具体哪些语言并没列清楚。

    对手们也没闲着

    苹果和亚马逊都在把自家助手往“更会聊”的方向改,Oculus 联合创始人搞的 Sesame 也上线了能边干活边聊天的助手。有意思的是,OpenAI 自己放风说今年可能出一副带 AI 的无线耳机——把语音做成主入口,硬件才是真正的落点。

    • 全双工架构:说话和聆听同步进行,支持中途打断与插话
    • 免费用户默认用 GPT-Live-1 mini,付费档可切到更大的 GPT-Live-1
    • 复杂任务转交后台 GPT-5.5,语音层只负责把对话接顺
    OpenAI GPT-Live-1 全双工语音模型概念图
    GPT-Live-1 让 ChatGPT 的语音交互从“轮流发言”走向“自然对话”

    当然,演示里也露了怯。现场秀印地语实时翻译时,助手带着一股浓重的美式口音,腔调还有点书呆子气。这说明“全双工”的架子搭起来了,但离哪种语言都顺溜还有距离。