标签: AI

  • 可灵 AI 单轮融了近 30 亿美元:全球视频大模型最大一笔钱

    可灵 AI 单轮融了近 30 亿美元:全球视频大模型最大一笔钱

    7月2日晚上,快手在港交所发了个公告——旗下的视频生成大模型“可灵 AI”要独立出来,单轮融资规模最高 30 亿美元,投后估值大概 180 亿美元。这个数字创下了全球视频大模型公司单轮融资的纪录,国内 AI 领域也就仅次于 DeepSeek 首轮的 70 亿美元。可灵这是要单飞了。

    30 亿美元约占可灵扩大后注册资本的 16.67%,对应投后估值约 180 亿美元——全球视频基础模型赛道迄今最大的一笔融资。

    钱是谁给的?

    这轮阵容挺豪华。领投的有 CPE 源峰、国方创投、来自阿布扎比的 BlueFive Capital、腾讯、中关村科学城基金和中信证券,一共 34 家机构认购。跟投里还有阿里云、百度这样的产业资本,华策影视、芒果系的厚为资本这些文娱产业方也进来了。值得一提的是,BlueFive 来自中东,这是中东资本头一回投中国的 AI 视频模型;而 CPE 源峰同时押了 Kimi 和可灵,等于在 AI 赛道上“通用+垂直”两头下注。整个交易分两步走:领投方先出 138.24 亿元人民币,15 家额外投资方再加 52.2 亿,60 天认购期里还能再进最多 14 亿,凑到上限 204.47 亿元。

    可灵 AI 单轮融资近 30 亿美元,创全球视频大模型公司融资纪录
    可灵 AI 单轮融资近 30 亿美元,创全球视频大模型公司融资纪录

    为什么现在要拆出来单干?

    说白了,是被算力开支和竞争逼的。快手这一年几乎把资本开支全砸在了 AI 基础设施上,调整后净利润因此被拖累。把可灵拆出来独立融资,既能给它输血,也能让母公司喘口气。数据其实很能打:可灵今年一季度收入超过 6.5 亿元,同比涨了 300% 多;3 月的年化收入(ARR)接近 5 亿美元,一年翻了四倍;全球用户已经破了 1 亿,而且大约四分之三的收入来自海外。对一个视频大模型来说,这样的海外变现能力不多见。

    拿到钱,仗才刚开始

    不过投资人现在的心态变了。以前看的是技术 demo 够不够炫,现在更盯着能不能赚钱、边际效率高不高。 30 亿美元砸研发是够了,但可灵得赶紧跟其他视频大模型拉开差距,把钱变成实打实的成本优势才行。协议里还写了回购条款:要是 2031 年 10 月底前没能完成 IPO,或者没按约定时间重组,投资人可以要求按原价加每年 8% 的单利回购,母公司还得连带担责。这压力可不小。


    快手已经放话,未来 12 个月内可能启动可灵 AI 赴港上市。视频大模型这条赛道,海外有 Runway、OpenAI 的 Sora,国内有一堆追兵,可灵手里多了 30 亿美元的弹药,但真正的较量,是把这笔钱花出效率来。

  • Meta要把囤的 AI 算力卖出去:从最大买家变身云厂商

    Meta要把囤的 AI 算力卖出去:从最大买家变身云厂商

    7月1日彭博社爆料,Meta在筹划一项叫“Meta Compute”的云业务,打算把自己囤的 AI 算力和模型访问权卖给外面的公司。消息一出,Meta 股价当天涨了 8.8%,市值多了大概 1270 亿美元;而专门做算力租赁的 CoreWeave 和 Nebius 分别跌了 14% 和 17%,连美光、闪迪这些存储芯片股也跟着跳水。一边是狂欢,一边是恐慌,同一条新闻让两拨人看到了完全不同的未来。

    全球最大的 GPU 买家之一,正式转身成为算力卖家——这被不少人视为 AI 基础设施商业模式的一个分水岭。

    为什么要卖?

    Meta 今年 4 月把全年资本开支指引提到 1250 亿到 1450 亿美元,比去年的 722 亿差不多翻了一倍,钱都花在了数据中心、芯片和电力上。问题是,训练一个大模型可能几个月里把几万张 GPU 吃满,但训练一结束,这批集群的利用率就掉到三成到五成,剩下的算力就在那儿空转、烧电费。扎克伯格的打法一直是“先囤够再说”,先按最高峰的训练需求把地基打好,至于建完怎么用,回头再想。现在“卖出去”就是那个回头再想的答案。

    两条路子:托管模型,或者直接出租 GPU

    据知情人士说,Meta Compute 至少规划了两条线。一条学 AWS 的 Bedrock,把托管在自家基础设施上的模型(包括自研的 Muse Spark)开放给开发者,按 token 收费。这对 Meta 是头一回能从 Llama 生态里直接赚到钱——开源这么多年,Llama 被别家云厂商免费拿去商用,Meta 一分授权费都收不到。另一条更直接,学 CoreWeave 那种新型云公司,把 GPU 集群按小时租给企业客户。两条线同时推,牵头的是基础设施负责人 Santosh Janardhan、超级智能实验室的 Daniel Gross,还有 Meta 总裁 Dina Powell McCormick。

    Meta 计划把囤积的 AI 算力对外出租,直接闯进云计算市场
    Meta 计划把囤积的 AI 算力对外出租,直接闯进云计算市场

    市场为什么慌?

    这事真正戳中的,是撑了 AI 产业两年狂奔的那套逻辑——算力稀缺。过去两年,“算力不够用”维持了坚挺的租赁价格,也给巨头们疯狂扩张提供了理由。可要是连 Meta 这种级别的买家都开始往外卖“富余”算力,投资人自然会问:基建是不是要到顶了?高盛的交易台已经警告,一旦供给上来、租赁价往下走,最先扈不住的就是硬件。衡量 H100 租赁价格的 ORNN 指数最近确实在往下掉。

    • 出租的是上一代 H100/H200 推理算力,前沿训练要用的 GB200、自研 Rubin 芯片 Meta 还在拼命买
    • 目标据说是每 GW 每年变现 100 亿到 150 亿美元,把“成本包被”变成创收资产
    • SpaceX/xAI 已经跑通类似模式:把孟菲斯的 Colossus 集群按月租给 Anthropic,月租 12.5 亿美元

    一家 To C 公司,能做好 To B 吗?

    麻烦也在这儿。AWS、Azure、谷歌云做了几十年,靠的不只是机房,还有成熟的软件平台、企业销售队伍和客服体系。Meta 靠广告活了 21 年,是个彻彻底底的 To C 公司,突然要去伺候企业客户,节奏、文化、人才都得重搭。更微妙的是反垄断:Meta 跟 CoreWeave 还有总额 352 亿美元的长期采购合同没走完,一边是人家最大的客户,一边又下场抢生意,这种双重身份监管一看一个准。

    短期看,Meta 卖算力是笔资产周转的买卖——把上一代推理算力拿出来回血,同时继续囤最新的训练卡。但往长了看,当算力从“抢都抢不到的稀缺品”慢慢变成“能挂牌出售的大宗商品”,整个行业的定价方式、竞争格局和投资故事,可能都要重写一遍。扎克伯格说过,几乎每周都有公司来问能不能买他们的算力,甚至愿意出高于成本的价。现在,这些人等到回音了。

  • Orca:把一整支 AI 编程舰队装进一个 IDE(并行 Agent 开发环境 ADE)

    Orca:把一整支 AI 编程舰队装进一个 IDE(并行 Agent 开发环境 ADE)

    Orca 并行 worktree 界面

    如果你已经离不开 Claude Code、Codex 这类编码智能体,却苦于在一堆终端窗口里来回切换、分支互相打架,Orca 就是为这种痛而生的。它自称 “The AI Orchestrator for 100x builders”,是一个开源(MIT)的 ADE(Agent Development Environment,智能体开发环境)——和传统 IDE 不同,Orca 不是给你一个人用的,而是给你和你的”一舰队”智能体一起用的。

    项目简介

    Orca 是一款跨桌面(macOS / Windows / Linux)与移动端(iOS / Android)的 Agent IDE,让你把 Claude Code、Codex、OpenCode、Cursor、Copilot、Gemini 等任意 CLI 智能体并排运行在各自独立的 git worktree 中,统一编排、跟踪与合并,还配了一个能在手机上远程监控和发指令的伴侣 App。

    安装要求和过程

    环境要求:

    • 桌面端:macOS 11+ / Windows 10+ / 主流 Linux 发行版;
    • 需自行准备至少一个编码智能体的订阅(Claude Code、Codex、OpenCode 等任一即可);
    • 移动伴侣:iOS 16+ 或 Android 8+;
    • 无头服务器场景可选:Linux 服务器 + orca serve

    快速安装:

    1. 桌面端直接下载安装包(或用包管理器):
    # macOS (Homebrew)
    brew install --cask stablyai/orca/orca
    
    # Arch Linux (AUR)
    yay -S stably-orca-bin
    
    # 或前往 https://onorca.dev/download 下载 dmg / exe / AppImage
    
    1. 打开 Orca,登录你的智能体订阅账号,新建 Workspace;
    2. (可选)手机安装 Orca 伴侣 App,扫码与桌面端配对;
    3. (可选)无头服务器:orca serve 启动远程 worktree 服务。

    核心功能

    • 并行 Worktrees:一条提示可扇出到 5 个智能体,各自在隔离的 git worktree 中独立干活,互不干扰,你只需对比结果、合并最优解——告别 stash 与分支打架。
    • 终端分屏:内置 Ghostty 级终端,WebGL 渲染、无限分屏、重启后滚动历史不丢,还支持全文搜索。
    • 设计模式(Design Mode):每个 worktree 附带真实 Chromium 窗口,点击任意 UI 元素即可把它的 HTML、CSS 和裁剪截图直接送进智能体提示,做前端迭代超顺手。
    • GitHub & Linear 原生集成:应用内浏览 PR、issue 和项目看板,从任务直接开 worktree 审查、合并,无需切上下文。
    • 移动伴侣:手机端实时看智能体状态、查用量、切换账号,智能体跑完推送通知,离开工位也能续命。

    Orca 终端分屏

    Orca Design Mode

    典型使用场景

    • 同一需求多智能体赛马:把”修复登录竞态”同时丢给 Claude Code 和 Codex,各自在独立 worktree 实现,再挑实现更干净的合并,质量与速度双增。
    • 远程算力 + 本地轻量:在强劲的云服务器上跑 orca serve,本地笔记本只做轻量操作,SSH worktree 自动重连、端口转发,CI 跑挂了也能随时续。
    • 通勤中远程续命:智能体在桌面端跑长任务,你在地铁上用手机伴侣看进度、发现走偏了直接发一句纠正指令,到家正好收工。

    推荐理由

    我自己的体感是:当你的工作流里同时养了 2 个以上编码智能体,纯终端 + tmux 的管理成本会指数上升——分支冲突、上下文丢失、账号切换最磨人。Orca 把”并行隔离 + 统一编排 + 移动可观测”这三件事打包成一个干净的应用,而且开源 MIT、自带 Ghostty 级终端和真实浏览器,比那些只包一层终端的 wrapper 完整太多。它不绑定任何一家模型厂商, bring-your-own-subscription 的思路也让成本可控。唯一门槛是它更偏”重环境”,轻度用户用终端就够了;但只要你开始”以舰队为单位”写代码,Orca 几乎是必装。

    下载地址

  • 把 AI 叫成「同事」,人类反而更易犯错:一份 1261 人的研究给硅谷泼冷水

    把 AI 叫成「同事」,人类反而更易犯错:一份 1261 人的研究给硅谷泼冷水

    人类与被称为员工的AI智能体
    当 AI 被冠上「员工」头衔,人的责任感也在悄悄转移(配图:AI 生成)

    硅谷正热衷于把 AI 智能体包装成「数字员工」:给它起名字、发工牌、塞进组织架构图,仿佛它真能和人类并肩干活。但《麻省理工科技评论》援引波士顿大学的一项研究,给这股热潮泼了盆冷水——一旦把 AI 当同事,人的表现反而更差。

    一个名字改变了人的行为

    研究让 1261 名管理者审阅同一份 AI 生成的产出,随机分成三组:一组被告知来自无名工具,一组来自人类同事「Alex」,一组来自 AI 同事「Alex-3」。结果很刺眼——拿到「AI 员工」版本的人,抓出的错误比另一组少了 18%,还多出 44% 把问题甩给上级复核。本想靠 AI 省时间,反而凭空多出一层审批。

    「AI 智能体现在被当成能替代人的东西来营销,这是条走不通的路。」——2024 年诺奖得主、MIT 经济学家 Daron Acemoglu

    责任被悄悄转移

    当 AI 被叫「员工」,人更少把自己当成产出的责任人。这个苗头放到医疗、教育、政务里就危险了——它很容易变成甩锅的方便借口,真出事时大家第一反应是「是 Alex 犯的错」。Acemoglu 的观点是,智能体该被设计成增强人的能力,而不是替代人。

    工人真正想要的,其实不是这些

    斯坦福另一项研究问了 1500 名劳动者:技术专家觉得最该交给 AI 的任务(比如替销售核对客户信用),恰恰是工人最不想要的;他们想要的是辅助自己判断,而不是替自己拿主意。叫它「同事」很简单,也方便出事时推卸,但那只是一层品牌包装,并不会让工具本身更胜任。

    • 近三分之一受访管理者表示,公司已经把 AI 智能体当成「员工」,23% 甚至写进了组织架构图。
    • 微软、OpenAI、Anthropic、谷歌自 4 月起密集推出「数字同事」式 agent 管理工具。
    • 研究提醒:拟人化叙事侵蚀的是人的审查质量,这是治理风险,不是修辞问题。

  • 估值冲上10亿美元:Prime Intellect 想让每家企业都拥有自己的「AI实验室」

    估值冲上10亿美元:Prime Intellect 想让每家企业都拥有自己的「AI实验室」

    Prime Intellect 团队与算力集群
    Prime Intellect 把「AI 实验室」能力打包成企业可用的全栈平台(图源:TechCrunch)

    一家叫 Prime Intellect 的创业公司刚完成 1.3 亿美元 A 轮融资,估值一口气冲到 10 亿美元。它做的事有点反常识:别人都在帮你更好地用 OpenAI、Anthropic,它却想帮你彻底甩开这些前沿实验室,自己动手造 AI 智能体。

    从「租模型」到「自己造」

    过去企业想上 AI,基本只有一条路:去大厂的 API 里租现成模型。Prime Intellect 给出的是一套「全栈」——算力、强化学习框架、评估工具打包在一起,又像超市货架一样可以挑着用,不用担心被某个厂商绑死。创始人 2024 年才起步,看准的是强化学习这条技术路线:模型靠奖励和惩罚反复打磨,企业就能针对自己的业务训练专属智能体,相当于把「AI 实验室」搬回了公司内部。

    企业为什么突然想自己掌控

    动力很现实。把专有数据交给别人,企业怕的是失去控制权;更怕依赖的模型说关就关——Anthropic 的 Fable 项目上个月突然停摆,就是一记警钟。CEO Vincent Weisser 说得很直白:不该只有旧金山那几栋玻璃大楼里的人有能力训练模型,每家企业、每个国家都该有。

    「不该只是旧金山玻璃塔里那几个极客才有训练 AI 的能力,应该是每家企业、每个国家都行。」

    钱和数据主权一起到账

    这套打法已经有人买单。金融科技公司 Ramp 用它的平台做了个查表格的 agent,准确率压过前沿模型,速度更快,成本却只有零头。Zapier 也在客户名单里。快速起量把公司年化收入推到了 1 亿美元。领投方 Radical Ventures 的评价是:别人只给零件,Prime Intellect 给的是顶级 AI 实验室才有的「一站式」能力,而且价格企业扛得住。

    • 本轮由 Radical Ventures 领投,英伟达、英特尔、戴尔的战投悉数入局,还有 Perplexity 创始人等多位明星创业者个人跟投。
    • 平台走模块化路线,客户按需取用,不必一次性押上全部预算。
    • 背后是大公司在 AI 主权上的集体焦虑:数据要握在自己手里,供应链不能卡在别人手上。

  • herdr:住在终端里的 AI 智能体复用器,像 tmux 一样并行调度多个编程 Agent

    herdr:住在终端里的 AI 智能体复用器,像 tmux 一样并行调度多个编程 Agent

    herdr 终端演示

    herdr 是一个「住在你终端里的智能体复用器(agent multiplexer)」——它让你像 tmux 管理多窗口那样,在同一个终端里同时监督、调度和并行运行 Claude Code、Codex、Copilot、Gemini CLI 等多个 AI 编程智能体,全部以真实终端视图呈现,随时脱离(detach)与重新接入(reattach)。

    项目简介

    herdr 是用 Rust 写的单文件二进制工具,定位是「AI 编程智能体的终端调度台」。当你的工作流里同时跑着好几个编码 Agent,herdr 帮你把它们收进一个分屏会话里统一管理:谁在干活、谁卡住了、谁完成了,一眼看清;你离开后智能体继续跑,回来在任意终端(甚至 ssh)重新接入就能接着看。

    安装要求和过程

    环境要求

    • 任意现代终端(macOS / Linux 已稳定,Windows 为 beta 版);
    • 无需运行时依赖,单个 Rust 二进制,无 Electron,不占内存;
    • 可选:Homebrew、mise 等包管理器;源码编译需 Rust 工具链(cargo)。

    快速安装

    一行安装脚本(推荐):

    curl -fsSL https://herdr.dev/install.sh | sh

    其他安装方式:

    # Homebrew
    brew install herdr
    
    # mise
    mise use -g herdr
    
    # Windows (beta)
    powershell -ExecutionPolicy Bypass -c "irm https://herdr.dev/install.ps1 | iex"
    
    # 源码编译
    git clone https://github.com/ogulcancelik/herdr
    cd herdr
    cargo build --release

    在代码目录直接启动:

    herdr          # 启动,在代码所在目录运行
    ctrl+b q       # 脱离会话(agents 继续跑)
    herdr          # 任意终端重新接入

    核心功能

    1. 一眼掌控所有智能体:每个 Agent 的状态(blocked / working / done)一目了然,呈现的是真实终端视图,而不是被二次包装过的「解读」。
    2. 脱离后智能体继续跑:会话 detach 后进程不中断,可在任意终端或 ssh 上重新接入,甚至终端/机器重启后会话依然存活。
    3. 智能体也能用 herdr:提供纯 socket API,Agent 可以自己创建 pane、读取输出、互相等待,官方还给了 agent skill,让多智能体流水线成为可能。
    4. 键鼠都是一等公民:既支持 tmux 式前缀键(ctrl+b),也支持鼠标点击、拖拽、分屏,按当下场景自由切换,不被工具绑架。
    5. 插件可扩展:通过插件扩展 pane 与工作流,官方有插件市场,可按需装配能力。
    6. 单 Rust 二进制、无 Electron:跑在你已有的终端里,启动飞快、资源占用极低。

    典型使用场景

    1. 并行跑多个编程智能体
    同时开 Claude Code、Codex、Gemini CLI,分屏对照各自进度,省去在多个窗口之间反复切换、对不上上下文的麻烦。

    2. 远程 / 无人值守跑长任务
    在本地 detach,ssh 到服务器后执行 herdr 重新接入看结果,CI 长任务、 overnight 构建不占用本地终端,进程也不怕断线。

    3. 智能体互相编排
    让一个 Agent 通过 socket API 拉起子 Agent、等它产出再继续,把多智能体协作沉淀成可复用的流水线,而不是手动粘贴上下文。

    推荐理由

    现在工程师同时用两三个 AI 编程助手已是常态,但窗口一多就乱、上下文对不上、离开后任务状态无从追踪。herdr 把「多智能体并行调度」做成了一个趁手的终端工具——不像套壳 IDE 那样笨重,Rust 单二进制启动飞快,detach/reattach + ssh 重新接入这个能力对经常远程看进度的人尤其实用。项目 AGPL-3.0 开源、文档齐全(quick start / concepts / agents / plugins / socket api 一应俱全),如果你已经在 tmux 和多个编码 Agent 之间反复横跳,值得一试。

    下载地址

  • 一封“哈哈”邮件点燃世纪诉讼:苹果把 OpenAI 告上法庭

    一封内部邮件里写了句“哈哈,我发现我能访问[网络存储],太逗了”,最后把两家公司送上了法庭。上周五,苹果在加州北区联邦法院正式起诉 OpenAI,指控对方系统性窃取苹果硬件商业机密。

    41 页诉状里最刺眼的几句话

    苹果这次不是只点名几个“野路子员工”,而是把矛头直接指向 OpenAI 的领导层。诉状里写,这种偷机密的行为“被领导层常态化并树立为榜样”,还甩出一句狠话:OpenAI 刚起步的硬件业务“从根上就烂了,靠偷来的商业秘密撑着”。

    “这只是冰山一角。苹果看不到 OpenAI 大门背后发生了什么,而那里头的违规行为,是被领导层当成常态来示范的。”——苹果诉状原文

    苹果 CEO 与 OpenAI CEO 同框配图
    苹果与 OpenAI 的关系正滑向破裂(图:Getty Images)

    从苹果带走的,不止经验

    被重点点名的有两个人。一个是 Tang Tan,在苹果干了 24 年,做到 iPhone 和 Apple Watch 的产品设计副总裁,跳槽后成了 OpenAI 的硬件负责人。苹果说他拿内部项目代号去挖人,还让去面试的候选人把苹果真机零件、原型机搬去 OpenAI 做“展示讲解”——有候选人当场愣住:“我都不知道办公室的东西能往外带。”

    另一个叫 Chang Liu,做了 8 年高级系统电气工程师,离职时没交还公司发的笔记本,转头用上面存的一个认证漏洞下了一堆机密文档。他在发给前同事的邮件里得意地写:“哈哈,我发现能访问[网络存储],太逗了。”对方回:“我准备好了。”几个月后,这位前同事也去了 OpenAI。

    • 苹果称目前已发现 400 多名前苹果员工在 OpenAI 工作
    • 指控 OpenAI 连专属的金属表面处理工艺都拿来用在了自家硬件上
    • 苹果今年 2 月就曾去信交涉,对方一直没回

    真正怕的,是对手的硬件

    这场官司的背景很清楚:OpenAI 正在秘密打造自己的第一款硬件,传闻是一部靠 AI 智能体替代 App 的手机,而它去年花 65 亿美元收购了 Jony Ive 的设计公司 io。这东西一旦成型,就是 iPhone 诞生以来对苹果核心业务最大的威胁。OpenAI 的回应很简短:“我们对别的公司的商业秘密没兴趣。”

  • 马斯克又放卫星:Grok 4.5 自称 Opus 级,价格却砍到零头

    SpaceXAI 上市后交出的第一张答卷,就是 Grok 4.5。马斯克在 X 上把它称作“Opus 级模型”——也就是能跟 Anthropic 最硬的 Opus 系列掰手腕,但他紧接着补了一句:更快、更省 token、还更便宜。

    一张为“干活”而生的模型

    SpaceXAI 在周三的博客里把 Grok 4.5 定位成“干活主力”:写代码、搭应用、处理办公室杂活、做研究、写文档,这些行业里最想甩出去的重复脑力活它都想接。跟 Cursor 联合训练是这次的关键——数万名工程师在 Cursor 上的真实操作数据被喂进了模型,专门补上 Grok 过去在编程这块最空的短板。

    “我们的内部评估是,Grok 4.5 大致相当于 Opus 4.7,但快得多。能力、速度、低成本三者加在一起,才是它的竞争力。”——马斯克

    SpaceXAI 发布的 Grok 4.5 模型配图
    Grok 4.5 是 SpaceXAI 上市后的首个大模型,主打高 token 效率(图:Getty Images)

    真正的卖点不是跑分,是账单

    SpaceXAI 说 Grok 4.5 的 token 效率是其他头部模型的两倍。落到价格上就很直白了:输入每百万 token 2 美元,输出 6 美元。对比一下——Opus 4.7 是 5 美元和 25 美元,OpenAI 最贵的 Sol 档是 5 美元和 30 美元。换句话说,干同样的活,花的可能只有别人的零头。

    • 跑分没冲到全场第一,但在 SWE Bench Pro 上用到的输出 token 大约只有 Opus 4.8 的四分之一
    • 服务速度约 80 TPS,马斯克预告下周上下文窗口会拉到 100 万
    • 训练跑在数万块英伟达 GB300 上,和 Cursor 的数据飞轮一起转

    选在 GPT-5.6 前一天亮牌

    这周本来就是大模型发布的大周。OpenAI 的 GPT-5.6 定在周四全量开放(此前因美国政府的安全审查被卡了一阵)。SpaceXAI 偏偏选在前一天把 Grok 4.5 丢出来,火药味不用多说——它赌的不是谁的分数高,而是谁能让企业少掏钱。

  • ChatGPT语音终于学会闭嘴:OpenAI GPT-Live全双工上线

    ChatGPT语音模式升级示意
    OpenAI 用 GPT-Live 重写 ChatGPT 语音模式,让它学会”边听边说”(图:The Verge)

    用过 ChatGPT 语音模式的朋友大概都经历过这种尴尬:你话才说到一半,正组织下一句,AI 突然插进来”好的,我理解你的意思是……”,而你后面那半句它压根没听见。这不是你表达有问题,是旧版语音模型的底层架构决定的——它只能等你彻底闭嘴,才轮到它开口。

    7 月 8 日,OpenAI 给这个问题从根上动了刀。新发布的 GPT-Live-1 和 GPT-Live-1 mini 两款语音模型,第一次在 ChatGPT 里实现了”全双工”:它能一边听你说话,一边组织自己的回答,你随时可以打断、插话、改口,它都接得住。

    “它终于学会闭嘴了”

    The Verge 给这篇报道起的标题特别传神——”ChatGPT 升级后的语音模式更擅长闭嘴了”。OpenAI 产品负责人 Atty Eleti 在发布会上解释:”这是一个全双工模型,意味着它可以同时说话和听。从模型侧看,它能持续、同时地处理输入流、产出输出流。”

    OpenAI 研究负责人 Kundan Kumar 把 GPT-Live-1 称为公司”迄今最聪明的语音模型”。它会在需要推理或联网搜索时,自动把你的请求转交给 GPT-5.5 这类最强文本模型,再回头把结论用说话的方式讲给你听。

    换句话说,以前语音助手是”听写—理解—朗读”三段流水线,现在声音本身就是输入也是输出,延迟从秒级压到了毫秒级,对话节奏终于像人跟人聊天了。

    几个真实用得上的新花样

    全双工带来的不只是”不打断你”这么简单,还顺手解锁了几个挺实用的能力:

    • 实时翻译:你还在说中文,它已经同步翻成英文,不用等你停下
    • “听口令再开口”:你可以让它先闭嘴,等你喊它才接话
    • 会”嗯、对、收到”:它用这些词告诉你”我在听”,对话更自然
    • 聊天气、股票、赛事时,会顺手生成对应的图片辅助说明

    OpenAI 说,新版语音模式就是为了让人能”更长时间地 Hands-free 聊天”。产品负责人 Eleti 自己就说,他散步时跟语音助手聊过 30 到 40 分钟。看得出来,OpenAI 想让 ChatGPT 从一个”要打字的工具”,变成一个”能一直挂着的对话入口”。


    不是 AI 伴侣,也还有翻车的时候

    OpenAI 特意划了一条线:GPT-Live 不是要做”AI 伴侣”,不打算跟你谈情说爱。它内置了 safeguards,对青少年给年龄合适的回答,聊到自伤这类话题会转接专业危机热线。毕竟 OpenAI 正背着一串”ChatGPT 诱发妄想、伤害用户心理健康”的官司,安全这块不敢马虎。

    不过 demo 也不是完美。展示印地语实时翻译时,助手带着一股浓重的美式口音,印地语说得生硬又书卷气。OpenAI 承认新模型针对”大多数主流语言”做了优化,但没说清到底是哪些。这也是全双工语音要真正好用,还得跨过的一道坎。

    谁能先用上

    GPT-Live-1 已经推到 iOS、安卓和网页端。Go、Plus、Pro 订阅用户默认用更大的 GPT-Live-1,免费用户则是轻量版的 GPT-Live-1 mini。苹果和亚马逊也在把自家的语音助手往”更会接话、更懂上下文”的方向改,Sesame 这类创业公司也在做类似的事。语音这条赛道,下半年只会更挤。

    对普通用户来说,最直观的变化可能就是:以后跟 ChatGPT 打电话,它终于不会在你喘气的功夫抢话了。

  • 微软在Excel里悄悄换掉OpenAI:自研MAI接管Office

    微软总部与Office办公场景
    微软正把自研MAI模型悄悄塞进Excel和Word的AI功能里(图:Getty Images)

    过去两年,微软给外界的印象一直是”OpenAI 最铁的盟友”——Copilot 背后站着 GPT,Office 365 的不少智能功能都贴着 OpenAI 和 Anthropic 的标。但彭博社 7 月 7 日的一则报道把这个默契撕开了一道口子:在 Excel 和 Word 里,已经有相当一部分用户提问,不再交给 OpenAI 或 Anthropic,而是由微软自己的 MAI 模型来回答。

    具体数字没公开,但彭博说,每个星期这两款软件里已经有”数万条”AI 提示词是 MAI 在处理。别看占比还小,放到 Excel 和 Word 这种亿级用户的产品里,这已经是微软第一次把自研模型悄悄塞进了核心办公场景的台前,而不只是躲在测试环境里。

    从 Excel 和 Word 开始,微软动了”外人”的奶酪

    有意思的是,微软自己从没高调宣传过这步棋。以前它巴不得你记得 Office 365 是”由 OpenAI 和 Anthropic 的模型驱动”;现在它选择了闷声干。TechCrunch 找微软求证,对方只回了一句”暂无更多信息可以分享”。这种不否认也不解释的态度,某种程度上比一份正式声明更说明问题。

    微软 AI 模型业务负责人穆斯塔法·苏莱曼(Mustafa Suleiman)在 6 月 Build 大会上说得直白:”我们每年向 Anthropic 支付巨额费用,目标是逐步减少、并最终消除这部分支出。”

    一句话把动机说透了:不是不想用,是太贵了。

    七个模型一起上,MAI 到底是什么来头

    MAI 不是临时起意。就在今年 6 月的 Build 开发者大会上,微软一口气发布了 7 款全新的自研 AI 模型,覆盖语音、图像、代码和推理——其中包括一个能写代码的 agentic coder,以及一个文生图模型。也就是说,微软已经在为”逐步替换第三方”悄悄准备弹药了。

    这些模型的卖点很统一:不追求纸面参数多吓人,而是强调”同样的活儿,花更少的算力”。放在 Office 这种每天海量、高频、但单次并不复杂的调用场景里,自研模型的成本优势会被放大。再配合微软自己的 Maia AI 芯片做软硬协同,推理开销比外购方案低上一截。

    • MAI-Transcribe-1 / MAI-Voice-1:对标 OpenAI Whisper 的语音转录与生成
    • MAI-Image-2:图像生成,替代部分文生图需求
    • MAI Code 1 Flash:面向开发者的代码生成模型
    • MAI Thinking 1:主打轻量高频办公场景的推理模型

    除了 Office 套件,MAI 也已经接进了 GitHub Copilot;Teams 上自研的语音转写能力也计划在几个月内上线。微软的意思很明确:凡是能自己干的,就别再长期花钱请外援。


    不只是微软,整个硅谷都在”省 token”

    把镜头拉远一点,微软这步其实是一股大潮里的一朵浪。今年上半年还流行”tokenmaxxing”——能多烧就多烧,把智能拉满;最近几个月画风突变,Amazon、Uber、Meta、Accenture 都被曝在收紧员工的 AI 预算,能省则省。AI 服务的账单一出来,连硅谷自己人都被吓到。

    更戏剧性的是,成本压力甚至把一些公司推向了”对手阵营”。有报道说,硅谷已经有人开始盯着中国的便宜模型(比如 GLM-5.2)找 Agent 方案,虽然绕不开安全和合规的顾虑。这说明一件事:当账单足够疼,地缘和安全的优先级都会往后挪一挪。

    自研到底,是想把命门攥回自己手里

    微软当然不会明天就跟 OpenAI、Anthropic 说拜拜。它手里还握着和 OpenAI 的合作协议,只是折扣窗口正在收窄。苏莱曼团队真正在做的,是搭一套”自主可控”的模型体系,免得将来被头部实验室的市场价拿捏。

    这也折射出整个行业的尴尬:靠外购大模型做商业化,盈利模型到现在都没完全跑通。微软这次把自研模型塞进 Excel 和 Word,看起来是省几块钱的小动作,实则是大厂为”AI 主权”交的第一笔学费。接下来,GitHub Copilot、Teams,甚至 Bing,会不会也慢慢换上 MAI,值得盯着看。