标签: 语音交互

  • ChatGPT语音终于学会闭嘴:OpenAI GPT-Live全双工上线

    ChatGPT语音模式升级示意
    OpenAI 用 GPT-Live 重写 ChatGPT 语音模式,让它学会”边听边说”(图:The Verge)

    用过 ChatGPT 语音模式的朋友大概都经历过这种尴尬:你话才说到一半,正组织下一句,AI 突然插进来”好的,我理解你的意思是……”,而你后面那半句它压根没听见。这不是你表达有问题,是旧版语音模型的底层架构决定的——它只能等你彻底闭嘴,才轮到它开口。

    7 月 8 日,OpenAI 给这个问题从根上动了刀。新发布的 GPT-Live-1 和 GPT-Live-1 mini 两款语音模型,第一次在 ChatGPT 里实现了”全双工”:它能一边听你说话,一边组织自己的回答,你随时可以打断、插话、改口,它都接得住。

    “它终于学会闭嘴了”

    The Verge 给这篇报道起的标题特别传神——”ChatGPT 升级后的语音模式更擅长闭嘴了”。OpenAI 产品负责人 Atty Eleti 在发布会上解释:”这是一个全双工模型,意味着它可以同时说话和听。从模型侧看,它能持续、同时地处理输入流、产出输出流。”

    OpenAI 研究负责人 Kundan Kumar 把 GPT-Live-1 称为公司”迄今最聪明的语音模型”。它会在需要推理或联网搜索时,自动把你的请求转交给 GPT-5.5 这类最强文本模型,再回头把结论用说话的方式讲给你听。

    换句话说,以前语音助手是”听写—理解—朗读”三段流水线,现在声音本身就是输入也是输出,延迟从秒级压到了毫秒级,对话节奏终于像人跟人聊天了。

    几个真实用得上的新花样

    全双工带来的不只是”不打断你”这么简单,还顺手解锁了几个挺实用的能力:

    • 实时翻译:你还在说中文,它已经同步翻成英文,不用等你停下
    • “听口令再开口”:你可以让它先闭嘴,等你喊它才接话
    • 会”嗯、对、收到”:它用这些词告诉你”我在听”,对话更自然
    • 聊天气、股票、赛事时,会顺手生成对应的图片辅助说明

    OpenAI 说,新版语音模式就是为了让人能”更长时间地 Hands-free 聊天”。产品负责人 Eleti 自己就说,他散步时跟语音助手聊过 30 到 40 分钟。看得出来,OpenAI 想让 ChatGPT 从一个”要打字的工具”,变成一个”能一直挂着的对话入口”。


    不是 AI 伴侣,也还有翻车的时候

    OpenAI 特意划了一条线:GPT-Live 不是要做”AI 伴侣”,不打算跟你谈情说爱。它内置了 safeguards,对青少年给年龄合适的回答,聊到自伤这类话题会转接专业危机热线。毕竟 OpenAI 正背着一串”ChatGPT 诱发妄想、伤害用户心理健康”的官司,安全这块不敢马虎。

    不过 demo 也不是完美。展示印地语实时翻译时,助手带着一股浓重的美式口音,印地语说得生硬又书卷气。OpenAI 承认新模型针对”大多数主流语言”做了优化,但没说清到底是哪些。这也是全双工语音要真正好用,还得跨过的一道坎。

    谁能先用上

    GPT-Live-1 已经推到 iOS、安卓和网页端。Go、Plus、Pro 订阅用户默认用更大的 GPT-Live-1,免费用户则是轻量版的 GPT-Live-1 mini。苹果和亚马逊也在把自家的语音助手往”更会接话、更懂上下文”的方向改,Sesame 这类创业公司也在做类似的事。语音这条赛道,下半年只会更挤。

    对普通用户来说,最直观的变化可能就是:以后跟 ChatGPT 打电话,它终于不会在你喘气的功夫抢话了。

  • OpenAI放出新语音模型:能随时打断、还能实时翻译,但口音有点出戏

    AI语音助手与声波动画
    GPT-Live-1 让 ChatGPT 的语音对话更接近真人

    OpenAI 今天把 ChatGPT 的「嘴」和「耳朵」换了一套新引擎。新模型叫 GPT-Live-1,还有个轻量版 GPT-Live-1 mini,官方说法是听起来更自然,也更会把握说话的节奏,不会再动不动就抢你的话。

    这次升级最关键的一点,是它变成了「全双工」模型——也就是能边听边说。你可以随时插话打断它,它也能在你说的时候默默听着,而不是像老版那样非得等你彻底说完、停顿一下才开口。实时翻译这种场景,靠的也是这个能力。

    从「三件套」到「一根线」

    之前的语音模式其实是拼起来的:先靠语音转文字把你说的话写成字,再丢给大模型想答案,最后用文字转语音念出来。环节一多,就容易出岔子——要么在你说话时突然打断,要么脑子跟不上、答非所问。

    新模型把这条链路收拢了。OpenAI 说,它会把你的提问交给最新的文字模型(比如 GPT-5.5)去做搜索、推理或者调度 Agent,同时语音对话还在继续,不用停下来等。它甚至能憋着不说话,安静听你讲上一长段,把上下文都接住,等被叫到才接话。

    我们觉得长远来看,语音会成为操作电脑的一种主要方式,也能用来打理那些越来越复杂、跑得很长的 Agent 任务。

    上面这句话出自 ChatGPT Voice 的产品负责人 Atty Eleti。他透露,自己散步时跟语音功能聊过三四十分钟。OpenAI 有意把语音往「能扛长时间复杂工作」的方向推,外界也一直传它今年可能出一副带 AI 的耳机,不过这次公司没提任何硬件。

    不是伴侣,但还在打磨

    默认情况下,免费用户会拿到 mini 版,付费档才能用上更大的 GPT-Live-1,它会逐步替换掉现在的 Advanced Voice Mode。OpenAI 强调,他们并不想把它做成「AI 陪伴」,而是加了护栏:对青少年给适龄的回应,聊到自残这类话题会提供求助资源。

    竞争对手也没闲着。苹果和亚马逊都在把自家的助手改得更会接话、更懂上下文;由 Oculus 联合创始人创办的 Sesame,也在做能边聊边在后台干活的助手。OpenAI 的方向和大家一致:让你能 hands-free 地跟助手聊更久。


    演示翻车的一幕,也值得记住

    新模型当然还有毛糙的地方。现场演示印地语实时翻译时,助手一口浓重的美式口音,说出来的印地语生硬又书面,听起来很出戏。OpenAI 说新模型是针对「大多数常用语言」优化的,但究竟覆盖哪些,它没细说。

    • 全双工 + 随时打断,是这次最实在的进步,聊天不再像在跟自动语音菜单较劲。
    • 接上 GPT-5.5 之后,语音能干的活明显变多,甚至能顺手给你看张图。
    • 口音和少数语言仍是短板,离「全世界都能自然聊」还早。

    OpenAI 透露,现在每个月有超过 1.5 亿人用语音或听写跟 ChatGPT 说话。从「能对话」走到「聊得像个真人在旁边」,GPT-Live-1 算是往前迈了一大步——只是这一步迈得还不够稳,尤其是当你说的不是英语的时候。

    📎 原文来源:OpenAI releases new voice models for more natural live conversations(TechCrunch / Ivan Mehta)
  • OpenClaw:380K+ Stars 的个人AI助手,任意系统任意平台,让AI真正成为你的数字管家

    OpenClaw:380K+ Stars 的个人AI助手,任意系统任意平台,让AI真正成为你的数字管家

    🦞 OpenClaw — 你的个人AI助手,任意系统任意平台

    OpenClaw 是一款可部署在个人设备上的本地AI助手,支持你常用的通讯渠道交互,可在 macOS/iOS/Android 上语音交互,还能渲染可交互的实时 Canvas 界面。其定位是「个人单用户专属助手」,主打本地化、响应快、随时在线的体验。


    📊 项目数据

    380K+
    GitHub Stars
    79K+
    Forks
    62K+
    Commits
    20+
    支持平台

    🚀 核心功能

    🏠 本地优先网关

    统一管理会话、渠道、工具、事件的控制平面。所有数据存储在本地,无需上传云端,保障隐私安全。

    📱 多渠道收件箱

    支持 20+ 主流通讯渠道接入,包括 WhatsApp、Telegram、Discord、Slack、Signal、iMessage 等。你可以在任意渠道直接和 AI 助手对话。

    🤖 多智能体路由

    可将不同渠道/账号/用户的请求路由到独立智能体,实现工作区、会话隔离。不同场景使用不同的 AI 助手配置。

    🎙️ 语音交互

    macOS/iOS 支持语音唤醒,Android 支持连续语音交互。支持 ElevenLabs 语音 + 系统 TTS 兜底,让 AI 助手能「说话」。

    🎨 实时 Canvas

    智能体驱动的视觉工作区,支持 A2UI(Agent-to-UI)交互。AI 可以生成可交互的界面,让你实时预览结果。

    🔧 原生工具集

    内置浏览器、Canvas、节点、定时任务、会话、Discord/Slack 操作等工具。支持 Docker 沙箱隔离,保障系统安全。


    💻 安装要求和过程

    环境要求

    • Node.js:推荐使用 Node 24,最低支持 Node 22.19+
    • 包管理器:支持 npm、pnpm、bun
    • 操作系统:macOS、Windows、Linux、iOS、Android 均支持

    快速安装

    # 1. 全局安装 OpenClaw
    npm install -g openclaw@latest
    
    # 2. 运行引导式设置(自动安装网关守护进程)
    openclaw onboard --install-daemon
    
    # 3. 验证运行状态
    openclaw gateway status
    

    快速启动(调试模式)

    # 停止守护进程
    openclaw gateway stop
    
    # 前台运行调试
    openclaw gateway --port 18789 --verbose
    

    使用和 AI 助手对话

    # 和助手对话
    openclaw agent --message "帮我整理桌面文件" --thinking high
    
    # 发送消息到渠道
    openclaw message send --target +1234567890 --message "Hello from OpenClaw"
    

    🎯 典型使用场景

    场景一:多平台消息聚合助手

    将 WhatsApp、Telegram、Discord、Slack 等所有消息渠道接入 OpenClaw,让 AI 助手统一处理。你可以直接在任意渠道里和 AI 对话,让它执行代码、管理文件、控制设备。

    # 示例:让 AI 整理消息
    You: "帮我总结今天所有渠道的重要消息"
    OpenClaw: 扫描 WhatsApp/Telegram/Discord → 提取关键信息 → 生成摘要
    

    场景二:语音控制的个人 AI 助手

    在 macOS/iOS/Android 上,通过语音唤醒 OpenClaw,让它帮你完成任务。比如:「帮我整理桌面上的截图,按日期分类」、「提醒我明天下午 3 点开会」。

    # 语音交互示例(macOS)
    # 按下快捷键唤醒 → 说话 → OpenClaw 执行任务
    "帮我查看今天的日程"
    "把桌面上的 PDF 文件移动到文档文件夹"
    

    场景三:AI 智能体开发平台

    OpenClaw 提供完整的智能体开发框架,支持从 ClawHub 技能市场安装自定义技能。你可以为 OpenClaw 开发专属技能,让它具备特定领域的能力。

    # 安装技能示例
    # 从 ClawHub 市场安装技能
    openclaw skills install <skill-name>
    

    💡 推荐理由

    为什么推荐 OpenClaw?

    • 🌟 超级热门:380K+ Stars,本月 GitHub Trending 榜首,AI Agent 领域最受关注的项目
    • 🏠 本地优先:所有数据存储在本地,隐私安全有保障,无需担心数据泄露
    • 📱 多平台支持:支持 macOS/Windows/Linux/iOS/Android,真正的跨平台 AI 助手
    • 🔌 多渠道接入:支持 20+ 主流通讯渠道,可以在你最常用的平台上使用 AI 助手
    • 🎨 实时 Canvas:创新的 A2UI 交互方式,让 AI 生成可交互界面,体验极佳
    • 🔧 高度可扩展:支持从 ClawHub 市场安装技能,支持自定义工具开发
    • 🛡️ 安全沙箱:非主会话默认运行在 Docker 沙箱中,避免恶意操作

    如果你正在寻找一个真正属于自己的 AI 助手,OpenClaw 是目前最好的选择。它不仅仅是一个聊天工具,更是一个可以帮你完成实际任务的智能助手。


    📦 下载地址


    📝 总结

    OpenClaw 是一款革命性的个人 AI 助手,它让 AI 真正走进了我们的日常生活。通过支持多平台、多渠道、多智能体,OpenClaw 实现了「Any OS, Any Platform」的愿景。

    380K+ Stars 的成绩证明了它的价值。如果你想要一个真正属于自己的 AI 助手,不妨试试 OpenClaw,让它成为你的「数字管家」!

    — 更新于 2026年6月30日