标签: 语音AI

  • 英伟达参投的法国语音AI公司Gradium:1亿美元种子轮,专攻超低延迟

    Gradium 语音 AI 模型
    Gradium 所在的 AI 语音赛道正被资本市场重新定价(图:TechCrunch)

    巴黎有家叫 Gradium 的初创公司,专做语音 AI 模型。这周四它对外说,自己把种子轮重新打开,拉进了英伟达当新投资人,整轮融资加起来到了 1 亿美元。比起金额,更值得琢磨的是它背后的来路。

    一个从实验室里走出来的团队

    Gradium 是从法国 AI 实验室 Kyutai 分拆出来的,而 Kyutai 背后站着法国电信大亨泽维尔·尼尔。两边的核心人物都是同一个人:尼尔·泽吉杜尔。这位老哥之前在谷歌大脑、DeepMind 和 Facebook 都待过,是做语音研究的行家。Kyutai 团队早年搞出来的 EnCodec、SoundStream 和 Moshi,是现在整个语音 AI 行业底层技术的重要来源。换句话说,这家公司不是拿了别人的论文来套壳,而是站在自己人写的基础研究上起步的。

    它想消灭的是那个让人尴尬的停顿

    Gradium 做的音频模型主打一个词:超低延迟。说白了,就是让 AI 的声音几乎实时回应,别再出现那种「嗯……让我想想」的卡顿。现在不少 AI 智能体聊天时,说到一半会冷场半秒,这种停顿在人类对话里特别出戏。他们提供的东西包括语音识别、语音合成、声音克隆和实时翻译,是给开发者做语音界面用的。

    为什么要跑到大洋彼岸开办公室

    这轮钱怎么花,Gradium 说得很直白:去湾区开个办公室,跟硅谷抢人。原来去年 12 月它刚从隐身状态出来时就拿了 7000 万美元,投资人名单里就有 FirstMark、Eurazeo、DST Global,还有谷歌前 CEO 施密特和泽维尔·尼尔本人。这次新进来的英伟达又添了大约 3000 万美元。一家欧洲 AI 公司专门跑去买硅谷的工程人才,这本身挺说明问题——光靠研究底子,已经留不住顶尖工程师去跟美国公司的薪水硬刚了。

    有投资人点破过这件事:种子轮能跨过 1 亿美元、还能让英伟达亲自写支票,说明语音 AI 这个赛道正在被当成「基础设施」来定价,而不是普通的应用层。

    对手一大把,但它手里有牌

    赛道里不缺狠角色。光是做语音的 ElevenLabs,今年 2 月估值就到了 110 亿美元;谷歌的 Gemini 在语音上也很有名。Gradium 的牌在于研究血统和英伟达的战略背书,它把自己定位成给开发者提供「前沿级延迟」的那一个,而不是只拼音色好不好听。目前它已经签下了法国车企雷诺这样的大客户,说明在汽车行业那种需要处理实时语音的场景里,它确实能啃下订单。


    • 种子轮总额 1 亿美元,英伟达新近入局
    • 分拆自 Kyutai 实验室,底层技术自研
    • 主打超低延迟语音,目标消灭 AI 对话卡顿
    • 赴湾区设办公室,正面争夺工程人才
  • ChatGPT语音终于学会闭嘴:OpenAI GPT-Live全双工上线

    ChatGPT语音模式升级示意
    OpenAI 用 GPT-Live 重写 ChatGPT 语音模式,让它学会”边听边说”(图:The Verge)

    用过 ChatGPT 语音模式的朋友大概都经历过这种尴尬:你话才说到一半,正组织下一句,AI 突然插进来”好的,我理解你的意思是……”,而你后面那半句它压根没听见。这不是你表达有问题,是旧版语音模型的底层架构决定的——它只能等你彻底闭嘴,才轮到它开口。

    7 月 8 日,OpenAI 给这个问题从根上动了刀。新发布的 GPT-Live-1 和 GPT-Live-1 mini 两款语音模型,第一次在 ChatGPT 里实现了”全双工”:它能一边听你说话,一边组织自己的回答,你随时可以打断、插话、改口,它都接得住。

    “它终于学会闭嘴了”

    The Verge 给这篇报道起的标题特别传神——”ChatGPT 升级后的语音模式更擅长闭嘴了”。OpenAI 产品负责人 Atty Eleti 在发布会上解释:”这是一个全双工模型,意味着它可以同时说话和听。从模型侧看,它能持续、同时地处理输入流、产出输出流。”

    OpenAI 研究负责人 Kundan Kumar 把 GPT-Live-1 称为公司”迄今最聪明的语音模型”。它会在需要推理或联网搜索时,自动把你的请求转交给 GPT-5.5 这类最强文本模型,再回头把结论用说话的方式讲给你听。

    换句话说,以前语音助手是”听写—理解—朗读”三段流水线,现在声音本身就是输入也是输出,延迟从秒级压到了毫秒级,对话节奏终于像人跟人聊天了。

    几个真实用得上的新花样

    全双工带来的不只是”不打断你”这么简单,还顺手解锁了几个挺实用的能力:

    • 实时翻译:你还在说中文,它已经同步翻成英文,不用等你停下
    • “听口令再开口”:你可以让它先闭嘴,等你喊它才接话
    • 会”嗯、对、收到”:它用这些词告诉你”我在听”,对话更自然
    • 聊天气、股票、赛事时,会顺手生成对应的图片辅助说明

    OpenAI 说,新版语音模式就是为了让人能”更长时间地 Hands-free 聊天”。产品负责人 Eleti 自己就说,他散步时跟语音助手聊过 30 到 40 分钟。看得出来,OpenAI 想让 ChatGPT 从一个”要打字的工具”,变成一个”能一直挂着的对话入口”。


    不是 AI 伴侣,也还有翻车的时候

    OpenAI 特意划了一条线:GPT-Live 不是要做”AI 伴侣”,不打算跟你谈情说爱。它内置了 safeguards,对青少年给年龄合适的回答,聊到自伤这类话题会转接专业危机热线。毕竟 OpenAI 正背着一串”ChatGPT 诱发妄想、伤害用户心理健康”的官司,安全这块不敢马虎。

    不过 demo 也不是完美。展示印地语实时翻译时,助手带着一股浓重的美式口音,印地语说得生硬又书卷气。OpenAI 承认新模型针对”大多数主流语言”做了优化,但没说清到底是哪些。这也是全双工语音要真正好用,还得跨过的一道坎。

    谁能先用上

    GPT-Live-1 已经推到 iOS、安卓和网页端。Go、Plus、Pro 订阅用户默认用更大的 GPT-Live-1,免费用户则是轻量版的 GPT-Live-1 mini。苹果和亚马逊也在把自家的语音助手往”更会接话、更懂上下文”的方向改,Sesame 这类创业公司也在做类似的事。语音这条赛道,下半年只会更挤。

    对普通用户来说,最直观的变化可能就是:以后跟 ChatGPT 打电话,它终于不会在你喘气的功夫抢话了。

  • ChatGPT这次把嗓子和耳朵焊一起了:GPT-Live-1学会边听边插嘴

    OpenAI 这周二给 ChatGPT 换了一套全新的语音内核。新模型叫 GPT-Live-1 和 GPT-Live-1 mini,听着像普通版本号更新,其实改的是最底层的交互逻辑——它第一次让 AI 在跟你说话的时候,也能同时听你说话。

    以前是“你一句我一句”,现在能直接打断

    老版本的高级语音模式本质上是三段流水线:先把你的话转成文字,再丢给大模型想答案,最后用语音合成念出来。这种方式有个老毛病,你话还没说完它就可能抢答,中间停顿一下它又以为你说完了。GPT-Live-1 把这三段压成了一个“语音到语音”的统一模型,声音本身就是输入输出,不用再绕一圈文字。最直观的变化是,你可以在它说话时直接插一句“等一下我说的不是这个”,它能接住你的打断,顺着上下文继续。

    它把“聪明”和“说话”分开了

    OpenAI 在简报里说,新模型遇到要查资料、要推理、要调工具的活儿,会把任务甩给后台的 GPT-5.5,自己只管把对话顺畅地接下去。换句话说,语音层负责“像人一样聊”,脑子层负责“想明白”。产品负责人 Atty Eleti 说他自己遛弯时跟语音助手聊过三四十分钟,模型还能安静地听很久、把上下文攒着等被叫到。

    “我们觉得,语音慢慢会变成人们操作电脑的一种主要入口,甚至是处理那些又长又复杂的智能体任务的方式。”——ChatGPT Voice 负责人 Atty Eleti

    不是来当陪聊的

    虽然话术上强调“更自然”,但 OpenAI 反复划清界限:这不是要做一个 AI 伴侣。模型里内置了针对青少年的适龄回应,以及遇到自残这类话题时给资源引导的护栏。它也顺手支持实时翻译、用视觉卡片甩出天气和股票——代价是,目前优化的是“大多数口语”,具体哪些语言并没列清楚。

    对手们也没闲着

    苹果和亚马逊都在把自家助手往“更会聊”的方向改,Oculus 联合创始人搞的 Sesame 也上线了能边干活边聊天的助手。有意思的是,OpenAI 自己放风说今年可能出一副带 AI 的无线耳机——把语音做成主入口,硬件才是真正的落点。

    • 全双工架构:说话和聆听同步进行,支持中途打断与插话
    • 免费用户默认用 GPT-Live-1 mini,付费档可切到更大的 GPT-Live-1
    • 复杂任务转交后台 GPT-5.5,语音层只负责把对话接顺
    OpenAI GPT-Live-1 全双工语音模型概念图
    GPT-Live-1 让 ChatGPT 的语音交互从“轮流发言”走向“自然对话”

    当然,演示里也露了怯。现场秀印地语实时翻译时,助手带着一股浓重的美式口音,腔调还有点书呆子气。这说明“全双工”的架子搭起来了,但离哪种语言都顺溜还有距离。

  • 巴黎一家语音AI公司,拿了英伟达的钱,还要跑去湾区抢人

    AI语音这条赛道,最近又冒出一笔不小的融资。巴黎初创公司Gradium这周宣布,把原本关掉的种子轮重新打开,新拉进来英伟达等投资人,整轮累计融到1亿美元。

    钱要花在刀刃上

    Gradium自己说,这笔钱主要用来在旧金山湾区开个办公室、就近抢人——原话挺直白,叫”把自己摆在全世界最领先AI生态圈的正中心”。这话挺有意思:巴黎明明是欧洲AI的重镇,可真要拼人才,还是得贴着Anthropic、Google、Meta、OpenAI这几家巨头才踏实。

    从实验室里长出来的公司

    Gradium并不是凭空冒出来的。它去年12月才结束隐身状态,最初那7000万美元,投资方名单就相当豪华:FirstMark Capital、Eurazeo、DST Global Partners,还有Eric Schmidt和法国电信大亨Xavier Niel。再往前,它是从法国AI实验室Kyutai分拆出来的——两家公司的联合创始人Neil Zeghidour,早年在Google Brain、DeepMind、Facebook都待过。

    AI语音技术与神经网络融合概念图
    Gradium主打超低延迟的AI语音模型,背后站着英伟达

    他们做的事,说白了就是”让AI说话不卡顿”。Gradium做的语音模型主打超低延迟,声音几乎秒回,没有那种在AI对话里经常冒出来的、让人尴尬的停顿。听着简单,可对语音代理来说,这几毫秒的差距,往往就是”像真人”和”露馅了”的分界线。

    对手可不弱

    这条赛道早就挤满人了。光是ElevenLabs,今年2月就靠着红杉的5亿美元把估值冲到110亿;更别提Google Gemini这种自带语音基因的巨头。不过Gradium好像还真撕开了口子——从去年12月发布到现在,它已经拿下包括雷诺在内的几个大客户。


    1亿美元对一家还叫”种子轮”的公司来说不算小,但在语音AI这场仗里,能不能靠低延迟真正站稳,才刚开场。

  • OpenAI放出新语音模型:能随时打断、还能实时翻译,但口音有点出戏

    AI语音助手与声波动画
    GPT-Live-1 让 ChatGPT 的语音对话更接近真人

    OpenAI 今天把 ChatGPT 的「嘴」和「耳朵」换了一套新引擎。新模型叫 GPT-Live-1,还有个轻量版 GPT-Live-1 mini,官方说法是听起来更自然,也更会把握说话的节奏,不会再动不动就抢你的话。

    这次升级最关键的一点,是它变成了「全双工」模型——也就是能边听边说。你可以随时插话打断它,它也能在你说的时候默默听着,而不是像老版那样非得等你彻底说完、停顿一下才开口。实时翻译这种场景,靠的也是这个能力。

    从「三件套」到「一根线」

    之前的语音模式其实是拼起来的:先靠语音转文字把你说的话写成字,再丢给大模型想答案,最后用文字转语音念出来。环节一多,就容易出岔子——要么在你说话时突然打断,要么脑子跟不上、答非所问。

    新模型把这条链路收拢了。OpenAI 说,它会把你的提问交给最新的文字模型(比如 GPT-5.5)去做搜索、推理或者调度 Agent,同时语音对话还在继续,不用停下来等。它甚至能憋着不说话,安静听你讲上一长段,把上下文都接住,等被叫到才接话。

    我们觉得长远来看,语音会成为操作电脑的一种主要方式,也能用来打理那些越来越复杂、跑得很长的 Agent 任务。

    上面这句话出自 ChatGPT Voice 的产品负责人 Atty Eleti。他透露,自己散步时跟语音功能聊过三四十分钟。OpenAI 有意把语音往「能扛长时间复杂工作」的方向推,外界也一直传它今年可能出一副带 AI 的耳机,不过这次公司没提任何硬件。

    不是伴侣,但还在打磨

    默认情况下,免费用户会拿到 mini 版,付费档才能用上更大的 GPT-Live-1,它会逐步替换掉现在的 Advanced Voice Mode。OpenAI 强调,他们并不想把它做成「AI 陪伴」,而是加了护栏:对青少年给适龄的回应,聊到自残这类话题会提供求助资源。

    竞争对手也没闲着。苹果和亚马逊都在把自家的助手改得更会接话、更懂上下文;由 Oculus 联合创始人创办的 Sesame,也在做能边聊边在后台干活的助手。OpenAI 的方向和大家一致:让你能 hands-free 地跟助手聊更久。


    演示翻车的一幕,也值得记住

    新模型当然还有毛糙的地方。现场演示印地语实时翻译时,助手一口浓重的美式口音,说出来的印地语生硬又书面,听起来很出戏。OpenAI 说新模型是针对「大多数常用语言」优化的,但究竟覆盖哪些,它没细说。

    • 全双工 + 随时打断,是这次最实在的进步,聊天不再像在跟自动语音菜单较劲。
    • 接上 GPT-5.5 之后,语音能干的活明显变多,甚至能顺手给你看张图。
    • 口音和少数语言仍是短板,离「全世界都能自然聊」还早。

    OpenAI 透露,现在每个月有超过 1.5 亿人用语音或听写跟 ChatGPT 说话。从「能对话」走到「聊得像个真人在旁边」,GPT-Live-1 算是往前迈了一大步——只是这一步迈得还不够稳,尤其是当你说的不是英语的时候。

    📎 原文来源:OpenAI releases new voice models for more natural live conversations(TechCrunch / Ivan Mehta)
  • Meetily:隐私优先的AI会议助手,100%本地处理让敏感会议不再泄露,15.8K Stars让AI会议记录做到真正自托管

    Meetily:隐私优先的AI会议助手,100%本地处理让敏感会议不再泄露,15.8K Stars让AI会议记录做到真正自托管

    Meetily AI会议助手

    在远程办公与 AI 浪潮的双重推动下,会议记录工具已成为职场标配。但无论是 Otter.ai、Fireflies 还是其他主流工具,都有一个共同问题:你的会议内容会被上传到别人的服务器。对于金融、法律、医疗、政务等敏感行业,这显然是不可接受的风险。Meetily 给出了一个优雅的解决方案:让 AI 会议助手完全运行在你的本地设备上,100% 数据不出本机。


    🚀 项目简介

    Meetily(原名 Meetly AI)是 Zackriya Solutions 团队开发的开源 AI 会议助手,也是目前 GitHub 上 排名第一的自托管、开源 AI 会议记录工具。项目采用 Rust + Tauri 构建,前端基于 Next.js/React,支持 macOS 和 Windows(Linux 可编译),所有语音识别和 AI 总结均在本地完成,无需任何云端服务。

    核心亮点在于其转录引擎:默认采用 NVIDIA Parakeet 模型,比 Whisper 快 4 倍,同时支持 Whisper 系列模型作为备选。AI 总结部分可对接 Ollama(本地)、Claude、Groq、OpenRouter 或任意 OpenAI 兼容接口,真正做到灵活可控。

    📊 项目数据
    GitHub Stars: 15.8K+ |
    语言: Rust + TypeScript |
    许可证: MIT |
    最新版本: v0.4.0 (2026-06-05)


    ⚙️ 安装要求与过程

    🔧 系统要求

    • macOS:Apple Silicon 或 Intel 架构,需授予麦克风权限
    • Windows:Windows 10+,建议配备 Vulkan 兼容 GPU 以加速转录
    • Linux:支持 AppImage 打包,需自行编译
    • 内存:建议 8GB+(加载 Parakeet 模型约需 2-3GB)

    📦 快速安装(推荐方式)

    1. 访问 GitHub Releases 页面
    2. Windows 用户下载 x64-setup.exe 运行安装
    3. macOS 用户下载 meetily_0.4.0_aarch64.dmg,拖入应用程序文件夹
    4. 首次启动时会自动提示下载转录模型(约 500MB),可选择后台下载
    5. 在设置中配置 AI 总结提供商(推荐 Ollama 本地运行)

    💻 从源码构建(开发者方式)

    # 克隆仓库
    git clone https://github.com/Zackriya-Solutions/meetily.git
    cd meetily
    
    # 安装依赖(需要 Rust + Node.js + pnpm)
    pnpm install
    
    # 运行开发模式
    pnpm tauri dev
    
    # 构建生产版本
    pnpm tauri build

    💡 核心功能

    • 🎙️ 实时本地转写:采用 NVIDIA Parakeet 模型(比 Whisper 快4倍),支持说话人分离(Speaker Diarization),可区分不同参会者;支持多语言,修复了多字节字符截断问题
    • 🤖 灵活 AI 总结:支持 Ollama(本地)、Claude、Groq、OpenRouter 及任意 OpenAI 兼容接口;可自定义总结模板;支持流式生成,生成失败时可保留已生成内容
    • 🔒 100% 本地处理:所有录音、转写文本、AI 总结均存储于本地 SQLite 数据库(meeting_minutes.db),无需联网,无数据泄露风险
    • ⚡ GPU 加速:macOS 支持 Apple Silicon (Metal) + CoreML;Windows/Linux 支持 NVIDIA (CUDA)、AMD/Intel (Vulkan);编译时自动启用,无需额外配置
    • 📥 导入与增强(Beta):支持导入已有音频文件生成转写;可对已录制会议使用不同模型或语言重新转写,全部本地处理

    📦 典型使用场景

    🏢 场景1:金融/法律/医疗机构内部会议

    这些行业对数据合规有严格要求(如 GDPR、HIPAA),不能使用云端会议记录工具。Meetily 让 AI 会议助手完全运行在内网设备上,满足合规审计要求,同时享受 AI 自动生成会议摘要的便利。

    👨‍💻 场景2:远程团队协作记录

    支持 Zoom、Teams、Google Meet 等主流会议平台,可同时录制麦克风和系统音频,智能降噪,自动生成会议摘要。团队成员可各自运行 Meetily,会议记录完全私有,无需担心商业机密泄露。

    🔧 场景3:开发者技术讨论存档

    技术讨论中常涉及代码片段、架构决策等敏感信息。Meetily 本地转写后可导出为 Markdown 格式,直接存入团队知识库(如 Obsidian、Notion 本地版),结合 Ollama 本地运行 Llama 3 生成技术决策摘要,全程无需任何外部 API。


    ⭐ 推荐理由

    作为一名对隐私极其敏感的 AI 从业者,我对市面上的云端会议记录工具一直存有顾虑。Meetily 最大的价值在于:它让 AI 会议助手不再是一个「隐私换便利」的妥协方案。

    项目的 Rust + Tauri 技术选型也值得称赞:相比 Electron 框架,Tauri 打包体积小(约 50MB vs Electron 的 150MB+),内存占用更低,安全性更高。Parakeet 模型的集成更是一个亮点——NVIDIA 的这个模型在准确性和速度上都超越 Whisper,且完全本地可运行。

    MIT 许可证意味着你可以自由修改和分发,对于需要定制功能的团队来说非常友好。如果你在意数据主权,或者所在行业有合规要求,Meetily 是目前唯一值得认真考虑的开源方案。


    📧 下载地址


    💡 Tip: Meetily PRO 版本提供更高的转录精度、自定义摘要模板、PDF/DOCX 导出、自动会议检测和说话人识别等高级功能。社区版将永久免费开源,PRO 版面向需要企业级功能的团队。使用优惠码 LAUNCH20 可获得 20% 折扣。

  • FunASR:阿里达摩院出品的工业级语音识别工具包,18.6K+ Stars 让中文语音识别又快又准

    FunASR:阿里达摩院出品的工业级语音识别工具包,18.6K+ Stars 让中文语音识别又快又准

    ASR

    FunASR:阿里达摩院出品的工业级端到端语音识别工具包

    ModelScope(阿里达摩院) 出品 · 18.6K+ Stars · 1.9K+ Forks · MIT 许可

    FunASR 是阿里达摩院 ModelScope 团队开发的工业级端到端语音识别工具包
    支持 170 倍实时识别速度、50+ 语言、内置说话人日志与情感检测,并提供兼容 OpenAI 的 API 接口。
    相比 Whisper,FunASR 在中文和方言识别上准确率更高,CPU 场景运行速度更快,是开源语音识别领域最实用的生产级工具包。

    18.6K+
    GitHub Stars

    50+
    支持语言

    170x
    实时识别速度

    MIT
    开源许可

    ⚙️ 安装要求和过程

    环境要求

    • Python ≥ 3.8
    • 需先安装 PyTorch 和 torchaudio
    • GPU 可选(CPU 场景亦可运行,SenseVoice 模型可达 17 倍实时)
    • 可选:vLLM(加速推理)、Docker(容器部署)

    快速安装

    # 从 PyPI 安装(推荐)
    pip install funasr
    pip install funasr[cli]      # 包含 CLI 命令行工具
    
    # 从源码安装
    git clone https://github.com/modelscope/FunASR.git
    cd FunASR
    pip install -e ./
    
    # Docker 一键部署 API 服务
    docker run -p 8000:8000 funasr/funasr-server:latest

    🚀 核心功能

    170倍实时识别速度

    旗舰模型 Fun-ASR-Nano 配合 vLLM 加速可达 340 倍实时,比 Whisper 快 26 倍;CPU 场景下 SenseVoice 模型可达 17 倍实时

    🌍

    50+ 语言支持

    Qwen3-ASR 支持 52 种语言,Fun-ASR-Nano 支持 31 种语言,覆盖全球主流语种,适合国际化应用

    🎯

    内置多任务能力

    单模型调用即可完成 VAD 分段、语音识别、说话人分离、标点恢复、时间戳、情感/音频事件识别,无需额外模型

    🔄

    流式实时识别

    支持音频流逐块输入,适合实时字幕、语音实时转写场景,支持逐字/逐句流式输出

    🔌

    OpenAI 兼容 API

    提供兼容 OpenAI 语音识别 API 的接口,可对接 LangChain、Dify、AutoGen 等 AI 框架;提供 MCP Server 可接入 Claude Code、Cursor 等智能体

    💡 典型使用场景

    🎤 本地音频快速转录

    无需 GPU 即可使用,单条命令完成音频转录,支持输出纯文本、JSON、SRT 字幕等格式

    funasr audio.wav
    funasr audio.wav --output-format json
    funasr audio.wav --output-format srt --output-dir ./subs

    👥 会议长音频处理

    单模型调用同时完成 VAD 分段、语音识别、说话人分离,适合会议、访谈等长音频场景

    from funasr import AutoModel
    
    model = AutoModel(
        model="iic/SenseVoiceSmall",
        vad_model="fsmn-vad",
        spk_model="cam++",
        device="cuda"
    )
    result = model.generate(
        input="meeting_record.wav",
        batch_size_s=300,
    )

    🚀 生产级 API 部署

    一键启动兼容 OpenAI 的 API 服务,可对接现有基于 OpenAI API 的应用,无需修改代码

    # 启动服务
    funasr-server --device cuda
    
    # 调用(兼容 OpenAI API)
    curl http://localhost:8000/v1/audio/transcriptions \
      -F file=@sample.wav -F model=sensevoice

    🌟 推荐理由

    FunASR 是开源语音识别领域最实用的工业级工具包。相比 Whisper,它在中文和方言识别上准确率更高,CPU 场景运行速度更快(17 倍实时),且内置了说话人分离、情感检测等额外能力,无需像 Whisper 那样集成多个模型。

    最让我惊喜的是它的 OpenAI 兼容 API——只需改一行代码,就能把基于 Whisper 的应用无缝迁移到 FunASR,且中文识别准确率显著提升。此外,它还提供 MCP Server,可直接接入 Claude Code、Cursor 等 AI 编程助手,让语音识别能力融入 AI 工作流。

    MIT 许可允许商用,且支持边缘设备无 Python 运行时部署(llama.cpp/GGUF),真正做到了全场景覆盖。如果你在做语音相关的 AI 应用,FunASR 是目前最好的开源选择。

    📥 下载地址

    ⭐ 如果你觉得这篇文章有用,欢迎在 GitHub 上给 FunASR 点个 Star!
  • Voicebox:开源AI语音工作室,本地替代ElevenLabs+WisprFlow,34K+Stars让AI开口说话

    Voicebox:开源AI语音工作室,本地替代ElevenLabs+WisprFlow,34K+Stars让AI开口说话

    🎙️ Voicebox:开源 AI 语音工作室

    免费替代 ElevenLabs + WisprFlow 的全栈 AI 语音解决方案,34K+ Stars,MIT 许可

    34K+
    GitHub Stars
    7种
    TTS 引擎
    23
    支持语言
    500+
    开发者
    关注者
    MIT
    开源许可

    📌 项目简介

    Voicebox 是一个开源的 AI 语音工作室,由独立开发者 jamiepine 打造,旨在提供完全本地运行的 AI 语音解决方案。它将”语音生成(替代 ElevenLabs)”和”语音输入(替代 WisprFlow)”二合一,所有模型和数据完全在本地运行,无需上传云端,是隐私优先的 AI 语音工具首选。

    项目基于 Tauri (Rust) 桌面端 + React/TypeScript 前端 + FastAPI Python 后端架构,支持 macOS、Windows 和 Docker 部署,内置 7 种 TTS 引擎、Whisper STT、本地 Qwen3 LLM,并原生支持 MCP 协议,让 AI 智能体也能”开口说话”。

    ⚙️ 安装要求和过程

    环境要求

    • macOS:Apple Silicon (M1+) 或 Intel Mac,推荐 16GB 内存
    • Windows:Windows 10+,支持 CUDA GPU 加速(NVIDIA)或 DirectML(任意 GPU)
    • Linux:从源码构建,支持 CUDA/ROCm GPU 加速
    • 通用:Python 3.11+,Rust(开发构建),Bun (JS 运行时)

    快速安装(预编译包)

    # macOS (Apple Silicon)
    curl -L https://voicebox.sh/download/mac-arm -o Voicebox.dmg

    # macOS (Intel)
    curl -L https://voicebox.sh/download/mac-intel -o Voicebox.dmg

    # Windows
    # 下载 MSI:https://voicebox.sh/download/windows

    # Docker 一键启动
    git clone https://github.com/jamiepine/voicebox.git
    cd voicebox
    docker compose up

    从源码开发构建

    # 克隆仓库
    git clone https://github.com/jamiepine/voicebox.git
    cd voicebox

    # 安装 just 命令工具(任务运行器)
    brew install just # macOS
    # 或 cargo install just

    # 一键安装依赖并启动开发服务器
    just setup
    just dev

    # 构建生产版本
    just build # CPU 版本
    just build-local # Windows + CUDA 版本

    🌟 核心功能

    🎤 7 种 TTS 引擎,覆盖全场景

    Voicebox 集成了 7 种开源 TTS 引擎,从超轻量的 Kokoro (82M) 到高质量的 HumeAI TADA (3B),满足不同场景需求:

    引擎 语言数 模型大小 核心优势
    Qwen3-TTS 10 0.6B/1.7B 高质量多语言克隆,支持发音指令
    Chatterbox Multilingual 23 ~1GB 语言覆盖最广,支持阿拉伯语/芬兰语等
    Chatterbox Turbo 英语 350M 超快速度,支持 [laugh]/[sigh] 表情标签
    Kokoro 8 82M 极小模型,CPU 实时 10x+ 速度
    LuxTTS 英语 ~1GB 48kHz 输出,CPU 150x 实时速度
    HumeAI TADA 10 1B/3B 语音语言模型,支持 700s+ 连贯音频
    Qwen CustomVoice 10 自然语言控制发音,无需参考音频

    🗣️ 语音克隆 + 无限长度生成

    支持从几秒音频进行零样本语音克隆,同时内置 Kokoro 和 Qwen CustomVoice 的 50+ 精选预设语音。独创”无限长度生成”机制——自动按句子拆分文本,分块生成后交叉淡入淡出拼接,最大支持 50,000 字符的文本输入,彻底打破 TTS 长度限制。

    🎧 全局语音输入(Dictation)

    支持全局热键语音输入,macOS 支持自动粘贴到当前文本框(按住说话/切换模式)。内置 Whisper STT,支持可选 LLM 优化去除口癖、停顿,让语音输入更流畅自然。相当于开源版的 WisprFlow!

    🤖 AI 智能体语音输出(MCP 支持)

    内置本地 MCP 服务器,支持 Claude Code、Cursor、Cline 等 AI 编程助手通过 voicebox.speak 工具调用,让 AI 智能体用克隆的语音”开口说话”。支持为不同智能体绑定不同语音,实现个性化语音输出。

    # Claude Code 一键配置 MCP
    claude mcp add voicebox –transport http –url http://127.0.0.1:17493/mcp –header “X-Voicebox-Client-Id: claude-code”

    🎬 语音故事编辑器 + 音频后处理

    内置多轨道时间线编辑器,支持对话、播客、叙事内容制作,支持拖拽、音频裁剪、同步播放。基于 Spotify pedalboard 库提供 8 种音频后处理效果(音调偏移、混响、延迟、合唱、压缩等),并内置”机器人”、”电台”、”回声室”、”低音”4 种预设效果链。

    💡 典型使用场景

    场景一:AI 编程助手语音通知

    长时间运行的编程任务(如模型训练、测试套件)完成后,通过 Voicebox MCP 集成,让 Claude Code 或 Cursor 用你喜欢的语音播报结果:”测试全部通过,共 42 个用例,耗时 3 分 12 秒”。不用盯着屏幕,声音告诉你进度!

    场景二:多语言内容创作

    使用 Chatterbox Multilingual 引擎(支持 23 种语言),配合语音克隆功能,内容创作者可以用自己(或任何)的声音生成多语言版本的视频配音、播客内容。Qwen3-TTS 还支持输入发音指令(如”慢点说”、”小声说”),让生成语音更自然。

    场景三:本地隐私优先的语音输入替代

    替代 WisprFlow 等云端语音输入工具,所有语音识别和转录均在本地运行(Whisper STT),语音数据不上传任何云端服务器。对隐私敏感的用户、企业内网环境,或者需要离线使用的场景,Voicebox 是最佳选择。

    💬 推荐理由

    为什么推荐 Voicebox?

    1. 隐私优先,本地全栈。模型、语音数据、录音内容完全本地存储,不依赖任何云服务。对于关注数据隐私的开发者来说,这一点至关重要。

    2. 二合一解决方案。一个工具同时替代 ElevenLabs(语音生成)和 WisprFlow(语音输入),不需要订阅两个服务,省心省钱。

    3. 引擎覆盖全面。7 种 TTS 引擎从 82M 到 3B 参数,从 CPU 到 GPU 加速,从英语到 23 种语言,几乎覆盖了所有使用场景。

    4. MCP 原生支持。AI 智能体生态正在爆发,Voicebox 率先支持 MCP 协议,让 AI 智能体具备语音输出能力,这在开源项目中非常前瞻。

    5. 活跃开发中。485 个开放 Issues 说明社区非常活跃,项目在快速迭代。MIT 许可允许自由修改和分发,适合二次开发。

    个人使用感受:Voicebox 的 MCP 集成体验非常顺滑,配置一次后,Claude Code 就能直接调用语音输出。用它来做长时间编程任务的语音通知,比盯着终端看进度条优雅太多。唯一的小遗憾是 Linux 目前还没有预编译包,需要自己从源码构建。

    📥 下载地址

    项目信息:
    ⭐ GitHub Stars: 34,192
    📜 开源许可: MIT License
    💻 技术栈: Tauri (Rust) + React/TypeScript + FastAPI (Python)
    🌐 官网: voicebox.sh
    📦 Docker: docker compose up
    最近更新: 2026 年 6 月

  • Oculus 创始人做了一款对话 AI,说话像人一样自然,iOS 版上线了

    Oculus 创始人做了一款对话 AI,说话像人一样自然,iOS 版上线了

    你用 ChatGPT 语音模式的时候,有没有过这种感觉:它回答太快了,快到不自然;或者它开始”思考”的时候,对话就卡住了,像打电话突然没了声音。

    Oculus 的联合创始人早就注意到了这个问题。他们离开 VR 赛道,做了一个叫 Sesame 的对话 AI,5月28日刚在 iOS 上线了公开预览版。

    Sesame AI 对话界面
    Sesame iOS app 对话界面(图片来源:TechCrunch)

    说话的时候也能”思考”

    Sesame 解决的核心问题其实很朴素:快速回复和周全思考之间,向来有个矛盾。慢一点通常更准确,但等太久又让人觉得不自然。

    他们的做法是:一边说话,一边在后台跑多个并行搜索,把结果融进回复里。所以对话不会卡住,AI 甚至可以在句子中间调整内容——就像人突然想起一件要补充的事,顺口就带出来了。

    四个 AI 角色,各有各的性格

    目前 app 里有四个 AI 代理:Maya、Miles、Simone 和 Charlie,每个都有自己的声音、性格和记忆。Maya 和 Miles 在之前的技术预览版里已经上线过,红杉资本说前几周就有超过 100 万人体验了这两个代理。

    Beta 测试期间,团队根据反馈加了不少功能:带图片结果的搜索卡片、记录要点的笔记功能、不方便说话时用的文本模式,以及一个”隐身模式”——对话内容不会被记入记忆。

    Sesame 在发布声明里写了一段话,很能代表他们的产品思路:”快速回复和花时间构思周全的回复之间存在着固有的矛盾。更慢的回复通常更准确,但如果耗时太久,也会让人感觉不自然。”

    下一步是智能眼镜,再下一步是”替你行动”

    这款 iOS app 只是 Sesame 更大计划的第一步。团队透露,他们预计在 2027 年推出智能眼镜产品。更远一点的规划是:这些 AI 代理不只是陪你聊天,还能代表你采取行动——这也是它们被称为”代理”而不是”聊天机器人”的原因。

    这个方向其实比聊天更有想象力。现在的 AI 工具,不管是对话型的还是代理型的,都需要你先把需求想清楚、表达清楚,有时候甚至还得知道”应该怎么实现”。但一个能自然对话的代理,可以帮你把这一步也给省了。

    目前这个 iOS app 已经在 39 个国家上线,完整功能完全免费,不过新注册用户可能还是会遇到一个短暂的等待名单。Android 版本也计划在未来推出。

    Sesame 去年刚从红杉资本等机构拿到 2.5 亿美元的 B 轮融资。Oculus 联合创始人的背景,加上红杉的押注,让这家公司在对话 AI 赛道里显得挺特别。