标签: 语音合成

  • LiveKit Agents:用 Python 构建实时语音 AI 智能体的开源框架

    LiveKit Agents:用 Python 构建实时语音 AI 智能体的开源框架

    在语音助手、AI 客服、实时翻译早已不是新鲜事的今天,真正难的是:如何用一个干净、可编排、可私有部署的框架,把 STT、LLM、TTS 串成一次低延迟、不打断、能“看见”的实时对话。LiveKit Agents 正是为这件事而生。

    📌 项目简介

    LiveKit Agents 是一个用于构建实时、可编程的多模态语音 AI 智能体的开源框架,运行在服务器端,让智能体具备“看、听、理解”的能力。它把语音识别(STT)、大模型(LLM)、语音合成(TTS)以及实时模型(Realtime API)抽象成可自由替换的组件,并提供任务调度、工具调用、测试框架等一整套生产级能力。

    💻 安装要求与过程

    环境要求

    • Python 3.9+
    • 一个 LiveKit 服务器:可用 LiveKit Cloud,也可用开源的 livekit 自托管
    • 至少一家模型服务商的密钥:如 Deepgram(STT)、OpenAI / Google(LLM)、Cartesia(TTS)等
    • 如需电话接入,可启用 LiveKit 的 SIP / 电话栈

    快速安装

    pip install "livekit-agents[openai,deepgram,cartesia]"

    三种运行模式

    # 终端本地测试:无需外部服务器,直接验证交互
    python myagent.py console
    
    # 开发模式:连接 LiveKit 云/自托管,支持热重载
    python myagent.py dev
    
    # 生产部署:生产级优化
    python myagent.py start

    开发 / 生产模式需配置环境变量:LIVEKIT_URLLIVEKIT_API_KEYLIVEKIT_API_SECRET(以及对应模型服务商的 Key)。也可用 Agents Playground 快速体验。

    ✨ 核心功能

    • 灵活集成:完整的插件生态,自由混搭最合适的 STT、LLM、TTS 与 Realtime API。
    • 内置任务调度:通过 Dispatch API 自动做任务分配与分发,把终端用户连接到对应智能体。
    • 语义轮流检测(Turn Detection):用 Transformer 模型判断用户是否说完,显著降低误打断。
    • 原生 MCP 支持:一行代码即可把 MCP 服务器提供的工具接入智能体。
    • 内置测试框架:用断言(expect)配合 LLM 评判(judge)编写测试,对抗 LLM 的非确定性。
    • 全平台 WebRTC 客户端 + 电话集成:覆盖浏览器、iOS、Android、Flutter 等,并可拨打 / 接听电话。

    🎯 典型使用场景

    • 语音客服 / 订餐机器人:内置 restaurant_agent 范例,可处理来电订餐与预约,直接对接电话线路。
    • 外呼电话机器人:Outbound Caller 范例可自动批量拨打电话、播报与收集信息。
    • 多智能体接力(Handoff):多个 Agent 按流程交接(如先收集信息、再切换讲故事 Agent),适合工单分流、复杂客服。
    • 视频数字人:通过 Tavus、Bithuman、LemonSlice 等接入 AI 虚拟形象,做出“能说话的脸”。
    • 实时视觉 Agent:结合 Gemini Live 等,做出能“看见”环境并对话的助手(含 iOS 端范例)。

    💡 推荐理由

    我自己折腾过不少语音 Agent 方案,LiveKit Agents 最打动我的是它的“把复杂留给自己、把简单交给开发者”:一个 AgentSession 把你想要的 STT/LLM/TTS 一行声明完,多智能体切换、工具调用、打断检测都有官方最佳实践兜底;更关键的是整套栈可私有化——连媒体服务器都是开源的,数据不出自己的机房,对企业场景非常友好。再加上官方提供的 LiveKit Docs MCPAgent Skill,用 AI 编程助手来搭语音应用也顺手很多。如果你打算认真做一个“能听会说”的产品,它值得作为底座首选。

    🔗 下载地址

    LiveKit Agents 核心亮点

  • AI客服一开口就露馅,这家公司想用小模型让你分不清人机

    打客服电话,对面接起来的是个AI,大部分人三秒钟就能听出来。露馅的地方往往不是音色——现在的合成语音已经足够干净了——而是节奏。你说完一句,它要顿一下才回;你想插一句,它照着自己的稿子往下念。那种”轮到你了、现在轮到我了”的机械感,一下就把幻觉戳破。

    Smallest.ai 联合创始人团队
    Smallest.ai 创始团队,左一为创始人兼CEO Sudarshan Kamath|图片来源:TechCrunch

    一家叫 Smallest.ai 的公司,正是冲着这半秒钟的尴尬去的。它2024年底才成立,刚刚拿到1300万美元A轮,由 Seligman Ventures 领投,Sierra Ventures 和 3one4 Capital 跟投,累计融资超过2100万美元。

    它赌的不是大模型跑得更快,而是换一条路

    行业里解决语音延迟的主流思路,是想办法把大语言模型的推理压得更短。Smallest.ai 的判断反过来:下一跳不会来自把大模型加速,而是来自专门为人类对话造的小模型。

    创始人兼CEO Sudarshan Kamath 解释他们的模型是怎么设计的时,用了一个特别日常的比方。

    我跟你说话的时候,你其实已经在想了,如果我讲太久,你甚至会打断我。

    听、想、说这三件事,人是同时干的。而大模型不是。Kamath 说,大模型的工作方式是你把一整段提示词交给它,它才开始思考。这点延迟放在文字聊天里没人在意,放到语音对话里,哪怕一小段静默都显得不自然——”你想想我们现在怎么讲话的,我不会把一大段音频剪好丢给你,你再开始想。”

    小模型顶前台,大模型在后面待命

    Smallest.ai 的产品结构是这样的:小语音模型充当实时智能层,负责在特定话题范围内跟客户自然对话,响应几乎没有延迟。一旦碰到超出它知识边界的问题,就把这个问题移交给大型基础模型,同时礼貌地请客户稍等,说自己去”查一下”——跟真人客服的处理方式一模一样。

    Kamath 相信这会变成所有语音智能体的标准架构:一个负责实时交互的小语音模型,加一个按需唤起、解决复杂问题的”离线”大模型。

    因为只做语音,它优化的东西也跟通用大模型不一样,全是些细碎但要命的场景:

    • 各种口音都能听懂,不挑发音标准的用户;
    • 支持几十种语言;
    • 在有背景噪音的环境里照样工作。

    客户名单里已经有 RingCentral 和 Truecaller

    目前 Smallest.ai 的客户主要是语音领域的公司,包括 RingCentral 和 Truecaller。Kamath 认为,任何做客服的公司都是潜在客户,包括 Sierra、Decagon 这类新兴的AI客服创业公司。

    有人会问:这些公司自己融了那么多钱,为什么不顺手把语音模型也做了?Kamath 的回答挺实在——对客服创业公司来说,把语音这一件事做到极致,是对主业的分心。

    它要面对的对手也不轻松。语音AI这条赛道上,ElevenLabs 是公认的头部,另外还有 Cartesia,以及像 Sarvam 这样专注本地语言的区域玩家。不同之处在于,一些对手把语音AI用在配音、播客这类内容生产场景上,而 Smallest.ai 只盯着面向企业的实时对话智能体,别的一概不碰。

    我们想让模型打破图灵测试。你跟它说话,应该分不出对面是人还是AI。这是公司唯一的目标。

    这条路走不走得通

    把话说回来,语音交互的瓶颈从来就不是知识储备。一个客服机器人需要懂的东西其实很有限,它输就输在反应的时间差和对话的节奏感上。行业主流还在往参数上加码,而 Smallest.ai 挑的是另一个维度——谁能先把那零点几秒的空白抹平,谁就先摸到这块市场的门。

    风险当然也在这里。小模型意味着能力边界明确,一旦频繁触发”请稍等我查一下”,那种真人感照样会碎掉。移交给大模型的那个瞬间处理得够不够顺滑,可能才是这家公司真正的技术门槛。

  • Voicebox:47.5K Stars 的开源 AI 语音工作室,克隆声音、全局听写、让 AI 智能体开口说话

    Voicebox:47.5K Stars 的开源 AI 语音工作室,克隆声音、全局听写、让 AI 智能体开口说话

    Voicebox 应用界面截图

    项目简介

    Voicebox 是一款本地优先的开源 AI 语音工作室——相当于把 ElevenLabs(语音合成)+ WisprFlow(语音听写) 两大云服务装进同一个免费开源的桌面应用:几秒参考音频即可克隆任意声音、7 大 TTS 引擎覆盖 23 种语言、全局热键把语音听写进系统任意输入框,还能通过 MCP 让 Claude Code / Cursor 等 AI 智能体用你克隆的声音「开口说话」。全部模型与数据均在本机运行,目前已收获 47.5K Stars,MIT 许可。

    安装要求和过程

    环境要求

    • macOS:Apple Silicon(MLX/Metal 加速)或 Intel
    • Windows:支持 NVIDIA CUDA 加速
    • Linux:暂无预编译包,需源码构建;另支持 AMD ROCm、Intel Arc
    • Docker:任意平台一行命令部署
    • 轻量引擎 LuxTTS 仅需 ~1GB 显存,CPU 也能 150 倍实时速度推理

    快速安装

    # 方式一:直接下载安装包(推荐)
    # macOS (Apple Silicon): https://voicebox.sh/download/mac-arm
    # macOS (Intel):         https://voicebox.sh/download/mac-intel
    # Windows (MSI):         https://voicebox.sh/download/windows
    
    # 方式二:Docker 一键启动
    git clone https://github.com/jamiepine/voicebox.git
    cd voicebox
    docker compose up
    

    首次启动时应用会引导下载所需模型;macOS 上还有权限向导,一步步带你完成「辅助功能」「输入监控」授权,用于全局听写自动粘贴。

    核心功能

    • 多引擎语音克隆:内置 Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual/Turbo、HumeAI TADA、Kokoro 共 7 大 TTS 引擎,零样本克隆 + 50 多个精选预置声音,覆盖 23 种语言,可逐次生成切换引擎。
    • 全局语音听写:按住热键在系统任意位置说话,松开即把转写文本粘贴进当前输入框(macOS 经辅助功能校验注入,且自动保存/恢复剪贴板);内置 Whisper 全系列模型(Turbo 版比 Large 快约 8 倍),可选本地 LLM 自动清理「嗯、啊」等口头语。
    • 给 AI 智能体一个声音:自带 MCP 服务器与 REST API,Claude Code、Cursor、Cline 等任意支持 MCP 的智能体只需调用 voicebox.speak 工具,就能用你克隆的声音向你「汇报工作」。
    • 专业级生产能力:不限长度生成(自动分句 + 交叉淡化拼接,最长 5 万字符)、多轨 Stories 时间线编辑器(做播客/对话/有声书)、8 种后期效果(变调/混响/延迟/压缩等,基于 Spotify pedalboard),生成版本全程可溯源。
    • 完全本地、隐私优先:模型、声音数据、录音捕获全部留在本机,永不上传;应用基于 Tauri(Rust)构建而非 Electron,原生性能,安装包小、内存占用低。

    典型使用场景

    1. 内容创作者做配音/播客:用自己的几秒录音克隆声音,把文章、剧本、章节直接批量转成音频;Stories 编辑器多轨拖拽即可编排双人对话播客,再叠加混响、电台音效等预设,全流程零云端费用。
    2. 开发者的「会说话的」编码智能体:给 Claude Code / Cursor 接上 Voicebox 的 MCP 服务器,长任务跑完后智能体用你指定的声音口头播报结果;配合全局听写热键,动口不动手地写 prompt,形成完整的语音 I/O 闭环。
    3. 注重隐私的日常语音输入:会议纪要、日记、即时消息全部用本地 Whisper 听写,敏感内容不经过任何第三方服务器;Captures 标签页保留每段原始音频 + 转写文本,可随时重转写、改写或升级为克隆样本。

    推荐理由

    试用下来最打动我的是「输入 + 输出一体」的产品思路:市面上克隆声音要买 ElevenLabs,语音听写要买 WisprFlow,而 Voicebox 把两半闭环装进一个 MIT 开源应用,还用本地 LLM 把两端串了起来。工程质量也远超一般开源项目——Tauri 原生应用不卡顿,生成队列异步不阻塞,甚至连 macOS 剪贴板保护、崩溃恢复这类细节都做了。对开发者来说,一行 MCP 配置就能让编码智能体开口说话,这个体验相当新奇实用。如果你需要一套不上云、不订阅的完整语音方案,这个项目值得马上装上试试。

    下载地址

  • 单卡GPU起家做到800万用户,Fish Audio拿下5000万美元种子轮

    一个人、一块GPU、一肚子对市面上”机器味”合成语音的不满——Fish Audio的故事就是这么开始的。前英伟达研究员Shijia Liao当年觉得市面上的合成声音太假,干脆自己在单卡GPU上训了一个语音生成模型,顺手开源。如今这个叫Fish Speech的仓库在GitHub上攒下超过3.1万颗星,独立开发者、游戏设计师、内容创作者都在用。

    这家总部在帕洛阿尔托的公司,本周二宣布拿到5000万美元种子轮融资,由Coreline Ventures和今日资本领投,359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners和HF0跟投。对一家种子期公司来说,这个数字不小,但看看它的底子就不奇怪了。

    Fish Audio联合创始人
    Fish Audio联合创始人(图片来源:TechCrunch)

    800万用户、2100万美元年收入的”种子期”公司

    上线一年多,开源版加托管版的用户超过800万,年度经常性收入做到2100万美元——这份成绩单放在种子轮公司里,相当扎眼。

    过去一年Fish Audio发了五个模型:四个语音生成、一个语音转文字。其中三个语音生成模型开源,最新的S2.1 Pro则只走付费API。它的打法很清晰:创作者和小团队买包月套餐,按分钟数生成语音、解锁声音克隆;企业客户走API和平台,HeyGen、Sanas、Plaud这些名字已经在客户名单上了。

    CEO兼联合创始人Rissa Cao说,不同客户要的东西完全不一样:HeyGen拿它的声音驱动AI数字人,要的是真实感;游戏工作室给角色配音,要的是表现力;LiveKit这类语音智能体公司做电话场景,要的是自然、低延迟、还得有情绪。Fish Audio靠一个超过1.5万条自然语言控制指令的库,把这些需求都接了下来。

    有意思的是,Cao坦承公司原本没打算融资——只做开源加创作者订阅的时候,小日子过得挺高效,根本不缺钱。但要训更强的模型、要接企业大单,加上投资人排着队敲门,这轮融资就水到渠成了。


    声音库的另一面:谁的声音,谁说了算

    Fish Audio声音库的扩张方式之一,是请用户提交自己的声音用于训练,被采用就给报酬。听起来很社区化,但几个月前出了岔子:有创作者公开指控,自己的声音在不知情的情况下被传到了平台上。当时虽然有DMCA下架流程,但处理速度太慢,惹了不少怨气。

    Cao的回应是把下架流程全自动化了:创作者提交一段短语音样本或一纸合同证明声音归属,3分钟内就能从平台下架。不过这依然是”先上车后补票”的逻辑——只要本人没发现,那个声音就会一直在平台上被使用。

    • 领投方Coreline Ventures合伙人Oskue Honda把话说得很直:社区驱动模式要成为持久优势,前提是创作者信任平台,同意、透明、署名必须做进产品里,而不是事后打补丁;
    • 他还提出行业该走向声音所有权验证、清晰的授权条款、便捷的举报下架机制,最终实现声音被商用时创作者能分钱;
    • 359 Capital合伙人Rico Mallozzi则看中性价比:这支团队用远少于大实验室的资源做出了前沿水准的模型,细粒度控制加低成本训练,是它跟巨头掰手腕的本钱。

    接下来的路线图也定了:年内发布音频理解模型,语音到语音的模型也在路上。赛道确实拥挤——ElevenLabs、WellSaid、Cartesia、Speechify、Async、Krisp全都盯着创作者和企业的钱包。但一家靠单卡GPU起家、用户破800万、还没花完种子钱的公司,至少证明了这个市场远没到终局。

  • Voicebox:本地优先的开源 AI 语音工作室,克隆声音 + 让智能体开口说话

    Voicebox:本地优先的开源 AI 语音工作室,克隆声音 + 让智能体开口说话

    Voicebox 开源 AI 语音工作室

    Voicebox —— 本地优先的开源 AI 语音工作室

    📌 项目简介

    Voicebox 是由 Jamie Pine 打造的开源 AI 语音工作室,一句话概括:克隆任意声音、生成语音、随时听写、还能让你的 AI 智能体用你拥有的声音开口说话。它是 ElevenLabs(语音输出)与 WisprFlow(语音输入)的本地优先、免费开源二合一替代品,整套语音 I/O 栈都跑在你自己的机器上。

    ⭐ GitHub 43,196 stars | 🍴 5,280 forks | 📅 创建于 2026-01-25,更新于 2026-07-19(当日 GitHub Trending 热门)| 📜 MIT 许可 | 💻 TypeScript / Tauri(Rust) / FastAPI(Python)

    🛠 安装要求和过程

    环境要求

    • 普通用户:直接下载桌面应用,无需配置开发环境;支持 macOS(Apple Silicon / Intel)、Windows、Linux(需源码构建)、Docker。
    • GPU 加速:macOS 走 MLX/Metal(神经引擎快 4-5×),Windows/Linux NVIDIA 走 CUDA,AMD 走 ROCm,Intel Arc 走 IPEX/XPU,Windows 任意显卡走 DirectML,无显卡则回退 CPU。
    • 开发者构建:需 BunRustPython 3.11+Tauri 前置依赖(macOS 还需 Xcode)。

    快速安装(三种方式)

    方式一 · 下载安装包(推荐)

    方式二 · 开发者一键启动

    git clone https://github.com/jamiepine/voicebox.git
    cd voicebox
    just setup    # 创建 Python venv 并安装全部依赖
    just dev      # 启动后端 + 桌面应用

    (先安装 just 命令运行器:brew install justcargo install just

    方式三 · 接入 AI 智能体(MCP)

    claude mcp add voicebox \
      --transport http \
      --url http://127.0.0.1:17493/mcp \
      --header "X-Voicebox-Client-Id: claude-code"

    ✨ 核心功能

    Voicebox 界面

    1. 7 大 TTS 引擎,自由切换:Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual、Chatterbox Turbo、HumeAI TADA、Kokoro,覆盖 23 种语言(英/阿/日/印地/斯瓦希里等),并支持零样本声音克隆与 50+ 预设音色。
    2. 声音克隆 + 语音性格:几秒参考音频即可克隆任意声音;可为每个声纹绑定自由格式的”性格”,通过本地 Qwen3 LLM 实现 Compose(即兴台词)与 Speak-in-character(拟人改写)。
    3. 全局听写 / 语音输入:系统级热键按住说话、松手即停(push-to-talk),macOS 下自动粘贴到当前输入框;底层基于 OpenAI Whisper 的 STT,支持 Base/Small/Medium/Large/Turbo。
    4. 后期音效处理:基于 Spotify pedalboard 的 8 种效果——变调、混响、延迟、合唱、压缩、增益、高/低通滤波,可实时预览并存为预设。
    5. Agent 语音输出(MCP):一句 voicebox.speak() 调用,任何支持 MCP 的智能体(Claude Code / Cursor / Cline / Windsurf)都能用你克隆的声音向你播报任务进展。

    Voicebox Stories 编辑器

    🎯 典型使用场景

    • 播客 / 有声内容创作:用内置 Stories 多轨时间线编辑器,零样本克隆嘉宾声音,一键生成多角色对话、播客与叙事音频,长文本自动分块 + 交叉淡入淡出。
    • AI 编码智能体开发循环:把 Claude Code 绑定到某个克隆声纹,构建完成、测试通过时它能”开口”告诉你——用耳朵接收进度,而不是一直盯着终端。
    • 无障碍与语音辅助:为无法用原声说话的人提供克隆声音;全局热键听写 + macOS 自动粘贴,大幅提升文字录入效率。
    • 游戏 / 叙事交互:为游戏角色或互动叙事工具接入带”性格”的语音,实现有情绪、带语气词的拟人对话。

    💡 推荐理由

    我用过多家云端语音服务,Voicebox 最打动我的是三点:

    • 真正的本地优先 + 隐私优先。模型、声音数据、录音全部留在本机,不上传任何云,对注重数据主权的用户极其友好。
    • 输入 + 输出一站式。ElevenLabs 只管”说”,WisprFlow 只管”听”,Voicebox 把两者打通,还用一个本地 LLM 串联性格改写,一 GPU 显存占用搞定全套。
    • 给 AI Agent 配声音这个设计非常新颖。当你的编码助手能用你熟悉的声音播报”部署完成”,人机交互的体验立刻不一样,这也是它和同类工具最大的差异化。

    ⚠️ 一点不足:Linux 目前没有预编译二进制,需要源码构建;同时 7 个引擎质量参差,部分小模型音色一般,建议按场景挑选。但瑕不掩瑜,作为开源语音 I/O 基础设施,它已经非常能打。

    📥 下载地址

    本文由自动化脚本基于 GitHub 公开仓库信息整理,项目数据截至 2026-07-19。