标签: 语音AI

  • AI客服一开口就露馅,这家公司想用小模型让你分不清人机

    打客服电话,对面接起来的是个AI,大部分人三秒钟就能听出来。露馅的地方往往不是音色——现在的合成语音已经足够干净了——而是节奏。你说完一句,它要顿一下才回;你想插一句,它照着自己的稿子往下念。那种”轮到你了、现在轮到我了”的机械感,一下就把幻觉戳破。

    Smallest.ai 联合创始人团队
    Smallest.ai 创始团队,左一为创始人兼CEO Sudarshan Kamath|图片来源:TechCrunch

    一家叫 Smallest.ai 的公司,正是冲着这半秒钟的尴尬去的。它2024年底才成立,刚刚拿到1300万美元A轮,由 Seligman Ventures 领投,Sierra Ventures 和 3one4 Capital 跟投,累计融资超过2100万美元。

    它赌的不是大模型跑得更快,而是换一条路

    行业里解决语音延迟的主流思路,是想办法把大语言模型的推理压得更短。Smallest.ai 的判断反过来:下一跳不会来自把大模型加速,而是来自专门为人类对话造的小模型。

    创始人兼CEO Sudarshan Kamath 解释他们的模型是怎么设计的时,用了一个特别日常的比方。

    我跟你说话的时候,你其实已经在想了,如果我讲太久,你甚至会打断我。

    听、想、说这三件事,人是同时干的。而大模型不是。Kamath 说,大模型的工作方式是你把一整段提示词交给它,它才开始思考。这点延迟放在文字聊天里没人在意,放到语音对话里,哪怕一小段静默都显得不自然——”你想想我们现在怎么讲话的,我不会把一大段音频剪好丢给你,你再开始想。”

    小模型顶前台,大模型在后面待命

    Smallest.ai 的产品结构是这样的:小语音模型充当实时智能层,负责在特定话题范围内跟客户自然对话,响应几乎没有延迟。一旦碰到超出它知识边界的问题,就把这个问题移交给大型基础模型,同时礼貌地请客户稍等,说自己去”查一下”——跟真人客服的处理方式一模一样。

    Kamath 相信这会变成所有语音智能体的标准架构:一个负责实时交互的小语音模型,加一个按需唤起、解决复杂问题的”离线”大模型。

    因为只做语音,它优化的东西也跟通用大模型不一样,全是些细碎但要命的场景:

    • 各种口音都能听懂,不挑发音标准的用户;
    • 支持几十种语言;
    • 在有背景噪音的环境里照样工作。

    客户名单里已经有 RingCentral 和 Truecaller

    目前 Smallest.ai 的客户主要是语音领域的公司,包括 RingCentral 和 Truecaller。Kamath 认为,任何做客服的公司都是潜在客户,包括 Sierra、Decagon 这类新兴的AI客服创业公司。

    有人会问:这些公司自己融了那么多钱,为什么不顺手把语音模型也做了?Kamath 的回答挺实在——对客服创业公司来说,把语音这一件事做到极致,是对主业的分心。

    它要面对的对手也不轻松。语音AI这条赛道上,ElevenLabs 是公认的头部,另外还有 Cartesia,以及像 Sarvam 这样专注本地语言的区域玩家。不同之处在于,一些对手把语音AI用在配音、播客这类内容生产场景上,而 Smallest.ai 只盯着面向企业的实时对话智能体,别的一概不碰。

    我们想让模型打破图灵测试。你跟它说话,应该分不出对面是人还是AI。这是公司唯一的目标。

    这条路走不走得通

    把话说回来,语音交互的瓶颈从来就不是知识储备。一个客服机器人需要懂的东西其实很有限,它输就输在反应的时间差和对话的节奏感上。行业主流还在往参数上加码,而 Smallest.ai 挑的是另一个维度——谁能先把那零点几秒的空白抹平,谁就先摸到这块市场的门。

    风险当然也在这里。小模型意味着能力边界明确,一旦频繁触发”请稍等我查一下”,那种真人感照样会碎掉。移交给大模型的那个瞬间处理得够不够顺滑,可能才是这家公司真正的技术门槛。

  • 让AI偷师金牌销售:Encore AI靠“交互挖掘”拿下3000万美元A轮

    做AI客服的公司满大街都是,但Encore AI的思路有点不一样:别的厂商忙着让AI学产品手册,它让AI直接去”偷师”公司里最会聊的那批销售和客服。7月29日,这家公司宣布拿下3000万美元A轮融资,由以色列风投Team8领投。

    Encore AI团队
    Encore AI团队 | 图源:TechCrunch / Encore AI

    “交互挖掘”:把金牌销售的话术拆开揉碎

    Encore AI的CEO德维尔·金茨堡(Dvir Ginzburg)给这套方法起了个名字,叫”交互挖掘”(interaction mining)。平台把公司的通话录音、邮件、短信全收进来,再和CRM系统打通,把每一次客户互动切成一个个阶段,逐段分析:哪句话推动了成交,哪句话把客户聊跑了。

    分析完之后,AI智能体就照着”验证有效”的剧本来。有意思的是,学得相当彻底——

    “有时候我们的智能体连客户经理爱讲的段子都会讲,他们举的例子、说的轶事也会原样用上,因为我们跑的就是那些被证明有效的剧本。我们做出来的智能体,本质上是一堆成功打法的合集。”——Encore AI CEO 德维尔·金茨堡

    这背后有个很实际的洞察:同一家公司里,有人擅长开场破冰,有人擅长临门一脚。把每个人最强的那段拼起来,就是一个不存在于现实中的”全能选手”。这些智能体既能直接用语音或文字跟客户对话,也能当员工的副驾驶,在通话过程中实时递话术。

    18个月ARR翻5倍,金融机构是主力买家

    这家公司2022年成立时叫Insait IO,最早给理财顾问做推荐软件,后来改名转型才有了现在的样子。目前全球企业客户超过40家,大部分是金融机构。距离种子轮不到18个月,年经常性收入涨了5倍多——具体数字和估值,金茨堡没肯透露。

    这轮融资还有个细节值得玩味:跟投方里除了Planven、Lukatz和Garage,还有几家银行和保险公司,其中一些是先用了产品觉得好,才决定掏钱入股的。客户变股东,对一家to B创业公司来说算是相当硬的背书。


    大厂追上来怎么办

    这个赛道的隐忧也明摆着:Salesforce、SAP、Zoho、HubSpot这些CRM巨头手里攥着海量客户数据,随时可能做出类似功能。金茨堡的回应是,光有数据没用,关键看架构——

    • 大厂的产品体系里,历史对话从来不是核心数据资产,只是附属记录;
    • 要把客户对话变成智能体的地基,它们得把整个实施和技术栈推倒重来;
    • 而Encore从第一天起就是围着对话数据长出来的,这是先发的结构性优势。

    这套说辞能撑多久,要看巨头的动作有多快。至于这3000万美元怎么花:扩建美国销售团队,把平台铺进更多大型金融机构。

  • 外卖电话不用人接了:Yelp的语音AI开始替餐厅收单、订位

    周五晚上的餐厅后厨有多忙,接过电话的服务员都懂:一边是堂食客人排着队,一边是电话里的外卖单要记菜名、记忌口、还要收钱。Yelp觉得这活儿不该人干了——7月28日,它给自家的AI电话接线员Yelp Host上了一次大更新,外卖点单和OpenTable订位全都交给AI,店员从头到尾不用碰电话。

    上线不到一年,Yelp Host已经替餐厅接了超过100万通电话,相当于近两年不间断的通话时长,月均增速38%。光母亲节那个周末,它就接了4万多通。

    打电话点外卖,全程AI搞定

    这次最大的变化是AI能直接收外卖单了。通过餐饮集成平台Stream,Yelp Host接上了Toast、Square、Clover这些主流收银系统,把整份菜单装进了脑子。顾客打电话进来,AI能对话式地帮你选菜、改配料、记特殊要求,还能约定取餐时间;付款可以到店再付,也可以发个短信链接提前支付。订单确认后自动流进收银系统和后厨屏幕,没有任何人工转录。

    更关键的一点:不抽佣金。相比动辄抽走两三成的第三方外卖平台,这对本来利润就薄的小餐馆来说是实打实的诱惑。这也是Yelp Host第一次把非堂食的快餐店、外带店纳入服务范围,等于打开了一个全新的市场。

    Yelp Host语音AI演示电话外卖点单
    Yelp Host在演示视频里完整接下了一单电话外卖 图源:The Verge

    订位这件事也顺手包了

    另一条主线是和OpenTable的打通。美国和加拿大用OpenTable的餐厅,现在可以让Yelp Host全天候接订位电话——预订、改期、取消都行,结果实时同步到OpenTable后台。更聪明的是,它还能调用店里的实际空位:网上显示订满的时段,只要店内还有桌子,AI照样能帮你订上。

    细节堆得很足

    这次一起放出来的还有一堆实用更新:

    • 新增16种语言,包括中文普通话、日语、韩语、西班牙语等,AI自动识别来电语言切换应答;
    • 8种新音色可选,还支持给餐厅定制专属声音;
    • 供应商来电转经理、宴会咨询转活动负责人,不同类型的电话自动分流;
    • 后台报表能看到接听质量、下班后来电量、订位转化率这些经营数据。

    定价方面,Yelp Host每月249美元起,Yelp Guest Manager的老客户优惠到199美元。今年夏天还会加上”推荐加购”功能——AI替你多卖一份薯条的日子不远了。

    有意思的是餐厅老板的反馈。一位美式餐厅老板说,有客人专门走进店里,夸他们电话接得好——对方压根没听出来那是AI。当然,The Verge也不忘提醒一句:希望它比麦当劳、温迪家那些闹过笑话的AI点餐机靠谱一些。电话那头的AI能不能一直稳住,得让周五晚高峰来检验。


  • 单卡GPU起家做到800万用户,Fish Audio拿下5000万美元种子轮

    一个人、一块GPU、一肚子对市面上”机器味”合成语音的不满——Fish Audio的故事就是这么开始的。前英伟达研究员Shijia Liao当年觉得市面上的合成声音太假,干脆自己在单卡GPU上训了一个语音生成模型,顺手开源。如今这个叫Fish Speech的仓库在GitHub上攒下超过3.1万颗星,独立开发者、游戏设计师、内容创作者都在用。

    这家总部在帕洛阿尔托的公司,本周二宣布拿到5000万美元种子轮融资,由Coreline Ventures和今日资本领投,359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners和HF0跟投。对一家种子期公司来说,这个数字不小,但看看它的底子就不奇怪了。

    Fish Audio联合创始人
    Fish Audio联合创始人(图片来源:TechCrunch)

    800万用户、2100万美元年收入的”种子期”公司

    上线一年多,开源版加托管版的用户超过800万,年度经常性收入做到2100万美元——这份成绩单放在种子轮公司里,相当扎眼。

    过去一年Fish Audio发了五个模型:四个语音生成、一个语音转文字。其中三个语音生成模型开源,最新的S2.1 Pro则只走付费API。它的打法很清晰:创作者和小团队买包月套餐,按分钟数生成语音、解锁声音克隆;企业客户走API和平台,HeyGen、Sanas、Plaud这些名字已经在客户名单上了。

    CEO兼联合创始人Rissa Cao说,不同客户要的东西完全不一样:HeyGen拿它的声音驱动AI数字人,要的是真实感;游戏工作室给角色配音,要的是表现力;LiveKit这类语音智能体公司做电话场景,要的是自然、低延迟、还得有情绪。Fish Audio靠一个超过1.5万条自然语言控制指令的库,把这些需求都接了下来。

    有意思的是,Cao坦承公司原本没打算融资——只做开源加创作者订阅的时候,小日子过得挺高效,根本不缺钱。但要训更强的模型、要接企业大单,加上投资人排着队敲门,这轮融资就水到渠成了。


    声音库的另一面:谁的声音,谁说了算

    Fish Audio声音库的扩张方式之一,是请用户提交自己的声音用于训练,被采用就给报酬。听起来很社区化,但几个月前出了岔子:有创作者公开指控,自己的声音在不知情的情况下被传到了平台上。当时虽然有DMCA下架流程,但处理速度太慢,惹了不少怨气。

    Cao的回应是把下架流程全自动化了:创作者提交一段短语音样本或一纸合同证明声音归属,3分钟内就能从平台下架。不过这依然是”先上车后补票”的逻辑——只要本人没发现,那个声音就会一直在平台上被使用。

    • 领投方Coreline Ventures合伙人Oskue Honda把话说得很直:社区驱动模式要成为持久优势,前提是创作者信任平台,同意、透明、署名必须做进产品里,而不是事后打补丁;
    • 他还提出行业该走向声音所有权验证、清晰的授权条款、便捷的举报下架机制,最终实现声音被商用时创作者能分钱;
    • 359 Capital合伙人Rico Mallozzi则看中性价比:这支团队用远少于大实验室的资源做出了前沿水准的模型,细粒度控制加低成本训练,是它跟巨头掰手腕的本钱。

    接下来的路线图也定了:年内发布音频理解模型,语音到语音的模型也在路上。赛道确实拥挤——ElevenLabs、WellSaid、Cartesia、Speechify、Async、Krisp全都盯着创作者和企业的钱包。但一家靠单卡GPU起家、用户破800万、还没花完种子钱的公司,至少证明了这个市场远没到终局。

  • ChatGPT语音模式登陆桌面端:一句话让AI建PR、找bug、翻网页

    动动嘴就能指挥电脑干活这件事,OpenAI这周四又往前推了一步:ChatGPT桌面App正式接入了ChatGPT Voice语音模式。以后坐在电脑前,你可以直接跟它说话,让它调度AI智能体、在你的电脑上执行各种任务。

    OpenAI ChatGPT语音模式
    ChatGPT Voice登陆桌面端,动嘴办公又近了一步 | 图源:TechCrunch

    这次更新的底子,是OpenAI本月初发布的新一代语音模型家族ChatGPT-Live。当时手机版上线,主打的是对话更自然、打断更流畅——你插话它能接得住,不会自顾自说完。但说到底,手机版只是“聊得舒服”,并不能替你动手做事。

    桌面版不一样:一句话,建线程、发PR、找bug

    桌面版的能力明显上了一个台阶。OpenAI放出的演示视频里,一位开发者对着ChatGPT说了一句话,就让它连着完成了三件事:新建一个线程、提交一个pull request、顺便找出某个bug的根本原因。多步骤的复杂指令可以直接口述,中途ChatGPT需要你拍板时,你张嘴回应就行。

    • 语音模式同时支持ChatGPT Work和编程智能体Codex;
    • 能调用computer use能力,替你查网站、翻应用;
    • macOS上配合Appshots,它还能看到你屏幕上的内容,连图片的替代文本都读得到;
    • iOS用户可以通过远程访问,在手机上语音指挥Codex干活。

    语音不再只是聊天的另一种输入方式,而是成了指挥AI智能体的操作台——这才是这次桌面端更新真正的看点。

    对面的Anthropic,前脚刚更新

    巧的是,就在前一天,Anthropic也升级了Claude的语音模式:用户可以在Opus、Sonnet、Haiku三档模型之间切换,还能靠语音在Gmail、日历、Slack、Notion、Canva这些应用里直接办事。一边是OpenAI把语音接进桌面和编程工作流,一边是Anthropic让语音打通办公全家桶,两家几乎在同一条赛道上贴身互搏。


    从趋势看,“动嘴办公”正在从演示视频走向日常:过去语音助手只能设个闹钟查个天气,现在已经能建PR、追bug、跨应用干活了。键盘和鼠标当然不会立刻退休,但对开发者来说,一边喝咖啡一边口述需求、看着智能体把活干完的日子,确实越来越近了。

  • Claude语音模式大升级:动嘴就能改日历发邮件,OpenAI还做不到

    OpenAI 前几周刚给 ChatGPT 换上一套新的对话模型,把语音体验拉了一个档次。Anthropic 显然坐不住了,周四直接给 Claude 的语音模式来了次大升级——以后动嘴聊天,也能用上 Opus、Sonnet、Haiku 三档模型,想要脑子还是想要速度,自己挑。

    Claude 语音模式升级界面
    Claude 语音模式此次升级支持切换 Opus、Sonnet、Haiku 三档模型(图源:Anthropic)

    以前只能”快问快答”,现在能干正事了

    Claude 的语音模式去年就上线了,但一直由最小杯的 Haiku 模型驱动。回话是挺快,可一碰到复杂点的活儿就露怯,更像个语音玩具。这次更新之后,语音模式会自动沿用你在文字聊天里最后用过的那个模型,并默认调它的最快版本——你在文字端用 Opus 干活,切到语音也还是那颗聪明的脑子。

    Anthropic 给的使用场景也很务实:跟它进行更长的对话、让它点评你的表达方式、陪你排练给客户的提案,或者一起头脑风暴做市场调研。换句话说,语音不再只是”帮我设个闹钟”级别的功能,而是想接住真正的工作流。

    最狠的一招:动嘴就能操作 Gmail 和 Notion

    新版语音模式可以直接调用 Gmail、Google 日历、Slack、Canva、Notion 等外部应用——改会议时间、起草邮件、新建文档,全程动嘴不动手。

    这才是这次更新真正的差异点。OpenAI 那边的新语音模式虽然聊天风格更自然了,但至今没法调用外部工具替你干活。Anthropic 直接把”能办事”作为卖点打出来,等于在语音助手这条赛道上换了个打法:你比谁聊得像人,我比谁真能把事办了。

    多语言方面,Claude 语音模式今年早些时候就开始测试,目前支持英语、法语、德语、印地语、日语、韩语、西班牙语等十来种语言,不过得手动指定语言,还做不到自动识别。


    免费用户有门槛,语音底层没动

    • 新语音模式以 Beta 形式向全平台所有用户开放;
    • 免费用户只能用 Haiku 模型,且只能连接一个外部应用;
    • 这次升级只换了”大脑”,没换”嗓子”——语音模型本身没有更新,Anthropic 也没披露底层语音技术栈;
    • 所以像打断处理这类对话体验,别指望有 OpenAI 新版那样的提升。

    这么看,两家的路线分歧越来越清楚:OpenAI 在把语音”调教得更像人”,Anthropic 在把语音”武装得更能干”。对用户来说这未必是坏事,一个负责好聊,一个负责好用,最后逼着双方把两头都补齐。下一步就看 OpenAI 什么时候给语音模式接上工具调用,以及 Anthropic 什么时候舍得换一副新嗓子了。

  • OpenAI 推出 Presence:把“靠谱”的 AI 智能体塞进企业客服和电话里

    企业用 AI 智能体,早就不缺”能不能跑起来”的证明了,缺的是”能不能放心让它干正事”。OpenAI 今天拿出的 Presence,瞄准的就是这个缺口——一套帮企业把可信智能体真正部署到生产和内部流程里的产品。

    从”能答”到”能办事”

    Presence 支持的智能体可以回答问题、解决工单、调用公司系统、在授权范围内直接动手操作,必要时再转给真人。关键设计是每个部署只盯一个具体活儿:处理账单纠纷、理赔保险索赔、解决员工 IT 求助都行。智能体只拿到这件事需要的知识和权限,企业自己定规则——什么它能做、什么要审批、什么必须人工接手。

    上线不是终点。真实会话和转人工的记录会暴露智能体的盲区,Presence 用 Codex 去分析这些信号、提出改动建议,团队先在和生产版本对照的环境里测过,再批准小范围推送。模型在变,业务在变,智能体也得跟着变,但方向盘始终在企业手里。

    已经替 OpenAI 自己接电话了

    这套东西不是 PPT。它现在就跑在 OpenAI 自己的英文电话客服线上(1-888-GPT-0090):接开放式提问、核验来电人身份、调取账户信息、执行授权操作。几周内,它的质量评分就追平甚至超过了一线人工客服的标准,目前 75% 的进线问题能自己搞定;靠 Codex 驱动的提升循环,十天里把人工转接率又压低了 15 个百分点。

    OpenAI Presence 平台示意
    OpenAI Presence 将语音、聊天、策略与人工转接工作流整合到企业智能体平台中。

    外部客户也在试:BBVA 在墨西哥探索用语音智能体做日常银行服务,软银在测自然的日语客户对话,IAG 想在大风大浪等极端天气时段提供及时支援。BBVA 的人说,他们就是把 Presence 当设计伙伴,一起把金融客服的语音体验打磨得更顺、更个性化。

    不是自助,是”陪跑”

    上线前,团队会用模拟和评分器把常见请求、边界情况、高风险场景先跑一遍,护栏在互动越界时介入。目前 Presence 还是限量开放,由 OpenAI 的现场部署工程师和少数全球集成商带着企业落地,暂时不卖自助版。


    对企业来说,最难的从来不是”上 AI”,而是”上完之后不出事”。Presence 的思路不性感,但很实在:把权限、策略、护栏、评估、改写全捆在一起,让智能体在受控的框里慢慢变聪明。

    📎 原文来源:Introducing OpenAI Presence
  • 苹果 iOS 27 公测开放:重做版 Siri 终于能打 ChatGPT 了?

    这么多年,Siri 一直是那种你喊它定个闹钟还行、稍微复杂点就装听不懂的助手。苹果显然也知道。今年 WWDC 上它亮出了”史上最大改版”的 Siri,当时只给开发者玩;现在 iOS 27 公开测试版一推,普通用户也能上手了——这是苹果头一回把这套 AI 版 Siri 大面积放开。

    全球揣着 iPhone、iPad、Mac 的人加起来有 25 亿。哪怕只有一小撮人装公测,这场测试的规模也够吓人:它等于把苹果重写后的 AI 助手,直接丢进真实生活里接受拷打,对手是 ChatGPT、Gemini、Claude 那些早就上桌的玩家。

    这次 Siri 到底变了什么

    过去的 Siri 像个只会念预设台词的播音员,新版则更像一个能翻你手机、懂你上下文的助手。它能读你设备上的邮件、照片、短信,能看你屏幕正显示什么,也能接住”今天本地有什么活动””刚才新闻说了啥”这类本来得搜网页才答得出的问题。

    入口也比以前多。除了老办法”嘿 Siri”和按侧边键,你还能从灵动岛往下滑把它叫出来;它甚至还塞进了 iPhone 自带的聚光搜索(Spotlight),等于顺手把搜索框也变成了问答框。苹果头一回给 Siri 做了个独立 App——虽然对已经深度嵌进系统的它来说,单独开个 App 多少有点多余。

    iOS 27 上的 AI 版 Siri
    iOS 27 公测里的 AI 版 Siri:能读邮件照片、看屏幕、跨设备调用

    底层是和谷歌一起”蒸馏”出来的

    说到内核,新版 Siri 靠的是 Apple Intelligence,以及苹果自己跑在设备上的基础模型,再加上私有云计算(Private Cloud Compute)。有意思的是,这些模型是苹果拉着谷歌、用 Gemini 当老师”蒸馏”出来的——但不是把 Gemini 改个名就拿来用,而是用苹果自己的数据和针对 Apple 芯片做的瘦身版。好处是模型小、跑得快,还能在端侧保护隐私:Private Cloud Compute 保证你的个人数据不会被苹果存下来,也不会被它翻看。

    开发者测试里,Siri 已经能找准相册里某张照片、总结群聊、把短信里的约会塞进日历,甚至对着镜头告诉你手里的食物大概多少卡。但它也会犯傻——有次被问”伊朗最新消息”,它跑去通讯录里找叫 Iran 的联系人。

    别急着全靠它

    苹果自己也说,公测归公测,真要设备一天都不能出岔子,最好还是等 9 月正式版。今年的开发者测试版整体算稳,比前几年靠谱,但 bug 仍在。另外,欧盟地区暂时还用不上这套 Siri。

    • 覆盖 iPhone、iPad、Mac、Apple Watch、CarPlay、AirPods、Apple TV、Vision Pro 全系设备
    • 不靠开 App 也能用,随时唤醒,更容易渗进日常
    • EU 用户暂被排除,是这版最大的区域遗憾

    说到底,Siri 这次不再是那个只会定闹钟的梗了。它能不能真的追上 ChatGPT 们,还得看秋天正式版和那 25 亿设备上的真实表现。但至少,苹果把”AI 助手”这堂课,补上了最该补的一节。

    📎 原文来源:Apple opens its new Siri AI to everyone with the iOS 27 public beta(TechCrunch / Sarah Perez)
  • Voicebox:本地优先的开源 AI 语音工作室,克隆声音 + 让智能体开口说话

    Voicebox:本地优先的开源 AI 语音工作室,克隆声音 + 让智能体开口说话

    Voicebox 开源 AI 语音工作室

    Voicebox —— 本地优先的开源 AI 语音工作室

    📌 项目简介

    Voicebox 是由 Jamie Pine 打造的开源 AI 语音工作室,一句话概括:克隆任意声音、生成语音、随时听写、还能让你的 AI 智能体用你拥有的声音开口说话。它是 ElevenLabs(语音输出)与 WisprFlow(语音输入)的本地优先、免费开源二合一替代品,整套语音 I/O 栈都跑在你自己的机器上。

    ⭐ GitHub 43,196 stars | 🍴 5,280 forks | 📅 创建于 2026-01-25,更新于 2026-07-19(当日 GitHub Trending 热门)| 📜 MIT 许可 | 💻 TypeScript / Tauri(Rust) / FastAPI(Python)

    🛠 安装要求和过程

    环境要求

    • 普通用户:直接下载桌面应用,无需配置开发环境;支持 macOS(Apple Silicon / Intel)、Windows、Linux(需源码构建)、Docker。
    • GPU 加速:macOS 走 MLX/Metal(神经引擎快 4-5×),Windows/Linux NVIDIA 走 CUDA,AMD 走 ROCm,Intel Arc 走 IPEX/XPU,Windows 任意显卡走 DirectML,无显卡则回退 CPU。
    • 开发者构建:需 BunRustPython 3.11+Tauri 前置依赖(macOS 还需 Xcode)。

    快速安装(三种方式)

    方式一 · 下载安装包(推荐)

    方式二 · 开发者一键启动

    git clone https://github.com/jamiepine/voicebox.git
    cd voicebox
    just setup    # 创建 Python venv 并安装全部依赖
    just dev      # 启动后端 + 桌面应用

    (先安装 just 命令运行器:brew install justcargo install just

    方式三 · 接入 AI 智能体(MCP)

    claude mcp add voicebox \
      --transport http \
      --url http://127.0.0.1:17493/mcp \
      --header "X-Voicebox-Client-Id: claude-code"

    ✨ 核心功能

    Voicebox 界面

    1. 7 大 TTS 引擎,自由切换:Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual、Chatterbox Turbo、HumeAI TADA、Kokoro,覆盖 23 种语言(英/阿/日/印地/斯瓦希里等),并支持零样本声音克隆与 50+ 预设音色。
    2. 声音克隆 + 语音性格:几秒参考音频即可克隆任意声音;可为每个声纹绑定自由格式的”性格”,通过本地 Qwen3 LLM 实现 Compose(即兴台词)与 Speak-in-character(拟人改写)。
    3. 全局听写 / 语音输入:系统级热键按住说话、松手即停(push-to-talk),macOS 下自动粘贴到当前输入框;底层基于 OpenAI Whisper 的 STT,支持 Base/Small/Medium/Large/Turbo。
    4. 后期音效处理:基于 Spotify pedalboard 的 8 种效果——变调、混响、延迟、合唱、压缩、增益、高/低通滤波,可实时预览并存为预设。
    5. Agent 语音输出(MCP):一句 voicebox.speak() 调用,任何支持 MCP 的智能体(Claude Code / Cursor / Cline / Windsurf)都能用你克隆的声音向你播报任务进展。

    Voicebox Stories 编辑器

    🎯 典型使用场景

    • 播客 / 有声内容创作:用内置 Stories 多轨时间线编辑器,零样本克隆嘉宾声音,一键生成多角色对话、播客与叙事音频,长文本自动分块 + 交叉淡入淡出。
    • AI 编码智能体开发循环:把 Claude Code 绑定到某个克隆声纹,构建完成、测试通过时它能”开口”告诉你——用耳朵接收进度,而不是一直盯着终端。
    • 无障碍与语音辅助:为无法用原声说话的人提供克隆声音;全局热键听写 + macOS 自动粘贴,大幅提升文字录入效率。
    • 游戏 / 叙事交互:为游戏角色或互动叙事工具接入带”性格”的语音,实现有情绪、带语气词的拟人对话。

    💡 推荐理由

    我用过多家云端语音服务,Voicebox 最打动我的是三点:

    • 真正的本地优先 + 隐私优先。模型、声音数据、录音全部留在本机,不上传任何云,对注重数据主权的用户极其友好。
    • 输入 + 输出一站式。ElevenLabs 只管”说”,WisprFlow 只管”听”,Voicebox 把两者打通,还用一个本地 LLM 串联性格改写,一 GPU 显存占用搞定全套。
    • 给 AI Agent 配声音这个设计非常新颖。当你的编码助手能用你熟悉的声音播报”部署完成”,人机交互的体验立刻不一样,这也是它和同类工具最大的差异化。

    ⚠️ 一点不足:Linux 目前没有预编译二进制,需要源码构建;同时 7 个引擎质量参差,部分小模型音色一般,建议按场景挑选。但瑕不掩瑜,作为开源语音 I/O 基础设施,它已经非常能打。

    📥 下载地址

    本文由自动化脚本基于 GitHub 公开仓库信息整理,项目数据截至 2026-07-19。

  • 124K Star 的「AI 应用宝库」:awesome-llm-apps,100+ 个拿来即跑的 LLM / RAG 项目

    124K Star 的「AI 应用宝库」:awesome-llm-apps,100+ 个拿来即跑的 LLM / RAG 项目

    awesome-llm-apps 项目预览

    一、项目简介

    awesome-llm-apps 是一个收录了 100+ 个端到端测试过、Apache-2.0 协议的开源 AI Agent、Agent Skills 与 RAG 应用的精选仓库——clone、定制、上线,全部免费。它兼容 Claude、Gemini、GPT、DeepSeek、Llama、Qwen 以及各类本地开源模型,是当下 GitHub 上星标增长最快的 LLM 应用模板库之一(124K+ Star)。

    二、安装要求和过程

    环境要求

    • Python 3.8+(多数模板基于 Streamlit / 各厂商官方 SDK)
    • 一个 LLM API Key(Claude / Gemini / GPT / DeepSeek / Llama / Qwen 均可,部分模板支持本地模型)
    • Git 与可联网环境

    快速开始(跑一个 Agent,约 30 秒)

    git clone https://github.com/Shubhamsaboo/awesome-llm-apps.git
    cd awesome-llm-apps/starter_ai_agents/ai_travel_agent
    pip install -r requirements.txt
    streamlit run travel_agent.py

    或者,给编码助手装一个 Skill(约 10 秒)

    npx skills add https://github.com/Shubhamsaboo/awesome-llm-apps/tree/main/agent_skills/project-graveyard

    模板每周持续更新;项目模型无关,支持 Ollama 等本地推理,方便对比与替换。

    三、核心功能

    1. 100+ 端到端验证的开源应用:不是 demo 片段,而是每个都能 pip install && run 的完整项目,统一 Apache-2.0,可商用可修改。
    2. 15 大场景全覆盖:从单文件 Starter Agent,到多智能体团队、语音 Agent、MCP 工具调用、RAG 检索、记忆、微调、生成式 UI,再到 Autonomous 游戏 Agent。
    3. Agent Skills 一键安装:把可复用能力直接装进 Claude Code / Codex / Cursor,每条 Skill 都带真实代码并通过「安全 + 评测」CI 门禁。
    4. 模型无关:Claude、Gemini、GPT、DeepSeek、Llama、Qwen 乃至本地模型通吃,方便横向对比。
    5. 自带框架速成课:Google ADK、OpenAI Agents SDK 的 Crash Course,边抄边学编排范式。

    Project Graveyard Agent Skill

    Project Graveyard —— 帮你复盘每个弃坑副业、并找出最值得捡回来的那个的 Agent Skill

    四、典型使用场景

    • 30 分钟搭一个 AI 应用:想做旅行助手、数据分析 Agent、博客转播客?直接 clone 对应 starter 模板、改个 API Key 即可运行。
    • 给编码助手加能力:团队要一个「Scope Creep Detector(范围蔓延检测)」或「Commit Archaeologist(提交考古)」?npx skills add 一行搞定,立刻在 Claude Code / Cursor 里可用。
    • 系统学习 RAG / 多智能体:仓库内含 20+ 个 RAG 教程与多智能体团队模板,即开即用,省去从零搭脚手架。

    Always-on HN Briefing Agent

    Always-on HN Briefing Agent —— 按日程巡逻、把每天值得看的 Hacker News 推送到 Slack / 邮箱的后台 Agent

    Insurance Claim Live Agent Team

    Insurance Claim Live Agent Team —— 基于 Gemini Live 的实时语音理赔 Agent 团队

    五、推荐理由

    对一个想动手做 AI 应用、又不想从零啃文档的人,这是目前质量最高、最「能跑」的 LLM 应用模板库之一。每个模板都是真实可运行代码,省去脚手架与踩坑成本;模型无关意味着你可以拿自己的 Key 直接试;Agent Skills 的设计尤其实用——把沉淀下来的工程能力变成可复用 Skill,正好契合当下 coding agent 的工作流。

    Self-Improving Agent Skills

    Self-Improving Agent Skills —— 用 Gemini + ADK 让 Skill 针对评测自我重写的进阶玩法

    唯一要注意的是:部分模板依赖特定商业模型的 API,跑之前看一眼 requirements.txt 与 README 里的模型说明即可。

    六、下载地址