标签: AI语音

  • 语音应用 Wispr Flow 悄悄杀入会议记录赛道

    Wispr Flow 准备推出会议记录功能
    Wispr Flow 借更新条款,透露将推会议记录功能(配图:生成式 AI)

    一条被悄悄写进条款的新功能

    语音听写应用 Wispr Flow 最近没开发布会,也没发官宣,而是借着更新服务条款,悄悄露了底。公司给用户发邮件说条款和隐私政策有变,细心人一翻发现,新增了好几段关于”会议数据”和”会议记录(Notetaker)”的内容。

    按条款原文,Notetaker 会处理会议音频、参会者信息、会议元数据、发言人标签和转录文本,输出则是 AI 生成的会议转录、摘要、行动项和会议洞察。换句话说,它要做的不只是把话转成字,而是顺手把”谁说了啥、接下来该干啥”都整理好。

    它要挤进一条拥挤的赛道

    这个功能一上,Wispr Flow 就直接撞上了 Granola、Fireflies、Read AI、Otter、Fathom 这一票老玩家。市面上其实有两条路线:

    • Granola 那类,靠系统音频在本地转录,不录音、也不以机器人身份入会,存在感最低;
    • Fathom、Fireflies 那类,则以可见的 bot 身份加入会议、把录音存到云端,功能更全但侵入感强。

    Wispr Flow 目前没明说走哪条。这个选择会直接决定它落到用户手里的观感——是轻巧的”隐形秘书”,还是又一款”全程在录”的工具。

    “OpenAI 的计算策略,是搭建一个有韧性的组合,把合适的系统匹配到合适的负载上。”——类似的思路也适用于会议记录:模型再强,也得看它落在哪条工作流里。

    为什么一个听写 app 想做会议

    表面看是品类扩张,骨子里是冲着”上下文”去的。Wispr Flow 本来就架在邮件、文档、消息、CRM 和代码编辑器之上,是个跨应用的语音层,它比别人更清楚你平时怎么写、用什么工具。会议记录能补上它一直缺的一块:会议里的决定、承诺和人脸人名,往往在打开那些 app 之前就产生了。把这些喂给创始人 Tanay Kothari 念叨已久的”懂你个人上下文的 AI 助手”,逻辑就通了。

    钱和隐私,两本账

    底气来自融资。Wispr Flow 至今已拿下超过 8100 万美元,上轮估值 7 亿美元;今年 5 月彭博说它在谈新轮,估值可能冲到 20 亿。估值要翻近三倍,投资人赌的就是产品能长出新东西,而不只是把语音转写做得更顺手。

    但会议记录带来的隐私账,和单纯听写不是一回事。听写通常是一个人主动对着它说话;会议记录处理的却是多方对话,里面可能还有根本不用 Wispr 的人。条款把”录制或转录前取得同意”的责任推给了用户,而 Notetaker 又要求开启 Cloud Sync——这意味着即便你关掉了模型训练,对话依然会进 Wispr 的云。当 AI 助手想更懂你,代价往往是把更多人的对话,也卷进同一片云里。

  • AI客服一开口就露馅,这家公司想用小模型让你分不清人机

    打客服电话,对面接起来的是个AI,大部分人三秒钟就能听出来。露馅的地方往往不是音色——现在的合成语音已经足够干净了——而是节奏。你说完一句,它要顿一下才回;你想插一句,它照着自己的稿子往下念。那种”轮到你了、现在轮到我了”的机械感,一下就把幻觉戳破。

    Smallest.ai 联合创始人团队
    Smallest.ai 创始团队,左一为创始人兼CEO Sudarshan Kamath|图片来源:TechCrunch

    一家叫 Smallest.ai 的公司,正是冲着这半秒钟的尴尬去的。它2024年底才成立,刚刚拿到1300万美元A轮,由 Seligman Ventures 领投,Sierra Ventures 和 3one4 Capital 跟投,累计融资超过2100万美元。

    它赌的不是大模型跑得更快,而是换一条路

    行业里解决语音延迟的主流思路,是想办法把大语言模型的推理压得更短。Smallest.ai 的判断反过来:下一跳不会来自把大模型加速,而是来自专门为人类对话造的小模型。

    创始人兼CEO Sudarshan Kamath 解释他们的模型是怎么设计的时,用了一个特别日常的比方。

    我跟你说话的时候,你其实已经在想了,如果我讲太久,你甚至会打断我。

    听、想、说这三件事,人是同时干的。而大模型不是。Kamath 说,大模型的工作方式是你把一整段提示词交给它,它才开始思考。这点延迟放在文字聊天里没人在意,放到语音对话里,哪怕一小段静默都显得不自然——”你想想我们现在怎么讲话的,我不会把一大段音频剪好丢给你,你再开始想。”

    小模型顶前台,大模型在后面待命

    Smallest.ai 的产品结构是这样的:小语音模型充当实时智能层,负责在特定话题范围内跟客户自然对话,响应几乎没有延迟。一旦碰到超出它知识边界的问题,就把这个问题移交给大型基础模型,同时礼貌地请客户稍等,说自己去”查一下”——跟真人客服的处理方式一模一样。

    Kamath 相信这会变成所有语音智能体的标准架构:一个负责实时交互的小语音模型,加一个按需唤起、解决复杂问题的”离线”大模型。

    因为只做语音,它优化的东西也跟通用大模型不一样,全是些细碎但要命的场景:

    • 各种口音都能听懂,不挑发音标准的用户;
    • 支持几十种语言;
    • 在有背景噪音的环境里照样工作。

    客户名单里已经有 RingCentral 和 Truecaller

    目前 Smallest.ai 的客户主要是语音领域的公司,包括 RingCentral 和 Truecaller。Kamath 认为,任何做客服的公司都是潜在客户,包括 Sierra、Decagon 这类新兴的AI客服创业公司。

    有人会问:这些公司自己融了那么多钱,为什么不顺手把语音模型也做了?Kamath 的回答挺实在——对客服创业公司来说,把语音这一件事做到极致,是对主业的分心。

    它要面对的对手也不轻松。语音AI这条赛道上,ElevenLabs 是公认的头部,另外还有 Cartesia,以及像 Sarvam 这样专注本地语言的区域玩家。不同之处在于,一些对手把语音AI用在配音、播客这类内容生产场景上,而 Smallest.ai 只盯着面向企业的实时对话智能体,别的一概不碰。

    我们想让模型打破图灵测试。你跟它说话,应该分不出对面是人还是AI。这是公司唯一的目标。

    这条路走不走得通

    把话说回来,语音交互的瓶颈从来就不是知识储备。一个客服机器人需要懂的东西其实很有限,它输就输在反应的时间差和对话的节奏感上。行业主流还在往参数上加码,而 Smallest.ai 挑的是另一个维度——谁能先把那零点几秒的空白抹平,谁就先摸到这块市场的门。

    风险当然也在这里。小模型意味着能力边界明确,一旦频繁触发”请稍等我查一下”,那种真人感照样会碎掉。移交给大模型的那个瞬间处理得够不够顺滑,可能才是这家公司真正的技术门槛。

  • Voicebox:47.5K Stars 的开源 AI 语音工作室,克隆声音、全局听写、让 AI 智能体开口说话

    Voicebox:47.5K Stars 的开源 AI 语音工作室,克隆声音、全局听写、让 AI 智能体开口说话

    Voicebox 应用界面截图

    项目简介

    Voicebox 是一款本地优先的开源 AI 语音工作室——相当于把 ElevenLabs(语音合成)+ WisprFlow(语音听写) 两大云服务装进同一个免费开源的桌面应用:几秒参考音频即可克隆任意声音、7 大 TTS 引擎覆盖 23 种语言、全局热键把语音听写进系统任意输入框,还能通过 MCP 让 Claude Code / Cursor 等 AI 智能体用你克隆的声音「开口说话」。全部模型与数据均在本机运行,目前已收获 47.5K Stars,MIT 许可。

    安装要求和过程

    环境要求

    • macOS:Apple Silicon(MLX/Metal 加速)或 Intel
    • Windows:支持 NVIDIA CUDA 加速
    • Linux:暂无预编译包,需源码构建;另支持 AMD ROCm、Intel Arc
    • Docker:任意平台一行命令部署
    • 轻量引擎 LuxTTS 仅需 ~1GB 显存,CPU 也能 150 倍实时速度推理

    快速安装

    # 方式一:直接下载安装包(推荐)
    # macOS (Apple Silicon): https://voicebox.sh/download/mac-arm
    # macOS (Intel):         https://voicebox.sh/download/mac-intel
    # Windows (MSI):         https://voicebox.sh/download/windows
    
    # 方式二:Docker 一键启动
    git clone https://github.com/jamiepine/voicebox.git
    cd voicebox
    docker compose up
    

    首次启动时应用会引导下载所需模型;macOS 上还有权限向导,一步步带你完成「辅助功能」「输入监控」授权,用于全局听写自动粘贴。

    核心功能

    • 多引擎语音克隆:内置 Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual/Turbo、HumeAI TADA、Kokoro 共 7 大 TTS 引擎,零样本克隆 + 50 多个精选预置声音,覆盖 23 种语言,可逐次生成切换引擎。
    • 全局语音听写:按住热键在系统任意位置说话,松开即把转写文本粘贴进当前输入框(macOS 经辅助功能校验注入,且自动保存/恢复剪贴板);内置 Whisper 全系列模型(Turbo 版比 Large 快约 8 倍),可选本地 LLM 自动清理「嗯、啊」等口头语。
    • 给 AI 智能体一个声音:自带 MCP 服务器与 REST API,Claude Code、Cursor、Cline 等任意支持 MCP 的智能体只需调用 voicebox.speak 工具,就能用你克隆的声音向你「汇报工作」。
    • 专业级生产能力:不限长度生成(自动分句 + 交叉淡化拼接,最长 5 万字符)、多轨 Stories 时间线编辑器(做播客/对话/有声书)、8 种后期效果(变调/混响/延迟/压缩等,基于 Spotify pedalboard),生成版本全程可溯源。
    • 完全本地、隐私优先:模型、声音数据、录音捕获全部留在本机,永不上传;应用基于 Tauri(Rust)构建而非 Electron,原生性能,安装包小、内存占用低。

    典型使用场景

    1. 内容创作者做配音/播客:用自己的几秒录音克隆声音,把文章、剧本、章节直接批量转成音频;Stories 编辑器多轨拖拽即可编排双人对话播客,再叠加混响、电台音效等预设,全流程零云端费用。
    2. 开发者的「会说话的」编码智能体:给 Claude Code / Cursor 接上 Voicebox 的 MCP 服务器,长任务跑完后智能体用你指定的声音口头播报结果;配合全局听写热键,动口不动手地写 prompt,形成完整的语音 I/O 闭环。
    3. 注重隐私的日常语音输入:会议纪要、日记、即时消息全部用本地 Whisper 听写,敏感内容不经过任何第三方服务器;Captures 标签页保留每段原始音频 + 转写文本,可随时重转写、改写或升级为克隆样本。

    推荐理由

    试用下来最打动我的是「输入 + 输出一体」的产品思路:市面上克隆声音要买 ElevenLabs,语音听写要买 WisprFlow,而 Voicebox 把两半闭环装进一个 MIT 开源应用,还用本地 LLM 把两端串了起来。工程质量也远超一般开源项目——Tauri 原生应用不卡顿,生成队列异步不阻塞,甚至连 macOS 剪贴板保护、崩溃恢复这类细节都做了。对开发者来说,一行 MCP 配置就能让编码智能体开口说话,这个体验相当新奇实用。如果你需要一套不上云、不订阅的完整语音方案,这个项目值得马上装上试试。

    下载地址

  • 字节跳动放出 Seed Audio 1.0:给视频配音,AI 不再只会「念稿」

    字节跳动 Seed Audio 1.0 音频创作模型
    Seed Audio 1.0 用统一框架联合建模人声、音效与环境声(概念图)

    做短视频、短剧的人大概都有过这种崩溃:画面拍好了,配一段像样的音效比写脚本还费劲。人声要去录音棚,环境声要现找素材,音效还得一笔笔手动对时间轴。7月20日,字节跳动 Seed 团队丢出一个叫 Seed Audio 1.0 的模型,想把这个流程一口气吞掉。

    它不是拼接,是「一起想」

    过去这类工具大多是各管一摊:一个模型生成人声,一个模型找音效,最后人工混音。Seed Audio 1.0 的卖点在于,它在一个统一框架里同时建模人声、音效和环境声,端到端直接产出一段能拿来叙事的完整声音。官方一句话挺妙:声音不再只是画面的补丁,而是能直接参与讲故事,「听见」即「看见」。

    具体有三个本事。第一是精细的时间编排,按时间线控制对白和音效什么时候进场,精度能到 100 毫秒,做视频配音和广告卡点刚好。第二是音色稳,支持零样本生成和长音频延展,一个角色从头到尾音色不变,还能同一声音演多个角色、带不同情绪。第三是语种全,覆盖中文、英文、日语等 20 多种语言,重音和节奏都按当地习惯来。

    官方评测显示,在影视、短剧、动漫、播客等多数场景里,音频可用率已经跑到 90% 以上;多语言自然度方面,大部分语种 MOS 评分超过 4 分,算优秀水平。

    从「会说」到「会创作」

    这中间的区别挺关键。早几年的语音合成,本质是把文字念出来,语调再自然也还是「读稿」。Seed Audio 1.0 瞄准的是创作——你给一条指令,它自己安排谁说话、什么情绪、背景音怎么铺、什么时候淡入。对短剧和动漫团队来说,这意味着原本要分几个工种、花几天的活,可能压缩到一轮生成。

    • 影视级音频:对白、音效、环境声统一编排,叙事更连贯
    • 可控音色:长音频保持一致,同一声音可演多角色
    • 20+ 语种:自然生成,适配本地表达节奏

    先上体验,后面还有大招

    模型现在已经放在火山方舟体验中心,创作者能直接试。团队放话,接下来会接进视频参考这类多模态输入,还会做可控翻译、长音频和分轨生成,方向是把脑子里的声音构想更快变成能听见的成品。


    大模型从文本、图像一路卷到音频,Seed Audio 1.0 是个信号:AI 音频正从单点工具走向全场景创作平台。对内容创作者,门槛又低了一截;对行业,竞争也从「谁念得真」变成「谁编得巧」。

  • 巴黎AI语音公司Gradium拿下英伟达1亿美元,要抢ElevenLabs的活

    AI语音技术概念图
    实时语音AI正在成为人机交互的新入口(图源:TechCrunch / Getty Images)

    你跟AI语音助手说话时,最别扭的瞬间是什么?多半是那种尴尬的停顿——你明明把话说完了,它还在”思考”,过了半秒才接上一句。巴黎一家叫 Gradium 的初创公司,盯上的就是这块短板:让机器说话别再卡顿,像真人一样即问即答。

    从开源实验室里长出来的公司

    Gradium 2025年12月才从隐身状态走出来,它本身是从法国 AI 实验室 Kyutai 分拆出来的。Kyutai 由法国电信大亨 Xavier Niel 支持,走开源路线。Gradium 的联合创始人 Neil Zeghidour 是个老面孔,先后待过 Google Brain、DeepMind 和 Facebook,是生成式音频领域的核心研究者之一。

    “语音AI正在到达一个拐点。” Zeghidour 在融资声明里这么判断——他认为语音会成为人和智能系统之间的主要界面。

    英伟达为什么愿意入局

    7月8日,Gradium 宣布把种子轮追加到 1 亿美元,新加入的投资者里出现了英伟达。它最初在2025年12月就拿了 7000 万美元,投资方名单相当豪华:FirstMark Capital、Eurazeo、DST Global Partners,还有 Eric Schmidt 和 Xavier Niel 个人。芯片巨头亲自下场投语音模型,释放的信号很明确:语音已经被视作 AI 基础设施的关键一环,而不只是应用层的点缀。

    它到底做了什么

    Gradium 做的是一个超低延迟的实时语音栈,核心目标是让 AI 声音几乎即时响应。具体拆开来看,几块能力都挺实在:

    • 新一代实时文本转语音,读缩写、邮箱、电话号码这类内容更准,也更自然;
    • 实时语音识别带”语义轮次检测”——能判断你是真的说完了,还是只是停下来喘口气,而不是靠静音就草草打断;
    • Gradium Translate 超低延迟的语音到语音翻译,还有端侧模型 Phonon,以及开源框架 GradBot,几行代码就能搭出能用的语音 agent。

    去湾区抢人,也抢客户

    这笔钱另一大用途,是在旧金山湾区开办公室。巴黎固然是欧洲 AI 重镇,但 Gradium 直言就是要离 Anthropic、Google、Meta、OpenAI 更近,方便挖人和贴近大客户。竞争当然激烈:做语音的 ElevenLabs 今年2月估值已经到 110 亿美元,Google 的 Gemini 也是语音老手。不过 Gradium 说自己上线几周就有了收入,还拿下了雷诺这样的企业客户。