标签: 实时语音

  • LiveKit Agents:用 Python 构建实时语音 AI 智能体的开源框架

    LiveKit Agents:用 Python 构建实时语音 AI 智能体的开源框架

    在语音助手、AI 客服、实时翻译早已不是新鲜事的今天,真正难的是:如何用一个干净、可编排、可私有部署的框架,把 STT、LLM、TTS 串成一次低延迟、不打断、能“看见”的实时对话。LiveKit Agents 正是为这件事而生。

    📌 项目简介

    LiveKit Agents 是一个用于构建实时、可编程的多模态语音 AI 智能体的开源框架,运行在服务器端,让智能体具备“看、听、理解”的能力。它把语音识别(STT)、大模型(LLM)、语音合成(TTS)以及实时模型(Realtime API)抽象成可自由替换的组件,并提供任务调度、工具调用、测试框架等一整套生产级能力。

    💻 安装要求与过程

    环境要求

    • Python 3.9+
    • 一个 LiveKit 服务器:可用 LiveKit Cloud,也可用开源的 livekit 自托管
    • 至少一家模型服务商的密钥:如 Deepgram(STT)、OpenAI / Google(LLM)、Cartesia(TTS)等
    • 如需电话接入,可启用 LiveKit 的 SIP / 电话栈

    快速安装

    pip install "livekit-agents[openai,deepgram,cartesia]"

    三种运行模式

    # 终端本地测试:无需外部服务器,直接验证交互
    python myagent.py console
    
    # 开发模式:连接 LiveKit 云/自托管,支持热重载
    python myagent.py dev
    
    # 生产部署:生产级优化
    python myagent.py start

    开发 / 生产模式需配置环境变量:LIVEKIT_URLLIVEKIT_API_KEYLIVEKIT_API_SECRET(以及对应模型服务商的 Key)。也可用 Agents Playground 快速体验。

    ✨ 核心功能

    • 灵活集成:完整的插件生态,自由混搭最合适的 STT、LLM、TTS 与 Realtime API。
    • 内置任务调度:通过 Dispatch API 自动做任务分配与分发,把终端用户连接到对应智能体。
    • 语义轮流检测(Turn Detection):用 Transformer 模型判断用户是否说完,显著降低误打断。
    • 原生 MCP 支持:一行代码即可把 MCP 服务器提供的工具接入智能体。
    • 内置测试框架:用断言(expect)配合 LLM 评判(judge)编写测试,对抗 LLM 的非确定性。
    • 全平台 WebRTC 客户端 + 电话集成:覆盖浏览器、iOS、Android、Flutter 等,并可拨打 / 接听电话。

    🎯 典型使用场景

    • 语音客服 / 订餐机器人:内置 restaurant_agent 范例,可处理来电订餐与预约,直接对接电话线路。
    • 外呼电话机器人:Outbound Caller 范例可自动批量拨打电话、播报与收集信息。
    • 多智能体接力(Handoff):多个 Agent 按流程交接(如先收集信息、再切换讲故事 Agent),适合工单分流、复杂客服。
    • 视频数字人:通过 Tavus、Bithuman、LemonSlice 等接入 AI 虚拟形象,做出“能说话的脸”。
    • 实时视觉 Agent:结合 Gemini Live 等,做出能“看见”环境并对话的助手(含 iOS 端范例)。

    💡 推荐理由

    我自己折腾过不少语音 Agent 方案,LiveKit Agents 最打动我的是它的“把复杂留给自己、把简单交给开发者”:一个 AgentSession 把你想要的 STT/LLM/TTS 一行声明完,多智能体切换、工具调用、打断检测都有官方最佳实践兜底;更关键的是整套栈可私有化——连媒体服务器都是开源的,数据不出自己的机房,对企业场景非常友好。再加上官方提供的 LiveKit Docs MCPAgent Skill,用 AI 编程助手来搭语音应用也顺手很多。如果你打算认真做一个“能听会说”的产品,它值得作为底座首选。

    🔗 下载地址

    LiveKit Agents 核心亮点

  • AI客服一开口就露馅,这家公司想用小模型让你分不清人机

    打客服电话,对面接起来的是个AI,大部分人三秒钟就能听出来。露馅的地方往往不是音色——现在的合成语音已经足够干净了——而是节奏。你说完一句,它要顿一下才回;你想插一句,它照着自己的稿子往下念。那种”轮到你了、现在轮到我了”的机械感,一下就把幻觉戳破。

    Smallest.ai 联合创始人团队
    Smallest.ai 创始团队,左一为创始人兼CEO Sudarshan Kamath|图片来源:TechCrunch

    一家叫 Smallest.ai 的公司,正是冲着这半秒钟的尴尬去的。它2024年底才成立,刚刚拿到1300万美元A轮,由 Seligman Ventures 领投,Sierra Ventures 和 3one4 Capital 跟投,累计融资超过2100万美元。

    它赌的不是大模型跑得更快,而是换一条路

    行业里解决语音延迟的主流思路,是想办法把大语言模型的推理压得更短。Smallest.ai 的判断反过来:下一跳不会来自把大模型加速,而是来自专门为人类对话造的小模型。

    创始人兼CEO Sudarshan Kamath 解释他们的模型是怎么设计的时,用了一个特别日常的比方。

    我跟你说话的时候,你其实已经在想了,如果我讲太久,你甚至会打断我。

    听、想、说这三件事,人是同时干的。而大模型不是。Kamath 说,大模型的工作方式是你把一整段提示词交给它,它才开始思考。这点延迟放在文字聊天里没人在意,放到语音对话里,哪怕一小段静默都显得不自然——”你想想我们现在怎么讲话的,我不会把一大段音频剪好丢给你,你再开始想。”

    小模型顶前台,大模型在后面待命

    Smallest.ai 的产品结构是这样的:小语音模型充当实时智能层,负责在特定话题范围内跟客户自然对话,响应几乎没有延迟。一旦碰到超出它知识边界的问题,就把这个问题移交给大型基础模型,同时礼貌地请客户稍等,说自己去”查一下”——跟真人客服的处理方式一模一样。

    Kamath 相信这会变成所有语音智能体的标准架构:一个负责实时交互的小语音模型,加一个按需唤起、解决复杂问题的”离线”大模型。

    因为只做语音,它优化的东西也跟通用大模型不一样,全是些细碎但要命的场景:

    • 各种口音都能听懂,不挑发音标准的用户;
    • 支持几十种语言;
    • 在有背景噪音的环境里照样工作。

    客户名单里已经有 RingCentral 和 Truecaller

    目前 Smallest.ai 的客户主要是语音领域的公司,包括 RingCentral 和 Truecaller。Kamath 认为,任何做客服的公司都是潜在客户,包括 Sierra、Decagon 这类新兴的AI客服创业公司。

    有人会问:这些公司自己融了那么多钱,为什么不顺手把语音模型也做了?Kamath 的回答挺实在——对客服创业公司来说,把语音这一件事做到极致,是对主业的分心。

    它要面对的对手也不轻松。语音AI这条赛道上,ElevenLabs 是公认的头部,另外还有 Cartesia,以及像 Sarvam 这样专注本地语言的区域玩家。不同之处在于,一些对手把语音AI用在配音、播客这类内容生产场景上,而 Smallest.ai 只盯着面向企业的实时对话智能体,别的一概不碰。

    我们想让模型打破图灵测试。你跟它说话,应该分不出对面是人还是AI。这是公司唯一的目标。

    这条路走不走得通

    把话说回来,语音交互的瓶颈从来就不是知识储备。一个客服机器人需要懂的东西其实很有限,它输就输在反应的时间差和对话的节奏感上。行业主流还在往参数上加码,而 Smallest.ai 挑的是另一个维度——谁能先把那零点几秒的空白抹平,谁就先摸到这块市场的门。

    风险当然也在这里。小模型意味着能力边界明确,一旦频繁触发”请稍等我查一下”,那种真人感照样会碎掉。移交给大模型的那个瞬间处理得够不够顺滑,可能才是这家公司真正的技术门槛。

  • AIRI:自托管 AI 数字伴侣,能实时语音聊天、陪你打 Minecraft(42K+ Stars)

    AIRI:自托管 AI 数字伴侣,能实时语音聊天、陪你打 Minecraft(42K+ Stars)

    AIRI 数字生命形象

    项目简介

    AIRI 是由 moeru-ai 团队开源的「自托管、你专属拥有」的 AI 数字生命(AI Companion)项目。它把大语言模型、实时语音交互与 VRM / Live2D 虚拟形象结合在一起,让你在 Web、桌面与移动端拥有一位能说话、能陪玩、有「身体」的赛博伴侣,目标是达到 AI 虚拟主播 Neuro-sama 那样的水平。整个项目基于 WebGPU / WebAudio / WebAssembly 等现代 Web 技术构建,强调本地优先与隐私保护。

    安装要求和过程

    环境要求

    • 运行时:Node.js 24+(项目已提升到 24.13.0),包管理使用 pnpm(monorepo 结构)。
    • 桌面端:默认可调用原生 NVIDIA CUDA / Apple Metal(通过 candle 项目),无需复杂依赖。
    • 移动端:使用 Capacitor(需 iOS 设备 / 模拟器)。
    • 浏览器:任意现代浏览器即可体验(PWA,已支持移动设备)。

    快速安装(普通用户)

    # Windows (winget)
    winget install MoeruAI.AIRI
    
    # 或 Scoop
    scoop bucket add airi https://github.com/moeru-ai/airi
    scoop install airi/airi
    
    # macOS (Homebrew)
    brew install --cask airi
    
    # Linux (Nix,需启用 flakes)
    nix run github:moeru-ai/airi
    
    # 不想安装?直接浏览器打开在线版
    # https://airi.moeru.ai

    AIRI 跨平台下载方式

    开发者从源码运行

    git clone https://github.com/moeru-ai/airi
    cd airi && pnpm i
    pnpm dev             # Web 版
    pnpm dev:tamagotchi # 桌面版

    核心功能

    • 实时语音交互(耳朵 + 嘴巴):客户端语音识别 + 说话人检测(VAD),配合 ElevenLabs / Azure Speech / OpenAI TTS / 阿里云 / 本地 Kokoro 等多供应商语音合成,对话延迟低、可离线运行。
    • 虚拟形象驱动(身体):支持 VRM 3D 模型与 Live2D 模型,自动眨眼、视线追踪、空闲眼动等动画,让 AI「活」在屏幕上。
    • 本地优先推理:基于 WebGPU 的浏览器内本地 LLM 推理,无需把数据发往外部服务器,隐私更有保障。
    • 游戏与记忆能力:可操控 Minecraft 游玩,Factorio 支持开发中(已有 PoC);内置 DuckDB WASM / pglite 浏览器内数据库与记忆系统(Alaya,开发中),让伴侣「记得你」。
    • 跨平台与集成:Web / 桌面(Win / macOS / Linux,桌面端走原生 CUDA / Metal 加速)/ 移动 PWA 全覆盖;支持 Telegram、Discord 聊天接入。

    典型使用场景

    1. 虚拟主播(VTuber):实时语音聊天、玩游戏、与观众互动,灵感直接来自 Neuro-sama,可作为直播 / 互动娱乐的数字人。
    2. 随身赛博伴侣:在手机、桌面、浏览器上随时拥有一个有形象、能聊天的专属电子宠物 / AI 朋友。
    3. 本地隐私 AI 助手:借助 WebGPU 本地推理在完全离线环境下运行 LLM,适合对数据隐私敏感的用户。

    推荐理由

    AIRI 是目前开源领域把「LLM + 实时语音 + 虚拟形象 + 游戏能力」整合得最完整、也最「有生命力」的项目之一。它完全自托管、可本地运行,技术栈现代(WebGPU / VRM / Live2D),跨平台覆盖到位,社区活跃(42K+ Stars、4.2K+ Forks,MIT 许可)。如果你一直好奇 Neuro-sama 是怎么「炼成」的,或者想拥有一个真正属于自己的、能聊天能陪玩的数字人,AIRI 值得一试。

    下载地址