标签: 语音识别

  • LiveKit Agents:用 Python 构建实时语音 AI 智能体的开源框架

    LiveKit Agents:用 Python 构建实时语音 AI 智能体的开源框架

    在语音助手、AI 客服、实时翻译早已不是新鲜事的今天,真正难的是:如何用一个干净、可编排、可私有部署的框架,把 STT、LLM、TTS 串成一次低延迟、不打断、能“看见”的实时对话。LiveKit Agents 正是为这件事而生。

    📌 项目简介

    LiveKit Agents 是一个用于构建实时、可编程的多模态语音 AI 智能体的开源框架,运行在服务器端,让智能体具备“看、听、理解”的能力。它把语音识别(STT)、大模型(LLM)、语音合成(TTS)以及实时模型(Realtime API)抽象成可自由替换的组件,并提供任务调度、工具调用、测试框架等一整套生产级能力。

    💻 安装要求与过程

    环境要求

    • Python 3.9+
    • 一个 LiveKit 服务器:可用 LiveKit Cloud,也可用开源的 livekit 自托管
    • 至少一家模型服务商的密钥:如 Deepgram(STT)、OpenAI / Google(LLM)、Cartesia(TTS)等
    • 如需电话接入,可启用 LiveKit 的 SIP / 电话栈

    快速安装

    pip install "livekit-agents[openai,deepgram,cartesia]"

    三种运行模式

    # 终端本地测试:无需外部服务器,直接验证交互
    python myagent.py console
    
    # 开发模式:连接 LiveKit 云/自托管,支持热重载
    python myagent.py dev
    
    # 生产部署:生产级优化
    python myagent.py start

    开发 / 生产模式需配置环境变量:LIVEKIT_URLLIVEKIT_API_KEYLIVEKIT_API_SECRET(以及对应模型服务商的 Key)。也可用 Agents Playground 快速体验。

    ✨ 核心功能

    • 灵活集成:完整的插件生态,自由混搭最合适的 STT、LLM、TTS 与 Realtime API。
    • 内置任务调度:通过 Dispatch API 自动做任务分配与分发,把终端用户连接到对应智能体。
    • 语义轮流检测(Turn Detection):用 Transformer 模型判断用户是否说完,显著降低误打断。
    • 原生 MCP 支持:一行代码即可把 MCP 服务器提供的工具接入智能体。
    • 内置测试框架:用断言(expect)配合 LLM 评判(judge)编写测试,对抗 LLM 的非确定性。
    • 全平台 WebRTC 客户端 + 电话集成:覆盖浏览器、iOS、Android、Flutter 等,并可拨打 / 接听电话。

    🎯 典型使用场景

    • 语音客服 / 订餐机器人:内置 restaurant_agent 范例,可处理来电订餐与预约,直接对接电话线路。
    • 外呼电话机器人:Outbound Caller 范例可自动批量拨打电话、播报与收集信息。
    • 多智能体接力(Handoff):多个 Agent 按流程交接(如先收集信息、再切换讲故事 Agent),适合工单分流、复杂客服。
    • 视频数字人:通过 Tavus、Bithuman、LemonSlice 等接入 AI 虚拟形象,做出“能说话的脸”。
    • 实时视觉 Agent:结合 Gemini Live 等,做出能“看见”环境并对话的助手(含 iOS 端范例)。

    💡 推荐理由

    我自己折腾过不少语音 Agent 方案,LiveKit Agents 最打动我的是它的“把复杂留给自己、把简单交给开发者”:一个 AgentSession 把你想要的 STT/LLM/TTS 一行声明完,多智能体切换、工具调用、打断检测都有官方最佳实践兜底;更关键的是整套栈可私有化——连媒体服务器都是开源的,数据不出自己的机房,对企业场景非常友好。再加上官方提供的 LiveKit Docs MCPAgent Skill,用 AI 编程助手来搭语音应用也顺手很多。如果你打算认真做一个“能听会说”的产品,它值得作为底座首选。

    🔗 下载地址

    LiveKit Agents 核心亮点

  • Voicebox:47.5K Stars 的开源 AI 语音工作室,克隆声音、全局听写、让 AI 智能体开口说话

    Voicebox:47.5K Stars 的开源 AI 语音工作室,克隆声音、全局听写、让 AI 智能体开口说话

    Voicebox 应用界面截图

    项目简介

    Voicebox 是一款本地优先的开源 AI 语音工作室——相当于把 ElevenLabs(语音合成)+ WisprFlow(语音听写) 两大云服务装进同一个免费开源的桌面应用:几秒参考音频即可克隆任意声音、7 大 TTS 引擎覆盖 23 种语言、全局热键把语音听写进系统任意输入框,还能通过 MCP 让 Claude Code / Cursor 等 AI 智能体用你克隆的声音「开口说话」。全部模型与数据均在本机运行,目前已收获 47.5K Stars,MIT 许可。

    安装要求和过程

    环境要求

    • macOS:Apple Silicon(MLX/Metal 加速)或 Intel
    • Windows:支持 NVIDIA CUDA 加速
    • Linux:暂无预编译包,需源码构建;另支持 AMD ROCm、Intel Arc
    • Docker:任意平台一行命令部署
    • 轻量引擎 LuxTTS 仅需 ~1GB 显存,CPU 也能 150 倍实时速度推理

    快速安装

    # 方式一:直接下载安装包(推荐)
    # macOS (Apple Silicon): https://voicebox.sh/download/mac-arm
    # macOS (Intel):         https://voicebox.sh/download/mac-intel
    # Windows (MSI):         https://voicebox.sh/download/windows
    
    # 方式二:Docker 一键启动
    git clone https://github.com/jamiepine/voicebox.git
    cd voicebox
    docker compose up
    

    首次启动时应用会引导下载所需模型;macOS 上还有权限向导,一步步带你完成「辅助功能」「输入监控」授权,用于全局听写自动粘贴。

    核心功能

    • 多引擎语音克隆:内置 Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual/Turbo、HumeAI TADA、Kokoro 共 7 大 TTS 引擎,零样本克隆 + 50 多个精选预置声音,覆盖 23 种语言,可逐次生成切换引擎。
    • 全局语音听写:按住热键在系统任意位置说话,松开即把转写文本粘贴进当前输入框(macOS 经辅助功能校验注入,且自动保存/恢复剪贴板);内置 Whisper 全系列模型(Turbo 版比 Large 快约 8 倍),可选本地 LLM 自动清理「嗯、啊」等口头语。
    • 给 AI 智能体一个声音:自带 MCP 服务器与 REST API,Claude Code、Cursor、Cline 等任意支持 MCP 的智能体只需调用 voicebox.speak 工具,就能用你克隆的声音向你「汇报工作」。
    • 专业级生产能力:不限长度生成(自动分句 + 交叉淡化拼接,最长 5 万字符)、多轨 Stories 时间线编辑器(做播客/对话/有声书)、8 种后期效果(变调/混响/延迟/压缩等,基于 Spotify pedalboard),生成版本全程可溯源。
    • 完全本地、隐私优先:模型、声音数据、录音捕获全部留在本机,永不上传;应用基于 Tauri(Rust)构建而非 Electron,原生性能,安装包小、内存占用低。

    典型使用场景

    1. 内容创作者做配音/播客:用自己的几秒录音克隆声音,把文章、剧本、章节直接批量转成音频;Stories 编辑器多轨拖拽即可编排双人对话播客,再叠加混响、电台音效等预设,全流程零云端费用。
    2. 开发者的「会说话的」编码智能体:给 Claude Code / Cursor 接上 Voicebox 的 MCP 服务器,长任务跑完后智能体用你指定的声音口头播报结果;配合全局听写热键,动口不动手地写 prompt,形成完整的语音 I/O 闭环。
    3. 注重隐私的日常语音输入:会议纪要、日记、即时消息全部用本地 Whisper 听写,敏感内容不经过任何第三方服务器;Captures 标签页保留每段原始音频 + 转写文本,可随时重转写、改写或升级为克隆样本。

    推荐理由

    试用下来最打动我的是「输入 + 输出一体」的产品思路:市面上克隆声音要买 ElevenLabs,语音听写要买 WisprFlow,而 Voicebox 把两半闭环装进一个 MIT 开源应用,还用本地 LLM 把两端串了起来。工程质量也远超一般开源项目——Tauri 原生应用不卡顿,生成队列异步不阻塞,甚至连 macOS 剪贴板保护、崩溃恢复这类细节都做了。对开发者来说,一行 MCP 配置就能让编码智能体开口说话,这个体验相当新奇实用。如果你需要一套不上云、不订阅的完整语音方案,这个项目值得马上装上试试。

    下载地址

  • AIRI:自托管 AI 数字伴侣,能实时语音聊天、陪你打 Minecraft(42K+ Stars)

    AIRI:自托管 AI 数字伴侣,能实时语音聊天、陪你打 Minecraft(42K+ Stars)

    AIRI 数字生命形象

    项目简介

    AIRI 是由 moeru-ai 团队开源的「自托管、你专属拥有」的 AI 数字生命(AI Companion)项目。它把大语言模型、实时语音交互与 VRM / Live2D 虚拟形象结合在一起,让你在 Web、桌面与移动端拥有一位能说话、能陪玩、有「身体」的赛博伴侣,目标是达到 AI 虚拟主播 Neuro-sama 那样的水平。整个项目基于 WebGPU / WebAudio / WebAssembly 等现代 Web 技术构建,强调本地优先与隐私保护。

    安装要求和过程

    环境要求

    • 运行时:Node.js 24+(项目已提升到 24.13.0),包管理使用 pnpm(monorepo 结构)。
    • 桌面端:默认可调用原生 NVIDIA CUDA / Apple Metal(通过 candle 项目),无需复杂依赖。
    • 移动端:使用 Capacitor(需 iOS 设备 / 模拟器)。
    • 浏览器:任意现代浏览器即可体验(PWA,已支持移动设备)。

    快速安装(普通用户)

    # Windows (winget)
    winget install MoeruAI.AIRI
    
    # 或 Scoop
    scoop bucket add airi https://github.com/moeru-ai/airi
    scoop install airi/airi
    
    # macOS (Homebrew)
    brew install --cask airi
    
    # Linux (Nix,需启用 flakes)
    nix run github:moeru-ai/airi
    
    # 不想安装?直接浏览器打开在线版
    # https://airi.moeru.ai

    AIRI 跨平台下载方式

    开发者从源码运行

    git clone https://github.com/moeru-ai/airi
    cd airi && pnpm i
    pnpm dev             # Web 版
    pnpm dev:tamagotchi # 桌面版

    核心功能

    • 实时语音交互(耳朵 + 嘴巴):客户端语音识别 + 说话人检测(VAD),配合 ElevenLabs / Azure Speech / OpenAI TTS / 阿里云 / 本地 Kokoro 等多供应商语音合成,对话延迟低、可离线运行。
    • 虚拟形象驱动(身体):支持 VRM 3D 模型与 Live2D 模型,自动眨眼、视线追踪、空闲眼动等动画,让 AI「活」在屏幕上。
    • 本地优先推理:基于 WebGPU 的浏览器内本地 LLM 推理,无需把数据发往外部服务器,隐私更有保障。
    • 游戏与记忆能力:可操控 Minecraft 游玩,Factorio 支持开发中(已有 PoC);内置 DuckDB WASM / pglite 浏览器内数据库与记忆系统(Alaya,开发中),让伴侣「记得你」。
    • 跨平台与集成:Web / 桌面(Win / macOS / Linux,桌面端走原生 CUDA / Metal 加速)/ 移动 PWA 全覆盖;支持 Telegram、Discord 聊天接入。

    典型使用场景

    1. 虚拟主播(VTuber):实时语音聊天、玩游戏、与观众互动,灵感直接来自 Neuro-sama,可作为直播 / 互动娱乐的数字人。
    2. 随身赛博伴侣:在手机、桌面、浏览器上随时拥有一个有形象、能聊天的专属电子宠物 / AI 朋友。
    3. 本地隐私 AI 助手:借助 WebGPU 本地推理在完全离线环境下运行 LLM,适合对数据隐私敏感的用户。

    推荐理由

    AIRI 是目前开源领域把「LLM + 实时语音 + 虚拟形象 + 游戏能力」整合得最完整、也最「有生命力」的项目之一。它完全自托管、可本地运行,技术栈现代(WebGPU / VRM / Live2D),跨平台覆盖到位,社区活跃(42K+ Stars、4.2K+ Forks,MIT 许可)。如果你一直好奇 Neuro-sama 是怎么「炼成」的,或者想拥有一个真正属于自己的、能聊天能陪玩的数字人,AIRI 值得一试。

    下载地址

  • Meetily:把会议转录和 AI 摘要锁在本地的隐私优先助手(24.4K Star)

    Meetily:把会议转录和 AI 摘要锁在本地的隐私优先助手(24.4K Star)

    每次开完会,最烦的不是写纪要,而是「这录音到底传去哪了」。云端会议助手很方便,但你的商业机密、病人信息、法律磋商,全进了别人家的服务器。最近在 GitHub 上刷到一个星标冲到 2.4 万+ 的项目 Meetily,它的卖点就一句话:转录和摘要 100% 在你自己电脑上跑,数据不出本机。今天把它拆给你看。

    📌 项目简介

    Meetily 是一个隐私优先的本地 AI 会议助手:实时录音转写、说话人分离、AI 生成会议纪要,全部在本地完成,零云端依赖。基于 Rust + Tauri 打包成单一桌面应用,macOS / Windows / Linux 通吃,采用 MIT 协议开源。

    Meetily 隐私优先 AI 会议助手
    Meetily:Privacy-First AI Meeting Assistant

    💻 安装要求和过程

    环境要求

    • 桌面端(推荐):macOS(Apple Silicon / Intel)、Windows 10+、Linux;无需自备 GPU,有则加速。
    • 本地 AI 模型:Whisper 或 NVIDIA Parakeet 做转写(Parakeet 官方称快 4 倍);摘要默认用本地 Ollama,也支持 Claude / Groq / OpenRouter / 任意 OpenAI 兼容端点。
    • 开发者构建:需安装 Rust 工具链 + Node.js(建议 18+) + pnpm。
    • GPU 加速:macOS 走 Metal/CoreML,Windows/Linux 走 NVIDIA CUDA 或 AMD/Intel Vulkan,构建时自动启用。

    快速安装

    Windows:到 Releases 下载最新 x64-setup.exe,双击安装即可。

    macOS:下载 meetily_0.4.0_aarch64.dmg,拖进「应用程序」文件夹后打开。

    Linux:建议从源码构建:

    git clone https://github.com/Zackriya-Solutions/meeting-minutes
    cd meeting-minutes/frontend
    pnpm install
    ./build-gpu.sh

    开发者本地跑:装好 Rust + Node 后,前端用 pnpm install && pnpm dev,后端由 Tauri 统一拉起。

    ✨ 核心功能

    1. 本地优先 / 隐私优先

    所有录音、转写文本、摘要都只存在你本机。不联云、不上传、无厂商锁定,企业可以把敏感会议完全留在自己的基础设施里。

    Meetily 本地存储与隐私设置
    所有数据留在本地,转录模型与记录均本机存储

    2. 实时转写 + 说话人分离

    用 Whisper 或 Parakeet 模型在设备端实时出稿,会议进行中就能看到逐字稿;支持说话人分离(speaker diarization),谁说了什么一目了然。

    Meetily 本地实时转写界面
    本地实时转写界面

    3. AI 驱动的会议摘要

    转写完成后一键生成摘要,AI Provider 可自选:本地 Ollama(推荐,零费用零外流)、或接入 Claude / Groq / OpenRouter / 自建 OpenAI 兼容端点。还支持导入已有录音文件重新转写。

    Meetily AI 会议摘要
    AI 生成的会议摘要

    4. 专业音频混音

    麦克风与系统声音同时采集,带智能闪避(ducking)和防削波,远端会议声音也能干净录下来,不用再担心「对方声音没录上」。

    Meetily 专业音频混音
    麦克风 + 系统音频同时采集,防削波

    5. 跨平台 + GPU 加速的轻量单包

    基于 Tauri(Rust 后端 + Next.js 前端)打包成单文件桌面应用,比 Electron 轻得多;三大桌面系统原生支持,GPU 加速开箱即用。

    🎯 典型使用场景

    • 合规敏感型企业会议:法律、医疗、军工、金融等行业,把会议内容留在内网,规避 GDPR / 数据泄露风险,满足审计与合规要求。
    • 团队与个人纪要自动化:日常站会、客户访谈、脑暴会,开完即出转写稿 + 摘要,省下整理时间,且全程不花任何 API 调用费。
    • 私有化部署的团队协同:用自建 OpenAI 兼容端点做摘要,把 Meetily 跑在公司服务器上,团队成员共享同一套本地推理基础设施。

    💡 推荐理由

    我用过一阵子,最打动我的是它的「零心理负担」:开会前不用先纠结「这段话能不能让第三方听见」。单一桌面应用安装即用,Tauri 打包体积小、启动快,Rust 后端也让人放心。转写质量在本地模型里属于第一梯队,Parakeet 确实快;摘要接 Ollama 本地跑,等于白嫖还不出户。当然它也有边界——Community 版靠本地模型,精度和高级导出、自动入会这类能力在付费 PRO 里;但社区版承诺永久免费开源,核心的本地转写 + 摘要完全够日常用。如果你在意数据主权、又想要一个不像「玩具」的会议助手,Meetily 值得放进收藏夹。

    📥 下载地址

    注:项目原名 meeting-minutes,发布与下载请认准 meeting-minutes 的 Releases 路径;仓库现已重命名为 meetily。

  • FunClip:阿里出品的 AI 视频剪辑神器,语音识别 + LLM 智能裁剪,5.9K Stars 让视频剪辑自动化

    FunClip:阿里出品的 AI 视频剪辑神器,语音识别 + LLM 智能裁剪,5.9K Stars 让视频剪辑自动化

    FunClip 界面

    做自媒体的朋友一定有过这样的痛苦:一段两小时的直播回放,只想剪出几句高光金句,却要在时间轴上反复拖拽、听写、对齐字幕。阿里通义语音实验室开源的 FunClip,用语音识别 + 大语言模型把这件事彻底自动化了——上传视频,复制你想保留的文字,点一下,片段就出来了。

    📌 项目简介

    FunClip 是一个完全开源、可本地部署的自动化视频剪辑工具,基于阿里巴巴通义语音实验室开源的 FunASR Paraformer 系列模型对视频做语音识别,用户自由选择识别文本片段或说话人,一键生成对应视频片段,并提供本地 Gradio Web 界面,支持 LLM 辅助智能剪辑。

    ⚙️ 安装要求与过程

    环境要求:仅需 Python 环境(推荐 Python 3.8+);如需内嵌字幕剪辑,需额外安装 ffmpeg 与 imagemagick 及中文字体文件。

    快速安装:

    # 克隆仓库
    git clone https://github.com/modelscope/FunClip.git
    cd FunClip
    # 安装依赖
    pip install -r ./requirements.txt
    
    # 启动本地 Gradio 服务(默认中文 Paraformer)
    python funclip/launch.py
    # 可选:-m fun-asr-nano (31语种) | -m sensevoice (情绪+事件) | -l en (英文)
    #       -p 端口号 | -s True (公网访问)

    启动后访问 localhost:7860 即可使用 Web 界面:上传视频 → 复制需剪辑文本到 “Text to Clip” → 调整字幕 → 点击 “Clip” 或 “Clip and Generate Subtitles”。

    ✨ 核心功能

    • 工业级中文 ASR(Paraformer-Large):阿里开源的顶尖中文语音识别模型,Modelscope 下载超 1300 万次,可精准预测时间戳,自动返回全视频与目标段 SRT 字幕。
    • 热词定制(SeACo-Paraformer):在识别过程中指定实体词、人名等热词,显著提升专有名词识别准确率。
    • 说话人分离(CAM++):集成说话人识别模型,可自动识别 speaker ID,一键剪出特定人物的全部发言片段。
    • LLM 智能剪辑:支持 qwen、GPT 等大模型,结合视频字幕自动推理出高光片段的时间戳;还可选 TwelveLabs Pegasus 视频理解模型,直接“看懂”画面而非仅依赖字幕。
    • 多模型与多语言:2026 年新增 Fun-ASR-Nano(31 种语言高精度)、SenseVoice(情绪识别 + 音频事件检测),并支持英文视频识别剪辑。

    🎬 典型使用场景

    • 自媒体长视频提取金句:把一场发布会、一次访谈原片丢进去,复制想保留的台词,FunClip 自动精准裁出对应时段并生成字幕,做短视频切片效率翻倍。
    • 会议 / 演讲按说话人剪辑:开启说话人分离后,直接剪出某位嘉宾的全部发言,用于整理观点、制作人物集锦,无需手动对照音轨。
    • 视频自动加字幕:识别后一键生成全片 SRT,并可内嵌硬字幕导出,省去逐句听写的繁琐,特别适合教程、纪录片类内容。

    💡 推荐理由

    我自己的使用感受是:FunClip 把“语音识别 → 文本选择 → 视频裁剪”这条链路做到了极简。它不像一些云端剪辑工具那样把数据传上去,而是完全本地运行,隐私可控;Gradio 界面几乎零学习成本,命令行模式又能轻松写进自动化流水线。对做内容创作、知识整理的人来说,它是那种“装好就天天想用”的效率利器。尤其 LLM 智能剪辑的加入,让“我要这段关于乡村振兴的发言”变成一句自然语言指令就能完成。

    🔗 下载地址

    许可协议:MIT(可自由商用与修改)

  • Meetily:隐私优先的AI会议助手,100%本地处理让敏感会议不再泄露,15.8K Stars让AI会议记录做到真正自托管

    Meetily:隐私优先的AI会议助手,100%本地处理让敏感会议不再泄露,15.8K Stars让AI会议记录做到真正自托管

    Meetily AI会议助手

    在远程办公与 AI 浪潮的双重推动下,会议记录工具已成为职场标配。但无论是 Otter.ai、Fireflies 还是其他主流工具,都有一个共同问题:你的会议内容会被上传到别人的服务器。对于金融、法律、医疗、政务等敏感行业,这显然是不可接受的风险。Meetily 给出了一个优雅的解决方案:让 AI 会议助手完全运行在你的本地设备上,100% 数据不出本机。


    🚀 项目简介

    Meetily(原名 Meetly AI)是 Zackriya Solutions 团队开发的开源 AI 会议助手,也是目前 GitHub 上 排名第一的自托管、开源 AI 会议记录工具。项目采用 Rust + Tauri 构建,前端基于 Next.js/React,支持 macOS 和 Windows(Linux 可编译),所有语音识别和 AI 总结均在本地完成,无需任何云端服务。

    核心亮点在于其转录引擎:默认采用 NVIDIA Parakeet 模型,比 Whisper 快 4 倍,同时支持 Whisper 系列模型作为备选。AI 总结部分可对接 Ollama(本地)、Claude、Groq、OpenRouter 或任意 OpenAI 兼容接口,真正做到灵活可控。

    📊 项目数据
    GitHub Stars: 15.8K+ |
    语言: Rust + TypeScript |
    许可证: MIT |
    最新版本: v0.4.0 (2026-06-05)


    ⚙️ 安装要求与过程

    🔧 系统要求

    • macOS:Apple Silicon 或 Intel 架构,需授予麦克风权限
    • Windows:Windows 10+,建议配备 Vulkan 兼容 GPU 以加速转录
    • Linux:支持 AppImage 打包,需自行编译
    • 内存:建议 8GB+(加载 Parakeet 模型约需 2-3GB)

    📦 快速安装(推荐方式)

    1. 访问 GitHub Releases 页面
    2. Windows 用户下载 x64-setup.exe 运行安装
    3. macOS 用户下载 meetily_0.4.0_aarch64.dmg,拖入应用程序文件夹
    4. 首次启动时会自动提示下载转录模型(约 500MB),可选择后台下载
    5. 在设置中配置 AI 总结提供商(推荐 Ollama 本地运行)

    💻 从源码构建(开发者方式)

    # 克隆仓库
    git clone https://github.com/Zackriya-Solutions/meetily.git
    cd meetily
    
    # 安装依赖(需要 Rust + Node.js + pnpm)
    pnpm install
    
    # 运行开发模式
    pnpm tauri dev
    
    # 构建生产版本
    pnpm tauri build

    💡 核心功能

    • 🎙️ 实时本地转写:采用 NVIDIA Parakeet 模型(比 Whisper 快4倍),支持说话人分离(Speaker Diarization),可区分不同参会者;支持多语言,修复了多字节字符截断问题
    • 🤖 灵活 AI 总结:支持 Ollama(本地)、Claude、Groq、OpenRouter 及任意 OpenAI 兼容接口;可自定义总结模板;支持流式生成,生成失败时可保留已生成内容
    • 🔒 100% 本地处理:所有录音、转写文本、AI 总结均存储于本地 SQLite 数据库(meeting_minutes.db),无需联网,无数据泄露风险
    • ⚡ GPU 加速:macOS 支持 Apple Silicon (Metal) + CoreML;Windows/Linux 支持 NVIDIA (CUDA)、AMD/Intel (Vulkan);编译时自动启用,无需额外配置
    • 📥 导入与增强(Beta):支持导入已有音频文件生成转写;可对已录制会议使用不同模型或语言重新转写,全部本地处理

    📦 典型使用场景

    🏢 场景1:金融/法律/医疗机构内部会议

    这些行业对数据合规有严格要求(如 GDPR、HIPAA),不能使用云端会议记录工具。Meetily 让 AI 会议助手完全运行在内网设备上,满足合规审计要求,同时享受 AI 自动生成会议摘要的便利。

    👨‍💻 场景2:远程团队协作记录

    支持 Zoom、Teams、Google Meet 等主流会议平台,可同时录制麦克风和系统音频,智能降噪,自动生成会议摘要。团队成员可各自运行 Meetily,会议记录完全私有,无需担心商业机密泄露。

    🔧 场景3:开发者技术讨论存档

    技术讨论中常涉及代码片段、架构决策等敏感信息。Meetily 本地转写后可导出为 Markdown 格式,直接存入团队知识库(如 Obsidian、Notion 本地版),结合 Ollama 本地运行 Llama 3 生成技术决策摘要,全程无需任何外部 API。


    ⭐ 推荐理由

    作为一名对隐私极其敏感的 AI 从业者,我对市面上的云端会议记录工具一直存有顾虑。Meetily 最大的价值在于:它让 AI 会议助手不再是一个「隐私换便利」的妥协方案。

    项目的 Rust + Tauri 技术选型也值得称赞:相比 Electron 框架,Tauri 打包体积小(约 50MB vs Electron 的 150MB+),内存占用更低,安全性更高。Parakeet 模型的集成更是一个亮点——NVIDIA 的这个模型在准确性和速度上都超越 Whisper,且完全本地可运行。

    MIT 许可证意味着你可以自由修改和分发,对于需要定制功能的团队来说非常友好。如果你在意数据主权,或者所在行业有合规要求,Meetily 是目前唯一值得认真考虑的开源方案。


    📧 下载地址


    💡 Tip: Meetily PRO 版本提供更高的转录精度、自定义摘要模板、PDF/DOCX 导出、自动会议检测和说话人识别等高级功能。社区版将永久免费开源,PRO 版面向需要企业级功能的团队。使用优惠码 LAUNCH20 可获得 20% 折扣。

  • FunASR:阿里达摩院出品的工业级语音识别工具包,18.6K+ Stars 让中文语音识别又快又准

    FunASR:阿里达摩院出品的工业级语音识别工具包,18.6K+ Stars 让中文语音识别又快又准

    ASR

    FunASR:阿里达摩院出品的工业级端到端语音识别工具包

    ModelScope(阿里达摩院) 出品 · 18.6K+ Stars · 1.9K+ Forks · MIT 许可

    FunASR 是阿里达摩院 ModelScope 团队开发的工业级端到端语音识别工具包
    支持 170 倍实时识别速度、50+ 语言、内置说话人日志与情感检测,并提供兼容 OpenAI 的 API 接口。
    相比 Whisper,FunASR 在中文和方言识别上准确率更高,CPU 场景运行速度更快,是开源语音识别领域最实用的生产级工具包。

    18.6K+
    GitHub Stars

    50+
    支持语言

    170x
    实时识别速度

    MIT
    开源许可

    ⚙️ 安装要求和过程

    环境要求

    • Python ≥ 3.8
    • 需先安装 PyTorch 和 torchaudio
    • GPU 可选(CPU 场景亦可运行,SenseVoice 模型可达 17 倍实时)
    • 可选:vLLM(加速推理)、Docker(容器部署)

    快速安装

    # 从 PyPI 安装(推荐)
    pip install funasr
    pip install funasr[cli]      # 包含 CLI 命令行工具
    
    # 从源码安装
    git clone https://github.com/modelscope/FunASR.git
    cd FunASR
    pip install -e ./
    
    # Docker 一键部署 API 服务
    docker run -p 8000:8000 funasr/funasr-server:latest

    🚀 核心功能

    170倍实时识别速度

    旗舰模型 Fun-ASR-Nano 配合 vLLM 加速可达 340 倍实时,比 Whisper 快 26 倍;CPU 场景下 SenseVoice 模型可达 17 倍实时

    🌍

    50+ 语言支持

    Qwen3-ASR 支持 52 种语言,Fun-ASR-Nano 支持 31 种语言,覆盖全球主流语种,适合国际化应用

    🎯

    内置多任务能力

    单模型调用即可完成 VAD 分段、语音识别、说话人分离、标点恢复、时间戳、情感/音频事件识别,无需额外模型

    🔄

    流式实时识别

    支持音频流逐块输入,适合实时字幕、语音实时转写场景,支持逐字/逐句流式输出

    🔌

    OpenAI 兼容 API

    提供兼容 OpenAI 语音识别 API 的接口,可对接 LangChain、Dify、AutoGen 等 AI 框架;提供 MCP Server 可接入 Claude Code、Cursor 等智能体

    💡 典型使用场景

    🎤 本地音频快速转录

    无需 GPU 即可使用,单条命令完成音频转录,支持输出纯文本、JSON、SRT 字幕等格式

    funasr audio.wav
    funasr audio.wav --output-format json
    funasr audio.wav --output-format srt --output-dir ./subs

    👥 会议长音频处理

    单模型调用同时完成 VAD 分段、语音识别、说话人分离,适合会议、访谈等长音频场景

    from funasr import AutoModel
    
    model = AutoModel(
        model="iic/SenseVoiceSmall",
        vad_model="fsmn-vad",
        spk_model="cam++",
        device="cuda"
    )
    result = model.generate(
        input="meeting_record.wav",
        batch_size_s=300,
    )

    🚀 生产级 API 部署

    一键启动兼容 OpenAI 的 API 服务,可对接现有基于 OpenAI API 的应用,无需修改代码

    # 启动服务
    funasr-server --device cuda
    
    # 调用(兼容 OpenAI API)
    curl http://localhost:8000/v1/audio/transcriptions \
      -F file=@sample.wav -F model=sensevoice

    🌟 推荐理由

    FunASR 是开源语音识别领域最实用的工业级工具包。相比 Whisper,它在中文和方言识别上准确率更高,CPU 场景运行速度更快(17 倍实时),且内置了说话人分离、情感检测等额外能力,无需像 Whisper 那样集成多个模型。

    最让我惊喜的是它的 OpenAI 兼容 API——只需改一行代码,就能把基于 Whisper 的应用无缝迁移到 FunASR,且中文识别准确率显著提升。此外,它还提供 MCP Server,可直接接入 Claude Code、Cursor 等 AI 编程助手,让语音识别能力融入 AI 工作流。

    MIT 许可允许商用,且支持边缘设备无 Python 运行时部署(llama.cpp/GGUF),真正做到了全场景覆盖。如果你在做语音相关的 AI 应用,FunASR 是目前最好的开源选择。

    📥 下载地址

    ⭐ 如果你觉得这篇文章有用,欢迎在 GitHub 上给 FunASR 点个 Star!