标签: 本地AI

  • 英伟达 Agent Toolkit:把 AI 智能体搬上桌面工作站

    英伟达最近给自家最强的台式工作站 DGX Station 塞进了一套新工具:Agent Toolkit。官方说,开发者只要三步、大概半小时,就能在本地把 AI 智能体跑起来——不用连云,模型和数据都留在你自己的机器上。

    本地 AI 智能体工作站概念图
    英伟达把智能体能力带到了桌面级工作站

    DGX Station 本身就不好惹,里面是一颗 GB300「Blackwell Ultra」GPU。Agent Toolkit 的价值,是把原来得靠云 GPU 集群才能玩转的复杂智能体,搬到了桌面端。

    借助 Omniverse 库,智能体可以在本地的安全运行时里调用工具与技能,完全不需要连接互联网。—— NVIDIA

    这一套到底装了什么

    它不是单个软件,而是一整个软件栈:

    • NemoClaw:开源的智能体蓝图,把模型、运行框架和 runtime 打包,方便团队照着自己的业务改
    • Nemotron 3 Ultra:一个 5500 亿参数的开放大模型,专为 DGX Station 优化,可以本地微调
    • Omniverse 库:把智能体接到物理仿真和 3D 工作流,机器人训练、自动驾驶仿真都能本地跑
    • OpenShell:开源的安全运行时,给智能体套上沙箱,按策略管住它碰什么工具、什么数据

    为什么是现在

    硬件底子是 GB300 超级芯片,最高 20 petaflops 的 FP4 算力、748GB 统一内存;网络用 ConnectX-8,带宽到 800GB/s,还能两台 DGX Station 并联扩容。NVIDIA 还拉上 Adobe、Blender、Unreal、Epic、Foundry、Canva 等伙伴做 MCP 接入,让智能体直接进到这些创作工具里干活。

    更关键的是战略转向。当资本市场开始计较 AI 的投资回报,英伟达把 Agent Toolkit 和 Omniverse 绑在一起,等于在说:我不只卖算力硬件,还想在你的工作站上长出一套软件生态。对怕数据出公司、又想快速迭代的企业来说,本地跑智能体确实少了一层顾虑。


  • AIRI:自托管 AI 数字伴侣,能实时语音聊天、陪你打 Minecraft(42K+ Stars)

    AIRI:自托管 AI 数字伴侣,能实时语音聊天、陪你打 Minecraft(42K+ Stars)

    AIRI 数字生命形象

    项目简介

    AIRI 是由 moeru-ai 团队开源的「自托管、你专属拥有」的 AI 数字生命(AI Companion)项目。它把大语言模型、实时语音交互与 VRM / Live2D 虚拟形象结合在一起,让你在 Web、桌面与移动端拥有一位能说话、能陪玩、有「身体」的赛博伴侣,目标是达到 AI 虚拟主播 Neuro-sama 那样的水平。整个项目基于 WebGPU / WebAudio / WebAssembly 等现代 Web 技术构建,强调本地优先与隐私保护。

    安装要求和过程

    环境要求

    • 运行时:Node.js 24+(项目已提升到 24.13.0),包管理使用 pnpm(monorepo 结构)。
    • 桌面端:默认可调用原生 NVIDIA CUDA / Apple Metal(通过 candle 项目),无需复杂依赖。
    • 移动端:使用 Capacitor(需 iOS 设备 / 模拟器)。
    • 浏览器:任意现代浏览器即可体验(PWA,已支持移动设备)。

    快速安装(普通用户)

    # Windows (winget)
    winget install MoeruAI.AIRI
    
    # 或 Scoop
    scoop bucket add airi https://github.com/moeru-ai/airi
    scoop install airi/airi
    
    # macOS (Homebrew)
    brew install --cask airi
    
    # Linux (Nix,需启用 flakes)
    nix run github:moeru-ai/airi
    
    # 不想安装?直接浏览器打开在线版
    # https://airi.moeru.ai

    AIRI 跨平台下载方式

    开发者从源码运行

    git clone https://github.com/moeru-ai/airi
    cd airi && pnpm i
    pnpm dev             # Web 版
    pnpm dev:tamagotchi # 桌面版

    核心功能

    • 实时语音交互(耳朵 + 嘴巴):客户端语音识别 + 说话人检测(VAD),配合 ElevenLabs / Azure Speech / OpenAI TTS / 阿里云 / 本地 Kokoro 等多供应商语音合成,对话延迟低、可离线运行。
    • 虚拟形象驱动(身体):支持 VRM 3D 模型与 Live2D 模型,自动眨眼、视线追踪、空闲眼动等动画,让 AI「活」在屏幕上。
    • 本地优先推理:基于 WebGPU 的浏览器内本地 LLM 推理,无需把数据发往外部服务器,隐私更有保障。
    • 游戏与记忆能力:可操控 Minecraft 游玩,Factorio 支持开发中(已有 PoC);内置 DuckDB WASM / pglite 浏览器内数据库与记忆系统(Alaya,开发中),让伴侣「记得你」。
    • 跨平台与集成:Web / 桌面(Win / macOS / Linux,桌面端走原生 CUDA / Metal 加速)/ 移动 PWA 全覆盖;支持 Telegram、Discord 聊天接入。

    典型使用场景

    1. 虚拟主播(VTuber):实时语音聊天、玩游戏、与观众互动,灵感直接来自 Neuro-sama,可作为直播 / 互动娱乐的数字人。
    2. 随身赛博伴侣:在手机、桌面、浏览器上随时拥有一个有形象、能聊天的专属电子宠物 / AI 朋友。
    3. 本地隐私 AI 助手:借助 WebGPU 本地推理在完全离线环境下运行 LLM,适合对数据隐私敏感的用户。

    推荐理由

    AIRI 是目前开源领域把「LLM + 实时语音 + 虚拟形象 + 游戏能力」整合得最完整、也最「有生命力」的项目之一。它完全自托管、可本地运行,技术栈现代(WebGPU / VRM / Live2D),跨平台覆盖到位,社区活跃(42K+ Stars、4.2K+ Forks,MIT 许可)。如果你一直好奇 Neuro-sama 是怎么「炼成」的,或者想拥有一个真正属于自己的、能聊天能陪玩的数字人,AIRI 值得一试。

    下载地址

  • Meetily:把会议转录和 AI 摘要锁在本地的隐私优先助手(24.4K Star)

    Meetily:把会议转录和 AI 摘要锁在本地的隐私优先助手(24.4K Star)

    每次开完会,最烦的不是写纪要,而是「这录音到底传去哪了」。云端会议助手很方便,但你的商业机密、病人信息、法律磋商,全进了别人家的服务器。最近在 GitHub 上刷到一个星标冲到 2.4 万+ 的项目 Meetily,它的卖点就一句话:转录和摘要 100% 在你自己电脑上跑,数据不出本机。今天把它拆给你看。

    📌 项目简介

    Meetily 是一个隐私优先的本地 AI 会议助手:实时录音转写、说话人分离、AI 生成会议纪要,全部在本地完成,零云端依赖。基于 Rust + Tauri 打包成单一桌面应用,macOS / Windows / Linux 通吃,采用 MIT 协议开源。

    Meetily 隐私优先 AI 会议助手
    Meetily:Privacy-First AI Meeting Assistant

    💻 安装要求和过程

    环境要求

    • 桌面端(推荐):macOS(Apple Silicon / Intel)、Windows 10+、Linux;无需自备 GPU,有则加速。
    • 本地 AI 模型:Whisper 或 NVIDIA Parakeet 做转写(Parakeet 官方称快 4 倍);摘要默认用本地 Ollama,也支持 Claude / Groq / OpenRouter / 任意 OpenAI 兼容端点。
    • 开发者构建:需安装 Rust 工具链 + Node.js(建议 18+) + pnpm。
    • GPU 加速:macOS 走 Metal/CoreML,Windows/Linux 走 NVIDIA CUDA 或 AMD/Intel Vulkan,构建时自动启用。

    快速安装

    Windows:到 Releases 下载最新 x64-setup.exe,双击安装即可。

    macOS:下载 meetily_0.4.0_aarch64.dmg,拖进「应用程序」文件夹后打开。

    Linux:建议从源码构建:

    git clone https://github.com/Zackriya-Solutions/meeting-minutes
    cd meeting-minutes/frontend
    pnpm install
    ./build-gpu.sh

    开发者本地跑:装好 Rust + Node 后,前端用 pnpm install && pnpm dev,后端由 Tauri 统一拉起。

    ✨ 核心功能

    1. 本地优先 / 隐私优先

    所有录音、转写文本、摘要都只存在你本机。不联云、不上传、无厂商锁定,企业可以把敏感会议完全留在自己的基础设施里。

    Meetily 本地存储与隐私设置
    所有数据留在本地,转录模型与记录均本机存储

    2. 实时转写 + 说话人分离

    用 Whisper 或 Parakeet 模型在设备端实时出稿,会议进行中就能看到逐字稿;支持说话人分离(speaker diarization),谁说了什么一目了然。

    Meetily 本地实时转写界面
    本地实时转写界面

    3. AI 驱动的会议摘要

    转写完成后一键生成摘要,AI Provider 可自选:本地 Ollama(推荐,零费用零外流)、或接入 Claude / Groq / OpenRouter / 自建 OpenAI 兼容端点。还支持导入已有录音文件重新转写。

    Meetily AI 会议摘要
    AI 生成的会议摘要

    4. 专业音频混音

    麦克风与系统声音同时采集,带智能闪避(ducking)和防削波,远端会议声音也能干净录下来,不用再担心「对方声音没录上」。

    Meetily 专业音频混音
    麦克风 + 系统音频同时采集,防削波

    5. 跨平台 + GPU 加速的轻量单包

    基于 Tauri(Rust 后端 + Next.js 前端)打包成单文件桌面应用,比 Electron 轻得多;三大桌面系统原生支持,GPU 加速开箱即用。

    🎯 典型使用场景

    • 合规敏感型企业会议:法律、医疗、军工、金融等行业,把会议内容留在内网,规避 GDPR / 数据泄露风险,满足审计与合规要求。
    • 团队与个人纪要自动化:日常站会、客户访谈、脑暴会,开完即出转写稿 + 摘要,省下整理时间,且全程不花任何 API 调用费。
    • 私有化部署的团队协同:用自建 OpenAI 兼容端点做摘要,把 Meetily 跑在公司服务器上,团队成员共享同一套本地推理基础设施。

    💡 推荐理由

    我用过一阵子,最打动我的是它的「零心理负担」:开会前不用先纠结「这段话能不能让第三方听见」。单一桌面应用安装即用,Tauri 打包体积小、启动快,Rust 后端也让人放心。转写质量在本地模型里属于第一梯队,Parakeet 确实快;摘要接 Ollama 本地跑,等于白嫖还不出户。当然它也有边界——Community 版靠本地模型,精度和高级导出、自动入会这类能力在付费 PRO 里;但社区版承诺永久免费开源,核心的本地转写 + 摘要完全够日常用。如果你在意数据主权、又想要一个不像「玩具」的会议助手,Meetily 值得放进收藏夹。

    📥 下载地址

    注:项目原名 meeting-minutes,发布与下载请认准 meeting-minutes 的 Releases 路径;仓库现已重命名为 meetily。

  • 一个研究生用12B模型干翻HuggingFace热榜,大厂这次真的有点尴尬

    一个研究生,两款模型,74万次下载

    HuggingFace的Trending模型榜,向来是大厂的秀场——直到逯雨鑫(yuxinlu1)带着他的GGUF量化模型闯了进来。

    这个美国AI方向的在读研究生,用Gemma4-12B做底座,通过蒸馏把Fable 5的编程推理能力「压」进了一个仅需4.5GB显存就能跑的小模型。结果很直接:在HuggingFace趋势榜上,它一度超过了智谱GLM-5.2、百度Unlimited-OCR等大厂作品,两款模型合计下载量突破74万

    个人开发者霸榜HuggingFace概念图
    个人开发者的12B模型在HuggingFace趋势榜超越众多大厂模型

    怎么做到的?数据质量胜过数量

    逯雨鑫的秘诀不算神秘,但很费功夫:他用约1万条高质量、经过验证的训练数据,而不是几百万条噪声数据。具体来说,他用Fable 5生成代码推理链,但只保留「能通过测试用例」的那些——相当于让老师先改作业,再把满分答案给学生做示范。

    两个版本各有侧重:V1 Coder版专注代码生成与解题;V2 Agentic版增加了多步工具调用能力。在tau2-bench telecom子集上,V2得分55%,而基座Gemma4-12B只有15%——提升了约3.5倍。

    「大厂能做得更好,但开源小模型受品牌和API引流目标影响。个人开发者可以更纯粹地解决『好用』问题。」——逯雨鑫

    为什么是现在?本地AI的窗口打开了

    这几年有个矛盾的现象:云端大模型越来越强,但很多人反而开始关心「本地能跑」的模型。原因很实际:隐私(不想把代码发给云端)、成本(不想为API账单发愁)、延迟(本地推理零网络开销)。

    逯雨鑫的模型最小版本(Q2_K)只要4.5GB显存,一张RTX 4060就能跑。对于很多个人开发者和中小团队,这个门槛意味着「不用申请采购、自己的笔记本就能用」。

    作者是个什么样的人?

    逯雨鑫,美国AI方向在读研究生,本科背景是数据与商业分析。他自述患有ADHD,但在快速变化的AI领域,这种「兴趣快速切换」的特质反而成了优势——hyperfocus让他能在模型训练上连续投入40多个小时。

    项目是纯自费的:一张RTX 5090(32GB VRAM)、约96GB本地SSD,没有融资、没有团队。V2版本最耗时的不是训练,而是数据处理——尤其是agentic长序列的裁剪和验证。


    • 模型底座:Google Gemma4-12B(蒸馏Fable 5能力)
    • 量化格式:GGUF(兼容llama.cpp/Ollama/LM Studio)
    • 最小显存:Q2_K约4.5GB(推荐Q4_K_M约6.87GB)
    • 合计下载:超74万(HuggingFace Trending榜一度超越GLM-5.2)
    • 未来计划:V3沿12B路线推进,同时开发基于Qwen3.6-27B的大版本