标签: AI

  • Voicebox:本地优先的开源 AI 语音工作室,克隆声音 + 让智能体开口说话

    Voicebox:本地优先的开源 AI 语音工作室,克隆声音 + 让智能体开口说话

    Voicebox 开源 AI 语音工作室

    Voicebox —— 本地优先的开源 AI 语音工作室

    📌 项目简介

    Voicebox 是由 Jamie Pine 打造的开源 AI 语音工作室,一句话概括:克隆任意声音、生成语音、随时听写、还能让你的 AI 智能体用你拥有的声音开口说话。它是 ElevenLabs(语音输出)与 WisprFlow(语音输入)的本地优先、免费开源二合一替代品,整套语音 I/O 栈都跑在你自己的机器上。

    ⭐ GitHub 43,196 stars | 🍴 5,280 forks | 📅 创建于 2026-01-25,更新于 2026-07-19(当日 GitHub Trending 热门)| 📜 MIT 许可 | 💻 TypeScript / Tauri(Rust) / FastAPI(Python)

    🛠 安装要求和过程

    环境要求

    • 普通用户:直接下载桌面应用,无需配置开发环境;支持 macOS(Apple Silicon / Intel)、Windows、Linux(需源码构建)、Docker。
    • GPU 加速:macOS 走 MLX/Metal(神经引擎快 4-5×),Windows/Linux NVIDIA 走 CUDA,AMD 走 ROCm,Intel Arc 走 IPEX/XPU,Windows 任意显卡走 DirectML,无显卡则回退 CPU。
    • 开发者构建:需 BunRustPython 3.11+Tauri 前置依赖(macOS 还需 Xcode)。

    快速安装(三种方式)

    方式一 · 下载安装包(推荐)

    方式二 · 开发者一键启动

    git clone https://github.com/jamiepine/voicebox.git
    cd voicebox
    just setup    # 创建 Python venv 并安装全部依赖
    just dev      # 启动后端 + 桌面应用

    (先安装 just 命令运行器:brew install justcargo install just

    方式三 · 接入 AI 智能体(MCP)

    claude mcp add voicebox \
      --transport http \
      --url http://127.0.0.1:17493/mcp \
      --header "X-Voicebox-Client-Id: claude-code"

    ✨ 核心功能

    Voicebox 界面

    1. 7 大 TTS 引擎,自由切换:Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual、Chatterbox Turbo、HumeAI TADA、Kokoro,覆盖 23 种语言(英/阿/日/印地/斯瓦希里等),并支持零样本声音克隆与 50+ 预设音色。
    2. 声音克隆 + 语音性格:几秒参考音频即可克隆任意声音;可为每个声纹绑定自由格式的”性格”,通过本地 Qwen3 LLM 实现 Compose(即兴台词)与 Speak-in-character(拟人改写)。
    3. 全局听写 / 语音输入:系统级热键按住说话、松手即停(push-to-talk),macOS 下自动粘贴到当前输入框;底层基于 OpenAI Whisper 的 STT,支持 Base/Small/Medium/Large/Turbo。
    4. 后期音效处理:基于 Spotify pedalboard 的 8 种效果——变调、混响、延迟、合唱、压缩、增益、高/低通滤波,可实时预览并存为预设。
    5. Agent 语音输出(MCP):一句 voicebox.speak() 调用,任何支持 MCP 的智能体(Claude Code / Cursor / Cline / Windsurf)都能用你克隆的声音向你播报任务进展。

    Voicebox Stories 编辑器

    🎯 典型使用场景

    • 播客 / 有声内容创作:用内置 Stories 多轨时间线编辑器,零样本克隆嘉宾声音,一键生成多角色对话、播客与叙事音频,长文本自动分块 + 交叉淡入淡出。
    • AI 编码智能体开发循环:把 Claude Code 绑定到某个克隆声纹,构建完成、测试通过时它能”开口”告诉你——用耳朵接收进度,而不是一直盯着终端。
    • 无障碍与语音辅助:为无法用原声说话的人提供克隆声音;全局热键听写 + macOS 自动粘贴,大幅提升文字录入效率。
    • 游戏 / 叙事交互:为游戏角色或互动叙事工具接入带”性格”的语音,实现有情绪、带语气词的拟人对话。

    💡 推荐理由

    我用过多家云端语音服务,Voicebox 最打动我的是三点:

    • 真正的本地优先 + 隐私优先。模型、声音数据、录音全部留在本机,不上传任何云,对注重数据主权的用户极其友好。
    • 输入 + 输出一站式。ElevenLabs 只管”说”,WisprFlow 只管”听”,Voicebox 把两者打通,还用一个本地 LLM 串联性格改写,一 GPU 显存占用搞定全套。
    • 给 AI Agent 配声音这个设计非常新颖。当你的编码助手能用你熟悉的声音播报”部署完成”,人机交互的体验立刻不一样,这也是它和同类工具最大的差异化。

    ⚠️ 一点不足:Linux 目前没有预编译二进制,需要源码构建;同时 7 个引擎质量参差,部分小模型音色一般,建议按场景挑选。但瑕不掩瑜,作为开源语音 I/O 基础设施,它已经非常能打。

    📥 下载地址

    本文由自动化脚本基于 GitHub 公开仓库信息整理,项目数据截至 2026-07-19。

  • 上线四天就认怂:Meta 用 @ 别人就能造 AI 深伪图,被骂到下架

    一个 @ 就能把陌生人塞进你的图里

    这周二,Meta 高调推出了自家的图像生成模型 Muse Image,并把它接进了 Instagram。其中一个被当成亮点的玩法很直白:在 Meta AI 里 @ 某个公共 Instagram 账号,系统就会把那个人的内容拉进你生成的图里。

    问题出在默认设置上。只要账号是公开的,它的照片就能被别人拿去生成 AI 图像,而且不需要本人同意。想不被用?得自己钻进设置里一层层翻,手动关掉。

    追求高风险的设计,却把责任推给个人去层层跳转菜单退出——这是不可接受的。

    说这话的是 Haley McNamara,美国全国性反性剥削组织(NCOSE)的负责人。她的担忧很具体:这不光是侵蚀了每个人对自己肖像的权利,更像是一个为”色情勒索”和其他诈骗者准备好的现成工具。

    四天,从上线到撤回

    批评声不只是来自民间。演员工会 SAG-AFTRA 直接建议旗下会员去关掉这个功能,还手把手写了操作教程。在舆论、行业组织和媒体一起施压之后,Meta 认了。

    公司在博客更新里写:”我们听到了反馈,这个功能没达到预期,所以不再提供了。”不过要注意,被撤下的只是”@ 公共账号生成图像”这一项,Muse Image 本身还能在 Meta AI、Instagram Stories 和 WhatsApp 里继续用。

    Meta Muse Image 的 @ 提及功能
    用 @ 就能把公开账号的内容拉进 AI 生成图(图:The Verge)

    真正的争论在”同意”两个字

    这起翻车背后,是一场关于”Opt-in 还是 Opt-out”的拉锯。Meta 选了后者:默认你同意,不想被用就自己去关。可当用户对自己形象的控制权,取决于他是否碰巧发现了那个隐藏开关,这套逻辑本身就站不住脚。

    • 演员公会主张,数字分身这类事必须”显式同意”,而不是事后退出;
    • 反剥削组织指出,把伦理风险从设计公司转嫁到使用者头上,是硅谷反复出现的老毛病;
    • 而随着 AI 图像、视频越来越难用肉眼分辨,隐形水印和内容标签也只是杯水车薪。

    有意思的是时间线。从官宣到撤回,前后不过四天。放在几年前,一个功能引发争议、公司再慢慢评估,往往是以”周”甚至”月”计的。2026 年的舆论场,反应速度快到可以用天来量。Meta 砸重金重建 AI 实验室、和 OpenAI、Anthropic 贴身肉搏的当口,这一跤摔得不算轻,但也算给全行业提了个醒:把别人的脸塞进 AI 之前,先问一句”你愿意吗”,大概不该是 optional。

  • 开源AI抢走流量,Anthropic凭什么还在赚大钱

    一个反直觉的现象

    上周,客服 AI 公司 Decagon 的 CEO Jesse Zhang 发了一篇长帖,标题很嚣张:”大家都搞错了企业里的开源 AI”。他抛出一个挺有意思的矛盾:在自己公司里,越来越多成熟的业务正在切到更轻量的模型上,可花在那些最贵的前沿模型上的总预算,几乎一点没少。

    这跟很多人预想的不一样。按常理,开源模型又免费又能自己部署,前沿实验室早该被冲得七零八落。但 Zhang 认为,这俩根本不是对手,更像是同一个生命周期里的两个阶段。

    前沿实验室会继续握着”发现”,开源则会一点点吃掉”生产”。

    用大白话说就是:先用贵的前沿模型把一个新场景跑通、验证它能赚钱,等路子熟了,再挪到便宜的开源模型上规模化。前端探路,后端量产,各司其职。

    数据摆出来,前沿真没吃亏

    Zhang 没给太多数据,但这种数据其实到处都是。Vercel 的 AI 网关看板显示,就这一周,DeepSeek 的 Token 量已经冲到全平台的三分之一以上,背后是 GLM-5.2 的 Z.ai 也挤进了第四。可往下滑到”总支出”那栏,Anthropic 一家还是占了半壁江山。

    OpenRouter 的故事也差不多。DeepSeek V4 Flash 每周处理 5.3 万亿 Token,是最忙的;而最火的前沿模型 Opus 4.8 才 2 万亿出头。但 Opus 每百万 Token 要 1.37 美元,V4 Flash 只要 6 美分,贵了快 23 倍。算下来,花钱的大头还是落在前沿模型手里。连英伟达刚放的 Nemotron 都还没算进去。

    开源AI与前沿模型的双层经济
    开源模型吃下了流量,前沿模型守住了利润(图:TechCrunch)

    为什么开源赢不了”钱”

    一种解释是,AI 能干的活儿增长得太快了,前沿模型只要卡住早期那些最难、最值钱的部署,就能一直待在牌桌上。另一种解释更实在:很多场景就是太难,便宜模型暂时顶不上。

    • 垂直类 AI 公司确实在往轻量模型迁移,这条预言已经应验;
    • 但”GPT 套壳”类创业公司的账,算下来还是稳的;
    • 最关键的是,按 Token 算,前沿厂商死死攥住了最值钱的”溢价 Token”价格。

    作者想起去年九月自己写过的一个比方:基础模型公司到最后可能变成给星巴克供咖啡豆的——自己是商品原料,利润全被应用层赚走。现在看,这个预言只兑现了一半。


    所以眼下的格局,很可能不是”开源干掉前沿”,而是两套玩法长期并存:前沿负责开荒,开源负责量产。只要 AI 能做的事情还在指数级扩张,两边就都还有饭吃。至于这个平衡能维持多久,大概得看下一个更难啃的场景,到底落在谁手里。

  • DeepMind CEO呼吁设立独立机构,监管最强AI模型发布

    给最强模型找个”上市前审查员”

    前沿 AI 模型发布前,到底谁来把关?Google DeepMind 的 CEO 戴密斯·哈萨比斯这周在 X 上发了一篇长文,抛出了一个相当具体的答案:参照金融业的 FINRA,成立一个独立的”标准机构”,在最强模型向公众开放之前,先替大家把危险试出来。

    哈萨比斯把这篇框架文章命名为《前沿 AI 的框架,与一个新时代的开端》。他的设想是:最初,做前沿模型的实验室可以自愿在发布前最多 30 天,把模型交给这个标准机构做评测;一旦评估流程被证明靠谱,就会顺势变成强制要求——通不过,就不能在美国市场部署。发布之后要是冒出严重漏洞,实验室也得配合机构一起修。

    DeepMind CEO Demis Hassabis
    Google DeepMind CEO 戴密斯·哈萨比斯(图源:TechCrunch / Getty Images)

    “这个办法的好处是,它技术上聚焦,同时又不压制创新,还能奖励负责任的做法。”哈萨比斯坦言,机构要跟得上领域加速,并能在风险变大时加码。

    绕开”AI 版 FDA”的政治死结

    AI 监管在美国至今是个烫手山芋。白宫 AI 顾问、a16z 合伙人 Sriram Krishnan 前不久就把话挑明了:行政体系里”不会有 AI 的 FDA”。把标准机构设计成 FINRA 那样的自监管组织,恰恰是给这个分歧留了条缝——它既有约束力,又不用新设一个联邦部门。

    按哈萨比斯的构想,这个机构由开源代表和业内技术专家组成,资金来自各家 AI 实验室,还可以把某些评测外包给专门盯特定风险的 AI 安全小组。测试重点也很明确:网络攻击、生物威胁,以及模型试图绕开自身护栏的”欺骗”行为。

    到底是真能管住最强模型,还是最后变成大玩家们学会”应付考试”的又一处场子,现在谁也给不了答案。但至少在”模型上线前该有人先看一眼”这件事上,行业里最有分量的那几位,似乎正在慢慢达成共识。

  • OpenAI首款硬件曝光:一台会自己动的无屏AI伴侣音箱

    一台会自己动的”伙伴”

    OpenAI 一直说想做硬件,但到底长什么样,外界猜了快一年。这周彭博给出了一版听起来相当具体的描述:它的第一台设备,很可能是一个没有屏幕、能自己在屋里挪动的智能音箱,内部定位是”住在你家里的、像人一样的 AI 伴侣”。

    据彭博周二报道,这台设备还在开发中,被叫做 ChatGPT 的”实体化身”。它不是一个普通智能音箱的换皮——消息人士说它有自己的”性格”,会随着时间主动去了解主人,接入你的邮件之类的数字生活,提供的服务越来越个性化。最出戏的一处描述是,它带有”能自行运动的机械部件”,设计目标就是让人觉得它像个伙伴,而不只是一台机器。

    OpenAI 首款 AI 硬件设备设想图
    OpenAI 首款硬件设备的设想图(图源:TechCrunch / Getty Images)

    一边打官司,一边把第一款硬件的轮廓抛出来,OpenAI 这一步走得相当大胆。它想证明自己不只是个 App,而是要把 ChatGPT 从屏幕里搬进客厅。

    苹果在门外,资本在门外

    负责这件事的团队里,有不少是从苹果出来的老将,当年 iPhone 和 Mac 就是他们参与打造的。这个履历现在反而成了麻烦:就在上周,苹果正式起诉 OpenAI 窃取商业机密,并且放话称目前的指控”只是冰山一角”。OpenAI 当然否认了。彭博援引知情人士称,OpenAI 内部认为新产品和苹果市面上的任何东西差异都很大,”不太可能侵犯苹果的商业机密”。

    OpenAI 不是唯一盯上这块的人。由 Brett Adcock 创立的 AI 实验室 Hark,今年 5 月就拿到了超额认购的 7 亿美元 A 轮,估值冲到 60 亿美元,要做的是所谓”个人智能”——自研模型配定制硬件,做成人和机器之间的”通用接口”。连产品长什么样都还没公布,资本已经先涌进来了。

    说到底,这款会动的音箱能不能成,取决于它能不能真的像一个”伙伴”那样有用,而不是又一个摆在架子上吃灰的电子产品。但 OpenAI 显然已经下定决心,要把赌注押在”无屏、随身、有温度”的硬件路线上。

  • Open Design:开源版 Claude Design,把你的编码智能体变成设计引擎

    Open Design:开源版 Claude Design,把你的编码智能体变成设计引擎

    ⭐ 79.6K Stars  ·  Apache-2.0  ·  TypeScript  ·  本地优先桌面应用

    项目简介

    Open Design 是 Anthropic Claude Design 的开源替代方案——一个本地优先(local-first)的桌面应用,让你的 Claude Code / Codex / Cursor / Gemini 等编码智能体直接化身”设计引擎”,生成网页、桌面、移动端原型、实时仪表盘、演示文稿、图片与视频,并导出为 HTML / PDF / PPTX / MP4 真实文件。

    Open Design 工作台

    安装要求与过程

    环境要求

    • 桌面应用:macOS(Apple Silicon / Intel x64)、Windows(x64)、Linux(AppImage)——无需 Node / pnpm / 克隆仓库。
    • 自托管:Docker + Docker Compose;源码运行需 Node 24、pnpm 10.33.x。
    • 编码智能体:Claude Code、Codex、Cursor、Copilot、OpenClaw、Gemini、Hermes、Kimi、Trae、OpenCode 等 25+ 本地 CLI,或任意 OpenAI 兼容端点(BYOK)。

    快速安装

    1. 下载桌面应用(推荐,零配置):前往官网或 GitHub Releases 下载对应平台安装包;安装后自动检测 PATH 上的编码智能体,加载 100+ 功能技能、渲染模板目录与 151 套设计系统。
    2. 装进编码智能体(无界面)od mcp install <agent><agent> = claude | codex | cursor | copilot | gemini | hermes | kimi | trae | opencode …);或用托管脚本 curl -fsSL https://open-design.ai/install.sh | sh -s <agent>
    3. Docker 自托管
      git clone https://github.com/nexu-io/open-design.git
      cd open-design/deploy
      cp .env.example .env
      echo "OD_API_TOKEN=$(openssl rand -hex 32)" >> .env
      docker compose up -d
      # 打开 http://localhost:7456
    4. 源码运行
      git clone https://github.com/nexu-io/open-design.git
      cd open-design
      corepack enable && pnpm install
      pnpm tools-dev run web

    核心功能

    内置 151 套品牌级设计系统

    1. 智能体原生、模型无关:不绑定任何厂商 Agent,你 PATH 上已有的 claude / codex / cursor / copilot / hermes / kimi 就是设计引擎,一键切换;一条 od mcp install <agent> 把 MCP 服务器接入 25+ 编码智能体。
    2. 品牌级 DESIGN.md 设计系统:每一帧渲染都读取当前包的 DESIGN.md 作为品牌契约;仓库内置 151 套品牌级设计系统(Claude、Stripe、Figma、Apple、NVIDIA…),丢进文件夹即被识别。
    3. 多形态产物,单一项目:Studio 支持原型(web / desktop / mobile 单页)、实时仪表盘 / artifact、演示文稿(deck)、图片、视频与 HyperFrames 动态图形,统一导出 HTML / PDF / PPTX / MP4。
    4. 四层可组合:插件(可运行工作流)+ 功能技能(Agent 行为)+ 设计模板(渲染蓝图)+ 设计系统(品牌),全部用可移植、可版本化的目录,任何人都能创作与发布;官方 277 个插件 + 183 个可复用示例。
    5. 本地优先 + BYOK 隐私:原生桌面应用(macOS / Windows)+ Docker + Vercel;所有数据在你本机、团队服务器或部署项目里运行,BYOK 代理具备 SSRF 防护,沙箱 iframe 预览。

    Open Design 支持的 25 个编码智能体 CLI

    典型使用场景

    • 一句话生成落地页:在入口视图输入 brief,智能体结合 saas-landing 模板与 Linear 设计系统,流式生成带 hero / 特性 / 定价 / CTA 的可运行着陆页,直接导出 HTML 部署。
    • 实时数据仪表盘:用 dashboard 模板生成带侧边栏的管理 / 分析看板,作为 live artifact 实时刷新,而非静态截图。
    • 品牌统一的演示文稿:用 guizang-ppt / html-ppt 模板生成杂志风 Web PPT;或把现有 git 仓库 + DESIGN.md 交给智能体,自动把真实组件重构到品牌规范(含 Figma / Pencil → React / Next / Vue 迁移插件)。

    演示文稿 / Deck 产物

    插件与集成生态

    推荐理由

    作为天天和编码智能体打交道的人,最打动我的是它把”设计”从闭源付费的云端玩具,变成了你笔记本上的文件系统——你的 CLI 是引擎,笔记本是工作室,团队的 DESIGN.md 是品牌契约。相比 Claude Design 的封闭锁定,Open Design 的 agent-native + 模型无关 + Apache-2.0,让我可以随意换模型、自托管、调用 151 套现成设计系统,还能用 277 个插件把 Figma 工作流迁到 React。对想把”vibe coding”从代码延伸到 UI / 海报 / 演示的人来说,这是目前最完整、最开放的一个选择。

    下载地址

  • Reflection 签 10 亿美元算力大单:开源模型商的弹药库焦虑

    Reflection 与 Nebius 10 亿美元算力协议
    算力正在变成 AI 公司的战略物资(图源:TechCrunch)

    开源模型公司 Reflection AI 最近像在囤弹药一样,连续签下大笔算力合同。7 月 14 日,这家估值 250 亿美元的美国初创公司宣布,和欧洲 AI 基础设施厂商 Nebius 签下一份价值 10 亿美元的算力协议。

    拿到的是英伟达最新的芯片

    Nebius 的前身是俄罗斯科技巨头 Yandex 的国际业务,这次它会把英伟达最新一代芯片的使用权交给 Reflection。有意思的是,这已经是 Reflection 几周里第二笔大型算力交易了——上一份是和 SpaceX 拿计算资源。两家公司都在抢同一件东西:训练和部署模型所需要的算力。

    当特朗普政府上个月施压 Anthropic 和 OpenAI 限制最强模型,业界开始担心模型访问权限可能被”一夜收回”。加上中国开源模型越来越能打,主流市场对开源 AI 的兴趣被彻底点燃。

    为什么开源模型商比谁都怕算力断供

    Reflection 由两位前 Google DeepMind 研究员在 2024 年创立,已经从英伟达、红杉、Lightspeed 手里融了近 26 亿美元。它的处境正好戳中当下最热的争论:闭源旗舰模型到底值不值那个价?当数据留存顾虑和政府干预一起涌上来,能自己掌控权重、不受制于单一厂商的开源路线,突然成了香饽饽。

    Nebius 才是幕后那个大赢家

    • 拿到英伟达 20 亿美元投资后,Nebius 转头就和 Meta 签了最高 270 亿美元、为期五年的基础设施协议。
    • 去年它跟微软也签了最高 194 亿美元的多年的协议。
    • 从 Yandex 拆分出来后,Nebius 几乎成了各大 AI 实验室的”算力二道贩子”。

    算力正在变成一种战略物资,谁先把芯片和机房锁死,谁就握住了下一代模型的命门。Reflection 连签两单,表面上是为了训练和部署,底下其实是整个行业对”算力稀缺”的集体焦虑。

  • Hugging Face 被自主 AI 智能体攻破:1.7 万次操作,全程无人指挥

    AI 智能体攻破云服务器基础设施概念图
    一个自主 AI 智能体框架,正在改写基础设施安全的威胁模型(配图由 AI 生成)

    7 月 16 日,Hugging Face 发了一份让整个安全圈倒吸凉气的事件通报:他们的生产基础设施被攻破了。而动手的并不是某个躲在暗处的黑客团队,是一套完全自主运行的 AI 智能体框架,从头到尾把入侵跑完了。

    入口藏在最不起眼的数据管道里

    AI 平台有个别的公司没有的软肋——它们会替用户自动处理上传的数据集。攻击者就盯上了这条流水线:一个恶意数据集同时利用了两处代码执行漏洞,一处是能远程跑代码的加载器,另一处是数据集配置里的模板注入。处理节点被拿下之后,攻击框架一路提权到节点级别,顺手收割了云和集群的凭据,并在一个周末里横向渗透进多个内部集群。

    整个入侵过程没有收到任何一条人类指令,全是这个智能体自己在决策、自己行动。防御方对抗的不再是一个人,而是一个能自我编排、弹性伸缩的自动化对手。

    1.7 万次操作,防守方反而被护栏挡住

    更戏剧性的一幕发生在取证阶段。Hugging Face 自家的异常检测管道最早发现了异常,随后工程师把超过 1.7 万条攻击动作记录丢给 LLM 驱动的分析代理,几小时就拼出了完整时间线——这件事人工要干上好几天。可轮到调用商业前沿大模型继续深挖时,护栏直接把请求拦了:那些模型分不清提交真实漏洞载荷的事件响应人员,和一个正在作案的黑客,统统当成危险内容堵掉。团队最后只好切回部署在自己机房的开源权重模型 GLM 5.2。

    这次事件真正改变了什么

    • 机器学习平台的数据和模型接口,从”理论上的攻击面”变成了”已被证实的攻击面”。
    • 自主攻击者在机器速度上运转,不受人的疲劳和工作节律限制,一个周末就能跑完上万次操作。
    • 把命令控制架在公共服务上还能自动迁移,传统的签名检测基本失效。

    好消息是,Hugging Face 确认公共模型、数据集和 Spaces 没有被篡改,软件供应链也干净,只波及少量内部数据集和服务凭据。但这次披露给所有跑 AI 平台的团队提了个醒:与其临场指望调用商业 API 做应急,不如事先在自己环境里备好一个能力够用、又不受使用政策掣肘的模型。

  • 124K Star 的「AI 应用宝库」:awesome-llm-apps,100+ 个拿来即跑的 LLM / RAG 项目

    124K Star 的「AI 应用宝库」:awesome-llm-apps,100+ 个拿来即跑的 LLM / RAG 项目

    awesome-llm-apps 项目预览

    一、项目简介

    awesome-llm-apps 是一个收录了 100+ 个端到端测试过、Apache-2.0 协议的开源 AI Agent、Agent Skills 与 RAG 应用的精选仓库——clone、定制、上线,全部免费。它兼容 Claude、Gemini、GPT、DeepSeek、Llama、Qwen 以及各类本地开源模型,是当下 GitHub 上星标增长最快的 LLM 应用模板库之一(124K+ Star)。

    二、安装要求和过程

    环境要求

    • Python 3.8+(多数模板基于 Streamlit / 各厂商官方 SDK)
    • 一个 LLM API Key(Claude / Gemini / GPT / DeepSeek / Llama / Qwen 均可,部分模板支持本地模型)
    • Git 与可联网环境

    快速开始(跑一个 Agent,约 30 秒)

    git clone https://github.com/Shubhamsaboo/awesome-llm-apps.git
    cd awesome-llm-apps/starter_ai_agents/ai_travel_agent
    pip install -r requirements.txt
    streamlit run travel_agent.py

    或者,给编码助手装一个 Skill(约 10 秒)

    npx skills add https://github.com/Shubhamsaboo/awesome-llm-apps/tree/main/agent_skills/project-graveyard

    模板每周持续更新;项目模型无关,支持 Ollama 等本地推理,方便对比与替换。

    三、核心功能

    1. 100+ 端到端验证的开源应用:不是 demo 片段,而是每个都能 pip install && run 的完整项目,统一 Apache-2.0,可商用可修改。
    2. 15 大场景全覆盖:从单文件 Starter Agent,到多智能体团队、语音 Agent、MCP 工具调用、RAG 检索、记忆、微调、生成式 UI,再到 Autonomous 游戏 Agent。
    3. Agent Skills 一键安装:把可复用能力直接装进 Claude Code / Codex / Cursor,每条 Skill 都带真实代码并通过「安全 + 评测」CI 门禁。
    4. 模型无关:Claude、Gemini、GPT、DeepSeek、Llama、Qwen 乃至本地模型通吃,方便横向对比。
    5. 自带框架速成课:Google ADK、OpenAI Agents SDK 的 Crash Course,边抄边学编排范式。

    Project Graveyard Agent Skill

    Project Graveyard —— 帮你复盘每个弃坑副业、并找出最值得捡回来的那个的 Agent Skill

    四、典型使用场景

    • 30 分钟搭一个 AI 应用:想做旅行助手、数据分析 Agent、博客转播客?直接 clone 对应 starter 模板、改个 API Key 即可运行。
    • 给编码助手加能力:团队要一个「Scope Creep Detector(范围蔓延检测)」或「Commit Archaeologist(提交考古)」?npx skills add 一行搞定,立刻在 Claude Code / Cursor 里可用。
    • 系统学习 RAG / 多智能体:仓库内含 20+ 个 RAG 教程与多智能体团队模板,即开即用,省去从零搭脚手架。

    Always-on HN Briefing Agent

    Always-on HN Briefing Agent —— 按日程巡逻、把每天值得看的 Hacker News 推送到 Slack / 邮箱的后台 Agent

    Insurance Claim Live Agent Team

    Insurance Claim Live Agent Team —— 基于 Gemini Live 的实时语音理赔 Agent 团队

    五、推荐理由

    对一个想动手做 AI 应用、又不想从零啃文档的人,这是目前质量最高、最「能跑」的 LLM 应用模板库之一。每个模板都是真实可运行代码,省去脚手架与踩坑成本;模型无关意味着你可以拿自己的 Key 直接试;Agent Skills 的设计尤其实用——把沉淀下来的工程能力变成可复用 Skill,正好契合当下 coding agent 的工作流。

    Self-Improving Agent Skills

    Self-Improving Agent Skills —— 用 Gemini + ADK 让 Skill 针对评测自我重写的进阶玩法

    唯一要注意的是:部分模板依赖特定商业模型的 API,跑之前看一眼 requirements.txt 与 README 里的模型说明即可。

    六、下载地址

  • 230美元一块发光键盘,OpenAI用它正式试探硬件市场

    OpenAI 这周悄悄迈出了做硬件的第一步:联合专业键盘厂牌 Work Louder,推出了一块售价 230 美元的发光小键盘 Codex Micro,专门配它的 AI 编程助手 Codex 用。

    说白了,这不是给你打字的常规键盘,而是一块放在主键盘旁边的”控制台”。OpenAI 现在能让你同时跑好几支 AI 编码智能体——那些半自主、能自己写代码、跑代码的机器人——而 Codex Micro 就是用来统管这群”数字员工”的。

    OpenAI 自己的说法是,有了这块 Micro,你就不用再掏手机或开桌面 App 去管智能体了,它就是你做”agentic 工作”的指挥台。

    键盘上到底有什么

    最显眼的是会发光的 Agent Keys,用不同颜色告诉你某个智能体现在是思考中、运行中、在等你,还是已经干完活了。Command Keys 可以自定义成常用快捷键,比如一键接受、拒绝,或者按住说话开新对话。旁边还有个平面摇杆,用来触发代码审查、排查报错、重构这类工作流。

    还有个旋钮,调的是”reasoning level”——也就是这支智能体在一件事上花多少时间和算力。往左拨快但浅,往右拨慢但想得深。所有这些都能在 ChatGPT 桌面端里改,连上蓝牙或 USB-C,Mac 和 Windows 都能用。

    OpenAI 与 Work Louder 联名的 Codex Micro 键盘
    OpenAI 与 Work Louder 联名的 Codex Micro 键盘,用实体按键和灯光管理 AI 编码智能体。

    先看个热闹,真硬件还在后头

    不过 OpenAI 自己跟 TechCrunch 说,Micro 只是限量联名款,更像是个噱头周边,不是冲着大众销量去的。真正重磅的硬件消息是另一桩:彭博爆料说 OpenAI 还在憋一个大件——一个便携、没屏幕、接入 ChatGPT 的智能音箱,而且带”能自己动的机械结构”。

    光看这几个词——没屏幕、能随身带、零件还会动——很难想象最后拼出来是个什么玩意儿,OpenAI 也不肯多说。彭博的说法是这东西还在开发中,随时可能变。但光这个雏形,就已经够让人浮想联翩了。

    麻烦的是,做硬件的偏偏是前苹果人

    更戏剧性的是,彭博提到这个音箱据称是由前苹果工程师设计的。而就在上周,苹果刚把 OpenAI 告了,指控对方高层故意套取自己的机密信息,还拿去开发硬件产品。OpenAI 当然否认了。


    所以现在场面就有点微妙:OpenAI 一边卖着 230 块的发光键盘小试水,一边被苹果指控偷师做硬件。那块键盘更像是个宣告”我来了”的仪式感道具,而真正决定 OpenAI 能不能在硬件这条路上走远的,是那个还没露面的音箱,以及它和苹果这场官司怎么收场。