标签: 开源

  • llama.cpp:119.5K Stars!纯 C/C++ 打造的大模型本地推理引擎

    llama.cpp:119.5K Stars!纯 C/C++ 打造的大模型本地推理引擎

    llama.cpp:119.5K Stars!纯 C/C++ 打造的大模型本地推理引擎

    📝 项目简介

    llama.cpp 是一个用纯 C/C++ 实现、零外部依赖的大语言模型(LLM)推理引擎。它让你无需 Python 环境、无需昂贵显卡,就能在笔记本、树莓派甚至手机上高性能地运行 LLaMA、Qwen、Gemma、Mistral 等主流开源模型——可以说,它是当下几乎所有「本地跑大模型」工具的底层基石。

    🌐 官网:https://llama.app

    📦 GitHub:https://github.com/ggml-org/llama.cpp

    ⭐ Stars:119.5K+

    📄 开源协议:MIT License

    💻 主要语言:C / C++

    💻 安装要求和过程

    环境要求

    • C/C++ 编译器:GCC / Clang / MSVC,支持 C++11 及以上
    • CMake 3.8+:从源码构建时需要
    • 可选 GPU 后端:CUDA(NVIDIA)、ROCm(AMD)、Metal(Apple Silicon)、Vulkan、SYCL 等,用于硬件加速
    • 可选 Python 3:仅用于模型格式转换脚本 convert_*.py
    • 支持平台:macOS / Linux / Windows,以及 iOS、Android、浏览器(WASM)等

    快速安装步骤

    方式一:包管理器一键安装(推荐新手)

    # macOS
    brew install llama.cpp
    
    # Windows
    winget install llama.cpp
    
    # Conda
    conda install -c conda-forge llama-cpp

    方式二:Docker 运行(自带 API 服务)

    docker run -p 8080:8080 -v ./models:/models \
      ghcr.io/ggml-org/llama.cpp:server -m /models/your_model.gguf

    方式三:从源码构建

    git clone https://github.com/ggml-org/llama.cpp
    cd llama.cpp
    cmake -B build
    cmake --build build --config Release

    快速开始:下载并运行一个模型

    # 命令行对话(自动从 Hugging Face 拉取 GGUF 模型)
    llama-cli -hf ggml-org/gemma-3-1b-it-GGUF
    
    # 启动 OpenAI 兼容的 API 服务(含简易 WebUI)
    llama-server -hf ggml-org/gemma-3-1b-it-GGUF --port 8080

    ✨ 核心功能

    1. 🪶 纯 C/C++ 零依赖,极致轻量

    不依赖 PyTorch、不依赖 Python 运行时,编译出一个二进制文件即可运行。极小的体积和无依赖特性,让它可以被移植到几乎所有计算设备——这正是它能跑在树莓派和手机上的根本原因。

    2. ⚡ 全平台硬件加速与混合推理

    针对 Apple Silicon(Metal / ARM NEON)、x86(AVX2 / AVX-512 / AMX)、RISC-V 等架构做了深度优化;支持 NVIDIA(CUDA)、AMD(ROCm)、摩尔线程(MUSA)、Vulkan、SYCL、OpenCL 等多种后端。CPU+GPU 混合推理甚至能运行超过显存容量的超大模型。

    3. 🗜️ GGUF 格式与 1.5~8 bit 量化

    模型统一封装为 GGUF 格式,并支持从 1.5-bit 到 8-bit 的整数量化。量化后显存与内存占用大幅下降,让消费级显卡甚至纯 CPU 也能流畅运行 70B 级别的大模型。

    4. 🔌 OpenAI 兼容 API 服务

    llama-server 提供与 OpenAI 完全兼容的 /v1 接口,并自带简易 WebUI。你现有的基于 OpenAI SDK 的应用几乎零改动就能切换到本地模型,彻底摆脱对云服务的依赖。

    5. 🧰 丰富的推理工具链

    内置 llama-bench(性能基准测试)、llama-perplexity(困惑度评估)、llama-quantize(模型量化)以及基于 GBNF 语法的约束解码(强制输出 JSON / 特定格式),覆盖从评测到生产的完整链路。

    🎯 典型使用场景

    场景一:在笔记本 / 手机上本地聊天,隐私数据不出端

    下载一个量化后的 Qwen 或 Gemma 模型,用 llama-cli 即可在断网环境下与 AI 对话。所有数据都在本地处理,特别适合处理合同、代码、笔记等敏感内容。

    场景二:自建私有 OpenAI 兼容推理服务

    在内网或离线环境中启动 llama-server,把本地模型包装成标准 API。前端应用、RAG 系统、Agent 框架(如 LangChain、Dify)都能直接对接,既保证数据合规,又省下云推理费用。

    llama-server -m models/qwen2.5-7b-instruct-q4_k_m.gguf --port 8080

    场景三:边缘设备与嵌入式部署

    在树莓派、工控机、车载设备上编译运行 llama.cpp,为 IoT 场景提供离线语音助手、本地知识问答等能力。配合量化技术,几百 MB 内存即可驱动一个可用的小模型。

    💡 推荐理由

    作为一名经常折腾本地大模型的开发者,我对 llama.cpp 的感情可以用「基石」二字形容。在它出现之前,想本地跑一个开源模型意味着安装几十 GB 的 PyTorch 环境,且基本只能在高端显卡上跑;llama.cpp 用纯 C/C++ 把这件事拉到了「人人可玩」的门槛。

    我的几点使用心得:

    • 它是整个生态的地基:Ollama、LM Studio、Jan、Open WebUI 乃至无数上层应用,底层推理几乎都调用了 llama.cpp。理解它,就理解了「本地 AI」的半壁江山。
    • 量化是性价比之王:7B 模型用 Q4_K_M 量化后体积不到 5GB,在普通笔记本上就能达到可用速度,是入门本地模型的最佳起点。
    • OpenAI 兼容接口太省心:一条 llama-server 命令就把本地模型变成标准 API,让我能把线上项目无痛切换到离线环境做.demo或内网部署。
    • 更新极快、社区极活跃:几乎每周都有新后端、新量化方法的合并,119K+ 的 Stars 背后是庞大而健康的贡献者群体。

    如果你想真正搞懂「大模型是怎么在本地跑起来的」,llama.cpp 是 2026 年依旧最值得 clone 一份源码、逐行读一读的开源项目。

    📥 下载地址

    🌐 官方网站:https://llama.app

    📦 GitHub 仓库:https://github.com/ggml-org/llama.cpp

    📚 官方文档:github.com/ggml-org/llama.cpp/docs

    🤗 GGUF 模型库:huggingface.co/ggml-org

    🐳 Docker 镜像:ghcr.io/ggml-org/llama.cpp


    📌 本文是《GitHub 热门 AI 开源项目》系列的第 95 期,每期介绍一个热门的 AI 开源项目。欢迎关注本栏目,获取更多优质开源项目介绍!

  • ai-website-cloner-template:AI 一键克隆任意网站,26K+ Stars 让网站逆向工程变得全自动

    ai-website-cloner-template:AI 一键克隆任意网站,26K+ Stars 让网站逆向工程变得全自动

    ai-website-cloner-template:用 AI 编程助手一键克隆任意网站

    📌 项目简介

    ai-website-cloner-template 是一个可复用的开源模板,让你用一条命令、借助任意 AI 编程助手,将任何网站逆向工程为干净、现代的 Next.js 代码库——相当于给 AI 下了个「克隆这个网站」的指令,它就能把设计令牌、组件结构、交互逻辑全部还原出来。

    ⭐ GitHub Stars:26,229+
    🏷️ 开源许可:MIT(免费商用)
    💻 主要语言:TypeScript(Next.js 16 + React 19)
    🤖 支持 AI 助手:13 款(Claude Code / Codex / Cursor / Windsurf 等)

    ⚙️ 安装要求和过程

    环境要求

    • Node.js 24+(必需,项目使用 Next.js 16 App Router)
    • 一个 AI 编程助手(推荐 Claude Code,也支持 Codex CLI / Cursor / Windsurf 等 13 款)
    • Git(用于多 worktree 并行开发)

    快速安装步骤

    1. 从模板创建自己的仓库
      在 GitHub 页面点击 Use this templateCreate a new repository
    2. 克隆到本地
      git clone https://github.com/YOUR-USERNAME/YOUR-NEW-REPOSITORY.git
      cd YOUR-NEW-REPOSITORY
    3. 安装依赖
      npm install
    4. 启动 AI 助手(推荐 Claude Code)
      claude --chrome
    5. 开始克隆网站!
      /clone-website https://example.com

    Docker 方式(可选):

    docker compose up app --build   # 构建并运行应用
    docker compose up dev --build    # 开发模式,端口 3001

    🌟 核心功能

    ① 13 款 AI 编程助手全覆盖

    无论你用的是哪款 AI 编程工具,都能直接上手。支持 Claude Code、Codex CLI、OpenCode、GitHub Copilot、Cursor、Windsurf、Gemini CLI、Cline、Roo Code、Continue、Amazon Q、Augment Code、Aider 共 13 款,真正做到了「一次配置,到处运行」。

    ② 五阶段智能流水线

    克隆过程被精心设计为五个阶段,模拟专业前端工程师的工作流:

    • 侦察阶段:自动截图、提取设计令牌(颜色/字体/间距)、扫描交互行为(滚动/点击/悬停/响应式)
    • 基础构建:更新字体、颜色、全局样式,下载所有静态资源
    • 组件规格:为每个组件编写详细规格文件(含精确 CSS 计算值、状态、行为、内容)
    • 并行构建:在独立 git worktree 中分派多个构建代理,每个代理负责一个 section/component,极大加速生成
    • 组装与 QA:合并 worktree,连接页面,与原始网站进行视觉差异对比

    ③ 多 URL 并行处理

    传入多个 URL,系统自动并行处理,每个站点输出隔离,互不干扰。非常适合克隆拥有多个子页面的完整网站。

    /clone-website https://example.com https://example.com/about https://example.com/pricing

    ④ 单一真相来源架构

    采用 AGENTS.md.claude/skills/clone-website/SKILL.md 作为源文件,通过同步脚本自动生成各平台(Claude Code / Cursor / Windsurf 等)的配置文件,避免多平台维护的噩梦。

    bash scripts/sync-agent-rules.sh   # 重新生成代理指令文件
    node scripts/sync-skills.mjs       # 重新生成所有平台的 /clone-website 技能

    ⑤ 生产级技术栈

    生成的代码库本身就是高质量成品:

    • Next.js 16(App Router)+ React 19 + TypeScript strict
    • shadcn/ui(Radix primitives)+ Tailwind CSS v4
    • Lucide React 图标(克隆时自动替换为提取的 SVG)
    • 内置 npm run check(lint + typecheck + build)完整质量检查链

    🚀 典型使用场景

    场景一:平台迁移

    你的网站跑在 WordPress / Webflow / Squarespace 上,想迁移到现代化的 Next.js 技术栈,但舍不得原有的设计和交互细节。ai-website-cloner-template 可以完整克隆原站的外观和交互,生成一个干净的 Next.js 项目,你可以在此基础上继续开发,告别笨重的旧平台。

    场景二:丢失源码的网站恢复

    网站还在运行,但代码库早已丢失(或者前开发者跑路了)。只要网站还能访问,就能用它逆向生成完整的 Next.js 源码。虽然不能保证 100% 还原(特别是复杂的后端交互),但前端部分可以还原到惊人的精度。

    场景三:学习生产级前端实现

    看到一个网站的布局、动画或响应式实现特别惊艳,想研究它是怎么做的?与其对着 DevTools 一行行扒代码,不如直接让 AI 克隆一份,然后在生成的代码库里慢慢研究。相当于有了一个「可运行的解构说明书」。

    💡 推荐理由

    作为前端开发者,我曾经多次遇到「这个网站的某个交互效果真好,我想知道它是怎么实现的」的情况。传统做法是在浏览器 DevTools 里对着压缩过的 CSS 和 JS 猜谜,效率低得令人发指。

    ai-website-cloner-template 最让我惊艳的地方在于它把「克隆网站」这个复杂任务分解成了 AI 助手真正擅长的子任务:侦察、提取设计令牌、编写组件规格、并行构建。整个流程设计得非常专业,不是简单的「让 AI 写代码」,而是模拟了一个资深前端工程师的工作流程。

    特别值得一提的是 并行构建 阶段——它利用 git worktree 让多个 AI 代理同时工作,每个代理负责不同的组件,最后再合并。这个设计既聪明又实用,大大缩短了等待时间。

    当然,这个项目也有局限性:它主要处理前端部分,动态后端逻辑无法完整还原;对于高度依赖状态的复杂 SPA,还原精度会有所下降。但作为「前端快速原型 + 设计逆向学习」工具,它已经远超我的预期。

    如果你正在考虑从旧平台迁移、需要快速做网站原型、或者单纯想学习优秀网站的前端实现,这个项目绝对值得一试。

    ⚠️ 使用提醒:请遵守法律法规和网站服务条款。不要将克隆的网站用于钓鱼、冒充或侵犯他人知识产权。项目作者也明确列出了不允许的用途。

    📥 下载地址


    本文由 AI 自动生成 · 数据来源 GitHub Trending · 如有错误或遗漏欢迎指正

  • Hermes Agent:会自我进化的开源 AI 智能体,Nous Research 出品,60000+ Stars 让 AI 真正成为你的数字分身

    Hermes Agent:会自我进化的开源 AI 智能体,Nous Research 出品,60000+ Stars 让 AI 真正成为你的数字分身

    Hermes Agent Banner

    Hermes Agent —— 会自我进化的开源 AI 智能体

    项目简介

    Hermes Agent 是由 Nous Research 开发的开源自主 AI 智能体框架,采用 MIT 协议完全免费。它的核心定位是:一个部署在你自己服务器上、能随你一起成长的持久化个人 AI 智能体

    与传统 AI 聊天机器人不同,Hermes Agent 是一个独立运行的后台守护进程,具备三大核心特性:自托管(数据完全本地化)、持久化(跨会话记忆)、自我进化(从经验中自动创建和改进技能)。


    安装要求和过程

    环境要求

    依赖 说明
    Python 3.11+ 主运行环境(安装器自动处理)
    Node.js 部分功能依赖(安装器自动处理)
    ripgrep 代码搜索(安装器自动处理)
    ffmpeg 语音备忘录转录(安装器自动处理)
    Git Bash Windows 上安装器会捆绑便携版 MinGit(约 45MB)

    支持平台:Linux ✅ / macOS ✅ / WSL2 ✅ / Windows (PowerShell) ✅ / Termux (Android) ✅

    一键安装

    Linux / macOS / WSL2:

    curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash
    source ~/.bashrc
    hermes

    Windows(PowerShell):

    iex (irm https://hermes-agent.nousresearch.com/install.ps1)
    hermes

    安装后配置

    hermes setup # 运行完整配置向导
    hermes model # 选择 LLM 提供商和模型
    hermes tools # 配置启用的工具
    hermes gateway # 启动消息网关

    核心功能

    1. 真正的终端 TUI 界面

    Hermes Agent 提供完整的终端 UI(TUI),支持多行编辑、斜杠命令自动补全、对话历史浏览、中断重定向、流式工具输出。不是简单的命令行包装,而是专为 AI 交互设计的终端体验。

    2. 多平台消息集成

    通过一个网关进程统一管理,支持 14+ 消息平台:Telegram、Discord、Slack、WhatsApp、Signal、CLI 等。支持语音备忘录转录、跨平台对话连续性——你在 Telegram 上的对话,可以在 Discord 上继续。

    3. 闭环学习系统(核心竞争力)

    这是 Hermes Agent 最独特的功能:

    • 自主技能创建:完成复杂任务(通常涉及 5 次以上工具调用)后,自动将成功的工作流程提炼为可复用的”技能”(Skill)
    • 技能自我改进:技能在使用过程中会自动优化
    • FTS5 会话搜索 + LLM 摘要:实现跨会话回忆
    • Honcho 辩证用户建模:持续构建对用户的深度理解模型
    • 兼容 agentskills.io 开放标准

    4. 定时自动化

    内建 cron 调度器,可向任意平台投递消息。用自然语言配置每日报告、夜间备份、每周审计等定时任务,无需编写代码。

    5. 多环境运行 + 子代理并行化

    支持六种终端后端:local、Docker、SSH、Singularity、Modal、Daytona。Daytona/Modal 提供无服务器持久化,空闲时休眠几乎零成本。

    可生成隔离子代理处理并行工作流;编写 Python 脚本通过 RPC 调用工具,将多步流水线压缩为零上下文成本轮次。


    典型使用场景

    场景一:个人 AI 助手(消息平台接入)

    通过 Telegram/Discord/Slack 等平台,随时随地与你的 AI 智能体对话。它记住你上周告诉它的项目偏好,能回忆起你三个月前让它执行的任务细节。用得越久,它就越了解你。

    场景二:开发辅助 + 定时自动化

    在终端中使用 TUI 进行交互式编程辅助,运行 shell 命令、管理项目。同时配置定时任务:每日自动生成工作日报、夜间备份代码仓库、每周审计服务器安全状态——全部无人值守自动执行。

    场景三:从 OpenClaw 迁移

    Hermes Agent 自动导入设置、记忆、技能和 API 密钥,迁移成本极低。相比 OpenClaw,Hermes Agent 的自我进化能力技能系统是核心差异化优势。


    推荐理由

    Hermes Agent 代表了 AI Agent 发展的一个重要方向:从”一次性工具”走向”持久化伙伴”

    我推荐它的理由:

    • 数据主权:部署在自己的机器上,SQLite 本地存储,不经过任何第三方云服务
    • 真正能成长:用得越久越聪明,技能系统让它能从经验中学习
    • 零成本运行:支持 Ollama 本地模型,可以完全免费运行
    • 多平台接入:通过消息 App 随时随地使用,不需要打开电脑
    • MIT 协议:完全开源,可以自由修改和商用

    小提示:Nous Research 是开源 AI 社区中声誉极高的研究机构,他们此前发布的 Hermes 系列开源模型(Hermes-2、Hermes-3)在 Hugging Face 上广受好评。Hermes Agent 可以看作是他们将多年技术积累打包成的开箱即用产品。


    下载地址

    来源 链接
    GitHub 仓库 github.com/NousResearch/hermes-agent
    官方网站 hermes-agent.nousresearch.com
    Nous Research nousresearch.com
    agentskills.io agentskills.io

    最低运行配置:2 核 CPU + 4GB RAM(推荐 4GB+ 以流畅运行 LLM)


    本文为 GitHub 热门 AI 开源项目系列第 93 篇。系列文章持续介绍最值得关注的开源 AI 项目,欢迎关注。

  • Continue:开源 AI 编程助手,让 VS Code 和 JetBrains 拥有最强大脑(34K+ Stars)

    Continue:开源 AI 编程助手,让 VS Code 和 JetBrains 拥有最强大脑(34K+ Stars)

    Continue:开源 AI 编程助手,让 VS Code 和 JetBrains 拥有最强大脑

    ⭐ 34K+ Stars
    TypeScript
    Apache-2.0
    持续维护中

    📌 项目简介

    Continue 是为 VS CodeJetBrains IDE 打造的开源 AI 编程助手,让开发者在熟悉的编辑器里直接获得代码补全、交互式聊天、代码编辑等 AI 能力。官网 slogan:“The easiest way to code with any LLM” —— 支持几乎所有主流大模型,本地、云端随意切换。

    🌐 官网continue.dev
    📦 安装VS Code / JetBrains Marketplace 搜索 “Continue”
    🔑 许可Apache-2.0

    🔧 安装要求和过程

    环境要求

    • VS Code 1.70+ 或 JetBrains IDE(IntelliJ / PyCharm / WebStorm 等)
    • 支持 Windows / macOS / Linux 三平台
    • 网络连通(用于下载模型或连接云端 API)
    • 本地运行需要 Ollama 等本地 LLM 工具(可选)

    快速安装(3 步搞定)

    1. 安装插件:在 VS Code 扩展市场或 JetBrains Plugin 市场搜索 Continue,一键安装
    2. 选择模型:打开 Continue 侧边栏,选择你想用的模型(云端 API 或本地 Ollama)
    3. 开始编码:在编辑器中选中代码,按快捷键唤醒 AI,或直接聊天提问
    💡 快速体验:不想配置 API Key?先装个 Ollama,在 Continue 里选一个本地模型,零成本跑起来!

    🎯 核心功能

    1. 智能代码补全(Autocomplete)

    基于上下文的多行代码补全,比传统补全更懂你的意图。支持主流编程语言,响应速度经过专门优化,打字如飞不卡顿。

    2. 交互式聊天(Chat)

    在侧边栏和 AI 对话,支持引用当前文件、选中代码、整个项目上下文。可以问 “这段代码什么意思?”、”帮我优化这个函数”、”写一个单测” 等,AI 直接给出代码建议。

    3. 编辑与重构(Edit)

    选中代码后,用自然语言描述你想做的修改,Continue 直接在编辑器里帮你改好。支持多文件编辑、批量重构,是日常开发最高频使用的功能。

    4. 模型自由切换

    支持 100+ LLM 提供商:Anthropic Claude、OpenAI GPT、Google Gemini、本地 Ollama、自托管 vLLM……一套界面,随意切换。企业可以用自己的模型,个人开发者可以零成本用本地模型。

    5. 上下文理解(Context Awareness)

    Continue 不只是 “聊天框里的 AI”,它能理解你的项目结构、当前文件、选中的代码,甚至整个代码库。支持 @files@folders@code 等快捷引用,让 AI 精准理解你的意图。

    🚀 典型使用场景

    场景一:快速理解遗留代码

    接手一个陌生项目,面对几千行没注释的代码一头雾水?选中整个文件,问 Continue:”这个文件的核心逻辑是什么?有哪些潜在问题?” 几秒钟就能获得清晰的解读,比自己啃代码效率高 10 倍。

    场景二:本地零成本 AI 编程

    不想把代码上传到云端?装个 Ollama,在 Continue 里选一个本地跑的开源模型(DeepSeek Coder、CodeLlama 等),所有代码处理都在本地完成,隐私 100% 可控,还不用花一分钱 API 费用。

    场景三:团队协作统一 AI 工作流

    Continue 支持配置文件(config.json)提交到代码库,团队所有人用同一套提示词、同一个模型,AI 辅助编码的效果可复现、可迭代,从 “个人玩具” 升级为 “团队生产力工具”。

    💎 推荐理由

    作为每天和代码打交道的开发者,我对 Continue 的评价就三个字:真的香

    最打动我的是它的 模型无关设计。不像有些 AI 编程工具绑定特定厂商,Continue 把选择权完全交给你——想用 Claude 写复杂逻辑、用本地模型做快速补全、用 GPT 做代码 review,全在一个插件里搞定,不用在不同的工具之间反复横跳。

    另一个亮点是 开源透明。Apache-2.0 许可,代码完全公开,不用担心 “哪天服务商涨价或者跑路”。而且开源社区非常活跃,几乎每周都有新功能发布,Issue 响应速度也很快。

    当然也有不足:模型切换的配置界面对新手不太友好,第一次用的时候需要花点时间搞清楚怎么添加自定义模型。但一旦配置好,日常使用体验非常流畅,已经成了我写代码时离不开的工具。

    如果你在用 VS Code 或 JetBrains,还没试过 Continue,强烈建议花 5 分钟装一下 —— 它可能会改变你写代码的方式。


    📦 下载地址

  • Orca:AI智能体并行编排IDE,让100x开发者同时驾驭5个AI编程助手(12,485 Stars)

    Orca:AI智能体并行编排IDE,让100x开发者同时驾驭5个AI编程助手(12,485 Stars)

    🐳 Orca:AI智能体并行编排IDE,让100x开发者同时驾驭5个AI编程助手

    ⭐ 12,485 Stars

    The AI Orchestrator for 100x Builders

    📌 项目简介

    一句话介绍

    Orca 是一款专为 AI 编程时代打造的智能体编排 IDE,让你在同一个界面中并排运行 Codex、Claude Code、OpenCode、Pi 等任意终端 AI 编码代理,每个代理在独立的 git worktree 中隔离运行,所有任务统一跟踪管理。它还提供 iOS/Android 移动端配套应用,让你随时随地监控和引导代理运行。

    项目背景:在 AI 编程助手爆发的今天,开发者往往需要在多个 AI 工具之间来回切换——Claude Code 写代码、Codex 做代码审查、OpenCode 处理重构……每个工具都有各自的优势,但切换成本极高。Orca 的诞生就是为了解决这个问题:把多个 AI 代理统一到一个界面中并行调度,真正实现「1+1>2」的协同效应。

    核心定位:不是要替代现有的 AI 编程助手,而是做一个「智能体编排层」,让你可以同时使用所有最好的工具,并在它们之间灵活分配任务。

    🌐 官网:onorca.dev | 📦 GitHub:stablyai/orca | 📄 许可:MIT

    ⚙️ 安装要求和过程

    环境要求

    • 桌面端:macOS(Apple Silicon / Intel)、Windows 10+、Linux(AppImage / AUR)
    • 移动端:iOS 16+ / Android 10+
    • 依赖:需要已安装并配置好至少一款 AI 编程助手(Claude Code / Codex / OpenCode 等)
    • 远程开发:支持 SSH 连接到高性能服务器运行代理

    快速安装

    方式一:官网下载(推荐)

    # macOS Apple Silicon
    open https://github.com/stablyai/orca/releases/latest/download/orca-macos-arm64.dmg

    # macOS Intel
    open https://github.com/stablyai/orca/releases/latest/download/orca-macos-x64.dmg

    # Windows
    # 下载并运行: https://github.com/stablyai/orca/releases/latest/download/orca-windows-setup.exe

    # Linux AppImage
    wget https://github.com/stablyai/orca/releases/latest/download/orca-linux.AppImage
    chmod +x orca-linux.AppImage && ./orca-linux.AppImage

    方式二:Homebrew(macOS)

    brew install –cask stablyai/orca/orca

    方式三:Arch Linux(AUR)

    yay -S stably-orca-bin # 预编译版本
    # 或
    yay -S stably-orca-git # 从源码构建

    移动端安装

    无头 Linux 服务器

    # 在远程 Linux 服务器上运行 Orca 服务
    orca serve
    # 然后通过桌面端或移动端远程连接

    🌟 核心功能

    1. 并行 Worktree —— 5个代理同时干活

    把一个需求同时派发给 5 个 AI 代理,每个代理在独立的 git worktree 中运行,互相不干扰。你可以对比各个代理的输出结果,然后合并最优方案。这就像同时雇佣了 5 个初级工程师,而你是架构师,负责审查和决策。

    2. 移动端伴侣 —— 手机上监控 AI 干活

    Orca 提供 iOS 和 Android 原生应用,你可以在手机上实时查看代理的运行状态,代理完成时自动推送通知,还可以随时发送后续指令。早上躺在床上就能查看昨晚跑的代理结果,通勤路上就能给代理安排新任务。

    3. 设计模式 —— 点击 UI 就能生成提示词

    在真实的 Chromium 窗口中点击任意 UI 元素,Orca 会自动提取该元素的 HTML、CSS 和裁剪后的截图,直接作为上下文发送给 AI 代理。再也不用手动复制粘贴代码片段了,点击即提示。

    4. 原生 GitHub & Linear 集成 —— 不离开 IDE 就能完成 Code Review

    Orca 内置 GitHub 和 Linear 支持,你可以在应用内直接浏览 PR、issue、项目看板,从任意任务直接打开对应的 worktree,无需切换浏览器上下文。AI Diff 标注功能让你在代码 diff 上直接添加评论并反馈给代理,审查-编辑-提交一气呵成。

    5. SSH Worktree —— 在远程服务器上跑代理

    支持在远程高性能服务器上运行 AI 代理,包含完整的文件编辑、git 操作、终端能力,自带自动重连和端口转发功能。你的笔记本可以保持凉快,而代理在远程服务器的 GPU 上飞奔。

    6. 终端分屏 + 内置编辑器 —— Ghostty 级别的终端体验

    Orca 内置了类 Ghostty 的高性能终端,基于 WebGL 渲染,支持无限分屏,滚动历史记录重启后保留。同时内置 VS Code 级别的编辑器,支持全局自动保存、文件拖拽到代理输入框等效率功能。

    7. Orca CLI —— 脚本化所有工作流

    Orca 提供完整的 CLI 工具,支持通过命令行脚本化所有操作:orca worktree createorca snapshotorca clickorca fill 等,可以无缝集成到 CI/CD 流程中。

    Orca 并行代理编排界面

    Orca 主界面:并行运行多个 AI 代理

    💡 典型使用场景

    场景一:多模型对比选型

    需求:你需要实现一个复杂的认证模块,不确定用 JWT 还是 Session,也不确定哪个 AI 助手能给出最好的实现方案。

    方案:在 Orca 中创建 3 个并行 worktree,分别派给 Claude Code、Codex 和 OpenCode,让它们各自给出实现方案和代码。30 分钟后,你在 Orca 界面中对比三份代码的质量、可读性和完整性,选择最优方案合并到主分支。

    价值:原本需要轮流试用 3 个工具、花费 2 小时的工作,现在 30 分钟就能完成,而且还能直观对比各工具的输出质量。

    场景二:移动办公 + AI 辅助

    需求:你经常在通勤路上突然想到代码改进点,但拿出笔记本又不方便,等到了办公室又忘了。

    方案:在手机上打开 Orca 移动端应用,查看正在运行的代理状态,发送一条新的指令:「在用户登录模块添加记住我功能,参考现有的 session 管理代码」。代理在远程服务器上开始工作,完成后推送通知到你的手机。到达办公室时,代码已经在等待你审查了。

    价值:碎片化时间也能推进开发工作, idea 不会丢失,效率显著提升。

    场景三:Code Review 加速

    需求:团队 PR 数量多,Code Review 成为瓶颈,人工 Review 容易遗漏边界情况。

    方案:在 Orca 中打开 GitHub PR,使用 AI Diff 标注功能,让 AI 代理自动分析代码变更、发现潜在 bug、检查代码风格。你可以在 AI 分析结果的基础上做最终决策,Review 效率提升 5 倍以上。

    🎯 推荐理由

    💡 个人使用心得

    Orca 解决了一个被很多人忽略但非常痛点的问题:

    • 🤝 多工具协同:现在 AI 编程助手太多了,每个都有自己的强项。Claude Code 擅长架构设计,Codex 代码质量高,OpenCode 在特定语言上表现出色。Orca 让你可以同时「雇佣」它们,而不是「选择」其中一个。
    • 📱 移动端创新:大多数开发者工具都忽略移动端,但 Orca 把移动端作为一等公民对待。在手机上监控 AI 代理这个功能,对于经常需要「让 AI 在晚上跑任务」的开发者来说,简直是救命稻草。
    • 🔒 隐私友好:支持 SSH 远程 worktree,你的代码不需要离开自己的服务器,AI 代理通过 SSH 连接执行操作,符合企业安全规范。
    • 🚀 真正提效:并行 worktree 不只是「同时开多个终端窗口」这么简单,它的核心价值在于任务编排和结果对比。你可以把一个大任务拆成多个子任务分给不同代理,然后汇总最优结果。

    注意事项:Orca 本身不包含 AI 模型,你需要自己配置 Claude Code / Codex 等工具。另外,移动端需要和桌面端配对使用,初次配置需要一些学习成本。

    总的来说,Orca 是目前市面上第一个真正把「多 AI 代理并行编排」做到可用级别的 IDE。如果你已经在用 AI 编程助手,Orca 绝对值得一试。

    📥 下载地址


    📌 本文由 WorkBuddy AI 自动整理发布 | 数据来源:GitHub – stablyai/orca

  • RuView:用WiFi信号实现空间智能感知,零摄像头做生命体征监测,76.6K Stars让隐私优先的AI感知成为可能

    RuView:用WiFi信号实现空间智能感知,零摄像头做生命体征监测,76.6K Stars让隐私优先的AI感知成为可能

    📡 RuView

    用普通 WiFi 信号实现空间智能感知,零摄像头、零穿戴设备
    ⭐ 76,620+ Stars
    🦀 Rust 核心引擎
    📅 2025年创建
    📜 MIT 开源
    🔒 隐私优先
    🎯 项目简介
    RuView 是一个革命性的无接触式 WiFi 感知平台,由 ruvnet 团队开发。它利用普通商用 WiFi 信号(ESP32 芯片或家用路由器)实现实时空间智能、生命体征监测和人员存在检测——全程无需摄像头、无需可穿戴设备,从根源上杜绝隐私泄露风险。

    🚀 核心功能

    📍 空间感知

    • 穿墙人员检测(可穿透墙壁)
    • 多房间人数统计
    • 人员进出记录与追踪
    • 17 关键点人体姿态估计

    💓 生命体征监测

    • 无接触呼吸率检测(6-30 BPM,精度 ±1)
    • 心率监测(40-120 BPM)
    • 整夜睡眠监测 + 呼吸暂停筛查
    • 支持静坐、睡眠、运动状态

    🏠 智能家居集成

    • 原生支持 Apple HomeKit
    • 对接 Home Assistant(21 个实体)
    • 支持 Google Home / Alexa
    • 通过 Siri 查询房间状态

    🤖 AI 智能体集成

    • 标准 MCP 协议接口
    • 支持 Claude Code / Codex 调用
    • Python / TypeScript SDK
    • 105+ 开箱即用边缘模块

    ⚙️ 安装要求与环境

    项目 要求
    核心语言 Rust 1.85+(感知引擎)、Python 3.10+(SDK/脚本)
    硬件选项 ESP32-S3(~$9)/ ESP32-C6(~$6)/ 普通家用 WiFi 路由器
    内存要求 最低 512MB RAM(树莓派可运行)
    许可协议 MIT License(完全开源可商用)
    支持平台 Docker / macOS / Windows / Linux / Home Assistant

    📦 快速安装步骤

    方式一:Docker 快速体验(推荐新手)

    # 拉取官方镜像
    docker pull ruvnet/wifi-densepose:latest
    
    # 启动服务,访问 http://localhost:3000
    docker run -p 3000:3000 ruvnet/wifi-densepose:latest

    方式二:npm 包安装(AI 集成推荐)

    # 安装核心 CLI 工具
    npx -y @ruvnet/ruview
    
    # 安装智能体 MCP 服务包
    npx -y @ruvnet/rvagent

    方式三:Python SDK(二次开发)

    pip install ruview
    # 可选:安装 WebSocket + MQTT 客户端扩展
    pip install "ruview[client]"

    方式四:ESP32 硬件部署(最低成本 $9)

    # 1. 烧录固件(替换 COM9 为你的设备端口)
    python -m esptool --chip esp32s3 --port COM9 --baud 460800 \
      write_flash 0x0 bootloader.bin 0x8000 partition-table.bin \
      0xf000 ota_data_initial.bin 0x20000 esp32-csi-node.bin
    
    # 2. 配置 WiFi 和上报地址
    python firmware/esp32-csi-node/provision.py --port COM9 \
      --ssid "你的WiFi名称" --password "WiFi密码" --target-ip 上报服务器IP

    💡 典型使用场景

    场景一:智能家居无感联动

    将 RuView 接入 Home Assistant 后,可自动暴露 21 个实体(11 个原始信号 + 10 个语义状态),实现:

    • 🏠 人员存在触发:有人进入房间自动开灯、开空调
    • 😴 睡眠监测:检测入睡后自动关闭灯光、开启白噪音
    • 👴 老人看护:异常长时间无移动自动推送告警
    • 🚿 浴室占用:检测浴室有人时自动开启排气扇

    通过 Siri 可语音查询:”嘿 Siri,卧室有没有人?”

    场景二:隐私优先的安防监控

    传统安防摄像头存在隐私泄露风险,且无法穿墙感知。RuView 的优势:

    • 📡 穿墙感知:WiFi 信号可穿透木质/石膏板墙壁
    • 🔒 零视频采集:从根源上避免隐私泄露,符合 GDPR/HIPAA 监管
    • 🌙 黑暗环境工作:无需任何光照条件
    • 💰 极低成本:ESP32 芯片约 $9,远低于热成像方案

    配套边缘模块 intrusion(非法入侵检测)、perimeter-breach(周界入侵检测)可直接使用。

    场景三:AI 智能体调用(MCP 协议)

    在 Claude Code 中配置 RuView MCP 服务后,可直接通过自然语言查询:

    > "现在客厅有没有人?呼吸和心率正常吗?"
    > 智能体会自动调用 ruview.presence.now、ruview.vitals.get_all 接口返回结果。
    
    > "帮我统计今天各房间的人员进出记录"
    > 自动生成日报,包含各时段人员分布热力图。

    RuView 提供标准 MCP 接口,支持 Claude Code / Codex / Cursor 等主流 AI 编程助手。

    🌟 推荐理由

    为什么 RuView 值得关注?

    1. 🔬 技术原理极其优雅:利用 WiFi 信号在空间中传播的 CSI(信道状态信息),通过反射、折射和散射特征推断人体状态。整个过程完全在本地处理,原始 CSI 数据不会上传云端。
    2. 🔒 隐私保护从设计开始:与摄像头方案根本不同——RuView 不产生任何视频/图像数据。支持 BFLD 隐私分级,可配置仅输出匿名化结果。对于医院、养老院、卧室等隐私敏感场景,这是唯一合规的智能化方案。
    3. 💰 成本极低、部署简单:ESP32-S3 芯片约 $9,加上普通家用路由器即可搭建完整系统。Docker 一键启动,npm 包即装即用。相比毫米波雷达、热成像等方案,成本降低 10 倍以上。
    4. 🏠 智能家居生态原生支持:Apple HomeKit、Home Assistant、Google Home、Amazon Alexa 四大生态全覆盖。接入后自动暴露 21 个实体,配套 3 个 HA 自动化蓝图,真正实现”即插即用”。
    5. 🤖 AI 智能体时代的最佳拍档:提供标准 MCP 协议接口,可被 Claude Code、Codex 等各类 AI 智能体调用。预训练模型已发布在 HuggingFace(ruvnet/wifi-densepose-pretrained),开箱即用。

    个人使用心得:RuView 代表了一个重要趋势——空间计算 + 隐私优先的融合。在 AI 智能体全面渗透的 2026 年,RuView 让”感知层”变得触手可及。如果你在搭建智能家居、做健康监测产品、或研究 WiFi 感知技术,这个项目绝对值得深入研究。

    📥 下载地址

    📌 技术笔记

    • 项目仍处于 Beta 阶段,API 和固件可能会有变动
    • 预训练模型量化后最小仅 4KB,可在树莓派上微秒级运行
    • 提供 105 个开箱即用的边缘模块,涵盖健康、安防、楼宇、零售等场景
    • 支持 182 篇架构决策记录(ADR),适合学习系统设计
    • GitHub 趋势榜常客,14 天克隆量达 27,887 次

    标签: #RuView #WiFi感知 #空间智能 #智能家居 #隐私优先 #Rust #MIT许可 #AI开源

  • Meetily:隐私优先的AI会议助手,100%本地处理让敏感会议不再泄露,15.8K Stars让AI会议记录做到真正自托管

    Meetily:隐私优先的AI会议助手,100%本地处理让敏感会议不再泄露,15.8K Stars让AI会议记录做到真正自托管

    Meetily AI会议助手

    在远程办公与 AI 浪潮的双重推动下,会议记录工具已成为职场标配。但无论是 Otter.ai、Fireflies 还是其他主流工具,都有一个共同问题:你的会议内容会被上传到别人的服务器。对于金融、法律、医疗、政务等敏感行业,这显然是不可接受的风险。Meetily 给出了一个优雅的解决方案:让 AI 会议助手完全运行在你的本地设备上,100% 数据不出本机。


    🚀 项目简介

    Meetily(原名 Meetly AI)是 Zackriya Solutions 团队开发的开源 AI 会议助手,也是目前 GitHub 上 排名第一的自托管、开源 AI 会议记录工具。项目采用 Rust + Tauri 构建,前端基于 Next.js/React,支持 macOS 和 Windows(Linux 可编译),所有语音识别和 AI 总结均在本地完成,无需任何云端服务。

    核心亮点在于其转录引擎:默认采用 NVIDIA Parakeet 模型,比 Whisper 快 4 倍,同时支持 Whisper 系列模型作为备选。AI 总结部分可对接 Ollama(本地)、Claude、Groq、OpenRouter 或任意 OpenAI 兼容接口,真正做到灵活可控。

    📊 项目数据
    GitHub Stars: 15.8K+ |
    语言: Rust + TypeScript |
    许可证: MIT |
    最新版本: v0.4.0 (2026-06-05)


    ⚙️ 安装要求与过程

    🔧 系统要求

    • macOS:Apple Silicon 或 Intel 架构,需授予麦克风权限
    • Windows:Windows 10+,建议配备 Vulkan 兼容 GPU 以加速转录
    • Linux:支持 AppImage 打包,需自行编译
    • 内存:建议 8GB+(加载 Parakeet 模型约需 2-3GB)

    📦 快速安装(推荐方式)

    1. 访问 GitHub Releases 页面
    2. Windows 用户下载 x64-setup.exe 运行安装
    3. macOS 用户下载 meetily_0.4.0_aarch64.dmg,拖入应用程序文件夹
    4. 首次启动时会自动提示下载转录模型(约 500MB),可选择后台下载
    5. 在设置中配置 AI 总结提供商(推荐 Ollama 本地运行)

    💻 从源码构建(开发者方式)

    # 克隆仓库
    git clone https://github.com/Zackriya-Solutions/meetily.git
    cd meetily
    
    # 安装依赖(需要 Rust + Node.js + pnpm)
    pnpm install
    
    # 运行开发模式
    pnpm tauri dev
    
    # 构建生产版本
    pnpm tauri build

    💡 核心功能

    • 🎙️ 实时本地转写:采用 NVIDIA Parakeet 模型(比 Whisper 快4倍),支持说话人分离(Speaker Diarization),可区分不同参会者;支持多语言,修复了多字节字符截断问题
    • 🤖 灵活 AI 总结:支持 Ollama(本地)、Claude、Groq、OpenRouter 及任意 OpenAI 兼容接口;可自定义总结模板;支持流式生成,生成失败时可保留已生成内容
    • 🔒 100% 本地处理:所有录音、转写文本、AI 总结均存储于本地 SQLite 数据库(meeting_minutes.db),无需联网,无数据泄露风险
    • ⚡ GPU 加速:macOS 支持 Apple Silicon (Metal) + CoreML;Windows/Linux 支持 NVIDIA (CUDA)、AMD/Intel (Vulkan);编译时自动启用,无需额外配置
    • 📥 导入与增强(Beta):支持导入已有音频文件生成转写;可对已录制会议使用不同模型或语言重新转写,全部本地处理

    📦 典型使用场景

    🏢 场景1:金融/法律/医疗机构内部会议

    这些行业对数据合规有严格要求(如 GDPR、HIPAA),不能使用云端会议记录工具。Meetily 让 AI 会议助手完全运行在内网设备上,满足合规审计要求,同时享受 AI 自动生成会议摘要的便利。

    👨‍💻 场景2:远程团队协作记录

    支持 Zoom、Teams、Google Meet 等主流会议平台,可同时录制麦克风和系统音频,智能降噪,自动生成会议摘要。团队成员可各自运行 Meetily,会议记录完全私有,无需担心商业机密泄露。

    🔧 场景3:开发者技术讨论存档

    技术讨论中常涉及代码片段、架构决策等敏感信息。Meetily 本地转写后可导出为 Markdown 格式,直接存入团队知识库(如 Obsidian、Notion 本地版),结合 Ollama 本地运行 Llama 3 生成技术决策摘要,全程无需任何外部 API。


    ⭐ 推荐理由

    作为一名对隐私极其敏感的 AI 从业者,我对市面上的云端会议记录工具一直存有顾虑。Meetily 最大的价值在于:它让 AI 会议助手不再是一个「隐私换便利」的妥协方案。

    项目的 Rust + Tauri 技术选型也值得称赞:相比 Electron 框架,Tauri 打包体积小(约 50MB vs Electron 的 150MB+),内存占用更低,安全性更高。Parakeet 模型的集成更是一个亮点——NVIDIA 的这个模型在准确性和速度上都超越 Whisper,且完全本地可运行。

    MIT 许可证意味着你可以自由修改和分发,对于需要定制功能的团队来说非常友好。如果你在意数据主权,或者所在行业有合规要求,Meetily 是目前唯一值得认真考虑的开源方案。


    📧 下载地址


    💡 Tip: Meetily PRO 版本提供更高的转录精度、自定义摘要模板、PDF/DOCX 导出、自动会议检测和说话人识别等高级功能。社区版将永久免费开源,PRO 版面向需要企业级功能的团队。使用优惠码 LAUNCH20 可获得 20% 折扣。

  • page-agent:阿里巴巴出品的页面内JS GUI代理,一行脚本让网页拥有AI操控能力(23K+Stars)

    page-agent:阿里巴巴出品的页面内JS GUI代理,一行脚本让网页拥有AI操控能力(23K+Stars)

    page-agent Logo

    ## 项目简介

    **page-agent** 是阿里巴巴出品的 **JavaScript 页面内 GUI 代理**,让 AI 通过自然语言直接控制 Web 界面。其核心理念是 —— *”The GUI Agent Living in Your Webpage”*,即:智能体不再运行在外部脚本或 Python 环境中,而是**活在页面内部**,用纯 JavaScript 操作 DOM,实现真正的轻量化 AI 能力嵌入。

    亮点概要:一行脚本接入、无需浏览器插件、无需 Python 环境、无需截图 —— 纯页面内 JS 实现的 GUI 代理,让任何 Web 应用瞬间拥有 AI 操作能力。

    ## 安装要求和过程

    ### 环境要求
    – **浏览器**:任意现代浏览器(Chrome/Edge/Firefox/Safari)
    – **Node.js**:≥ 18(仅 NPM 安装方式需要)
    – **LLM API**:支持接入任意兼容 OpenAI API 格式的大模型(默认可使用阿里云百炼、OpenAI、DeepSeek 等)

    ### 快速安装(一行脚本体验)

    最简单的方式,在任意网页的 HTML 中插入一行 `



    ```

    插入后刷新页面,即可看到 page-agent 的演示界面(使用官方免费测试 LLM)。

    > ⚠️ 免费测试 API 仅用于技术评估,生产使用请接入自有 LLM API Key。

    ### NPM 安装(生产使用)

    ```bash
    npm install page-agent
    ```

    ```javascript
    import { PageAgent } from 'page-agent'

    const agent = new PageAgent({
    model: 'qwen3.5-plus',
    baseURL: 'https://dashscope.aliyuncs.com/compatible-mode/v1',
    apiKey: 'YOUR_API_KEY',
    language: 'zh-CN',
    })

    await agent.execute('点击登录按钮')
    ```

    ## 核心功能

    1

    极低接入成本 —— 一行脚本即可嵌入

    无需浏览器插件、无需 Python 环境、无需无头浏览器,纯页面内 JavaScript 实现,所有功能都在当前网页内运行。仅需一行 <script> 标签即可为任意 Web 应用接入 AI 控制能力,CDN 和 NPM 包双重分发。

    2

    轻量交互模式 —— 基于 DOM 操作,无需截图

    摒弃了传统 GUI 代理依赖截图 + 多模态大模型的重量级方案,page-agent 直接基于 DOM 结构理解页面,用文本描述操作指令。优势:延迟更低、成本更低、无需特殊权限、不依赖视觉大模型。

    3

    自定义大模型支持 —— 无绑定,完全开放

    支持接入任意兼容 OpenAI API 格式的自有 LLM,无厂商绑定。推荐使用阿里云百炼 qwen3.5-plus,也可接入 OpenAI GPT、DeepSeek、Gemini 等主流大模型,灵活适配企业已有 AI 基础设施。

    4

    扩展能力 —— Chrome 扩展 + MCP Server(Beta)

    可选安装 Chrome 扩展,支持跨多页面任务调度;同时提供 Beta 版 MCP Server,允许外部 AI 系统通过 MCP 协议控制浏览器,与主流 AI Agent 框架无缝集成。

    ## 典型使用场景

    ### 场景一:SaaS AI Copilot 快速接入
    仅需少量代码即可为 SaaS 产品接入 AI 助手,用户可通过自然语言操控产品界面,无需重写后端逻辑。例如:在 CRM 系统中,用户说"创建一个跟进任务并设置明天的提醒",page-agent 即可自动完成一系列 DOM 操作。

    ### 场景二:智能表单填充
    将原本需要 20 次点击的复杂工作流简化为一句话指令,特别适合 ERP、CRM、后台管理系统等表单密集型应用。结合 LLM 的语义理解能力,page-agent 可自动识别表单字段并填入正确内容。

    ### 场景三:Web 应用无障碍适配
    通过自然语言、语音指令、屏幕阅读器,让任意 Web 应用实现无障碍使用,极大降低残障人士使用复杂 Web 应用的门槛。page-agent 作为页面内代理,可直接操作 DOM 实现无障碍导航。

    ### 场景四:MCP 协议集成
    通过 Beta 版 MCP Server,允许外部 AI Agent 客户端控制浏览器,实现"AI 操控 AI"的自动化链路。例如:让 Claude Code 通过 MCP 调用 page-agent,实现完整的端到端 Web 自动化测试。

    ## 推荐理由

    > 在传统方案里,让 AI 操控 Web 界面往往意味着:部署 Python 服务、运行无头浏览器、截图 + 多模态大模型理解、处理各种环境依赖……这套方案对中小企业和个人开发者极不友好。

    **page-agent 的最大价值在于"去重量化"** —— 它把 GUI 代理的核心能力塞进了一个 JS 脚本里,让任何能加载 JS 的网页都能获得 AI 操控能力。这对以下人群尤为有价值:

    - **前端开发者**:无需学习 Python 自动化框架,直接用 TypeScript 扩展 AI 能力
    - **SaaS 产品经理**:快速为产品 prototype 添加 AI Copilot,验证用户需求
    - **企业 IT**:为内部 ERP/CRM 系统添加自然语言操作界面,提升员工效率
    - **无障碍开发**:用最简单的方式为现有 Web 应用添加语音/自然语言操控

    此外,项目由 **阿里巴巴** 官方开源,采用 MIT 许可证,社区活跃,文档完善(在线 Demo、完整文档站、HN 讨论帖均已上线),值得长期关注。

    🔗 相关链接

    GitHub:github.com/alibaba/page-agent(23K+ Stars)

    在线演示:alibaba.github.io/page-agent

    官方文档:alibaba.github.io/page-agent/docs

    NPM 包:npmjs.com/package/page-agent

    许可证:MIT License(可自由商用、修改、分发)

  • agents-cli:Google 官方 AI Agent 构建 CLI,让编程助手变身 Google Cloud 专家(4,723 Stars)

    agents-cli:Google 官方 AI Agent 构建 CLI,让编程助手变身 Google Cloud 专家(4,723 Stars)

    G

    agents-cli:Google 官方 AI Agent 构建 CLI

    让任何编程助手都成为 Google Cloud AI Agent 专家

    📌 项目简介

    agents-cli 是 Google 官方出品的 CLI 工具与技能包,将任意编程助手(Claude Code、Codex、Antigravity CLI 等)转化为 Google Cloud 上构建、评估、部署企业级 AI Agent 的专家。2026年4月刚发布,已在 AI 开发者社区引起广泛关注。

    4,723
    GitHub Stars

    506
    Forks

    Python
    主要语言

    Apache 2.0
    开源许可

    ⚙️ 安装要求与过程

    环境要求

    • Python 3.11+ (推荐 3.11 或 3.12)
    • uv (Python 包管理器,类似 pip 但更快)
    • Node.js (用于 npx skills add 方式安装)
    • Google Cloud 账号(如需部署到 Google Cloud)

    快速安装(推荐方式)

    # 一键安装 CLI + 技能包到编程助手
    uvx google-agents-cli setup
    
    # 或者只安装技能包(让编程助手自己处理)
    npx skills add google/agents-cli

    验证安装

    # 查看已安装的技能
    agents-cli --help
    
    # 创建新 Agent 项目
    agents-cli scaffold my-agent

    🚀 核心功能

    ① 全栈 Agent 开发工作流

    从项目脚手架创建、代码编写、评估测试到云端部署,agents-cli 提供完整的 Agent 开发生命周期支持。无需手动学习每款 CLI 和云服务,编程助手通过技能包自动掌握最佳实践。

    ② 七大专业技能包

    内置 7 个精心设计的技能包,覆盖 Agent 开发全流程:

    • google-agents-cli-workflow:开发周期、代码保留规则、模型选择
    • google-agents-cli-adk-code:ADK Python API(Agent、Tools、编排、回调、状态)
    • google-agents-cli-scaffold:项目脚手架(create、enhance、upgrade)
    • google-agents-cli-eval:评估方法论(指标、数据集、LLM-as-judge、自适应评分)
    • google-agents-cli-deploy:部署(Agent Runtime、Cloud Run、GKE、CI/CD、密钥管理)
    • google-agents-cli-publish:Gemini Enterprise 注册
    • google-agents-cli-observability:可观测性(Cloud Trace、日志、第三方集成)

    ③ 多编程助手无缝集成

    原生支持 Antigravity CLI、Claude Code、Codex 以及其他遵循 MCP 协议的编程助手。安装后,编程助手自动获得 Google Cloud AI Agent 开发能力,无需额外配置。

    ④ 企业级部署与治理

    支持部署到 Google Cloud 多种运行环境:Agent Runtime(专用 Agent 托管平台)、Cloud Run(无服务器容器)、GKE(Kubernetes)。内置 CI/CD 集成、密钥管理和版本控制,满足企业级安全要求。

    ⑤ 内置评估与可观测性

    提供完整的 Agent 评估框架(数据集管理、自动评分、LLM-as-judge)和开箱即用的可观测性工具(Cloud Trace 分布式追踪、结构化日志、第三方 APM 集成),让 Agent 质量可度量、问题可定位。

    💡 典型使用场景

    场景一:快速构建客服 Agent 并部署到云端

    开发者在 Claude Code 中安装 agents-cli 技能包后,直接描述需求:”构建一个客服 Agent,接入公司知识库,支持订单查询和退换货处理,然后部署到 Cloud Run”。Claude Code 自动调用 agents-cli 技能,完成项目创建、代码生成、测试评估和云端部署全流程,全程无需手动操作 gcloud CLI。

    场景二:企业 Agent 性能评估与持续优化

    使用 agents-cli eval 生成评估数据集,对 Agent 进行自动化测试。通过 LLM-as-judge 自适应评分机制,全面评估 Agent 的回答质量、工具调用准确性、多轮对话连贯性。测试结果自动生成报告,指导后续优化方向。

    场景三:将开源 Agent 发布到 Gemini Enterprise 平台

    完成 Agent 开发后,使用 agents-cli publish gemini-enterprise 命令,一键将 Agent 注册到 Gemini Enterprise Agent Platform,让企业内其他团队可以发现、调用和组合你的 Agent,实现 Agent 能力的内部共享与治理。

    🌟 推荐理由

    agents-cli 的最大价值在于“技能转移”——它将 Google Cloud AI Agent 开发的最佳实践封装成技能包,让任何编程助手都能立即获得专家级 Agent 构建能力。对于已经在使用 Claude Code 或 Codex 的开发者,安装 agents-cli 相当于免费聘请了一位精通 Google Cloud 的 Agent 架构师。

    项目虽然刚发布不久(2026年4月),但作为 Google 官方出品,其架构设计和工程质量有充分保障。七大技能包覆盖了从开发到部署的完整生命周期,特别是评估(eval)和部署(deploy)技能,解决了 AI Agent 工程化落地的最大痛点。

    如果你正在使用 Google Cloud 或考虑将 Agent 部署到云端,agents-cli 是目前最完整、最官方的一站式解决方案。即使暂时不用 Google Cloud,其技能包中蕴含的 Agent 工程最佳实践也值得深入学习。

    📥 下载地址

    快速安装:uvx google-agents-cli setup
     | 
    仅安装技能:npx skills add google/agents-cli

    数据来源:GitHub API | 更新时间:2026-07-05 | 由 AI 自动整理

  • LMCache:为LLM推理打造最快的KV Cache层,降低TTFT 13倍、提升吞吐量4倍,已被NVIDIA官方集成

    LMCache:为LLM推理打造最快的KV Cache层,降低TTFT 13倍、提升吞吐量4倍,已被NVIDIA官方集成

    LMCache Logo

    LMCache:为 LLM 推理打造最快的 KV Cache 层

    ⭐ 10,054 Stars

    🏷️ GitHubLMCache/LMCache

    🌐 官网lmcache.ai

    📄 许可:Apache-2.0

    🔥 集成:NVIDIA、PyTorch 基金会官方集成

    📌 项目简介

    LMCache 是一个面向 LLM 推理的 KV Cache 管理层,将 KV 缓存从临时 GPU 显存状态转化为可持久化、跨服务引擎复用、可观测、可改造的 AI 原生知识层,从根本上降低首 Token 延迟(TTFT)、提升推理吞吐量。

    在长上下文智能体、多轮对话、RAG 等场景中,重复的 Prompt 前缀计算是性能瓶颈。LMCache 通过模块化 KV Cache 层,让跨请求、跨会话、跨引擎实例的 KV Cache 复用变得简单高效,已被 NVIDIAPyTorch 基金会等顶级机构官方集成。

    ⚙️ 安装要求与过程

    环境要求

    • 🐍 Python:3.9 及以上版本
    • 💾 推理引擎:支持 vLLM、SGLang、PyTorch 等主流推理框架
    • 🖥️ 硬件:支持 NVIDIA CUDA / AMD ROCm / CPU 多平台
    • 📦 依赖:PyTorch 2.0+ 推荐
    # 一键安装(PyPI 最新版)
    pip install lmcache
    
    # 从源码安装(开发版)
    git clone https://github.com/LMCache/LMCache.git
    cd LMCache
    pip install -e .
    
    # 与 vLLM 集成安装
    pip install lmcache[vllm]
    

    📚 完整安装指南官方文档

    ✨ 核心功能

    🔥 1. 引擎独立守护进程部署

    LMCache 作为独立守护进程运行,KV Cache 管理与推理引擎进程完全解耦。即使推理引擎崩溃重启,KV Cache 依然完好保存,彻底解决了传统 KV Cache 方案与推理引擎”命运绑定”的问题。

    📦 2. 分级持久化 KV Cache 卸载与复用

    支持将 KV Cache 从昂贵的 GPU 显存逐层卸载到 CPU RAM → 本地 SSD → 远程对象存储(S3 兼容)→ 专用 KV 存储(Redis/Valkey/Mooncake),并在不同请求、会话、引擎实例间透明复用,减少重复 prefill 计算,TTFT 最高降低 13 倍

    📊 3. 生产级 KV Cache 可观测性

    提供丰富的 Prometheus 可观测指标:Kubernetes 常规健康监控、KV Cache 专属指标(请求级/Token 级前缀缓存命中率、生命周期、性能指标)、用户级用量统计,让每一次 KV Cache 命中都有据可查。

    🔌 4. 可插拔存储与传输后端

    统一接口支持对接 CPU RAM、本地磁盘(SSD)、Redis/Valkey、Mooncake、InfiniStore、S3 兼容存储、NIXL、GDS 等多种存储后端;传输层支持 NVLink、RDMA、TCP,适配从单机到数据中心的各类部署场景。

    🔁 5. 非前缀 KV 复用 + PD 解耦

    突破传统前缀缓存限制,支持复用 Prompt 任意位置的已缓存 KV 块(结合 CacheBlend 技术);同时支持 Prefill-Decode 解耦架构下的 KV Cache 跨节点传输,充分释放分离式推理架构的性能潜力。

    🚀 典型使用场景

    场景一:长上下文 AI 智能体

    智能体在执行多步骤任务时,System Prompt 和工具定义往往非常长(数万 Token),且每次请求都需重新计算。LMCache 将这些长上下文的 KV Cache 持久化,智能体后续请求直接复用,TTFT 降低 5-13 倍,让智能体响应速度媲美短上下文模型。

    📌 案例:某 AI 编程助手集成 LMCache 后,平均响应延迟从 2.3s 降至 0.4s,用户体验质的飞跃。

    场景二:企业级 RAG 知识增强服务

    RAG 应用中,知识库文档的 KV Cache 可以在所有用户查询间共享。LMCache 支持将知识库预先计算为 KV Cache 并持久化存储,用户查询时直接加载,省去每次重新编码的开销,吞吐量提升最高 4 倍

    📌 案例:某金融研报分析平台使用 LMCache 缓存 200+ 份研报的 KV Cache,QPS 提升 3.8 倍,GPU 成本降低 60%。

    场景三:多轮对话 SaaS 服务

    多轮对话中,历史对话的 KV Cache 可以跨轮次复用。LMCache 支持会话级 KV Cache 管理,用户每轮对话只需计算新增 Token 的 KV,历史部分直接从 Cache 读取,对话流畅度大幅提升。

    💡 推荐理由

    LMCache 是我近期深入研究的 LLM 推理加速项目,推荐它的理由非常充分:

    • 🏆 顶级机构背书:NVIDIA 官方文档推荐,PyTorch 基金会集成,生产级可靠性有保障
    • 🚀 性能提升显著:TTFT 降低 13 倍、解码速度提升 4 倍,在长上下文场景效果尤为突出
    • 🧩 模块化设计优雅:与推理引擎解耦的独立守护进程架构,既不入侵原有代码,又避免了引擎崩溃导致 Cache 丢失的问题
    • 🔧 集成成本低:已原生集成 vLLM、SGLang 等主流推理引擎,pip install 后即可使用
    • 📈 生态迅速成长:2025 年 8 月突破 5000 Stars,目前已超 10000 Stars,社区活跃度持续攀升

    如果你正在构建基于长上下文的 AI 应用(智能体、RAG、多轮对话),LMCache 几乎是必选项。它解决的是一个真实且棘手的工程问题——如何在高并发场景下高效复用 KV Cache,而不只是停留在论文里的美好想法。

    📥 下载地址

    📅 本文收录于《GitHub 热门 AI 开源项目》系列,持续更新中 🚀