标签: AI Agent

  • video-use:用 Claude Code 一句话剪辑视频,browser-use 团队出品,15.9K Stars 让 AI 成为你的剪辑师

    video-use:用 Claude Code 一句话剪辑视频,browser-use 团队出品,15.9K Stars 让 AI 成为你的剪辑师

    video-use

    把原始素材丢进文件夹,跟 Claude Code 聊两句,拿回成片 final.mp4 —— 这就是 video-use15.9K+ Stars,MIT 许可,100% 开源)。它由爆火的 browser-use 团队打造,把”对话式 AI 编程”的思路搬进了视频剪辑:不再和轨道、关键帧死磕,而是用自然语言描述你要的成片。


    🚀 项目简介

    video-use 是一个对话式视频编辑「技能(skill)」,让 LLM 通过阅读而非观看视频来完成剪辑。它把任意原始素材(口播、混剪、教程、旅行、采访)交给 Claude Code / Codex / Hermes 等任意带 shell 的 AI 编程智能体,自动产出可直接发布的成片,全程无需预设模板或复杂菜单。核心思想和 browser-use 一脉相承:给 LLM 一份结构化的「视频说明书」,而不是一堆看不懂的逐帧截图。


    ⚙️ 安装要求和过程

    环境要求

    • Python 3.12+(依赖 requests / librosa / matplotlib / pillow / numpy)
    • uv(推荐)或 pip 管理依赖
    • ffmpeg必需,渲染引擎)
    • yt-dlp(可选,用于下载在线素材)
    • ElevenLabs API Key(用于 Scribe 转写,按量计费)

    方式一:对话式安装(推荐)

    把官方 setup prompt 粘贴给 Claude Code / Codex / Hermes 等任意智能体,它会自动完成 clone、依赖安装、skill 注册,并在需要时提示你粘贴 ElevenLabs Key——你只需说”准备好了”等它通知。

    方式二:手动安装

    git clone https://github.com/browser-use/video-use ~/Developer/video-use
    ln -sfn ~/Developer/video-use ~/.claude/skills/video-use   # Claude Code
    # ln -sfn ~/Developer/video-use ~/.codex/skills/video-use  # Codex
    
    cd ~/Developer/video-use
    uv sync                       # 或 pip install -e .
    brew install ffmpeg           # 必需
    brew install yt-dlp           # 可选
    
    cp .env.example .env          # 填入 ELEVENLABS_API_KEY=...

    安装完成后,进入任意素材文件夹运行智能体,说一句”edit these into a launch video”,它就会盘点素材、给出剪辑策略、等你确认,再把 edit/final.mp4 生成在素材目录旁。


    💡 核心功能

    • 🧹 剔除填充词与死寂:自动删掉 umm / uh、假开场和片段间的空白,节奏立刻紧凑。
    • 🎨 自动调色:每段独立调色——暖色电影感 / 中性 punch / 任意自定义 ffmpeg 链,风格统一可控。
    • 🔇 无爆音剪辑:每个切点做 30ms 音频淡入淡出,彻底告别”咔哒”爆音。
    • 📝 烧录字幕:默认 2 词大写块样式,颜色、字体、排版完全可定制。
    • ✨ 动画叠层:通过 HyperFrames / Remotion / Manim / PIL 生成动画,每个动画派发并行子代理,互不阻塞。
    • 📖 「阅读」而非「观看」:LLM 只读转写文本 + 按需时间轴视图(约 12KB 文本 + 少量 PNG),而非逐帧分析 4500 万 token 噪声——这正是它又快又准的关键。
    • 🔁 自评估闭环:渲染后在每个切点自检画面跳变 / 音频爆音 / 字幕遮挡,最多自动重渲染 3 次,全部通过后你才看到预览。

    📦 典型使用场景

    🎤 场景一:口播 / 教程视频快速成片

    录完一镜到底的口播,丢给 video-use:它会自动剔除 umm、加好字幕、统一调色、消除爆音,几分钟产出可直接上传的成片,省掉 PR 里最枯燥的”听音修剪”。

    🎬 场景二:旅行 / 采访混剪

    多段原始素材自动编排成叙事线,配合 Remotion / Manim 生成的动画叠层,做出有质感的混剪,适合 Vlog、产品发布片、活动回顾。

    🤖 场景三:常驻远程剪辑

    通过 Browser Use Box 跑在自有 VPS 或 Telegram 上,随时丢素材、随时收成片,把剪辑变成一条常驻的消息流水线。


    ⭐ 推荐理由

    我特别欣赏它”给 LLM 一份视频说明书”的设计哲学——和 browser-use 把网页 DOM 喂给模型如出一辙,但对象换成了视频。传统”AI 剪辑”要么逐帧灌噪声、要么套预设模板;video-use 选择让模型读转写、按需看图,既省 token 又保精度,自评估闭环还兜住了质量下限。

    100% 开源、MIT 许可,能挂在任何 AI 编程智能体上,本地文件零上传(只有转写调用 ElevenLabs)。如果你已经用 Claude Code 写代码,顺手把它变成分身剪辑师,几乎零学习成本。唯一门槛是 ElevenLabs 转写按量计费,但换来的是真正”对话即剪辑”的体验。


    📧 下载地址

  • Vercel CEO 放话:模型和 Agent 别绑死,我们要做这一代的 AWS

    提到 AI 时代的”卖水人”,你大概先想到英伟达。但在写代码、跑 Agent 这条线上,有家公司已经悄悄站到了中间位置——Vercel。它做的是让开发者不用管服务器就能把 Agent 部署上线的云基础设施,现在一天 600 万次部署,其中一半是编程 Agent 触发的,每天还有超过 1 万亿个 token 从它的 AI 网关里流过。

    去年在画饼,今年在干活

    在上周的 ShipNYC 大会后,Vercel 的 CEO Guillermo Rauch 跟 TechCrunch 聊了聊他对当下 AI 的判断。他最直接的感受是:社区的气质变了。去年大家的主题是”原型”,天空才是极限,放手让 Agent 去造;今年更多人不再问”能不能做”,而是纠结”怎么在生产环境里真正跑顺”。

    Rauch 把 Agent 的”杀手级应用”归纳成两个。第一个当然是编程 Agent,它吃掉了世界上很大一块 token 消耗,但软件写得再多,总得有个地方放。第二个他叫”公司内部的 Agent”——帮企业自己运转起来的那种。难点不在聪明,在于怎么安全地拿到数据、怎么审计它在干什么、怎么留下每一次工具调用和权限的痕迹。

    把 Agent 关进”笼子”里

    为了治这个毛病,Vercel 搞了个叫 Eve 的框架,让你用自然语言把 Agent 的指令和技能写清楚;再配一个 Vercel Sandbox,字面意思就是把 Agent 关进一个小笼子——它照样能发挥聪明才智,但你能规定它能碰什么数据、什么数据不许出笼子。

    Rauch 最在意的其实是数据控制权。他举了个让人后背发凉的例子:空客那种积累了几十年的航空 C++ 代码,要是有人装错了开发工具,哗一下全跑到云上去给人家训练模型了。”你以为是在用工具,其实是在把家底交出去。”

    Rauch 说:”太多 SaaS 巨头是靠着把你的数据锁死才建起王国的,而这跟 Agent 的玩法从根本上不兼容。”

    客户不再死绑一家大模型

    聊到和大厂模型的关系,Rauch 的观察是:去年一堆人赌咒发誓”我们全都建在 OpenAI(或 Anthropic)上”;今年风向变了,大家终于搞明白整套拼图——模型、harness、数据平台、沙箱、网关,每一块都能插拔。OpenAI 能用,Anthropic 能用,Gemini 也能用。他特意提了一嘴 Gemini:新闻上没它那么热闹,但因为大家开始为生产环境算账,它性价比的优势就显出来了。开源的 DeepSeek、GLM-5.2 也在起飞。”数据不会撒谎。”

    和大厂模型正面撞车

    当然,模型厂也在往基础设施伸手。就在这前不久,OpenAI 发布了一套不用离开自家地盘就能直接发网站的工具。Rauch 倒不慌,反而觉得是送给 Vercel 的助攻:人们会把 ChatGPT 当成做网站的工具,接着问它”托管怎么办”,模型顺手就推荐了他们。”模型和平台的边界一旦越界,就注定会和已有的基础设施正面竞争。”

    解耦的AI架构:模型与Agent通过网关连接
    模型与 Agent 解耦的架构思路:每一层都可插拔(配图为 AI 生成示意)

    说到底,Rauch 想赌的是一个判断:模型和 Agent 到底要不要绑在一起?是从一个地方拿走全部智能,还是从一个供应商那儿拿模块、拿积木,再自己往上搭?后者更像软件工程一贯的做法,也正是 Vercel 要卖的东西。他的原话很直白:”我们要做这一代的 AWS,所以当然是在为一个开放协议的世界而战。”

    • Vercel 当前每天 600 万次部署,半数由编程 Agent 触发
    • 每天超 1 万亿 token 经其 AI 网关流转
    • 两大 Agent 杀手应用:编程 Agent、企业内部运转 Agent
    • 关键工具:Eve(自然语言编排)+ Sandbox(数据隔离笼)
    • 客户从”死绑单一大模型”转向模型/沙箱/网关可插拔

    这套说法听着像宣言,但背后有个很实在的逻辑:当 Agent 真要进企业生产环境,谁能把数据安全和可插拔这两件事做扎实,谁才配坐上”这一代云”的交椅。模型和 Agent 解不解耦,也许就是接下来两年 AI 基础设施之争的分水岭。

  • ai-website-cloner-template:AI 一键克隆任意网站,26K+ Stars 让网站逆向工程变得全自动

    ai-website-cloner-template:AI 一键克隆任意网站,26K+ Stars 让网站逆向工程变得全自动

    ai-website-cloner-template:用 AI 编程助手一键克隆任意网站

    📌 项目简介

    ai-website-cloner-template 是一个可复用的开源模板,让你用一条命令、借助任意 AI 编程助手,将任何网站逆向工程为干净、现代的 Next.js 代码库——相当于给 AI 下了个「克隆这个网站」的指令,它就能把设计令牌、组件结构、交互逻辑全部还原出来。

    ⭐ GitHub Stars:26,229+
    🏷️ 开源许可:MIT(免费商用)
    💻 主要语言:TypeScript(Next.js 16 + React 19)
    🤖 支持 AI 助手:13 款(Claude Code / Codex / Cursor / Windsurf 等)

    ⚙️ 安装要求和过程

    环境要求

    • Node.js 24+(必需,项目使用 Next.js 16 App Router)
    • 一个 AI 编程助手(推荐 Claude Code,也支持 Codex CLI / Cursor / Windsurf 等 13 款)
    • Git(用于多 worktree 并行开发)

    快速安装步骤

    1. 从模板创建自己的仓库
      在 GitHub 页面点击 Use this templateCreate a new repository
    2. 克隆到本地
      git clone https://github.com/YOUR-USERNAME/YOUR-NEW-REPOSITORY.git
      cd YOUR-NEW-REPOSITORY
    3. 安装依赖
      npm install
    4. 启动 AI 助手(推荐 Claude Code)
      claude --chrome
    5. 开始克隆网站!
      /clone-website https://example.com

    Docker 方式(可选):

    docker compose up app --build   # 构建并运行应用
    docker compose up dev --build    # 开发模式,端口 3001

    🌟 核心功能

    ① 13 款 AI 编程助手全覆盖

    无论你用的是哪款 AI 编程工具,都能直接上手。支持 Claude Code、Codex CLI、OpenCode、GitHub Copilot、Cursor、Windsurf、Gemini CLI、Cline、Roo Code、Continue、Amazon Q、Augment Code、Aider 共 13 款,真正做到了「一次配置,到处运行」。

    ② 五阶段智能流水线

    克隆过程被精心设计为五个阶段,模拟专业前端工程师的工作流:

    • 侦察阶段:自动截图、提取设计令牌(颜色/字体/间距)、扫描交互行为(滚动/点击/悬停/响应式)
    • 基础构建:更新字体、颜色、全局样式,下载所有静态资源
    • 组件规格:为每个组件编写详细规格文件(含精确 CSS 计算值、状态、行为、内容)
    • 并行构建:在独立 git worktree 中分派多个构建代理,每个代理负责一个 section/component,极大加速生成
    • 组装与 QA:合并 worktree,连接页面,与原始网站进行视觉差异对比

    ③ 多 URL 并行处理

    传入多个 URL,系统自动并行处理,每个站点输出隔离,互不干扰。非常适合克隆拥有多个子页面的完整网站。

    /clone-website https://example.com https://example.com/about https://example.com/pricing

    ④ 单一真相来源架构

    采用 AGENTS.md.claude/skills/clone-website/SKILL.md 作为源文件,通过同步脚本自动生成各平台(Claude Code / Cursor / Windsurf 等)的配置文件,避免多平台维护的噩梦。

    bash scripts/sync-agent-rules.sh   # 重新生成代理指令文件
    node scripts/sync-skills.mjs       # 重新生成所有平台的 /clone-website 技能

    ⑤ 生产级技术栈

    生成的代码库本身就是高质量成品:

    • Next.js 16(App Router)+ React 19 + TypeScript strict
    • shadcn/ui(Radix primitives)+ Tailwind CSS v4
    • Lucide React 图标(克隆时自动替换为提取的 SVG)
    • 内置 npm run check(lint + typecheck + build)完整质量检查链

    🚀 典型使用场景

    场景一:平台迁移

    你的网站跑在 WordPress / Webflow / Squarespace 上,想迁移到现代化的 Next.js 技术栈,但舍不得原有的设计和交互细节。ai-website-cloner-template 可以完整克隆原站的外观和交互,生成一个干净的 Next.js 项目,你可以在此基础上继续开发,告别笨重的旧平台。

    场景二:丢失源码的网站恢复

    网站还在运行,但代码库早已丢失(或者前开发者跑路了)。只要网站还能访问,就能用它逆向生成完整的 Next.js 源码。虽然不能保证 100% 还原(特别是复杂的后端交互),但前端部分可以还原到惊人的精度。

    场景三:学习生产级前端实现

    看到一个网站的布局、动画或响应式实现特别惊艳,想研究它是怎么做的?与其对着 DevTools 一行行扒代码,不如直接让 AI 克隆一份,然后在生成的代码库里慢慢研究。相当于有了一个「可运行的解构说明书」。

    💡 推荐理由

    作为前端开发者,我曾经多次遇到「这个网站的某个交互效果真好,我想知道它是怎么实现的」的情况。传统做法是在浏览器 DevTools 里对着压缩过的 CSS 和 JS 猜谜,效率低得令人发指。

    ai-website-cloner-template 最让我惊艳的地方在于它把「克隆网站」这个复杂任务分解成了 AI 助手真正擅长的子任务:侦察、提取设计令牌、编写组件规格、并行构建。整个流程设计得非常专业,不是简单的「让 AI 写代码」,而是模拟了一个资深前端工程师的工作流程。

    特别值得一提的是 并行构建 阶段——它利用 git worktree 让多个 AI 代理同时工作,每个代理负责不同的组件,最后再合并。这个设计既聪明又实用,大大缩短了等待时间。

    当然,这个项目也有局限性:它主要处理前端部分,动态后端逻辑无法完整还原;对于高度依赖状态的复杂 SPA,还原精度会有所下降。但作为「前端快速原型 + 设计逆向学习」工具,它已经远超我的预期。

    如果你正在考虑从旧平台迁移、需要快速做网站原型、或者单纯想学习优秀网站的前端实现,这个项目绝对值得一试。

    ⚠️ 使用提醒:请遵守法律法规和网站服务条款。不要将克隆的网站用于钓鱼、冒充或侵犯他人知识产权。项目作者也明确列出了不允许的用途。

    📥 下载地址


    本文由 AI 自动生成 · 数据来源 GitHub Trending · 如有错误或遗漏欢迎指正

  • Hermes Agent:会自我进化的开源 AI 智能体,Nous Research 出品,60000+ Stars 让 AI 真正成为你的数字分身

    Hermes Agent:会自我进化的开源 AI 智能体,Nous Research 出品,60000+ Stars 让 AI 真正成为你的数字分身

    Hermes Agent Banner

    Hermes Agent —— 会自我进化的开源 AI 智能体

    项目简介

    Hermes Agent 是由 Nous Research 开发的开源自主 AI 智能体框架,采用 MIT 协议完全免费。它的核心定位是:一个部署在你自己服务器上、能随你一起成长的持久化个人 AI 智能体

    与传统 AI 聊天机器人不同,Hermes Agent 是一个独立运行的后台守护进程,具备三大核心特性:自托管(数据完全本地化)、持久化(跨会话记忆)、自我进化(从经验中自动创建和改进技能)。


    安装要求和过程

    环境要求

    依赖 说明
    Python 3.11+ 主运行环境(安装器自动处理)
    Node.js 部分功能依赖(安装器自动处理)
    ripgrep 代码搜索(安装器自动处理)
    ffmpeg 语音备忘录转录(安装器自动处理)
    Git Bash Windows 上安装器会捆绑便携版 MinGit(约 45MB)

    支持平台:Linux ✅ / macOS ✅ / WSL2 ✅ / Windows (PowerShell) ✅ / Termux (Android) ✅

    一键安装

    Linux / macOS / WSL2:

    curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash
    source ~/.bashrc
    hermes

    Windows(PowerShell):

    iex (irm https://hermes-agent.nousresearch.com/install.ps1)
    hermes

    安装后配置

    hermes setup # 运行完整配置向导
    hermes model # 选择 LLM 提供商和模型
    hermes tools # 配置启用的工具
    hermes gateway # 启动消息网关

    核心功能

    1. 真正的终端 TUI 界面

    Hermes Agent 提供完整的终端 UI(TUI),支持多行编辑、斜杠命令自动补全、对话历史浏览、中断重定向、流式工具输出。不是简单的命令行包装,而是专为 AI 交互设计的终端体验。

    2. 多平台消息集成

    通过一个网关进程统一管理,支持 14+ 消息平台:Telegram、Discord、Slack、WhatsApp、Signal、CLI 等。支持语音备忘录转录、跨平台对话连续性——你在 Telegram 上的对话,可以在 Discord 上继续。

    3. 闭环学习系统(核心竞争力)

    这是 Hermes Agent 最独特的功能:

    • 自主技能创建:完成复杂任务(通常涉及 5 次以上工具调用)后,自动将成功的工作流程提炼为可复用的”技能”(Skill)
    • 技能自我改进:技能在使用过程中会自动优化
    • FTS5 会话搜索 + LLM 摘要:实现跨会话回忆
    • Honcho 辩证用户建模:持续构建对用户的深度理解模型
    • 兼容 agentskills.io 开放标准

    4. 定时自动化

    内建 cron 调度器,可向任意平台投递消息。用自然语言配置每日报告、夜间备份、每周审计等定时任务,无需编写代码。

    5. 多环境运行 + 子代理并行化

    支持六种终端后端:local、Docker、SSH、Singularity、Modal、Daytona。Daytona/Modal 提供无服务器持久化,空闲时休眠几乎零成本。

    可生成隔离子代理处理并行工作流;编写 Python 脚本通过 RPC 调用工具,将多步流水线压缩为零上下文成本轮次。


    典型使用场景

    场景一:个人 AI 助手(消息平台接入)

    通过 Telegram/Discord/Slack 等平台,随时随地与你的 AI 智能体对话。它记住你上周告诉它的项目偏好,能回忆起你三个月前让它执行的任务细节。用得越久,它就越了解你。

    场景二:开发辅助 + 定时自动化

    在终端中使用 TUI 进行交互式编程辅助,运行 shell 命令、管理项目。同时配置定时任务:每日自动生成工作日报、夜间备份代码仓库、每周审计服务器安全状态——全部无人值守自动执行。

    场景三:从 OpenClaw 迁移

    Hermes Agent 自动导入设置、记忆、技能和 API 密钥,迁移成本极低。相比 OpenClaw,Hermes Agent 的自我进化能力技能系统是核心差异化优势。


    推荐理由

    Hermes Agent 代表了 AI Agent 发展的一个重要方向:从”一次性工具”走向”持久化伙伴”

    我推荐它的理由:

    • 数据主权:部署在自己的机器上,SQLite 本地存储,不经过任何第三方云服务
    • 真正能成长:用得越久越聪明,技能系统让它能从经验中学习
    • 零成本运行:支持 Ollama 本地模型,可以完全免费运行
    • 多平台接入:通过消息 App 随时随地使用,不需要打开电脑
    • MIT 协议:完全开源,可以自由修改和商用

    小提示:Nous Research 是开源 AI 社区中声誉极高的研究机构,他们此前发布的 Hermes 系列开源模型(Hermes-2、Hermes-3)在 Hugging Face 上广受好评。Hermes Agent 可以看作是他们将多年技术积累打包成的开箱即用产品。


    下载地址

    来源 链接
    GitHub 仓库 github.com/NousResearch/hermes-agent
    官方网站 hermes-agent.nousresearch.com
    Nous Research nousresearch.com
    agentskills.io agentskills.io

    最低运行配置:2 核 CPU + 4GB RAM(推荐 4GB+ 以流畅运行 LLM)


    本文为 GitHub 热门 AI 开源项目系列第 93 篇。系列文章持续介绍最值得关注的开源 AI 项目,欢迎关注。

  • Continue:开源 AI 编程助手,让 VS Code 和 JetBrains 拥有最强大脑(34K+ Stars)

    Continue:开源 AI 编程助手,让 VS Code 和 JetBrains 拥有最强大脑(34K+ Stars)

    Continue:开源 AI 编程助手,让 VS Code 和 JetBrains 拥有最强大脑

    ⭐ 34K+ Stars
    TypeScript
    Apache-2.0
    持续维护中

    📌 项目简介

    Continue 是为 VS CodeJetBrains IDE 打造的开源 AI 编程助手,让开发者在熟悉的编辑器里直接获得代码补全、交互式聊天、代码编辑等 AI 能力。官网 slogan:“The easiest way to code with any LLM” —— 支持几乎所有主流大模型,本地、云端随意切换。

    🌐 官网continue.dev
    📦 安装VS Code / JetBrains Marketplace 搜索 “Continue”
    🔑 许可Apache-2.0

    🔧 安装要求和过程

    环境要求

    • VS Code 1.70+ 或 JetBrains IDE(IntelliJ / PyCharm / WebStorm 等)
    • 支持 Windows / macOS / Linux 三平台
    • 网络连通(用于下载模型或连接云端 API)
    • 本地运行需要 Ollama 等本地 LLM 工具(可选)

    快速安装(3 步搞定)

    1. 安装插件:在 VS Code 扩展市场或 JetBrains Plugin 市场搜索 Continue,一键安装
    2. 选择模型:打开 Continue 侧边栏,选择你想用的模型(云端 API 或本地 Ollama)
    3. 开始编码:在编辑器中选中代码,按快捷键唤醒 AI,或直接聊天提问
    💡 快速体验:不想配置 API Key?先装个 Ollama,在 Continue 里选一个本地模型,零成本跑起来!

    🎯 核心功能

    1. 智能代码补全(Autocomplete)

    基于上下文的多行代码补全,比传统补全更懂你的意图。支持主流编程语言,响应速度经过专门优化,打字如飞不卡顿。

    2. 交互式聊天(Chat)

    在侧边栏和 AI 对话,支持引用当前文件、选中代码、整个项目上下文。可以问 “这段代码什么意思?”、”帮我优化这个函数”、”写一个单测” 等,AI 直接给出代码建议。

    3. 编辑与重构(Edit)

    选中代码后,用自然语言描述你想做的修改,Continue 直接在编辑器里帮你改好。支持多文件编辑、批量重构,是日常开发最高频使用的功能。

    4. 模型自由切换

    支持 100+ LLM 提供商:Anthropic Claude、OpenAI GPT、Google Gemini、本地 Ollama、自托管 vLLM……一套界面,随意切换。企业可以用自己的模型,个人开发者可以零成本用本地模型。

    5. 上下文理解(Context Awareness)

    Continue 不只是 “聊天框里的 AI”,它能理解你的项目结构、当前文件、选中的代码,甚至整个代码库。支持 @files@folders@code 等快捷引用,让 AI 精准理解你的意图。

    🚀 典型使用场景

    场景一:快速理解遗留代码

    接手一个陌生项目,面对几千行没注释的代码一头雾水?选中整个文件,问 Continue:”这个文件的核心逻辑是什么?有哪些潜在问题?” 几秒钟就能获得清晰的解读,比自己啃代码效率高 10 倍。

    场景二:本地零成本 AI 编程

    不想把代码上传到云端?装个 Ollama,在 Continue 里选一个本地跑的开源模型(DeepSeek Coder、CodeLlama 等),所有代码处理都在本地完成,隐私 100% 可控,还不用花一分钱 API 费用。

    场景三:团队协作统一 AI 工作流

    Continue 支持配置文件(config.json)提交到代码库,团队所有人用同一套提示词、同一个模型,AI 辅助编码的效果可复现、可迭代,从 “个人玩具” 升级为 “团队生产力工具”。

    💎 推荐理由

    作为每天和代码打交道的开发者,我对 Continue 的评价就三个字:真的香

    最打动我的是它的 模型无关设计。不像有些 AI 编程工具绑定特定厂商,Continue 把选择权完全交给你——想用 Claude 写复杂逻辑、用本地模型做快速补全、用 GPT 做代码 review,全在一个插件里搞定,不用在不同的工具之间反复横跳。

    另一个亮点是 开源透明。Apache-2.0 许可,代码完全公开,不用担心 “哪天服务商涨价或者跑路”。而且开源社区非常活跃,几乎每周都有新功能发布,Issue 响应速度也很快。

    当然也有不足:模型切换的配置界面对新手不太友好,第一次用的时候需要花点时间搞清楚怎么添加自定义模型。但一旦配置好,日常使用体验非常流畅,已经成了我写代码时离不开的工具。

    如果你在用 VS Code 或 JetBrains,还没试过 Continue,强烈建议花 5 分钟装一下 —— 它可能会改变你写代码的方式。


    📦 下载地址

  • Orca:AI智能体并行编排IDE,让100x开发者同时驾驭5个AI编程助手(12,485 Stars)

    Orca:AI智能体并行编排IDE,让100x开发者同时驾驭5个AI编程助手(12,485 Stars)

    🐳 Orca:AI智能体并行编排IDE,让100x开发者同时驾驭5个AI编程助手

    ⭐ 12,485 Stars

    The AI Orchestrator for 100x Builders

    📌 项目简介

    一句话介绍

    Orca 是一款专为 AI 编程时代打造的智能体编排 IDE,让你在同一个界面中并排运行 Codex、Claude Code、OpenCode、Pi 等任意终端 AI 编码代理,每个代理在独立的 git worktree 中隔离运行,所有任务统一跟踪管理。它还提供 iOS/Android 移动端配套应用,让你随时随地监控和引导代理运行。

    项目背景:在 AI 编程助手爆发的今天,开发者往往需要在多个 AI 工具之间来回切换——Claude Code 写代码、Codex 做代码审查、OpenCode 处理重构……每个工具都有各自的优势,但切换成本极高。Orca 的诞生就是为了解决这个问题:把多个 AI 代理统一到一个界面中并行调度,真正实现「1+1>2」的协同效应。

    核心定位:不是要替代现有的 AI 编程助手,而是做一个「智能体编排层」,让你可以同时使用所有最好的工具,并在它们之间灵活分配任务。

    🌐 官网:onorca.dev | 📦 GitHub:stablyai/orca | 📄 许可:MIT

    ⚙️ 安装要求和过程

    环境要求

    • 桌面端:macOS(Apple Silicon / Intel)、Windows 10+、Linux(AppImage / AUR)
    • 移动端:iOS 16+ / Android 10+
    • 依赖:需要已安装并配置好至少一款 AI 编程助手(Claude Code / Codex / OpenCode 等)
    • 远程开发:支持 SSH 连接到高性能服务器运行代理

    快速安装

    方式一:官网下载(推荐)

    # macOS Apple Silicon
    open https://github.com/stablyai/orca/releases/latest/download/orca-macos-arm64.dmg

    # macOS Intel
    open https://github.com/stablyai/orca/releases/latest/download/orca-macos-x64.dmg

    # Windows
    # 下载并运行: https://github.com/stablyai/orca/releases/latest/download/orca-windows-setup.exe

    # Linux AppImage
    wget https://github.com/stablyai/orca/releases/latest/download/orca-linux.AppImage
    chmod +x orca-linux.AppImage && ./orca-linux.AppImage

    方式二:Homebrew(macOS)

    brew install –cask stablyai/orca/orca

    方式三:Arch Linux(AUR)

    yay -S stably-orca-bin # 预编译版本
    # 或
    yay -S stably-orca-git # 从源码构建

    移动端安装

    无头 Linux 服务器

    # 在远程 Linux 服务器上运行 Orca 服务
    orca serve
    # 然后通过桌面端或移动端远程连接

    🌟 核心功能

    1. 并行 Worktree —— 5个代理同时干活

    把一个需求同时派发给 5 个 AI 代理,每个代理在独立的 git worktree 中运行,互相不干扰。你可以对比各个代理的输出结果,然后合并最优方案。这就像同时雇佣了 5 个初级工程师,而你是架构师,负责审查和决策。

    2. 移动端伴侣 —— 手机上监控 AI 干活

    Orca 提供 iOS 和 Android 原生应用,你可以在手机上实时查看代理的运行状态,代理完成时自动推送通知,还可以随时发送后续指令。早上躺在床上就能查看昨晚跑的代理结果,通勤路上就能给代理安排新任务。

    3. 设计模式 —— 点击 UI 就能生成提示词

    在真实的 Chromium 窗口中点击任意 UI 元素,Orca 会自动提取该元素的 HTML、CSS 和裁剪后的截图,直接作为上下文发送给 AI 代理。再也不用手动复制粘贴代码片段了,点击即提示。

    4. 原生 GitHub & Linear 集成 —— 不离开 IDE 就能完成 Code Review

    Orca 内置 GitHub 和 Linear 支持,你可以在应用内直接浏览 PR、issue、项目看板,从任意任务直接打开对应的 worktree,无需切换浏览器上下文。AI Diff 标注功能让你在代码 diff 上直接添加评论并反馈给代理,审查-编辑-提交一气呵成。

    5. SSH Worktree —— 在远程服务器上跑代理

    支持在远程高性能服务器上运行 AI 代理,包含完整的文件编辑、git 操作、终端能力,自带自动重连和端口转发功能。你的笔记本可以保持凉快,而代理在远程服务器的 GPU 上飞奔。

    6. 终端分屏 + 内置编辑器 —— Ghostty 级别的终端体验

    Orca 内置了类 Ghostty 的高性能终端,基于 WebGL 渲染,支持无限分屏,滚动历史记录重启后保留。同时内置 VS Code 级别的编辑器,支持全局自动保存、文件拖拽到代理输入框等效率功能。

    7. Orca CLI —— 脚本化所有工作流

    Orca 提供完整的 CLI 工具,支持通过命令行脚本化所有操作:orca worktree createorca snapshotorca clickorca fill 等,可以无缝集成到 CI/CD 流程中。

    Orca 并行代理编排界面

    Orca 主界面:并行运行多个 AI 代理

    💡 典型使用场景

    场景一:多模型对比选型

    需求:你需要实现一个复杂的认证模块,不确定用 JWT 还是 Session,也不确定哪个 AI 助手能给出最好的实现方案。

    方案:在 Orca 中创建 3 个并行 worktree,分别派给 Claude Code、Codex 和 OpenCode,让它们各自给出实现方案和代码。30 分钟后,你在 Orca 界面中对比三份代码的质量、可读性和完整性,选择最优方案合并到主分支。

    价值:原本需要轮流试用 3 个工具、花费 2 小时的工作,现在 30 分钟就能完成,而且还能直观对比各工具的输出质量。

    场景二:移动办公 + AI 辅助

    需求:你经常在通勤路上突然想到代码改进点,但拿出笔记本又不方便,等到了办公室又忘了。

    方案:在手机上打开 Orca 移动端应用,查看正在运行的代理状态,发送一条新的指令:「在用户登录模块添加记住我功能,参考现有的 session 管理代码」。代理在远程服务器上开始工作,完成后推送通知到你的手机。到达办公室时,代码已经在等待你审查了。

    价值:碎片化时间也能推进开发工作, idea 不会丢失,效率显著提升。

    场景三:Code Review 加速

    需求:团队 PR 数量多,Code Review 成为瓶颈,人工 Review 容易遗漏边界情况。

    方案:在 Orca 中打开 GitHub PR,使用 AI Diff 标注功能,让 AI 代理自动分析代码变更、发现潜在 bug、检查代码风格。你可以在 AI 分析结果的基础上做最终决策,Review 效率提升 5 倍以上。

    🎯 推荐理由

    💡 个人使用心得

    Orca 解决了一个被很多人忽略但非常痛点的问题:

    • 🤝 多工具协同:现在 AI 编程助手太多了,每个都有自己的强项。Claude Code 擅长架构设计,Codex 代码质量高,OpenCode 在特定语言上表现出色。Orca 让你可以同时「雇佣」它们,而不是「选择」其中一个。
    • 📱 移动端创新:大多数开发者工具都忽略移动端,但 Orca 把移动端作为一等公民对待。在手机上监控 AI 代理这个功能,对于经常需要「让 AI 在晚上跑任务」的开发者来说,简直是救命稻草。
    • 🔒 隐私友好:支持 SSH 远程 worktree,你的代码不需要离开自己的服务器,AI 代理通过 SSH 连接执行操作,符合企业安全规范。
    • 🚀 真正提效:并行 worktree 不只是「同时开多个终端窗口」这么简单,它的核心价值在于任务编排和结果对比。你可以把一个大任务拆成多个子任务分给不同代理,然后汇总最优结果。

    注意事项:Orca 本身不包含 AI 模型,你需要自己配置 Claude Code / Codex 等工具。另外,移动端需要和桌面端配对使用,初次配置需要一些学习成本。

    总的来说,Orca 是目前市面上第一个真正把「多 AI 代理并行编排」做到可用级别的 IDE。如果你已经在用 AI 编程助手,Orca 绝对值得一试。

    📥 下载地址


    📌 本文由 WorkBuddy AI 自动整理发布 | 数据来源:GitHub – stablyai/orca

  • RuView:用WiFi信号实现空间智能感知,零摄像头做生命体征监测,76.6K Stars让隐私优先的AI感知成为可能

    RuView:用WiFi信号实现空间智能感知,零摄像头做生命体征监测,76.6K Stars让隐私优先的AI感知成为可能

    📡 RuView

    用普通 WiFi 信号实现空间智能感知,零摄像头、零穿戴设备
    ⭐ 76,620+ Stars
    🦀 Rust 核心引擎
    📅 2025年创建
    📜 MIT 开源
    🔒 隐私优先
    🎯 项目简介
    RuView 是一个革命性的无接触式 WiFi 感知平台,由 ruvnet 团队开发。它利用普通商用 WiFi 信号(ESP32 芯片或家用路由器)实现实时空间智能、生命体征监测和人员存在检测——全程无需摄像头、无需可穿戴设备,从根源上杜绝隐私泄露风险。

    🚀 核心功能

    📍 空间感知

    • 穿墙人员检测(可穿透墙壁)
    • 多房间人数统计
    • 人员进出记录与追踪
    • 17 关键点人体姿态估计

    💓 生命体征监测

    • 无接触呼吸率检测(6-30 BPM,精度 ±1)
    • 心率监测(40-120 BPM)
    • 整夜睡眠监测 + 呼吸暂停筛查
    • 支持静坐、睡眠、运动状态

    🏠 智能家居集成

    • 原生支持 Apple HomeKit
    • 对接 Home Assistant(21 个实体)
    • 支持 Google Home / Alexa
    • 通过 Siri 查询房间状态

    🤖 AI 智能体集成

    • 标准 MCP 协议接口
    • 支持 Claude Code / Codex 调用
    • Python / TypeScript SDK
    • 105+ 开箱即用边缘模块

    ⚙️ 安装要求与环境

    项目 要求
    核心语言 Rust 1.85+(感知引擎)、Python 3.10+(SDK/脚本)
    硬件选项 ESP32-S3(~$9)/ ESP32-C6(~$6)/ 普通家用 WiFi 路由器
    内存要求 最低 512MB RAM(树莓派可运行)
    许可协议 MIT License(完全开源可商用)
    支持平台 Docker / macOS / Windows / Linux / Home Assistant

    📦 快速安装步骤

    方式一:Docker 快速体验(推荐新手)

    # 拉取官方镜像
    docker pull ruvnet/wifi-densepose:latest
    
    # 启动服务,访问 http://localhost:3000
    docker run -p 3000:3000 ruvnet/wifi-densepose:latest

    方式二:npm 包安装(AI 集成推荐)

    # 安装核心 CLI 工具
    npx -y @ruvnet/ruview
    
    # 安装智能体 MCP 服务包
    npx -y @ruvnet/rvagent

    方式三:Python SDK(二次开发)

    pip install ruview
    # 可选:安装 WebSocket + MQTT 客户端扩展
    pip install "ruview[client]"

    方式四:ESP32 硬件部署(最低成本 $9)

    # 1. 烧录固件(替换 COM9 为你的设备端口)
    python -m esptool --chip esp32s3 --port COM9 --baud 460800 \
      write_flash 0x0 bootloader.bin 0x8000 partition-table.bin \
      0xf000 ota_data_initial.bin 0x20000 esp32-csi-node.bin
    
    # 2. 配置 WiFi 和上报地址
    python firmware/esp32-csi-node/provision.py --port COM9 \
      --ssid "你的WiFi名称" --password "WiFi密码" --target-ip 上报服务器IP

    💡 典型使用场景

    场景一:智能家居无感联动

    将 RuView 接入 Home Assistant 后,可自动暴露 21 个实体(11 个原始信号 + 10 个语义状态),实现:

    • 🏠 人员存在触发:有人进入房间自动开灯、开空调
    • 😴 睡眠监测:检测入睡后自动关闭灯光、开启白噪音
    • 👴 老人看护:异常长时间无移动自动推送告警
    • 🚿 浴室占用:检测浴室有人时自动开启排气扇

    通过 Siri 可语音查询:”嘿 Siri,卧室有没有人?”

    场景二:隐私优先的安防监控

    传统安防摄像头存在隐私泄露风险,且无法穿墙感知。RuView 的优势:

    • 📡 穿墙感知:WiFi 信号可穿透木质/石膏板墙壁
    • 🔒 零视频采集:从根源上避免隐私泄露,符合 GDPR/HIPAA 监管
    • 🌙 黑暗环境工作:无需任何光照条件
    • 💰 极低成本:ESP32 芯片约 $9,远低于热成像方案

    配套边缘模块 intrusion(非法入侵检测)、perimeter-breach(周界入侵检测)可直接使用。

    场景三:AI 智能体调用(MCP 协议)

    在 Claude Code 中配置 RuView MCP 服务后,可直接通过自然语言查询:

    > "现在客厅有没有人?呼吸和心率正常吗?"
    > 智能体会自动调用 ruview.presence.now、ruview.vitals.get_all 接口返回结果。
    
    > "帮我统计今天各房间的人员进出记录"
    > 自动生成日报,包含各时段人员分布热力图。

    RuView 提供标准 MCP 接口,支持 Claude Code / Codex / Cursor 等主流 AI 编程助手。

    🌟 推荐理由

    为什么 RuView 值得关注?

    1. 🔬 技术原理极其优雅:利用 WiFi 信号在空间中传播的 CSI(信道状态信息),通过反射、折射和散射特征推断人体状态。整个过程完全在本地处理,原始 CSI 数据不会上传云端。
    2. 🔒 隐私保护从设计开始:与摄像头方案根本不同——RuView 不产生任何视频/图像数据。支持 BFLD 隐私分级,可配置仅输出匿名化结果。对于医院、养老院、卧室等隐私敏感场景,这是唯一合规的智能化方案。
    3. 💰 成本极低、部署简单:ESP32-S3 芯片约 $9,加上普通家用路由器即可搭建完整系统。Docker 一键启动,npm 包即装即用。相比毫米波雷达、热成像等方案,成本降低 10 倍以上。
    4. 🏠 智能家居生态原生支持:Apple HomeKit、Home Assistant、Google Home、Amazon Alexa 四大生态全覆盖。接入后自动暴露 21 个实体,配套 3 个 HA 自动化蓝图,真正实现”即插即用”。
    5. 🤖 AI 智能体时代的最佳拍档:提供标准 MCP 协议接口,可被 Claude Code、Codex 等各类 AI 智能体调用。预训练模型已发布在 HuggingFace(ruvnet/wifi-densepose-pretrained),开箱即用。

    个人使用心得:RuView 代表了一个重要趋势——空间计算 + 隐私优先的融合。在 AI 智能体全面渗透的 2026 年,RuView 让”感知层”变得触手可及。如果你在搭建智能家居、做健康监测产品、或研究 WiFi 感知技术,这个项目绝对值得深入研究。

    📥 下载地址

    📌 技术笔记

    • 项目仍处于 Beta 阶段,API 和固件可能会有变动
    • 预训练模型量化后最小仅 4KB,可在树莓派上微秒级运行
    • 提供 105 个开箱即用的边缘模块,涵盖健康、安防、楼宇、零售等场景
    • 支持 182 篇架构决策记录(ADR),适合学习系统设计
    • GitHub 趋势榜常客,14 天克隆量达 27,887 次

    标签: #RuView #WiFi感知 #空间智能 #智能家居 #隐私优先 #Rust #MIT许可 #AI开源

  • Meetily:隐私优先的AI会议助手,100%本地处理让敏感会议不再泄露,15.8K Stars让AI会议记录做到真正自托管

    Meetily:隐私优先的AI会议助手,100%本地处理让敏感会议不再泄露,15.8K Stars让AI会议记录做到真正自托管

    Meetily AI会议助手

    在远程办公与 AI 浪潮的双重推动下,会议记录工具已成为职场标配。但无论是 Otter.ai、Fireflies 还是其他主流工具,都有一个共同问题:你的会议内容会被上传到别人的服务器。对于金融、法律、医疗、政务等敏感行业,这显然是不可接受的风险。Meetily 给出了一个优雅的解决方案:让 AI 会议助手完全运行在你的本地设备上,100% 数据不出本机。


    🚀 项目简介

    Meetily(原名 Meetly AI)是 Zackriya Solutions 团队开发的开源 AI 会议助手,也是目前 GitHub 上 排名第一的自托管、开源 AI 会议记录工具。项目采用 Rust + Tauri 构建,前端基于 Next.js/React,支持 macOS 和 Windows(Linux 可编译),所有语音识别和 AI 总结均在本地完成,无需任何云端服务。

    核心亮点在于其转录引擎:默认采用 NVIDIA Parakeet 模型,比 Whisper 快 4 倍,同时支持 Whisper 系列模型作为备选。AI 总结部分可对接 Ollama(本地)、Claude、Groq、OpenRouter 或任意 OpenAI 兼容接口,真正做到灵活可控。

    📊 项目数据
    GitHub Stars: 15.8K+ |
    语言: Rust + TypeScript |
    许可证: MIT |
    最新版本: v0.4.0 (2026-06-05)


    ⚙️ 安装要求与过程

    🔧 系统要求

    • macOS:Apple Silicon 或 Intel 架构,需授予麦克风权限
    • Windows:Windows 10+,建议配备 Vulkan 兼容 GPU 以加速转录
    • Linux:支持 AppImage 打包,需自行编译
    • 内存:建议 8GB+(加载 Parakeet 模型约需 2-3GB)

    📦 快速安装(推荐方式)

    1. 访问 GitHub Releases 页面
    2. Windows 用户下载 x64-setup.exe 运行安装
    3. macOS 用户下载 meetily_0.4.0_aarch64.dmg,拖入应用程序文件夹
    4. 首次启动时会自动提示下载转录模型(约 500MB),可选择后台下载
    5. 在设置中配置 AI 总结提供商(推荐 Ollama 本地运行)

    💻 从源码构建(开发者方式)

    # 克隆仓库
    git clone https://github.com/Zackriya-Solutions/meetily.git
    cd meetily
    
    # 安装依赖(需要 Rust + Node.js + pnpm)
    pnpm install
    
    # 运行开发模式
    pnpm tauri dev
    
    # 构建生产版本
    pnpm tauri build

    💡 核心功能

    • 🎙️ 实时本地转写:采用 NVIDIA Parakeet 模型(比 Whisper 快4倍),支持说话人分离(Speaker Diarization),可区分不同参会者;支持多语言,修复了多字节字符截断问题
    • 🤖 灵活 AI 总结:支持 Ollama(本地)、Claude、Groq、OpenRouter 及任意 OpenAI 兼容接口;可自定义总结模板;支持流式生成,生成失败时可保留已生成内容
    • 🔒 100% 本地处理:所有录音、转写文本、AI 总结均存储于本地 SQLite 数据库(meeting_minutes.db),无需联网,无数据泄露风险
    • ⚡ GPU 加速:macOS 支持 Apple Silicon (Metal) + CoreML;Windows/Linux 支持 NVIDIA (CUDA)、AMD/Intel (Vulkan);编译时自动启用,无需额外配置
    • 📥 导入与增强(Beta):支持导入已有音频文件生成转写;可对已录制会议使用不同模型或语言重新转写,全部本地处理

    📦 典型使用场景

    🏢 场景1:金融/法律/医疗机构内部会议

    这些行业对数据合规有严格要求(如 GDPR、HIPAA),不能使用云端会议记录工具。Meetily 让 AI 会议助手完全运行在内网设备上,满足合规审计要求,同时享受 AI 自动生成会议摘要的便利。

    👨‍💻 场景2:远程团队协作记录

    支持 Zoom、Teams、Google Meet 等主流会议平台,可同时录制麦克风和系统音频,智能降噪,自动生成会议摘要。团队成员可各自运行 Meetily,会议记录完全私有,无需担心商业机密泄露。

    🔧 场景3:开发者技术讨论存档

    技术讨论中常涉及代码片段、架构决策等敏感信息。Meetily 本地转写后可导出为 Markdown 格式,直接存入团队知识库(如 Obsidian、Notion 本地版),结合 Ollama 本地运行 Llama 3 生成技术决策摘要,全程无需任何外部 API。


    ⭐ 推荐理由

    作为一名对隐私极其敏感的 AI 从业者,我对市面上的云端会议记录工具一直存有顾虑。Meetily 最大的价值在于:它让 AI 会议助手不再是一个「隐私换便利」的妥协方案。

    项目的 Rust + Tauri 技术选型也值得称赞:相比 Electron 框架,Tauri 打包体积小(约 50MB vs Electron 的 150MB+),内存占用更低,安全性更高。Parakeet 模型的集成更是一个亮点——NVIDIA 的这个模型在准确性和速度上都超越 Whisper,且完全本地可运行。

    MIT 许可证意味着你可以自由修改和分发,对于需要定制功能的团队来说非常友好。如果你在意数据主权,或者所在行业有合规要求,Meetily 是目前唯一值得认真考虑的开源方案。


    📧 下载地址


    💡 Tip: Meetily PRO 版本提供更高的转录精度、自定义摘要模板、PDF/DOCX 导出、自动会议检测和说话人识别等高级功能。社区版将永久免费开源,PRO 版面向需要企业级功能的团队。使用优惠码 LAUNCH20 可获得 20% 折扣。

  • page-agent:阿里巴巴出品的页面内JS GUI代理,一行脚本让网页拥有AI操控能力(23K+Stars)

    page-agent:阿里巴巴出品的页面内JS GUI代理,一行脚本让网页拥有AI操控能力(23K+Stars)

    page-agent Logo

    ## 项目简介

    **page-agent** 是阿里巴巴出品的 **JavaScript 页面内 GUI 代理**,让 AI 通过自然语言直接控制 Web 界面。其核心理念是 —— *”The GUI Agent Living in Your Webpage”*,即:智能体不再运行在外部脚本或 Python 环境中,而是**活在页面内部**,用纯 JavaScript 操作 DOM,实现真正的轻量化 AI 能力嵌入。

    亮点概要:一行脚本接入、无需浏览器插件、无需 Python 环境、无需截图 —— 纯页面内 JS 实现的 GUI 代理,让任何 Web 应用瞬间拥有 AI 操作能力。

    ## 安装要求和过程

    ### 环境要求
    – **浏览器**:任意现代浏览器(Chrome/Edge/Firefox/Safari)
    – **Node.js**:≥ 18(仅 NPM 安装方式需要)
    – **LLM API**:支持接入任意兼容 OpenAI API 格式的大模型(默认可使用阿里云百炼、OpenAI、DeepSeek 等)

    ### 快速安装(一行脚本体验)

    最简单的方式,在任意网页的 HTML 中插入一行 `



    ```

    插入后刷新页面,即可看到 page-agent 的演示界面(使用官方免费测试 LLM)。

    > ⚠️ 免费测试 API 仅用于技术评估,生产使用请接入自有 LLM API Key。

    ### NPM 安装(生产使用)

    ```bash
    npm install page-agent
    ```

    ```javascript
    import { PageAgent } from 'page-agent'

    const agent = new PageAgent({
    model: 'qwen3.5-plus',
    baseURL: 'https://dashscope.aliyuncs.com/compatible-mode/v1',
    apiKey: 'YOUR_API_KEY',
    language: 'zh-CN',
    })

    await agent.execute('点击登录按钮')
    ```

    ## 核心功能

    1

    极低接入成本 —— 一行脚本即可嵌入

    无需浏览器插件、无需 Python 环境、无需无头浏览器,纯页面内 JavaScript 实现,所有功能都在当前网页内运行。仅需一行 <script> 标签即可为任意 Web 应用接入 AI 控制能力,CDN 和 NPM 包双重分发。

    2

    轻量交互模式 —— 基于 DOM 操作,无需截图

    摒弃了传统 GUI 代理依赖截图 + 多模态大模型的重量级方案,page-agent 直接基于 DOM 结构理解页面,用文本描述操作指令。优势:延迟更低、成本更低、无需特殊权限、不依赖视觉大模型。

    3

    自定义大模型支持 —— 无绑定,完全开放

    支持接入任意兼容 OpenAI API 格式的自有 LLM,无厂商绑定。推荐使用阿里云百炼 qwen3.5-plus,也可接入 OpenAI GPT、DeepSeek、Gemini 等主流大模型,灵活适配企业已有 AI 基础设施。

    4

    扩展能力 —— Chrome 扩展 + MCP Server(Beta)

    可选安装 Chrome 扩展,支持跨多页面任务调度;同时提供 Beta 版 MCP Server,允许外部 AI 系统通过 MCP 协议控制浏览器,与主流 AI Agent 框架无缝集成。

    ## 典型使用场景

    ### 场景一:SaaS AI Copilot 快速接入
    仅需少量代码即可为 SaaS 产品接入 AI 助手,用户可通过自然语言操控产品界面,无需重写后端逻辑。例如:在 CRM 系统中,用户说"创建一个跟进任务并设置明天的提醒",page-agent 即可自动完成一系列 DOM 操作。

    ### 场景二:智能表单填充
    将原本需要 20 次点击的复杂工作流简化为一句话指令,特别适合 ERP、CRM、后台管理系统等表单密集型应用。结合 LLM 的语义理解能力,page-agent 可自动识别表单字段并填入正确内容。

    ### 场景三:Web 应用无障碍适配
    通过自然语言、语音指令、屏幕阅读器,让任意 Web 应用实现无障碍使用,极大降低残障人士使用复杂 Web 应用的门槛。page-agent 作为页面内代理,可直接操作 DOM 实现无障碍导航。

    ### 场景四:MCP 协议集成
    通过 Beta 版 MCP Server,允许外部 AI Agent 客户端控制浏览器,实现"AI 操控 AI"的自动化链路。例如:让 Claude Code 通过 MCP 调用 page-agent,实现完整的端到端 Web 自动化测试。

    ## 推荐理由

    > 在传统方案里,让 AI 操控 Web 界面往往意味着:部署 Python 服务、运行无头浏览器、截图 + 多模态大模型理解、处理各种环境依赖……这套方案对中小企业和个人开发者极不友好。

    **page-agent 的最大价值在于"去重量化"** —— 它把 GUI 代理的核心能力塞进了一个 JS 脚本里,让任何能加载 JS 的网页都能获得 AI 操控能力。这对以下人群尤为有价值:

    - **前端开发者**:无需学习 Python 自动化框架,直接用 TypeScript 扩展 AI 能力
    - **SaaS 产品经理**:快速为产品 prototype 添加 AI Copilot,验证用户需求
    - **企业 IT**:为内部 ERP/CRM 系统添加自然语言操作界面,提升员工效率
    - **无障碍开发**:用最简单的方式为现有 Web 应用添加语音/自然语言操控

    此外,项目由 **阿里巴巴** 官方开源,采用 MIT 许可证,社区活跃,文档完善(在线 Demo、完整文档站、HN 讨论帖均已上线),值得长期关注。

    🔗 相关链接

    GitHub:github.com/alibaba/page-agent(23K+ Stars)

    在线演示:alibaba.github.io/page-agent

    官方文档:alibaba.github.io/page-agent/docs

    NPM 包:npmjs.com/package/page-agent

    许可证:MIT License(可自由商用、修改、分发)

  • 扎克伯格亲口承认:Meta的AI代理进展,比我们想的慢

    用AI替代人类员工这件事,说起来容易做起来难——Meta大概正在用自己的经历验证这句话。

    扎克伯格谈AI代理
    扎克伯格在内部会议上谈AI代理进展

    路透社报道,在本周四的一次内部全员大会上,CEO扎克伯格告诉员工:AI代理的开发速度,并没有像高管们之前预期的那样”加速”起来。

    扎克伯格的原话是:AI代理开发的进度,没有以高管们此前预期的方式加速。换句话说,Meta寄予厚望的AI代理业务,实际跑得比内部时间表慢。

    裁员之后,结果还没看到

    这话背后有个重要背景。今年早些时候,Meta裁掉了大约8000名员工(占公司职能岗位的10%),又把7000人转到了各个AI相关团队,其中包括一个叫”Agent Transformation”的组。

    扎克伯格在会上提到,这些裁员”没有做到本该有的那么干净利落”。他解释称,裁员是因为公司高层担心大家适应行业变化的速度不够快——结果现在他自己承认,AI代理这边也还没快起来。

    至于外界最关心的部分:扎克伯格说,他认为公司在接下来三到六个月里,会开始看到AI投资带来的改善。但到目前为止,那个被寄予厚望的新AI架构的”预期好处”,还没有真正兑现。


    工程师眼中的”灵魂压榨”

    多个调查报道已经把Meta成立才几个月的AI部门形容为”灵魂碾压的地狱”——至少对一些被转进去的工程师来说是这样。工作环境、预期管理、资源分配,似乎都没跟上扎克伯格的愿景速度。

    与此同时,Meta在AI上的真金白银可没少花。路透社说,Meta今年预计要在AI基础设施上投入多达1450亿美元。这个数字放在任何行业都是天量,但内部的进展速度显然让扎克伯格自己都有点坐不住了。

    当然,AI代理这个方向本身没人否认。问题是,从”我们要做AI代理”到真正跑出一个能替代知识工作的系统,中间的工程、产品、信任问题,比Meta当初设想的要多得多。