标签: 浏览器自动化

  • Browser Use:让 AI 像人一样操作浏览器的开源智能体(10.5万+ Star)

    Browser Use:让 AI 像人一样操作浏览器的开源智能体(10.5万+ Star)

    Browser Use 自动填写表单演示

    Browser Use 是一个让 AI 像人一样操作浏览器的开源智能体框架——你用自然语言描述任务,它便自动打开网页、点击按钮、输入文字、填写表单,一站式完成多步骤的网页操作。

    一、项目简介

    🌐 Make websites accessible for AI agents. Automate tasks online with ease.

    Browser Use 把”浏览器”变成 AI Agent 可直接操控的环境。它目前拥有 10.5 万+ Star(Python 编写,MIT 许可),并在 Odyssey 长程网页任务榜上以 87.4% 的平均成功率排名第一,超越了 OpenAI、Anthropic、Google、Microsoft 各自的 computer-use 方案。它既是给现有编码 Agent(Claude Code / Codex / Cursor 等)即插即用的”浏览器技能”,也是可规模化调用的 Python 库。

    二、安装要求与过程

    环境要求:

    • Python ≥ 3.11(官方推荐 3.12,可用 uv 管理)
    • 本地无需额外安装 Chromium,Browser Use 会按需驱动 Playwright 浏览器
    • 一个 LLM API Key(Browser Use 云、OpenAI、Anthropic、Google,或本地 Ollama 模型均可)

    快速安装:

    1. 安装库:
      pip install browser-use  (或 uv add browser-use
    2. .env 中配置 Key:
      BROWSER_USE_API_KEY=your-key  或  ANTHROPIC_API_KEY=... / GOOGLE_API_KEY=...
    3. 运行你的第一个 Agent:
    import asyncio
    from browser_use import Agent, ChatBrowserUse
    
    async def main():
        agent = Agent(
            task="Find the number of stars of the browser-use repo",
            llm=ChatBrowserUse(model="openai/gpt-5.5"),
        )
        history = await agent.run()
    
    asyncio.run(main())

    若你已在使用 Claude Code / Codex / Cursor 等编码 Agent,只需让 Agent 执行一次 browser-use skill install,即可把浏览器能力挂载到现有工作流中,无需自己写代码。

    三、核心功能

    • 自然语言驱动浏览器:自动打开页面、点击、输入、填表、翻页,把”多步骤网页操作”压缩成一句话指令。
    • 双形态接入:CLI 模式配合已有 Agent 即装即用;Python 库模式支持定时、并行、嵌入自有产品,细粒度控制浏览器。
    • 多模型统一接入:ChatBrowserUseprovider/model 前缀即可切换 OpenAI / Anthropic / Google,或走本地 Ollama 模型,一个 Key 通吃。
    • 强扩展能力:支持自定义 Tools、MCP 协议,云端版更提供 1000+ 集成(Gmail、Slack、Notion 等)与持久化记忆。
    • SOTA 级表现:Odyssey 200 项长程网页任务榜第一(87.4%),官方基准在 100 个真实任务上开源可复现。

    四、典型使用场景

    1. 自动填表与办事
    让 Agent 带着你的简历信息自动填写并投递职位申请、注册账号、提交各类在线表单。

    2. 网页数据采集
    从任意网站抽取结构化数据并导出为 CSV,例如”抓取我关注者的资料并整理成表格”。

    Browser Use 网站 QA 自动化演示

    3. 网站 QA 自动化
    对本地站点做可用性、视觉一致性与 Bug 巡检,自动产出测试报告,替代部分人工回归测试。

    五、推荐理由

    作为重度网页操作用户,我对 Browser Use 最大的感受是”把重复劳动还给机器“——订票比价、表单填报、定点抓取这类机械活,原来要人守着点半小时,现在一句话交代清楚就能后台跑。

    它开源免费、本地可控,隐私敏感的任务完全可以在本机跑;遇到强反爬、验证码场景再切到云端(代理轮换 + 隐身指纹 + 验证码破解)。对开发者而言,Python 库 + 自定义 Tools + MCP 的扩展性,让它不只是玩具,而是能真正嵌进产品的浏览器自动化底座。如果你已经在用 Cursor / Claude Code,强烈建议装一下它的 skill 体验。

    六、下载地址

    (本文配图来自项目官方 README,版权归 Browser Use 团队所有。)

  • Page Agent:阿里巴巴开源的“住在网页里的”GUI 智能体,一行脚本让网页自己动起来

    Page Agent:阿里巴巴开源的“住在网页里的”GUI 智能体,一行脚本让网页自己动起来

    Page Agent 项目横幅

    项目简介

    Page Agent 是阿里巴巴开源的一个运行在网页内部的 JavaScript GUI 智能体。只需一行脚本,就能让任意网页拥有自己的 AI 代理,用自然语言直接控制 Web 界面——点击按钮、填写表单、跳转页面,全部交给 AI 完成。项目当前已收获约 2.6 万 Star,采用 MIT 协议,主要使用 TypeScript 编写,运行时以纯前端 JavaScript 注入。

    “The GUI Agent Living in Your Webpage. One script gives any web page its own AI agent.”

    安装要求和过程

    环境要求

    • 任意支持 <script> 标签或 npm 的网页环境即可;
    • 无需浏览器扩展、Python 或无头浏览器,纯前端运行;
    • 如需自托管大模型,需一个可访问的模型 API(如通义千问 Qwen、本地模型等);
    • 使用 npm 安装 / 二次构建时需要 Node.js 环境。

    快速安装(三种方式)

    方式一:CDN 一行接入

    <script
        src="https://cdn.jsdelivr.net/npm/page-agent@1.12.1/dist/iife/page-agent.demo.js"
        crossorigin="anonymous"
    ></script>

    国内镜像:https://registry.npmmirror.com/page-agent/1.12.1/files/dist/iife/page-agent.demo.js

    方式二:NPM 安装

    npm install page-agent
    import { PageAgent } from 'page-agent'
    
    const agent = new PageAgent({
        model: 'qwen3.5-plus',
        baseURL: 'https://dashscope.aliyuncs.com/compatible-mode/v1',
        apiKey: 'YOUR_API_KEY',
        language: 'en-US',
    })
    
    await agent.execute('Click the login button')

    方式三:Chrome 扩展 —— 从 Chrome 网上应用店安装 Page Agent 扩展,用于跨多标签页的多页面任务。

    核心功能

    • 🎯 极简集成:纯页面内 JavaScript,不需要浏览器扩展、Python 或无头浏览器,几行代码即可嵌入。
    • 📖 基于文本的 DOM 操作:无需截图、不依赖多模态大模型或特殊权限,通过结构化 DOM 文本理解页面并执行操作。
    • 🧠 自带 LLM(BYO):支持绝大多数主流模型(含本地部署),模型选择完全自由。
    • 🐙 可选 Chrome 扩展:支持跨标签页的多页面任务编排。
    • 🔌 MCP Server(Beta):允许外部 Agent 客户端(如 Claude Code / Cursor)从外部控制你的浏览器。

    典型使用场景

    • SaaS AI Copilot:几行代码为自家产品嵌入 AI 助手,无需重写后端,立刻获得“对话式操作界面”能力。
    • 智能表单填充:把原本需要 20 步点击的流程压缩成一句话,特别适合 ERP / CRM / 后台管理系统等高频重复操作。
    • 无障碍访问:通过自然语言让任何 Web 应用变得可操作,配合语音 / 读屏为行动不便的用户打开大门。
    • 多页面自动化 / MCP 控制:借助 Chrome 扩展或 MCP Server,让 AI 跨页面完成复杂工作流(如比价、数据搬运)。

    推荐理由

    我第一次看到 Page Agent 时最直接的感受是:它把“浏览器自动化”这件事做得太轻了。传统方案(如 Playwright / Puppeteer 脚本、或无头浏览器方案)要么要写一堆选择器、要么要吃截图走多模态,门槛和成本都不低。Page Agent 反其道而行——它就活在页面里,用文本化的 DOM 理解来“读懂”界面,再用自然语言驱动操作,心智负担几乎为零。

    对前端 / 产品同学尤其友好:你想给后台加个“AI 帮我导这份报表”的入口,挂一段脚本就行,不用动架构。再加上它支持 BYO 模型、可接本地大模型,数据不出内网也能玩。如果你正琢磨怎么给产品接一个“会自己点页面”的 AI,Page Agent 是目前最省心、最贴近生产的选择之一。

    下载地址

  • chrome-devtools-mcp:Chrome 官方出品,让 AI 编程助手直接操控与调试浏览器

    chrome-devtools-mcp:Chrome 官方出品,让 AI 编程助手直接操控与调试浏览器

    Chrome DevTools MCP

    chrome-devtools-mcp 是 Chrome DevTools 官方团队推出的一个 MCP(Model Context Protocol)服务器,它把整个 Chrome 开发者工具的能力开放给 AI 编程助手——让 Claude、Cursor、Copilot、Gemini CLI 等智能体能够直接控制并检视一个真实运行的 Chrome 浏览器,实现可靠的自动化、深度调试和性能分析。截至目前该项目在 GitHub 已收获约 46,700+ Stars

    项目简介

    一句话说明:chrome-devtools-mcp 让你的 AI 编程助手拥有一双”眼睛”和一双”手”,可以打开网页、点击操作、查看网络请求与控制台报错、录制性能 trace,从而真正”看见”自己写的代码在浏览器里跑成什么样。它基于 Puppeteer 驱动 Chrome,并会自动等待操作结果,让智能体的浏览器操作变得稳定可靠。

    安装要求和过程

    环境要求

    • Node.js —— LTS 版本
    • Chrome —— 当前稳定版或更新版本
    • npm

    快速安装

    无需手动安装,直接在 MCP 客户端配置中通过 npx 拉起即可。以标准配置为例,在客户端的 MCP 配置文件中加入:

    {
      "mcpServers": {
        "chrome-devtools": {
          "command": "npx",
          "args": ["-y", "chrome-devtools-mcp@latest"]
        }
      }
    }

    使用 Claude Code CLI 的用户可以一行命令完成添加:

    claude mcp add chrome-devtools --scope user npx chrome-devtools-mcp@latest

    如果只需要基础的导航、执行脚本与截图,可以用精简 + 无头模式降低开销:

    "args": ["-y", "chrome-devtools-mcp@latest", "--slim", "--headless"]

    核心功能

    • 性能洞察:调用 Chrome DevTools 录制性能 trace,并提取可执行的优化建议(如”检查 https://developers.chrome.com 的性能”)。
    • 高级浏览器调试:分析网络请求、抓取截图、读取控制台消息,并附带经过 source map 还原的堆栈信息。
    • 可靠自动化:底层由 Puppeteer 驱动,自动等待动作完成,避免因时序问题导致的操作失败。
    • 丰富的工具集:涵盖输入自动化、页面导航、设备模拟、性能、网络、调试、内存、扩展等 10 大类共 50 余个工具。
    • 灵活的连接方式:支持无头/有头、隔离实例、指定 Chrome 通道,还能通过 --autoConnect / --browser-url 连接已经在运行的 Chrome,与人工共享登录状态。

    典型使用场景

    • 前端性能诊断:让 AI 助手打开你的站点自动录制性能 trace,指出 LCP、长任务、渲染阻塞等瓶颈并给出改进方案,把”性能优化”从玄学变成可量化的闭环。
    • 自动化调 Bug:当页面报错或接口异常时,智能体可直接查看控制台报错和网络请求详情(含还原后的堆栈),定位问题后再改代码,减少来回复制粘贴。
    • 沙箱内安全调试:在沙箱里运行 MCP,连接沙箱外带远程调试端口的 Chrome,既保证隔离又能复用真实浏览器环境,适合 Agent 产品集成浏览器能力。

    推荐理由

    用下来最大的感受是:它补齐了 AI 编程助手最缺的一环——“看得见运行结果”。过去让 AI 改前端,它只能凭代码想象效果;接入之后,它能真正打开页面、看到报错、量到性能数据,再回头改代码,闭环体验明显更靠谱。作为 Chrome DevTools 官方出品的项目,工具设计规范、更新及时,且用 npx 零安装接入、Apache-2.0 开源,几乎没有上手门槛。如果你已经在用 Claude Code、Cursor 或 Copilot 做前端开发,非常值得加上这一个 MCP。

    下载地址

    项目信息:ChromeDevTools 官方出品 · TypeScript 开发 · Apache-2.0 许可 · 约 46,700+ GitHub Stars。

  • browser-use:99.6k Stars!让AI代理自动操作浏览器,网页自动化从未如此简单

    browser-use:99.6k Stars!让AI代理自动操作浏览器,网页自动化从未如此简单

    browser-use logo
    browser-use – AI浏览器自动化工具

    📦 项目简介

    browser-use 是一个让AI代理能够自动操作浏览器的开源工具,通过自然语言指令即可完成各类网页操作,无需手动编写复杂的爬虫逻辑。无论是表单填写、网页信息提取,还是复杂的多步骤网页交互,AI都能帮你自动完成。


    ⚙️ 安装要求和过程

    环境要求

    • Python版本:≥3.11
    • 推荐包管理工具uv(也可使用pip等常规Python包管理工具)
    • 浏览器:自动安装Chromium(也可使用本地已安装的Chrome/Edge)

    快速安装步骤

    # 1. 初始化项目并安装browser-use
    uv init && uv add browser-use && uv sync
    
    # 2. 若本地未安装Chromium,执行以下命令自动安装
    uvx browser-use install

    可选配置

    • 如需使用云端能力,可前往 Browser Use Cloud 获取API Key,在.env文件中配置即可
    • 支持对接多种LLM提供商:自带优化后的ChatBrowserUse模型,也支持Google Gemini、Anthropic Claude、OpenAI等主流模型,还可对接Ollama运行本地模型

    💡 核心功能

    • 自然语言控制浏览器:支持AI代理通过自然语言指令自动完成各类网页操作,无需手动编写复杂爬虫逻辑
    • 双模式支持:提供开源版本云端托管版本两种使用模式,可按需选择
    • 丰富的工具集成:支持集成1000+第三方工具(如Gmail、Slack、Notion等),支持自定义工具扩展
    • CLI命令行支持:提供CLI命令行快速操作,提供持久化浏览器会话,适合快速迭代调试
    • AI编码工具集成:支持Claude Code等AI编码工具集成,可直接对接AI工作流

    云端版本专属能力

    • 更强的复杂任务处理能力,任务完成准确率远高于开源版本
    • 内置隐身浏览器指纹、代理轮换、验证码自动解决能力,避免被网站反爬检测
    • 支持持久化文件系统和记忆,适合长期运行的代理任务
    • 无需本地部署,开箱即用,支持大规模并行任务调度

    🚀 典型使用场景

    1. 个人效率提升:自动完成重复性网页操作,如批量填写表单、自动购物、自动整理网页信息等
    2. AI应用开发:作为AI代理的浏览器交互层,让AI具备操作网页的能力,开发智能助手类产品
    3. 企业级自动化:结合云端版本的扩展能力,实现大规模网页数据采集、业务流程自动化等场景
    4. 编码辅助:对接Cursor、Claude Code等AI编码工具,让AI可以直接操作浏览器验证代码效果、调试网页相关问题

    🌟 推荐理由

    在AI Agent爆发的2026年,让AI具备操作浏览器的能力,就像给AI装上了一双”眼睛”和”手”。browser-use不仅简化了浏览器自动化的开发流程,更重要的是它让AI真正能够与世界互动——从简单的信息查询到复杂的多步骤业务流程,都可以通过自然语言来完成。

    特别推荐它的双模式设计:如果你只是想快速尝试,开源版本足够使用;如果你需要生产级别的稳定性和扩展性,云端版本提供了完整的解决方案。这种灵活的设计理念,让不同需求的开发者都能找到适合自己的使用方式。

    另外,它对主流LLM的原生支持也是一大亮点。无论你用的是Claude、GPT还是本地部署的模型,都能无缝对接。这种开放性的设计,正是开源项目的魅力所在。


    📥 下载地址


    ⭐ 如果你觉得这个项目有帮助,欢迎到GitHub上给它一个Star!

  • 【开源推荐】chrome-devtools-mcp:43.5K+ Stars!Google官方出品,让AI编程助手直接操控Chrome浏览器

    【开源推荐】chrome-devtools-mcp:43.5K+ Stars!Google官方出品,让AI编程助手直接操控Chrome浏览器

    🔥 GitHub 热门 AI 开源项目

    chrome-devtools-mcp

    43.5K+ Stars · Google Chrome 官方团队出品 · MCP 协议 · 浏览器自动化

    📌 项目简介

    chrome-devtools-mcp 是 Google Chrome DevTools 团队官方开源的 MCP(Model Context Protocol)服务器,它将 Chrome 浏览器的完整调试能力通过标准化协议暴露给 AI 编程助手。借助它,Claude Code、Cursor、Copilot、Antigravity 等 AI 工具可以直接控制浏览器、抓取性能数据、执行自动化测试,真正实现”AI 懂浏览器”。

    ⚙️ 安装要求与过程

    环境要求
    • Node.js LTS 长期支持版
    • Google Chrome 稳定版或更新版本
    • npm 包管理工具
    快速安装(4步搞定)
    # 1. 在 MCP 客户端配置中添加(以 Claude Code 为例)
    claude mcp add chrome-devtools –scope user \
      npx chrome-devtools-mcp@latest

    # 2. 或者直接在 MCP 配置 JSON 中添加
    {
      “mcpServers”: {
        “chrome-devtools”: {
          “command”: “npx”,
          “args”: [“-y”, “chrome-devtools-mcp@latest”]
        }
      }

    # 3. 无头模式 + 精简模式(仅3个核心工具)
    args: [“-y”, “chrome-devtools-mcp@latest”, “–slim”, “–headless”]

    # 4. 验证安装
    在 AI 客户端中输入:
    “Check the performance of https://developers.chrome.com”

    ✨ 核心功能

    🔧 完整的浏览器自动化
    基于 Puppeteer 实现,支持点击、拖拽、表单填充、文件上传、弹窗处理等 10 类输入自动化操作,且自动等待操作结果,避免时序问题。

    📊 性能分析 & Lighthouse 审计
    录制 Chrome 性能追踪(trace),提取可落地的性能优化建议;集成 Lighthouse,一键完成 PWA、SEO、可访问性审计。

    🐛 深度调试能力
    查看网络请求详情、截取页面截图、获取控制台消息(支持源码映射栈追踪)、获取堆内存快照,调试能力媲美手动打开 DevTools。

    🔌 多客户端支持
    原生支持 Claude Code、VS Code Copilot、Cursor、Antigravity、Gemini CLI、Windsurf 等所有主流 AI 编程工具,配置即用。

    🛠️ 48+ 工具全覆盖
    提供输入自动化、导航、设备模拟、性能分析、网络调试、内存调试、Chrome 扩展操作等 6 大类 48 个工具,满足各类浏览器自动化需求。

    🚀 典型使用场景

    场景一:AI 辅助前端性能优化
    让 Claude Code 打开你的前端项目页面,自动录制性能追踪,分析长任务、布局抖动、网络瀑布流,并给出针对性的优化建议。整个过程无需手动操作 DevTools。

    场景二:E2E 自动化测试生成
    告诉 AI 助手”帮我测试登录流程”,它会自动操控浏览器完成用户名输入、密码填写、按钮点击,并验证跳转结果。比传统 E2E 测试框架更灵活,用例用自然语言描述即可。

    场景三:Web 截图 & 视觉回归
    需要批量截取页面截图?AI 助手可以自动控制浏览器遍历页面,截图并对比基线图片,快速发现视觉回归问题。配合 CI/CD 流水线,实现全自动视觉测试。

    💡 推荐理由

    chrome-devtools-mcp 最大的价值在于打通了 AI 与现实浏览器之间的最后一公里。以前 AI 编程助手只能改代码,改完还需要开发者手动打开浏览器验证;现在 AI 可以自己打开页面、重现 Bug、截取证据、甚至给出修复后的验证结果。

    作为 Google Chrome 团队官方出品的项目,它的可靠性和迭代速度都有保障。特别是 –slim 精简模式的设计非常贴心——如果你只需要基础的页面导航和截图,3 个工具就够用,不会让 AI 的上下文被大量工具描述占据。

    对于 daily 使用 AI 编程工具的开发者,这个项目几乎是一个”必装”的 MCP 服务器。它让 AI 从”代码生成器”进化成了”全栈开发助手”,值得每个前端/全栈工程师尝试。🌟

    📦 下载地址

    License: Apache-2.0 | 开发语言: TypeScript | 维护方: Google Chrome DevTools Team

  • 【开源推荐】Skyvern:21.8K+ Stars!AI视觉浏览器自动化,让网页操作像对话一样自然

    【开源推荐】Skyvern:21.8K+ Stars!AI视觉浏览器自动化,让网页操作像对话一样自然

    Skyvern:21.8K+ Stars!AI 视觉浏览器自动化,让网页操作像对话一样自然

    基于 LLM + 计算机视觉 · 告别脆弱的 XPath 选择器 · 自适应任意网站布局

    📌 项目简介

    Skyvern 是一款基于大语言模型(LLM)和计算机视觉的开源浏览器自动化工具。与传统依赖 XPath/选择器的脆弱自动化脚本不同,Skyvern 通过 AI 视觉理解网页结构,自动适配任意网站布局变化,真正实现了”一次编写,随处运行”的浏览器自动化体验。项目在 GitHub 已获得 21,880+ Stars,是 AI RPA 领域的热门开源项目。

    21.8K+
    GitHub Stars

    64.4%
    WebBench 准确率 SOTA

    AGPL-3.0
    开源协议

    Playwright
    兼容增强 SDK

    ⚙️ 安装要求和过程

    方式一:pip 安装(推荐)

    环境要求:Python 3.11 / 3.12 / 3.13;Windows 用户需安装 Rust 运行时和 VS C++ 开发工具

    # 安装 Skyvern
    pip install "skyvern[all]"
    
    # 快速启动(默认 SQLite)
    skyvern quickstart
    
    # 如需 PostgreSQL
    skyvern quickstart --postgres

    方式二:Docker Compose(完全容器化)

    git clone https://github.com/Skyvern-AI/skyvern.git
    cd skyvern
    cp .env.example .env   # 编辑 .env 填入 LLM API Key
    docker compose up -d
    # 访问 http://localhost:8080

    方式三:Skyvern Cloud(免维护)

    直接访问 app.skyvern.com 注册使用,自带反机器人检测、代理网络、验证码破解等高级功能。

    ⭐ 核心功能

    ① AI 增强的浏览器操作
    通过 4 个核心 AI 指令(act / extract / validate / prompt)用自然语言驱动浏览器,无需手写选择器。同时兼容所有 Playwright 原生操作,支持”传统选择器 + AI 定位”混合模式。

    ② 可视化工作流编排
    提供无代码工作流构建器,支持浏览器任务、数据提取、循环、条件判断、HTTP 请求、自定义代码块等能力,非技术用户也能搭建复杂自动化流程。

    ③ 强大的认证与 2FA 支持
    内置密码管理器集成(Bitwarden / 1Password / LastPass),支持 TOTP 双因素认证(Google Authenticator / Authy)、邮件 2FA、短信 2FA,可自动化登录各类需认证的网站。

    ④ 多 LLM 兼容 + MCP 协议支持
    支持 OpenAI、Anthropic Claude、Azure OpenAI、AWS Bedrock、Gemini、Ollama、OpenRouter 及任何 OpenAI 兼容端点;同时支持 MCP 协议,可对接 Zapier、Make.com、N8N 等平台。

    ⑤ 实时浏览器直播与本地 Chrome 控制
    可实时直播浏览器视口画面便于调试;支持接入本地已安装的 Chrome(通过 CDP 调试协议),复用已有 Cookie、登录态和浏览器扩展,真正实现”人机协同”自动化。

    🚀 典型使用场景

    场景一:跨网站发票自动下载
    企业需要定期从多个供应商网站下载发票,传统 RPA 脚本逢网站改版即失效。使用 Skyvern,只需描述”登录各供应商网站,下载上月发票并保存到指定目录”,AI 即可自动适配不同网站布局完成任务,网站改版也无需维护脚本。

    场景二:批量联系表单提交
    市场团队需要在上百个网站的”联系我们”表单提交产品咨询。Skyvern 通过 AI 视觉理解每个表单的字段含义,自动填写并提交,无需为每个网站单独编写填表规则,效率提升 10 倍以上。

    场景三:求职申请自动填写
    在多个招聘平台投递简历时,Skyvern 可自动识别各平台的简历上传入口和表单字段,自动填写个人信息并提交申请,大幅减少重复性操作,让求职者专注于准备面试。

    💡 推荐理由

    作为一名经常需要与多个网站打交道的开发者,我深刻体会过传统浏览器自动化的痛点——XPath 一改,脚本全挂。Skyvern 最打动我的是它”用 AI 视觉理解网页”的思路:不再依赖固定的 DOM 选择器,而是由 LLM 实时分析页面视觉结构,真正做到了”布局无关”。

    另一个亮点是它与 Playwright 的深度兼容——你可以在同一个脚本里混合使用传统选择器(高性能)和 AI 操作(高适配),这种渐进式采用策略对已有自动化代码库的团队非常友好。加上对工作流编排、多 LLM 支持和企业级认证能力的覆盖,Skyvern 正在重新定义”AI + RPA”的边界。

    ⚠️ 注意:核心代码以 AGPL-3.0 开源,但反机器人检测等高级功能仅在托管云服务中提供。如果只是内部使用,完全够用;如果用于商业产品,建议评估云服务的许可方案。

    📌 更多 GitHub 热门 AI 开源项目介绍,请持续关注本站「开源项目」栏目
  • Browser-Use:97.8K Stars!让AI Agent自动操控浏览器的开源神器

    Browser-Use:97.8K Stars!让AI Agent自动操控浏览器的开源神器

    📝 项目简介

    Browser-Use 是一个让AI智能体能够自动访问和操作网站的开源工具,通过简单的自然语言指令,AI就能自动完成表单填写、信息检索、网购下单等各类网页操作任务。

    🌐 官网:https://browser-use.com

    📦 GitHub:https://github.com/browser-use/browser-use

    ⭐ Stars:97.8K+

    📄 开源协议:MIT License

    💻 安装要求和过程

    环境要求

    • Python >= 3.11
    • 推荐使用包管理工具 uv
    • 可选:Playwright(用于浏览器自动化)

    快速安装步骤

    # 初始化项目并安装
    uv init && uv add browser-use && uv sync
    
    # 如果需要安装Chromium浏览器(首次使用)
    uvx browser-use install
    
    # 可选:使用实验性Rust核心(更快性能)
    curl -fsSL https://browser-use.com/terminal/install.sh | sh

    配置API密钥(可选)

    # 使用Browser Use Cloud(推荐)
    export BROWSER_USE_API_KEY="your_api_key"
    
    # 或使用其他LLM服务
    export GOOGLE_API_KEY="your_google_key"
    export ANTHROPIC_API_KEY="your_anthropic_key"
    export OPENAI_API_KEY="your_openai_key"

    ✨ 核心功能

    1. 🤖 AI智能体浏览器自动化

    通过自然语言指令让AI自动完成网页操作,无需编写复杂的自动化脚本。AI会智能识别页面元素,自动完成点击、输入、滚动、截图等操作。

    2. 🌐 多场景任务支持

    覆盖表单填写、生鲜采购、硬件选购、信息检索等各类线上任务。无论是自动化测试、数据采集还是日常办公,都能轻松应对。

    3. 🔧 灵活部署方案

    支持开源本地部署和云端托管两种使用方式。本地部署完全免费,云端版本提供指纹伪装、代理轮换、验证码破解等高级功能。

    4. 🔌 强大的扩展能力

    支持添加自定义工具、接入MCP工具、对接1000+第三方应用(Gmail、Slack、Notion等)。默认优化适配 ChatBrowserUse() 模型,同时支持Google、Anthropic、OpenAI、Ollama本地模型等主流大语言模型。

    5. 💻 CLI命令行工具

    提供命令行工具,支持快速导航、元素点击、文本输入、截图等浏览器操作,支持多命令间浏览器状态保持,非常适合脚本化和自动化场景。

    🎯 典型使用场景

    场景一:自动化表单填写

    自动填写求职申请、各类线上登记表,可自动匹配简历信息,大大提升效率。对于需要重复填写类似表单的场景,可以节省大量时间。

    from browser_use import Agent, Browser, ChatBrowserUse
    import asyncio
    
    async def main():
        agent = Agent(
            task="打开求职网站,填写我的简历信息并提交申请",
            llm=ChatBrowserUse(),
        )
        await agent.run()
    
    if __name__ == "__main__":
        asyncio.run(main())

    场景二:电商自动化操作

    自动将购物清单加入购物车、比价、下单等。可以编写脚本定期监控商品价格,在合适的时候自动下单。

    场景三:信息查询与数据采集

    自动查询GitHub仓库Star数、检索商品信息、收集公开数据等。配合定时任务,可以实现全自动的数据监控和采集。

    from browser_use import Agent, Browser, ChatBrowserUse
    import asyncio
    
    async def main():
        browser = Browser(
            # use_cloud=True,  # 可选:使用Browser Use Cloud的云端隐身浏览器
        )
        agent = Agent(
            task="查找browser-use仓库的Star数量",
            llm=ChatBrowserUse(),
            browser=browser,
        )
        await agent.run()
    
    if __name__ == "__main__":
        asyncio.run(main())

    💡 推荐理由

    作为一名开发者,我深刻体会到浏览器自动化在日常工作中的重要性。传统的Selenium、Playwright等工具虽然强大,但需要编写大量的代码来处理各种页面元素和交互逻辑。

    Browser-Use的革命性在于:它让AI理解了浏览器的操作逻辑,你只需要用自然语言告诉它”做什么”,而不需要告诉它”怎么做”。

    我个人使用Browser-Use的几个心得:

    • 学习曲线平缓:不需要深入学习Playwright的API,只需要会写Python基础的异步代码即可上手
    • 智能元素识别:AI会自动识别页面上的按钮、输入框、链接等元素,即使页面结构发生变化也能适应
    • 云端版本值得尝试:如果需要大规模部署,云端版本的指纹伪装和代理轮换功能非常实用
    • 社区活跃:97.8K的Stars数量说明了项目的热度,Issue响应速度快,文档完善

    如果你正在寻找一个让AI帮你操作浏览器的工具,Browser-Use绝对是2026年最值得关注的开源项目之一!

    📥 下载地址

    🌐 官方网站:https://browser-use.com

    ☁️ 云端服务:https://cloud.browser-use.com

    📦 GitHub仓库:https://github.com/browser-use/browser-use

    📚 官方文档:https://docs.browser-use.com

    💬 Discord社区:https://discord.gg/browser-use


    📌 本文是《GitHub热门AI开源项目》系列的第17期,每期介绍一个热门的AI开源项目。欢迎关注本栏目,获取更多优质开源项目介绍!

  • browser-use:95.3k Stars!让AI代理自动操作浏览器,网页自动化从未如此简单

    browser-use:95.3k Stars!让AI代理自动操作浏览器,网页自动化从未如此简单

    browser-use logo
    browser-use – AI浏览器自动化工具

    📦 项目简介

    browser-use 是一个让AI代理能够自动操作浏览器的开源工具,通过自然语言指令即可完成各类网页操作,无需手动编写复杂的爬虫逻辑。无论是表单填写、网页信息提取,还是复杂的多步骤网页交互,AI都能帮你自动完成。


    ⚙️ 安装要求和过程

    环境要求

    • Python版本:≥3.11
    • 推荐包管理工具uv(也可使用pip等常规Python包管理工具)
    • 浏览器:自动安装Chromium(也可使用本地已安装的Chrome/Edge)

    快速安装步骤

    # 1. 初始化项目并安装browser-use
    uv init && uv add browser-use && uv sync
    
    # 2. 若本地未安装Chromium,执行以下命令自动安装
    uvx browser-use install

    可选配置

    • 如需使用云端能力,可前往 Browser Use Cloud 获取API Key,在.env文件中配置即可
    • 支持对接多种LLM提供商:自带优化后的ChatBrowserUse模型,也支持Google Gemini、Anthropic Claude、OpenAI等主流模型,还可对接Ollama运行本地模型

    💡 核心功能

    • 自然语言控制浏览器:支持AI代理通过自然语言指令自动完成各类网页操作,无需手动编写复杂爬虫逻辑
    • 双模式支持:提供开源版本云端托管版本两种使用模式,可按需选择
    • 丰富的工具集成:支持集成1000+第三方工具(如Gmail、Slack、Notion等),支持自定义工具扩展
    • CLI命令行支持:提供CLI命令行快速操作,提供持久化浏览器会话,适合快速迭代调试
    • AI编码工具集成:支持Claude Code等AI编码工具集成,可直接对接AI工作流

    云端版本专属能力

    • 更强的复杂任务处理能力,任务完成准确率远高于开源版本
    • 内置隐身浏览器指纹、代理轮换、验证码自动解决能力,避免被网站反爬检测
    • 支持持久化文件系统和记忆,适合长期运行的代理任务
    • 无需本地部署,开箱即用,支持大规模并行任务调度

    🚀 典型使用场景

    1. 个人效率提升:自动完成重复性网页操作,如批量填写表单、自动购物、自动整理网页信息等
    2. AI应用开发:作为AI代理的浏览器交互层,让AI具备操作网页的能力,开发智能助手类产品
    3. 企业级自动化:结合云端版本的扩展能力,实现大规模网页数据采集、业务流程自动化等场景
    4. 编码辅助:对接Cursor、Claude Code等AI编码工具,让AI可以直接操作浏览器验证代码效果、调试网页相关问题

    🌟 推荐理由

    在AI Agent爆发的2026年,让AI具备操作浏览器的能力,就像给AI装上了一双”眼睛”和”手”。browser-use不仅简化了浏览器自动化的开发流程,更重要的是它让AI真正能够与世界互动——从简单的信息查询到复杂的多步骤业务流程,都可以通过自然语言来完成。

    特别推荐它的双模式设计:如果你只是想快速尝试,开源版本足够使用;如果你需要生产级别的稳定性和扩展性,云端版本提供了完整的解决方案。这种灵活的设计理念,让不同需求的开发者都能找到适合自己的使用方式。

    另外,它对主流LLM的原生支持也是一大亮点。无论你用的是Claude、GPT还是本地部署的模型,都能无缝对接。这种开放性的设计,正是开源项目的魅力所在。


    📥 下载地址


    ⭐ 如果你觉得这个项目有帮助,欢迎到GitHub上给它一个Star!