标签: Playwright

  • Browser Use:让 AI 像人一样操作浏览器的开源智能体(10.5万+ Star)

    Browser Use:让 AI 像人一样操作浏览器的开源智能体(10.5万+ Star)

    Browser Use 自动填写表单演示

    Browser Use 是一个让 AI 像人一样操作浏览器的开源智能体框架——你用自然语言描述任务,它便自动打开网页、点击按钮、输入文字、填写表单,一站式完成多步骤的网页操作。

    一、项目简介

    🌐 Make websites accessible for AI agents. Automate tasks online with ease.

    Browser Use 把”浏览器”变成 AI Agent 可直接操控的环境。它目前拥有 10.5 万+ Star(Python 编写,MIT 许可),并在 Odyssey 长程网页任务榜上以 87.4% 的平均成功率排名第一,超越了 OpenAI、Anthropic、Google、Microsoft 各自的 computer-use 方案。它既是给现有编码 Agent(Claude Code / Codex / Cursor 等)即插即用的”浏览器技能”,也是可规模化调用的 Python 库。

    二、安装要求与过程

    环境要求:

    • Python ≥ 3.11(官方推荐 3.12,可用 uv 管理)
    • 本地无需额外安装 Chromium,Browser Use 会按需驱动 Playwright 浏览器
    • 一个 LLM API Key(Browser Use 云、OpenAI、Anthropic、Google,或本地 Ollama 模型均可)

    快速安装:

    1. 安装库:
      pip install browser-use  (或 uv add browser-use
    2. .env 中配置 Key:
      BROWSER_USE_API_KEY=your-key  或  ANTHROPIC_API_KEY=... / GOOGLE_API_KEY=...
    3. 运行你的第一个 Agent:
    import asyncio
    from browser_use import Agent, ChatBrowserUse
    
    async def main():
        agent = Agent(
            task="Find the number of stars of the browser-use repo",
            llm=ChatBrowserUse(model="openai/gpt-5.5"),
        )
        history = await agent.run()
    
    asyncio.run(main())

    若你已在使用 Claude Code / Codex / Cursor 等编码 Agent,只需让 Agent 执行一次 browser-use skill install,即可把浏览器能力挂载到现有工作流中,无需自己写代码。

    三、核心功能

    • 自然语言驱动浏览器:自动打开页面、点击、输入、填表、翻页,把”多步骤网页操作”压缩成一句话指令。
    • 双形态接入:CLI 模式配合已有 Agent 即装即用;Python 库模式支持定时、并行、嵌入自有产品,细粒度控制浏览器。
    • 多模型统一接入:ChatBrowserUseprovider/model 前缀即可切换 OpenAI / Anthropic / Google,或走本地 Ollama 模型,一个 Key 通吃。
    • 强扩展能力:支持自定义 Tools、MCP 协议,云端版更提供 1000+ 集成(Gmail、Slack、Notion 等)与持久化记忆。
    • SOTA 级表现:Odyssey 200 项长程网页任务榜第一(87.4%),官方基准在 100 个真实任务上开源可复现。

    四、典型使用场景

    1. 自动填表与办事
    让 Agent 带着你的简历信息自动填写并投递职位申请、注册账号、提交各类在线表单。

    2. 网页数据采集
    从任意网站抽取结构化数据并导出为 CSV,例如”抓取我关注者的资料并整理成表格”。

    Browser Use 网站 QA 自动化演示

    3. 网站 QA 自动化
    对本地站点做可用性、视觉一致性与 Bug 巡检,自动产出测试报告,替代部分人工回归测试。

    五、推荐理由

    作为重度网页操作用户,我对 Browser Use 最大的感受是”把重复劳动还给机器“——订票比价、表单填报、定点抓取这类机械活,原来要人守着点半小时,现在一句话交代清楚就能后台跑。

    它开源免费、本地可控,隐私敏感的任务完全可以在本机跑;遇到强反爬、验证码场景再切到云端(代理轮换 + 隐身指纹 + 验证码破解)。对开发者而言,Python 库 + 自定义 Tools + MCP 的扩展性,让它不只是玩具,而是能真正嵌进产品的浏览器自动化底座。如果你已经在用 Cursor / Claude Code,强烈建议装一下它的 skill 体验。

    六、下载地址

    (本文配图来自项目官方 README,版权归 Browser Use 团队所有。)

  • Crawl4AI:把全网网页变成 LLM 能直接用的干净 Markdown,RAG 数据清洗一步到位(71.8K★)

    Crawl4AI:把全网网页变成 LLM 能直接用的干净 Markdown,RAG 数据清洗一步到位(71.8K★)

    Crawl4AI 项目封面

    一、项目简介

    Crawl4AI 是一个开源、对大模型友好的网页爬虫与抓取框架,能把任意网页一键转换成结构清晰、可直接喂给 LLM / RAG 的 Markdown,并支持结构化数据提取、截图、动态渲染等能力。对做检索增强、知识库、Agent 联网取数的人来说,它基本等于把”爬虫 + 清洗”两道工序合并了。

    二、安装要求和过程

    环境要求:Python 3.10 及以上;底层基于 Playwright(Chromium),首次使用需下载浏览器内核。

    快速安装(Python 包):

    # 安装
    pip install -U crawl4ai
    
    # 安装后执行一键浏览器配置
    crawl4ai-setup
    
    # 自检环境是否就绪
    crawl4ai-doctor
    
    # 若遇到浏览器相关报错,可手动补全
    python -m playwright install --with-deps chromium

    Docker 部署(推荐生产环境):

    docker pull unclecode/crawl4ai:latest
    docker run -d -p 11235:11235 --name crawl4ai --shm-size=1g unclecode/crawl4ai:latest
    # 监控面板: http://localhost:11235/dashboard
    # 交互 playground: http://localhost:11235/playground

    三、核心功能

    • LLM 就绪的 Markdown 输出:智能 Markdown 保留标题、表格、代码块,并提供 Fit Markdown(裁剪导航/广告等无关内容)、引用标注,以及基于 BM25 算法的内容过滤,正文噪声大幅降低。
    • 结构化数据提取:支持基于 LLM 的 Schema 提取、CSS 选择器提取、余弦相似度匹配,配合分块(Chunk)策略,直接产出 Pydantic 结构化对象,无需手写正则。
    • 真·浏览器级抓取:基于 Playwright 托管浏览器,支持会话保持、代理、Cookie、用户脚本、Hook、动态视口调整、懒加载处理,还能截图与生成 PDF。
    • 自适应爬取与调度:异步浏览器池 + 缓存机制,能学习网站结构、只爬该爬的页面;内置深度爬取与内存自适应调度,从单页到万级站点都能扛。
    • 部署灵活、可接 Agent:零密钥、CLI + Docker 双形态;新版 Docker 自带监控面板、浏览器池预热、Playground 与 MCP 集成,可直连 Claude Code 等 AI 编程工具。

    四、典型使用场景

    • 搭 RAG 知识库:把公司文档站、竞品官网、行业博客批量抓成干净 Markdown,直接喂进向量库做检索增强,省去大量手写清洗规则。
    • 生成 LLM 训练 / 微调语料:用 LLM 提取策略从定价页、榜单页抽取结构化字段(例如各家模型的价格表),产出干净的 JSON 数据集。
    • AI Agent 联网取数:通过 Docker + MCP 把 Crawl4AI 接进 Agent 工作流,让智能体实时抓取网页、执行 JS、截图后回写结果,补足大模型”看不见实时网页”的短板。

    五、推荐理由

    我自己踩过不少爬虫的坑:传统方案要么反爬头疼,要么抓下来的 Markdown 一堆导航/侧边栏噪音,接 RAG 前还得再写一层清洗。Crawl4AI 的 Fit Markdown + BM25 过滤基本把”正文 vs 杂质”这件事做对了,接检索增强时相当省心;异步 + 浏览器池的性能也不错,小规模到大规模都能用。Docker 镜像开箱即用,MCP 直连 Claude Code 这点对做 Agent 的人尤其香。小提醒:它依赖 Playwright/Chromium,首次部署体积不小;上生产建议走 0.9.0+ 的安全加固 Docker 镜像(已修复路径遍历 / SSRF / RCE)。

    六、下载地址

  • MediaCrawler:多平台自媒体数据采集工具,54.9K+ Stars 让 Playwright 爬虫变得简单

    MediaCrawler:多平台自媒体数据采集工具,54.9K+ Stars 让 Playwright 爬虫变得简单

    🕷️ MediaCrawler

    多平台自媒体数据采集工具 —— 为 AI 时代提供高质量训练数据

    ⭐ 54,991+ Stars  |  🐍 Python  |  🎭 Playwright  |  📜 MIT License

    📌 项目简介

    MediaCrawler 是一个多平台自媒体数据采集工具,支持小红书、抖音、快手、B站、微博、百度贴吧、知乎共 7 个主流内容平台的公开信息抓取。项目基于 Playwright 浏览器自动化框架实现,无需 JS 逆向,直接利用保存的登录态浏览器上下文通过 JS 表达式获取签名参数,大幅降低了爬虫技术门槛。

    该项目定位为学习爬虫技术、研究浏览器自动化方案的开源教学项目,同时也为 LLM 训练数据收集、内容分析等场景提供了实用工具链。

    Python 3.11+
    Playwright
    7 大平台支持
    WebUI 可视化
    多存储格式
    MIT 许可

    ⚙️ 安装要求与过程

    环境要求

    • Python:推荐 3.11 及以上版本(已支持 Python 3.13)
    • Node.js:≥ 16.0.0(WebUI 前端需要)
    • Chrome 浏览器:推荐 ≥ 144 版本(开启远程调试后可复用登录态)
    • 包管理工具:推荐 uv(速度快、依赖解析准确)

    快速安装(5 分钟上手)

    # 1. 克隆项目
    git clone https://github.com/NanmiCoder/MediaCrawler.git
    cd MediaCrawler
    
    # 2. 安装 Python 依赖(使用 uv)
    uv sync
    
    # 3.(可选)安装 Playwright 浏览器驱动(标准模式需要)
    uv run playwright install
    
    # 4.(推荐)配置 Chrome 远程调试
    # 在 Chrome 地址栏输入 chrome://inspect/#remote-debugging
    # 勾选允许远程调试,确认 Server 运行在 127.0.0.1:9222

    WebUI 可视化界面部署

    # 开发调试模式
    # 终端 1:启动后端 API 服务(默认端口 8080)
    uv run uvicorn api.main:app --port 8080 --reload
    
    # 终端 2:启动前端开发服务
    cd webui
    npm install
    npm run dev
    # 访问 http://localhost:5173/ 即可使用
    
    # 生产部署模式
    cd webui
    npm install
    npm run build
    uv run uvicorn api.main:app --port 8080 --reload
    # 直接访问 http://localhost:8080

    ✨ 核心功能

    • 7 大平台全覆盖:小红书、抖音、快手、B站、微博、百度贴吧、知乎,功能覆盖度一致
    • 多种爬取模式:支持关键词搜索爬取、指定 ID 爬取帖子/视频、二级评论爬取、指定创作者主页爬取
    • 登录态缓存:基于 Playwright 保存登录态,支持 CDP 模式连接本地 Chrome,复用已有登录态、Cookie 和扩展,降低平台风控风险
    • WebUI 可视化界面:无需命令行,直接在网页配置爬虫参数、查看运行状态、导出数据,大幅降低使用门槛
    • 多存储格式支持:CSV、JSON、JSONL、Excel、SQLite、MySQL 等多种数据存储格式,满足不同 downstream 需求
    • IP 代理池:内置代理池支持,可配置多账号+IP 轮换,降低被封禁风险
    • 评论词云图:自动生成评论词云图,直观展示用户情感倾向和热点话题

    🖼️ 支持平台一览

    📕 小红书

    搜索笔记、指定帖子详情、创作者主页、二级评论

    🎵 抖音

    搜索视频、视频详情、用户信息、评论数据

    🎬 快手

    视频搜索、详情页、用户主页、评论爬取

    📺 B站

    视频搜索、视频详情、UP 主信息、弹幕与评论

    💬 微博

    关键词搜索、博文详情、评论、用户主页

    📝 知乎

    问答搜索、问题详情、回答内容、评论数据

    🙋 百度贴吧

    贴子搜索、贴子详情、回复内容、吧内信息

    🚀 典型使用场景

    场景一:LLM 训练数据收集

    MediaCrawler 可以批量采集各平台公开的文本、图片、评论数据,经过清洗后作为 LLM 的微调或预训练数据。相比手动采集,效率提升 100 倍以上,且支持断点续爬,适合大规模数据采集任务。

    # 爬取小红书关键词搜索结果(用于训练数据分析类 LLM)
    uv run main.py --platform xhs --lt qrcode --type search
    # 数据自动保存为 JSON/CSV,可直接接入训练 pipeline

    场景二:社交媒体舆情监测

    企业或研究机构可以使用 MediaCrawler 定期采集特定关键词的社交媒体内容,结合 LLM 进行情感分析、热点话题发现和舆情预警。WebUI 界面使得非技术团队也能轻松配置和运行爬取任务。

    # 爬取指定关键词的微博内容
    uv run main.py --platform weibo --lt cookie --type search --keywords "AI大模型"

    场景三:内容创作者竞品分析

    自媒体运营者可以用 MediaCrawler 采集同类创作者的高赞内容、评论热词、发布时间规律等,为内容策略优化提供数据支撑。结合评论词云图功能,可以快速把握受众偏好。

    💡 推荐理由

    🌟 个人使用心得:
    MediaCrawler 是我见过的最易上手的社交媒体数据采集项目之一。它巧妙避开了最难的 JS 逆向问题 —— 通过保存登录态浏览器上下文直接执行 JS 获取签名,让爬虫开发从”黑魔法”变成”标准流程”。

    三大亮点:
    零 JS 逆向:基于 Playwright 的登录态复用机制,不需要分析各平台的签名算法
    WebUI 降低门槛:可视化界面让非程序员也能使用,是真正”可用”的开源工具
    CDP 模式创新:连接本地 Chrome,复用真实用户的登录态和扩展,大幅降低风控概率

    需要注意的是,项目明确声明仅可用于学习研究,禁止用于商业用途和非法爬虫行为。建议在遵守平台 ToS 和相关法律法规的前提下使用。

    📦 下载地址


    ⚠️ 注意事项

    🚨 法律与合规提醒:
    ① 本项目仅供学习研究使用,禁止用于商业用途和非法爬虫行为
    ② 因违规使用产生的法律责任由使用者自行承担
    ③ 请遵守各平台的 robots.txt 和服务条款(ToS)
    ④ 建议合理控制爬取频率,避免对目标平台造成过大压力
    ⑤ 不要爬取明确标注”禁止爬取”的私密或付费内容

    📅 数据更新至 2026 年 7 月  |  ⭐ GitHub: NanmiCoder/MediaCrawler

  • browser-use:99.6k Stars!让AI代理自动操作浏览器,网页自动化从未如此简单

    browser-use:99.6k Stars!让AI代理自动操作浏览器,网页自动化从未如此简单

    browser-use logo
    browser-use – AI浏览器自动化工具

    📦 项目简介

    browser-use 是一个让AI代理能够自动操作浏览器的开源工具,通过自然语言指令即可完成各类网页操作,无需手动编写复杂的爬虫逻辑。无论是表单填写、网页信息提取,还是复杂的多步骤网页交互,AI都能帮你自动完成。


    ⚙️ 安装要求和过程

    环境要求

    • Python版本:≥3.11
    • 推荐包管理工具uv(也可使用pip等常规Python包管理工具)
    • 浏览器:自动安装Chromium(也可使用本地已安装的Chrome/Edge)

    快速安装步骤

    # 1. 初始化项目并安装browser-use
    uv init && uv add browser-use && uv sync
    
    # 2. 若本地未安装Chromium,执行以下命令自动安装
    uvx browser-use install

    可选配置

    • 如需使用云端能力,可前往 Browser Use Cloud 获取API Key,在.env文件中配置即可
    • 支持对接多种LLM提供商:自带优化后的ChatBrowserUse模型,也支持Google Gemini、Anthropic Claude、OpenAI等主流模型,还可对接Ollama运行本地模型

    💡 核心功能

    • 自然语言控制浏览器:支持AI代理通过自然语言指令自动完成各类网页操作,无需手动编写复杂爬虫逻辑
    • 双模式支持:提供开源版本云端托管版本两种使用模式,可按需选择
    • 丰富的工具集成:支持集成1000+第三方工具(如Gmail、Slack、Notion等),支持自定义工具扩展
    • CLI命令行支持:提供CLI命令行快速操作,提供持久化浏览器会话,适合快速迭代调试
    • AI编码工具集成:支持Claude Code等AI编码工具集成,可直接对接AI工作流

    云端版本专属能力

    • 更强的复杂任务处理能力,任务完成准确率远高于开源版本
    • 内置隐身浏览器指纹、代理轮换、验证码自动解决能力,避免被网站反爬检测
    • 支持持久化文件系统和记忆,适合长期运行的代理任务
    • 无需本地部署,开箱即用,支持大规模并行任务调度

    🚀 典型使用场景

    1. 个人效率提升:自动完成重复性网页操作,如批量填写表单、自动购物、自动整理网页信息等
    2. AI应用开发:作为AI代理的浏览器交互层,让AI具备操作网页的能力,开发智能助手类产品
    3. 企业级自动化:结合云端版本的扩展能力,实现大规模网页数据采集、业务流程自动化等场景
    4. 编码辅助:对接Cursor、Claude Code等AI编码工具,让AI可以直接操作浏览器验证代码效果、调试网页相关问题

    🌟 推荐理由

    在AI Agent爆发的2026年,让AI具备操作浏览器的能力,就像给AI装上了一双”眼睛”和”手”。browser-use不仅简化了浏览器自动化的开发流程,更重要的是它让AI真正能够与世界互动——从简单的信息查询到复杂的多步骤业务流程,都可以通过自然语言来完成。

    特别推荐它的双模式设计:如果你只是想快速尝试,开源版本足够使用;如果你需要生产级别的稳定性和扩展性,云端版本提供了完整的解决方案。这种灵活的设计理念,让不同需求的开发者都能找到适合自己的使用方式。

    另外,它对主流LLM的原生支持也是一大亮点。无论你用的是Claude、GPT还是本地部署的模型,都能无缝对接。这种开放性的设计,正是开源项目的魅力所在。


    📥 下载地址


    ⭐ 如果你觉得这个项目有帮助,欢迎到GitHub上给它一个Star!

  • browser-use:95.3k Stars!让AI代理自动操作浏览器,网页自动化从未如此简单

    browser-use:95.3k Stars!让AI代理自动操作浏览器,网页自动化从未如此简单

    browser-use logo
    browser-use – AI浏览器自动化工具

    📦 项目简介

    browser-use 是一个让AI代理能够自动操作浏览器的开源工具,通过自然语言指令即可完成各类网页操作,无需手动编写复杂的爬虫逻辑。无论是表单填写、网页信息提取,还是复杂的多步骤网页交互,AI都能帮你自动完成。


    ⚙️ 安装要求和过程

    环境要求

    • Python版本:≥3.11
    • 推荐包管理工具uv(也可使用pip等常规Python包管理工具)
    • 浏览器:自动安装Chromium(也可使用本地已安装的Chrome/Edge)

    快速安装步骤

    # 1. 初始化项目并安装browser-use
    uv init && uv add browser-use && uv sync
    
    # 2. 若本地未安装Chromium,执行以下命令自动安装
    uvx browser-use install

    可选配置

    • 如需使用云端能力,可前往 Browser Use Cloud 获取API Key,在.env文件中配置即可
    • 支持对接多种LLM提供商:自带优化后的ChatBrowserUse模型,也支持Google Gemini、Anthropic Claude、OpenAI等主流模型,还可对接Ollama运行本地模型

    💡 核心功能

    • 自然语言控制浏览器:支持AI代理通过自然语言指令自动完成各类网页操作,无需手动编写复杂爬虫逻辑
    • 双模式支持:提供开源版本云端托管版本两种使用模式,可按需选择
    • 丰富的工具集成:支持集成1000+第三方工具(如Gmail、Slack、Notion等),支持自定义工具扩展
    • CLI命令行支持:提供CLI命令行快速操作,提供持久化浏览器会话,适合快速迭代调试
    • AI编码工具集成:支持Claude Code等AI编码工具集成,可直接对接AI工作流

    云端版本专属能力

    • 更强的复杂任务处理能力,任务完成准确率远高于开源版本
    • 内置隐身浏览器指纹、代理轮换、验证码自动解决能力,避免被网站反爬检测
    • 支持持久化文件系统和记忆,适合长期运行的代理任务
    • 无需本地部署,开箱即用,支持大规模并行任务调度

    🚀 典型使用场景

    1. 个人效率提升:自动完成重复性网页操作,如批量填写表单、自动购物、自动整理网页信息等
    2. AI应用开发:作为AI代理的浏览器交互层,让AI具备操作网页的能力,开发智能助手类产品
    3. 企业级自动化:结合云端版本的扩展能力,实现大规模网页数据采集、业务流程自动化等场景
    4. 编码辅助:对接Cursor、Claude Code等AI编码工具,让AI可以直接操作浏览器验证代码效果、调试网页相关问题

    🌟 推荐理由

    在AI Agent爆发的2026年,让AI具备操作浏览器的能力,就像给AI装上了一双”眼睛”和”手”。browser-use不仅简化了浏览器自动化的开发流程,更重要的是它让AI真正能够与世界互动——从简单的信息查询到复杂的多步骤业务流程,都可以通过自然语言来完成。

    特别推荐它的双模式设计:如果你只是想快速尝试,开源版本足够使用;如果你需要生产级别的稳定性和扩展性,云端版本提供了完整的解决方案。这种灵活的设计理念,让不同需求的开发者都能找到适合自己的使用方式。

    另外,它对主流LLM的原生支持也是一大亮点。无论你用的是Claude、GPT还是本地部署的模型,都能无缝对接。这种开放性的设计,正是开源项目的魅力所在。


    📥 下载地址


    ⭐ 如果你觉得这个项目有帮助,欢迎到GitHub上给它一个Star!