标签: 网络爬虫

  • Wigolo:给 AI 编程智能体装上本地优先的「上网」引擎(开源 MCP)

    Wigolo:给 AI 编程智能体装上本地优先的「上网」引擎(开源 MCP)

    Wigolo 演示

    在 Claude Code、Cursor、Codex 这类编码智能体大行其道的今天,一个尴尬的现实是:它们很会写代码,却「看不见」互联网。想查一份报错、一份 API 文档、一个竞品定价,往往得开发者自己复制粘贴喂给模型。Wigolo 要做的,就是给 AI 智能体装上一双「眼睛和手」——一个本地优先、无需 API Key、按查询 0 计费的统一「上网」引擎。

    🦉 项目简介

    WigoloKnockOutEZ 开源的 AI 编程智能体本地优先「上网」引擎:以 MCP 服务器(或 REST / SDK)的形式运行在智能体身边,统一提供 搜索、抓取、爬取、提取、缓存、相似发现、研究、自主收集 等全套 Web 能力。核心理念是 no keys, no cloud, no metered bill——核心工具无需任何 API Key,所有数据留在本地 ~/.wigolo/,用得越多账单也不会涨。

    💻 安装要求与过程

    环境要求:Node.js ≥ 20,约 1.5 GB 空闲磁盘(首次运行会下载浏览器引擎等本地组件)。核心搜索 / 抓取 / 爬取无需任何外部 Key 即可使用;如需 researchagent 等高级研究能力,可选择性配置一个 LLM Provider(如 Gemini)。

    快速安装:

    # 初始化本地引擎(任意系统)
    npx wigolo init
    
    # 初始化并一键接入日常 agent(如 Claude Code + Cursor)
    npx wigolo init --agents=claude-code,cursor
    
    # 以 Docker 方式作为 stdio MCP 服务运行
    docker run -i --rm -v wigolo-data:/data ghcr.io/knockoutez/wigolo
    
    # 在自托管 box 上暴露 HTTP 服务(默认 127.0.0.1:3333)
    wigolo serve
    
    # 在你的应用里用 SDK 嵌入
    npm install wigolo-sdk     # TypeScript
    pip install wigolo         # Python

    常用运维命令:npx wigolo verify(健康检测)、npx wigolo warmup --all(重下引擎)、npx wigolo docto --fix(修复环境)。

    ⚙️ 核心功能

    Wigolo 核心工具全景

    1. 🔍 多引擎搜索 search:内置 18 个直连适配器,ML 重排 + 可解释评分,让智能体拿到「为什么是这条结果」。
    2. 🔗 抓取 & 爬取 fetch / crawl:分层路由获取单页并清洗为 markdown(含 PDF / 鉴权页处理);BFS / DFS / sitemap 多页爬取并自带限流保护。
    3. 🧩 提取 & 缓存 & 相似 extract / cache / find_similar:从页面抽取表格 / JSON-LD / Schema 等结构化数据;本地缓存已见内容,二次查询毫秒即回;关键词 + 语义 + 实时发现相似页面。
    4. 🤖 自主研究 research / agent:把一个问题自动分解成子查询、扇出检索、综合成报告;agent 工具则跑 search→fetch→extract→synthesize 的自主收集循环。
    5. 🔔 变更追踪 diff / watch:检测页面变化并推送 webhook,把「定时盯网页」变成可编排的事件。

    🚀 典型使用场景

    • 场景一 · 编码时实时联网:在 Claude Code / Cursor 里改代码时,智能体直接调用 search / fetch 查文档、查报错、查第三方 API,开发者不再手动复制粘贴;所有命中缓存在 ~/.wigolo/,隐私不出本机。
    • 场景二 · 自托管 Agent 的「联网大脑」:在自托管服务器上 wigolo serve 暴露 REST / MCP 端点,LangChain、CrewAI、n8n 等编排框架或任意 MCP client 统一调用,把分散在各处的抓取逻辑收敛成一个服务。
    • 场景三 · 持续竞品 / 文档监控:用 watch 盯住竞品定价页或文档页,diff 出变化并推 webhook 到飞书 / Slack / 自有系统,第一时间感知变更。

    💡 推荐理由

    我特别看好 Wigolo 的一点,是它真正把「本地优先」做到了极致:零 API Key、零按量账单,直接戳中「想让 agent 上网,却要为每家搜索引擎单独接 key、还要担心账单爆掉」的痛点。统一的 MCP 接口对 Claude Code / Cursor / Codex / Gemini CLI / VS Code / Zed 通吃,接入几乎零心智负担;数据默认留在本地,对重视隐私的开发者很友好;AGPL-3.0 开源、可完全自托管。如果你正想给自己的 coding agent 装上一双「眼睛和手」,Wigolo 是目前最省心的一站式方案。

    Wigolo 四种接入方式与差异化

    🔗 下载地址

  • Crawl4AI:把全网网页变成 LLM 能直接用的干净 Markdown,RAG 数据清洗一步到位(71.8K★)

    Crawl4AI:把全网网页变成 LLM 能直接用的干净 Markdown,RAG 数据清洗一步到位(71.8K★)

    Crawl4AI 项目封面

    一、项目简介

    Crawl4AI 是一个开源、对大模型友好的网页爬虫与抓取框架,能把任意网页一键转换成结构清晰、可直接喂给 LLM / RAG 的 Markdown,并支持结构化数据提取、截图、动态渲染等能力。对做检索增强、知识库、Agent 联网取数的人来说,它基本等于把”爬虫 + 清洗”两道工序合并了。

    二、安装要求和过程

    环境要求:Python 3.10 及以上;底层基于 Playwright(Chromium),首次使用需下载浏览器内核。

    快速安装(Python 包):

    # 安装
    pip install -U crawl4ai
    
    # 安装后执行一键浏览器配置
    crawl4ai-setup
    
    # 自检环境是否就绪
    crawl4ai-doctor
    
    # 若遇到浏览器相关报错,可手动补全
    python -m playwright install --with-deps chromium

    Docker 部署(推荐生产环境):

    docker pull unclecode/crawl4ai:latest
    docker run -d -p 11235:11235 --name crawl4ai --shm-size=1g unclecode/crawl4ai:latest
    # 监控面板: http://localhost:11235/dashboard
    # 交互 playground: http://localhost:11235/playground

    三、核心功能

    • LLM 就绪的 Markdown 输出:智能 Markdown 保留标题、表格、代码块,并提供 Fit Markdown(裁剪导航/广告等无关内容)、引用标注,以及基于 BM25 算法的内容过滤,正文噪声大幅降低。
    • 结构化数据提取:支持基于 LLM 的 Schema 提取、CSS 选择器提取、余弦相似度匹配,配合分块(Chunk)策略,直接产出 Pydantic 结构化对象,无需手写正则。
    • 真·浏览器级抓取:基于 Playwright 托管浏览器,支持会话保持、代理、Cookie、用户脚本、Hook、动态视口调整、懒加载处理,还能截图与生成 PDF。
    • 自适应爬取与调度:异步浏览器池 + 缓存机制,能学习网站结构、只爬该爬的页面;内置深度爬取与内存自适应调度,从单页到万级站点都能扛。
    • 部署灵活、可接 Agent:零密钥、CLI + Docker 双形态;新版 Docker 自带监控面板、浏览器池预热、Playground 与 MCP 集成,可直连 Claude Code 等 AI 编程工具。

    四、典型使用场景

    • 搭 RAG 知识库:把公司文档站、竞品官网、行业博客批量抓成干净 Markdown,直接喂进向量库做检索增强,省去大量手写清洗规则。
    • 生成 LLM 训练 / 微调语料:用 LLM 提取策略从定价页、榜单页抽取结构化字段(例如各家模型的价格表),产出干净的 JSON 数据集。
    • AI Agent 联网取数:通过 Docker + MCP 把 Crawl4AI 接进 Agent 工作流,让智能体实时抓取网页、执行 JS、截图后回写结果,补足大模型”看不见实时网页”的短板。

    五、推荐理由

    我自己踩过不少爬虫的坑:传统方案要么反爬头疼,要么抓下来的 Markdown 一堆导航/侧边栏噪音,接 RAG 前还得再写一层清洗。Crawl4AI 的 Fit Markdown + BM25 过滤基本把”正文 vs 杂质”这件事做对了,接检索增强时相当省心;异步 + 浏览器池的性能也不错,小规模到大规模都能用。Docker 镜像开箱即用,MCP 直连 Claude Code 这点对做 Agent 的人尤其香。小提醒:它依赖 Playwright/Chromium,首次部署体积不小;上生产建议走 0.9.0+ 的安全加固 Docker 镜像(已修复路径遍历 / SSRF / RCE)。

    六、下载地址

  • MediaCrawler:多平台自媒体数据采集工具,54.9K+ Stars 让 Playwright 爬虫变得简单

    MediaCrawler:多平台自媒体数据采集工具,54.9K+ Stars 让 Playwright 爬虫变得简单

    🕷️ MediaCrawler

    多平台自媒体数据采集工具 —— 为 AI 时代提供高质量训练数据

    ⭐ 54,991+ Stars  |  🐍 Python  |  🎭 Playwright  |  📜 MIT License

    📌 项目简介

    MediaCrawler 是一个多平台自媒体数据采集工具,支持小红书、抖音、快手、B站、微博、百度贴吧、知乎共 7 个主流内容平台的公开信息抓取。项目基于 Playwright 浏览器自动化框架实现,无需 JS 逆向,直接利用保存的登录态浏览器上下文通过 JS 表达式获取签名参数,大幅降低了爬虫技术门槛。

    该项目定位为学习爬虫技术、研究浏览器自动化方案的开源教学项目,同时也为 LLM 训练数据收集、内容分析等场景提供了实用工具链。

    Python 3.11+
    Playwright
    7 大平台支持
    WebUI 可视化
    多存储格式
    MIT 许可

    ⚙️ 安装要求与过程

    环境要求

    • Python:推荐 3.11 及以上版本(已支持 Python 3.13)
    • Node.js:≥ 16.0.0(WebUI 前端需要)
    • Chrome 浏览器:推荐 ≥ 144 版本(开启远程调试后可复用登录态)
    • 包管理工具:推荐 uv(速度快、依赖解析准确)

    快速安装(5 分钟上手)

    # 1. 克隆项目
    git clone https://github.com/NanmiCoder/MediaCrawler.git
    cd MediaCrawler
    
    # 2. 安装 Python 依赖(使用 uv)
    uv sync
    
    # 3.(可选)安装 Playwright 浏览器驱动(标准模式需要)
    uv run playwright install
    
    # 4.(推荐)配置 Chrome 远程调试
    # 在 Chrome 地址栏输入 chrome://inspect/#remote-debugging
    # 勾选允许远程调试,确认 Server 运行在 127.0.0.1:9222

    WebUI 可视化界面部署

    # 开发调试模式
    # 终端 1:启动后端 API 服务(默认端口 8080)
    uv run uvicorn api.main:app --port 8080 --reload
    
    # 终端 2:启动前端开发服务
    cd webui
    npm install
    npm run dev
    # 访问 http://localhost:5173/ 即可使用
    
    # 生产部署模式
    cd webui
    npm install
    npm run build
    uv run uvicorn api.main:app --port 8080 --reload
    # 直接访问 http://localhost:8080

    ✨ 核心功能

    • 7 大平台全覆盖:小红书、抖音、快手、B站、微博、百度贴吧、知乎,功能覆盖度一致
    • 多种爬取模式:支持关键词搜索爬取、指定 ID 爬取帖子/视频、二级评论爬取、指定创作者主页爬取
    • 登录态缓存:基于 Playwright 保存登录态,支持 CDP 模式连接本地 Chrome,复用已有登录态、Cookie 和扩展,降低平台风控风险
    • WebUI 可视化界面:无需命令行,直接在网页配置爬虫参数、查看运行状态、导出数据,大幅降低使用门槛
    • 多存储格式支持:CSV、JSON、JSONL、Excel、SQLite、MySQL 等多种数据存储格式,满足不同 downstream 需求
    • IP 代理池:内置代理池支持,可配置多账号+IP 轮换,降低被封禁风险
    • 评论词云图:自动生成评论词云图,直观展示用户情感倾向和热点话题

    🖼️ 支持平台一览

    📕 小红书

    搜索笔记、指定帖子详情、创作者主页、二级评论

    🎵 抖音

    搜索视频、视频详情、用户信息、评论数据

    🎬 快手

    视频搜索、详情页、用户主页、评论爬取

    📺 B站

    视频搜索、视频详情、UP 主信息、弹幕与评论

    💬 微博

    关键词搜索、博文详情、评论、用户主页

    📝 知乎

    问答搜索、问题详情、回答内容、评论数据

    🙋 百度贴吧

    贴子搜索、贴子详情、回复内容、吧内信息

    🚀 典型使用场景

    场景一:LLM 训练数据收集

    MediaCrawler 可以批量采集各平台公开的文本、图片、评论数据,经过清洗后作为 LLM 的微调或预训练数据。相比手动采集,效率提升 100 倍以上,且支持断点续爬,适合大规模数据采集任务。

    # 爬取小红书关键词搜索结果(用于训练数据分析类 LLM)
    uv run main.py --platform xhs --lt qrcode --type search
    # 数据自动保存为 JSON/CSV,可直接接入训练 pipeline

    场景二:社交媒体舆情监测

    企业或研究机构可以使用 MediaCrawler 定期采集特定关键词的社交媒体内容,结合 LLM 进行情感分析、热点话题发现和舆情预警。WebUI 界面使得非技术团队也能轻松配置和运行爬取任务。

    # 爬取指定关键词的微博内容
    uv run main.py --platform weibo --lt cookie --type search --keywords "AI大模型"

    场景三:内容创作者竞品分析

    自媒体运营者可以用 MediaCrawler 采集同类创作者的高赞内容、评论热词、发布时间规律等,为内容策略优化提供数据支撑。结合评论词云图功能,可以快速把握受众偏好。

    💡 推荐理由

    🌟 个人使用心得:
    MediaCrawler 是我见过的最易上手的社交媒体数据采集项目之一。它巧妙避开了最难的 JS 逆向问题 —— 通过保存登录态浏览器上下文直接执行 JS 获取签名,让爬虫开发从”黑魔法”变成”标准流程”。

    三大亮点:
    零 JS 逆向:基于 Playwright 的登录态复用机制,不需要分析各平台的签名算法
    WebUI 降低门槛:可视化界面让非程序员也能使用,是真正”可用”的开源工具
    CDP 模式创新:连接本地 Chrome,复用真实用户的登录态和扩展,大幅降低风控概率

    需要注意的是,项目明确声明仅可用于学习研究,禁止用于商业用途和非法爬虫行为。建议在遵守平台 ToS 和相关法律法规的前提下使用。

    📦 下载地址


    ⚠️ 注意事项

    🚨 法律与合规提醒:
    ① 本项目仅供学习研究使用,禁止用于商业用途和非法爬虫行为
    ② 因违规使用产生的法律责任由使用者自行承担
    ③ 请遵守各平台的 robots.txt 和服务条款(ToS)
    ④ 建议合理控制爬取频率,避免对目标平台造成过大压力
    ⑤ 不要爬取明确标注”禁止爬取”的私密或付费内容

    📅 数据更新至 2026 年 7 月  |  ⭐ GitHub: NanmiCoder/MediaCrawler

  • Agent-Reach:给AI Agent一键装上互联网能力,44.1K+ Stars让Agent自由访问Twitter/Reddit/YouTube等10+平台

    Agent-Reach:给AI Agent一键装上互联网能力,44.1K+ Stars让Agent自由访问Twitter/Reddit/YouTube等10+平台

    🌐 Agent-Reach

    给 AI Agent 一键装上互联网能力
    零配置 · 全平台 · 完全免费

    Agent-Reach 是一个为 AI Agent 提供互联网访问能力的一站式脚手架工具。它让 Claude Code、OpenClaw、Cursor、Windsurf 等 AI 编程助手能够轻松读取 Twitter、Reddit、YouTube、GitHub、B站、小红书等平台的内容,无需任何 API 费用,所有功能完全免费。

    44.1K+
    GitHub Stars

    10+
    支持平台

    ¥0
    API 费用

    🤔 为什么需要 Agent-Reach?

    现在的 AI Agent 已经很强大了。Claude Code 能帮你重构整个项目,OpenClaw 能管理日常事务,Cursor 能在 IDE 里完成全栈开发。

    但有一件事它们始终做不好:去网上找点东西。

    ❌ 遇到的问题
    • “去 GitHub 找类似的开源项目”——认证配置卡半天
    • “去 Reddit 看看社区反馈”——403,匿名接口被封
    • “去推特搜产品评价”——Twitter API 要付费,最低档上百刀
    ✅ Agent-Reach 的方案
    • 一句话安装,Agent 全自动完成配置
    • 多后端冗余路由,某条路线失效自动切换
    • 完全免费,零 API 费用

    ⚙️ 安装要求和过程

    环境要求

    • Python:3.10 及以上版本
    • 适用环境:本地电脑、开发服务器、生产服务器均支持
    • OpenClaw 用户:需先开启 exec 权限(执行 openclaw config set tools.profile "coding" 并重启 Gateway)

    快速安装(推荐方式)

    不需要懂任何配置,只需要把这句话复制给你的 AI Agent:

    帮我安装 Agent Reach:https://raw.githubusercontent.com/Panniantong/agent-reach/main/docs/install.md

    剩下的事情 Agent 会自己完成——安装 CLI 工具、配置搜索引擎、检测环境、注册技能文档,甚至会问你要不要解锁更多平台。

    手动安装

    # 安装 Python 包
    pip install agent-reach
    
    # 执行安装脚本
    agent-reach install --env=auto

    安装模式选项

    模式 参数 说明
    全自动(默认) --env=auto 自动检测环境并完成所有配置
    安全模式 --safe 仅列出所需依赖,不自动修改系统(适合生产服务器)
    预览模式 --dry-run 安装前预览所有操作,不实际执行

    ✨ 核心功能

    🎯

    零配置开箱即用

    默认激活 6 个零配置渠道(网页、YouTube、GitHub、RSS、全网搜索、V2EX),安装完成就能直接使用,无需任何额外设置。

    🔄

    多后端冗余路由

    每个平台都配置「首选 + 备选」多套接入方案,某条路线失效自动切换,用户无感知。2026 年 3 月一批单平台 CLI 集体停更,Agent-Reach 用户零操作,因为路由已经自动切好了。

    🩺

    内置诊断工具

    执行 agent-reach doctor 可一键检测所有渠道的可用状态、当前使用的后端,以及故障修复方案。排查问题再也不用瞎猜。

    🤖

    全 Agent 兼容

    支持 Claude Code、OpenClaw、Cursor、Windsurf、Codex、Aider 等所有支持命令行调用的 AI Agent,无需针对每个工具单独配置。

    🔒

    隐私安全 & 完全免费

    所有 Cookie、Token 仅本地存储,不上传任何第三方,代码完全开源可审计。所有依赖工具均为开源项目,所有 API 免费接入,无需支付任何 API 费用。

    📡 支持平台(10+)

    Tier 0 – 零配置即用
    • 网页:Jina Reader 解析任意网页,自动转 Markdown
    • YouTube:yt-dlp 提取字幕和视频搜索
    • GitHub:gh CLI 读取公开仓库、搜索、查看 Issue
    • RSS:feedparser 解析任意 RSS/Atom 源
    • 全网搜索:MCP 接入 Exa 语义搜索,免费无需 Key
    • V2EX:热门帖子、节点帖子、用户信息读取

    Tier 1 – 配置后解锁
    • Twitter/X:读推文 + 搜索 + 时间线(Cookie 认证)
    • Reddit:搜索 + 读帖子和评论(需登录态)
    • B站:搜索、视频详情、字幕获取
    • 小红书:搜索、内容阅读、评论查看
    • LinkedIn:公开页面、Profile、职位搜索
    • 雪球:股票行情、搜索、热门帖子

    🚀 典型使用场景

    📊

    场景一:全网技术调研

    你正在选型一个 LLM 框架,需要了解社区反馈和技术对比。只需对 Agent 说:

    “帮我全网调研一下最新的 LLM 框架对比,包括 GitHub 上的 Stars 数、Reddit 社区讨论、YouTube 评测视频内容”

    Agent 会自动调用 Exa 语义搜索(全网)、gh CLI(GitHub 数据)、yt-dlp(YouTube 字幕提取)、Reddit CLI(社区讨论),汇总成一份完整的调研报告。

    🐦

    场景二:社交媒体舆情分析

    你想了解某个开源项目在社交媒体上的评价。只需对 Agent 说:

    “帮我搜一下 Twitter 上关于 vLLM 的讨论,总结一下大家的主要观点”

    Agent 会自动调用 twitter-cli 搜索相关推文,提取内容并总结。如果需要,还可以结合 RedditB站 的讨论内容,获得更全面的舆情画像。

    📺

    场景三:视频内容总结

    你看到一个技术分享视频,但没时间看完。只需对 Agent 说:

    “这个 YouTube 视频讲了什么内容?帮我总结一下关键要点:https://youtube.com/watch?v=xxx”

    Agent 会自动调用 yt-dlp 提取视频字幕,然后调用 LLM 进行总结。支持多语言字幕,B站视频同样支持。

    💡 推荐理由

    Agent-Reach 解决了 AI Agent 最头疼的问题——如何低成本、高效率地获取互联网信息

    它的核心价值不在于提供了什么新功能,而在于 把选型、配置、维护的脏活累活都替你做了。每个平台都有多套接入方案,某条路线失效自动切换,用户完全无感知。

    我特别喜欢它的 零配置设计——安装完成就能用 6 个平台,不需要查文档、不需要申请 API Key。对于需要登录态的平台,只需要对 Agent 说”帮我配 Twitter”,Agent 会自动引导完成配置,不需要手动处理 Cookie。

    完全免费也是一大亮点。所有依赖工具都是开源项目,搜索引擎等能力免费接入,不需要支付任何 API 费用。相比 Twitter API 上百美元的月费,Agent-Reach 真的是良心之作。

    🩺 内置诊断工具

    安装完成后,执行以下命令可以一键检测所有渠道的可用状态:

    agent-reach doctor

    该命令会输出:

    • 每个渠道的可用状态(✅ 可用 / ❌ 不可用)
    • 当前使用的后端路由
    • 如果不可用,给出故障修复方案

    🔄 更新与卸载

    更新方法

    已安装的用户直接给 Agent 发送指令即可完成更新:

    帮我更新 Agent Reach:https://raw.githubusercontent.com/Panniantong/agent-reach/main/docs/update.md

    卸载方法

    • 完整卸载agent-reach uninstall
    • 保留配置agent-reach uninstall --keep-config
    • 预览卸载agent-reach uninstall --dry-run
    • Python 包卸载pip uninstall agent-reach

    📥 下载地址

    许可证:MIT License(商业友好,可自由使用、修改和分发)
  • Firecrawl — 134K+ Stars,为 AI Agent 量身打造的网页数据 API,搜索/爬取/交互一体化

    Firecrawl — 134K+ Stars,为 AI Agent 量身打造的网页数据 API,搜索/爬取/交互一体化

    Firecrawl Logo

    🔥 Firecrawl

    The API to search, scrape, and interact with the web at scale

    ⭐ 134K+ Stars
    📦 TypeScript
    📜 AGPL-3.0

    📌 项目简介

    Firecrawl 是专为 AI Agent 设计的网页数据 API,能将任意网页(含 JS 渲染)转换成 AI 友好的 Markdown/JSON 格式。它覆盖 96% 的网页,P95 延迟仅 3.4 秒,原生支持 MCP 协议,是 AI 应用获取实时网页数据的首选基础设施。

    ⚙️ 安装要求和过程

    环境要求

    Python
    3.8+ (SDK 支持)
    Node.js
    16+ (SDK 支持)
    API Key
    firecrawl.dev 注册
    自托管
    Docker / Redis / Playwright

    快速安装(Python SDK)

    # 安装 Python SDK
    pip install firecrawl-py
    
    # 基础使用示例
    from firecrawl import Firecrawl
    
    app = Firecrawl(api_key="fc-YOUR_API_KEY")
    
    # 搜索网页
    result = app.search("Firecrawl tutorial", limit=5)
    
    # 爬取单个 URL
    result = app.scrape('https://example.com', formats=["markdown"])
    print(result.markdown)

    快速安装(Node.js SDK)

    # 安装 Node.js SDK
    npm install firecrawl
    
    # 基础使用示例
    import { Firecrawl } from 'firecrawl';
    
    const app = new Firecrawl({ apiKey: 'fc-YOUR_API_KEY' });
    
    const result = await app.scrape('https://example.com', {
      formats: ['markdown']
    });
    console.log(result.markdown);

    MCP 集成(AI Agent 一键接入)

    # 一键安装 MCP Skill(支持 Claude Code、OpenClaw 等)
    npx -y firecrawl-cli@latest init --all --browser
    
    # 或手动配置 MCP 客户端
    {
      "mcpServers": {
        "firecrawl-mcp": {
          "command": "npx",
          "args": ["-y", "firecrawl-mcp"],
          "env": {
            "FIRECRAWL_API_KEY": "fc-YOUR_API_KEY"
          }
        }
      }
    }

    自托管部署(Docker)

    # 克隆仓库
    git clone https://github.com/firecrawl/firecrawl.git
    cd firecrawl
    
    # 启动自托管服务(需要 Docker、Redis、Playwright)
    docker-compose up -d
    
    # 访问本地服务
    # API: http://localhost:3002
    # Playground: http://localhost:3002/playground

    核心功能

    🔍 Search(智能搜索)

    全网搜索并返回结果页的完整 Markdown 内容,不再只是返回标题和 URL。支持关键词搜索、URL 搜索、智能过滤,返回结果可直接供 AI Agent 使用,无需二次处理。

    🕷️ Scrape(智能爬取)

    将任意 URL 转换为 Markdown、HTML、截图或结构化 JSON。自动处理 JS 渲染、代理轮换、速率限制、反爬虫策略,覆盖 96% 的网页,P95 延迟仅 3.4 秒。

    🤖 Agent(智能代理)

    无需指定 URL,用自然语言描述需求即可自动完成数据收集。支持结构化输出(Pydantic Schema),可自动提取创始人信息、产品定价、竞品对比等复杂数据,返回类型安全的 Python 对象。

    🗺️ Crawl + Map(全站爬取与 URL 发现)

    Crawl 支持单次请求爬取整个网站的所有页面内容;Map 快速发现网站所有 URL,支持关键词筛选。支持异步批量爬取数千个 URL,适合大规模数据采集场景。

    🖱️ Interact(交互式爬取)

    爬取页面后可执行点击、滚动、输入、等待、按键等交互操作,应对需要登录、搜索、翻页等动态场景。AI 提示驱动,无需编写复杂的选择器代码。

    💡 典型使用场景

    场景一:AI Agent 实时联网搜索

    通过 Firecrawl 的 Search API,AI Agent 可以实时搜索网页并获取完整内容,不再受训练数据时效限制。结合 MCP 协议,Claude Code、OpenClaw 等 AI 工具可以一键调用 Firecrawl 获取最新信息。

    # AI Agent 使用 Firecrawl 搜索最新信息
    result = app.search(
        query="2026年 AI 开源项目趋势",
        limit=10,
        scrape_options={"formats": ["markdown"]}
    )
    # result 包含搜索结果 + 每个结果的完整 Markdown 内容

    场景二:RAG 应用网页数据注入

    RAG(检索增强生成)应用需要大量外部数据,Firecrawl 可以批量爬取指定网站内容并转换为 Markdown,直接注入向量数据库。支持智能等待、JS 渲染、反爬虫绕过,大幅提升 RAG 应用的数据质量。

    # 批量爬取文档网站,用于 RAG
    docs = app.crawl(
        url="https://docs.example.com",
        limit=1000,
        scrape_options={"formats": ["markdown", "html"]}
    )
    # 将 docs 存入向量数据库(如 Milvus、Pinecone)

    场景三:竞品价格监控与数据分析

    使用 Agent API 自动收集竞品定价、功能对比、用户评价等数据,无需手动指定 URL,只需用自然语言描述需求。支持结构化输出,直接返回类型安全的 JSON 数据,可接入自动化分析流程。

    # 使用 Agent 自动收集竞品定价
    result = app.agent(
        prompt="Compare pricing of Firecrawl, ScrapingBee, and Apify",
        schema=PricingComparisonSchema
    )
    print(result.data)  # 结构化 JSON 输出

    ❤️ 推荐理由

    在 AI Agent 和 RAG 应用爆发式增长的今天,如何获取实时、高质量的网页数据成为了一个核心痛点。传统爬虫工具要么太底层(需要自己处理代理、JS 渲染、反爬虫),要么不够 AI 友好(返回脏 HTML,需要额外清洗)。

    Firecrawl 完美解决了这个问题:

    • 🌟 AI 原生设计:输出直接是 Markdown/JSON,无需额外清洗,降低 token 消耗
    • 🌟 高可靠性:覆盖 96% 的网页,自动处理 JS 渲染、代理轮换、速率限制
    • 🌟 高速度:百万级页面爬取 P95 延迟仅 3.4 秒,适合实时 AI 应用
    • 🌟 MCP 原生支持:一键接入主流 AI Agent 工具,无需复杂配置
    • 🌟 多语言 SDK:Python、Node.js、Java、Rust、Elixir 全覆盖
    • 🌟 开源可自托管:AGPL-3.0 许可,数据隐私完全自主可控

    💡 个人使用心得:Firecrawl 已成为我构建 AI Agent 的标配工具。以前需要组合使用 requests + BeautifulSoup + Playwright + 代理池才能完成的任务,现在一行代码就能解决。特别是它的 Agent API,用自然语言描述需求即可自动收集数据,大大降低了数据采集的门槛。如果你正在构建需要实时网页数据的 AI 应用,Firecrawl 绝对值得一试!

    📊 项目数据

    134K+
    GitHub Stars

    🍴
    7.8K+
    Forks

    👥
    375+
    Contributors

    📦
    5+
    官方 SDK

    📥 下载地址

    支持 Python、Node.js、Java、Rust、Elixir 等多语言 SDK • 开源 AGPL-3.0 许可 • 支持自托管部署

  • Agent-Reach:给AI Agent装上「全网眼睛」,30K+ Stars的免费互联网接入神器

    Agent-Reach:给AI Agent装上「全网眼睛」,30K+ Stars的免费互联网接入神器

    Agent-Reach - 给AI Agent装上全网眼睛

    项目简介

    Agent-Reach 是一个为 AI 智能体(AI Agent)提供全网内容读取与搜索能力的开源工具。它让 AI Agent 能够一键读取 Twitter、Reddit、YouTube、B站、小红书、GitHub 等 15+ 平台的内容——完全免费、无需付费 API,只需一行命令安装。

    项目目前拥有 30K+ GitHub Stars,是当前 AI Agent 基础设施领域最热门的项目之一。由开发者 Panniantong 开发并持续维护,采用 MIT 开源协议。

    为什么需要 Agent Reach?

    AI Agent 已经能帮你写代码、改文档、管项目——但你让它去网上找点东西,它就抓瞎了:

    • 📺 让 AI 看 YouTube 教程 → 拿不到字幕
    • 🐦 让 AI 搜推特产品评价 → Twitter API 要付费
    • 📖 让 AI 去 Reddit 找同类 bug → 返回 403
    • 📕 让 AI 看小红书商品口碑 → 必须登录才能打开
    • 📺 让 AI 总结 B 站技术视频 → 被风控拦截
    • 🔍 让 AI 搜索最新 LLM 框架对比 → 没有好用的免费工具

    安装要求与环境配置

    环境要求 说明
    Python 版本 Python 3.10 及以上
    操作系统 macOS / Linux / Windows 全平台支持
    兼容 Agent Claude Code、OpenClaw、Cursor、Windsurf、Codex 等所有能执行命令的 Agent
    网络代理 本地电脑不需要;服务器部署可能需要(~$1/月)

    快速安装步骤

    方法一:一键安装(推荐)
    # 复制这句话给你的 AI Agent:
    帮我安装 Agent Reach:https://raw.githubusercontent.com/Panniantong/agent-reach/main/docs/install.md
    
    # 或手动执行:
    pip install agent-reach
    agent-reach install --env=auto
    方法二:安全模式(生产环境推荐)
    pip install agent-reach
    agent-reach install --env=auto --safe

    安装完成后,运行诊断命令查看各渠道状态:

    agent-reach doctor

    核心功能

    🌐 网页阅读

    基于 Jina Reader 免费读取任意网页内容,自动清洗 HTML 标签,输出干净文本。无需 API Key。

    🐦 Twitter/X 读取

    通过 Cookie 认证免费读取和搜索推文,支持单条推文、时间线浏览、长文阅读。无需 Twitter API 付费。

    📺 YouTube 字幕提取

    基于 yt-dlp(154K Stars)提取视频字幕和元数据,支持多语言,无需 API Key。

    📺 B站搜索与阅读

    使用 bili-cli 无需登录即可搜索视频、获取详情。支持字幕提取(需 OpenCLI 配置)。

    🔍 全网语义搜索

    集成 Exa AI 语义搜索引擎(MCP 接入),支持自然语言查询,免费无需 Key。

    完整平台支持列表

    平台 零配置功能 配置后解锁
    🌐 网页 阅读任意网页
    📺 YouTube 字幕 + 搜索
    📡 RSS 解析任意源
    📦 GitHub 公开仓库 + 搜索 私有仓库 / Issue / PR
    🐦 Twitter/X 读单条推文 搜索 / 时间线 / 长文
    📖 Reddit 搜索 + 读帖子和评论
    📕 小红书 搜索 / 阅读 / 评论
    💼 LinkedIn Jina Reader 公开页 Profile / 公司页面
    💻 V2EX 热门帖子 + 详情
    📈 雪球 行情 + 搜索 + 热榜 高级数据

    典型使用场景

    🎯 场景一:AI 产品调研助手

    让 AI Agent 同时搜索 Twitter 用户对竞品的真实评价、Reddit 上的讨论帖、YouTube 上的评测视频,再汇总成调研报告。以前需要人工切换多个平台的操作,现在一句话搞定:

    "帮我调研一下 Cursor vs Windsurf 的用户反馈,
    搜一下 Twitter 和 Reddit 上的讨论"

    🎯 场景二:技术视频学习加速器

    把 YouTube/B站的技术教程链接丢给 Agent,它会自动提取字幕、总结要点、生成笔记。再也不用花 2 小时看完一个视频才知道讲的是什么:

    "总结一下这个 YouTube 视频的核心内容:
    https://youtube.com/watch?v=xxx"

    🎯 场景三:全网信息监控与聚合

    设置定时任务让 Agent 监控特定关键词在 Twitter、Reddit、V2EX 等平台的最新动态,汇总后推送给你。特别适合追踪技术趋势、竞品动态或舆情监测:

    "每天早上搜一下 RAG 相关的最新讨论,
    看看 Twitter 和 Reddit 上有什么新进展"

    推荐理由

    💡 个人使用心得:

    作为一个每天和各种 AI Agent 打交道的人,Agent-Reach 解决了我最大的痛点——Agent 的「互联网盲区」。以前让 Claude Code 去查个资料,它只能靠内置知识或者我手动复制粘贴;现在装上 Agent-Reach 后,它能自己去看 Twitter 讨论、读 Reddit 帖子、甚至总结 YouTube 视频内容。

    最让我印象深刻的是它的「能力层」设计理念:它不自己造轮子,而是帮你在底层选好、装好、配好各个平台的最佳开源工具(twitter-cli、bili-cli、OpenCLI 等)。而且当某个工具失效时(比如 yt-dlp 被 B 站风控封了),它会自动切换备选方案,用户几乎无感。

    另一个亮点是 `agent-reach doctor`——一条命令告诉你每个渠道通不通、走的是哪个后端、怎么修。这种「体检」设计在开源工具里非常少见。

    如果你正在使用 Claude Code、Cursor 或任何 AI 编程助手,强烈建议试试 Agent-Reach。它会让你的 Agent 从「只能写代码的程序员」进化为「能联网调研的全栈工程师」。

    技术架构亮点

    • 多后端路由机制:每个平台维护「首选 + 备选」有序后端列表,某条路失效自动切下一条
    • 零包装层设计:Agent 直接调用上游工具,没有中间封装层,性能损耗最小化
    • SKILL.md 注册制:安装后在 Agent skills 目录注册使用指南,Agent 自动知道该调什么
    • 安全优先:Cookie 仅存本地(权限 600)、支持安全模式和 Dry Run、代码完全可审计
    • 跨平台兼容:macOS / Linux / Windows 全平台支持,兼容所有主流 AI Agent

    下载地址

    GitHub 仓库 github.com/Panniantong/Agent-Reach
    PyPI 安装 pip install agent-reach
    开源协议 MIT License
    Star 数量 ⭐ 30K+ Stars