![]()
项目简介
PixelRAG 是伯克利 SkyLab / BAIR 团队开源的视觉检索增强生成框架。它把网页、PDF、图片渲染成截图块,再用视觉语言模型直接在“像素”上检索,从而绕过传统文本 RAG 的 HTML 解析问题,把表格、图表、版式、信息图原样保留给读者模型。仓库还附带一个已建好的 828 万维基百科页面视觉索引,以及免费的在线 API,真正做到了开箱即用。
安装要求和过程
环境要求
- Python 3.10+
- Linux(CUDA)或 macOS(Apple Silicon / MPS),CPU 亦可作为 fallback
- 可选:Playwright / CDP 用于网页渲染
- 可选:用于本地索引构建的 GPU,或直接使用
api.pixelrag.ai线上服务
快速安装
# 1. 基础包:像素化截图工具 pixelshot
pip install pixelrag
# 2. 带向量化:用于本地构建 FAISS 索引
pip install 'pixelrag'
# 3. 完整流水线:source → ingest → embed → index
pip install 'pixelrag[index]'
# 4. 本地搜索 API 服务
pip install 'pixelrag[serve]'
如果想让 pixelshot 始终处在 PATH 里供 Claude 调用,官方推荐用 uv tool 或 pipx:
uv tool install pixelrag # pipx install pixelrag
核心功能
- 像素级文档渲染: 通过
pixelshot把网页、PDF 转成截图块,保留文本 RAG 会丢失的视觉结构与版式。 - 视觉语义检索: 基于
Qwen3-VL-Embedding-2B微调后的嵌入模型,将页面图片映射到可检索向量空间。 - 828 万维基百科预建索引: 官方已建好并托管了
api.pixelrag.ai,无需任何配置即可搜索,还支持“以图搜图”。 - 本地自建索引: 通过
pixelrag index build处理本地文档(网页 / PDF / 图片),再pixelrag serve启动 FastAPI 搜索服务。 - Claude Code 插件:
pixelbrowseskill 让 Claude 直接截图并阅读页面,告别原始 HTML。
![]()
传统文本RAG会丢失表格等视觉结构,PixelRAG通过截图块保留完整版式。
![]()
典型使用场景
场景 1:财报 / 论文中的表格问答
传统文本 RAG 把 PDF 表格拆成凌乱文字后,模型经常找不到数字。PixelRAG 直接截取表格区域截图,检索相关页并交给 VLM 读取,数字、单位、行列关系一目了然。
场景 2:Claude 浏览复杂网页
安装 pixelbrowse skill 后,Claude 能够对任意页面执行 /screenshot https://example.com,然后“看图”总结新闻、解读产品页或提取图表结论,而不再受限于 HTML 标签提取不全的问题。
场景 3:内部知识库可视化搜索
把企业内的产品手册、设计稿、UI 截图、架构图做成 PixelRAG 索引。用户上传一张截图或输入图片描述,即可召回相关视觉文档,适用于设计系统、运维监控面板、竞品分析资料库。
推荐理由
PixelRAG 给我最大的启发是:当大家都在卷“更好的 HTML 解析器”时,它直接换了一条赛道——让模型像人一样“看”网页。这不是炫技,而是切中了 RAG 的实际痛点:大量网页的表格、图表、公式和交互组件一旦转成纯文本就面目全非。配合已经训练好的视觉嵌入模型和 828 万维基百科索引,从实验到落地只需要几条命令。
对于 Claude / Cursor / Codex 等 Coding Agent 用户来说,pixelbrowse skill 是一个润物细无声的能力升级:它不需要 MCP server,也不依赖后端服务,只是让 Agent 多了一双“眼睛”。如果你正在做多模态知识库、网页问答或文档理解,PixelRAG 值得放进候选清单。
下载地址
- GitHub:https://github.com/StarTrail-org/PixelRAG
- 在线 Demo:https://pixelrag.ai
- API 文档:https://pixelrag.ai/docs
- 论文地址:https://arxiv.org/abs/2606.28344
—— 本文由 WorkBuddy 整理发布。














