标签: RAG

  • PixelRAG:用网页截图做检索增强,让模型“看图说话”

    PixelRAG:用网页截图做检索增强,让模型“看图说话”

    PixelRAG 配图

    项目简介

    PixelRAG 是伯克利 SkyLab / BAIR 团队开源的视觉检索增强生成框架。它把网页、PDF、图片渲染成截图块,再用视觉语言模型直接在“像素”上检索,从而绕过传统文本 RAG 的 HTML 解析问题,把表格、图表、版式、信息图原样保留给读者模型。仓库还附带一个已建好的 828 万维基百科页面视觉索引,以及免费的在线 API,真正做到了开箱即用。

    安装要求和过程

    环境要求

    • Python 3.10+
    • Linux(CUDA)或 macOS(Apple Silicon / MPS),CPU 亦可作为 fallback
    • 可选:Playwright / CDP 用于网页渲染
    • 可选:用于本地索引构建的 GPU,或直接使用 api.pixelrag.ai 线上服务

    快速安装

    # 1. 基础包:像素化截图工具 pixelshot
    pip install pixelrag
    
    # 2. 带向量化:用于本地构建 FAISS 索引
    pip install 'pixelrag'
    
    # 3. 完整流水线:source → ingest → embed → index
    pip install 'pixelrag[index]'
    
    # 4. 本地搜索 API 服务
    pip install 'pixelrag[serve]'
    

    如果想让 pixelshot 始终处在 PATH 里供 Claude 调用,官方推荐用 uv toolpipx

    uv tool install pixelrag   # pipx install pixelrag
    

    核心功能

    1. 像素级文档渲染: 通过 pixelshot 把网页、PDF 转成截图块,保留文本 RAG 会丢失的视觉结构与版式。
    2. 视觉语义检索: 基于 Qwen3-VL-Embedding-2B 微调后的嵌入模型,将页面图片映射到可检索向量空间。
    3. 828 万维基百科预建索引: 官方已建好并托管了 api.pixelrag.ai,无需任何配置即可搜索,还支持“以图搜图”。
    4. 本地自建索引: 通过 pixelrag index build 处理本地文档(网页 / PDF / 图片),再 pixelrag serve 启动 FastAPI 搜索服务。
    5. Claude Code 插件: pixelbrowse skill 让 Claude 直接截图并阅读页面,告别原始 HTML。

    传统文本RAG vs PixelRAG

    传统文本RAG会丢失表格等视觉结构,PixelRAG通过截图块保留完整版式。

    PixelRAG 关键速览

    典型使用场景

    场景 1:财报 / 论文中的表格问答

    传统文本 RAG 把 PDF 表格拆成凌乱文字后,模型经常找不到数字。PixelRAG 直接截取表格区域截图,检索相关页并交给 VLM 读取,数字、单位、行列关系一目了然。

    场景 2:Claude 浏览复杂网页

    安装 pixelbrowse skill 后,Claude 能够对任意页面执行 /screenshot https://example.com,然后“看图”总结新闻、解读产品页或提取图表结论,而不再受限于 HTML 标签提取不全的问题。

    场景 3:内部知识库可视化搜索

    把企业内的产品手册、设计稿、UI 截图、架构图做成 PixelRAG 索引。用户上传一张截图或输入图片描述,即可召回相关视觉文档,适用于设计系统、运维监控面板、竞品分析资料库。

    推荐理由

    PixelRAG 给我最大的启发是:当大家都在卷“更好的 HTML 解析器”时,它直接换了一条赛道——让模型像人一样“看”网页。这不是炫技,而是切中了 RAG 的实际痛点:大量网页的表格、图表、公式和交互组件一旦转成纯文本就面目全非。配合已经训练好的视觉嵌入模型和 828 万维基百科索引,从实验到落地只需要几条命令。

    对于 Claude / Cursor / Codex 等 Coding Agent 用户来说,pixelbrowse skill 是一个润物细无声的能力升级:它不需要 MCP server,也不依赖后端服务,只是让 Agent 多了一双“眼睛”。如果你正在做多模态知识库、网页问答或文档理解,PixelRAG 值得放进候选清单。

    下载地址

    —— 本文由 WorkBuddy 整理发布。

  • Unlimited OCR:百度开源的「一次前向通读整本 PDF」的 OCR 大模型

    Unlimited OCR:百度开源的「一次前向通读整本 PDF」的 OCR 大模型

    项目简介

    Unlimited OCR 是百度开源的一款端到端 OCR 大模型,主打「One-shot Long-horizon Parsing」——在单次前向传播中,直接解析长达 32K token 的整份 PDF 或连续多页图像,而不是把文档切碎后一页页跑。

    它以 DeepSeek-OCR 的编码器为基础,但把解码器的所有注意力层替换为自研的 Reference Sliding Window Attention(R-SWA),让 KV Cache 在解码过程中保持恒定。换句话说:输出越长,显存和速度越稳定,不会出现传统 LLM 解码器「越写越慢」的窘境。

    核心亮点

    • 恒定 KV Cache:R-SWA 替换标准自注意力,长文档生成时显存占用平稳、解码速度不衰减。
    • 一次前向通读多页:标准 32K 上下文内,可一次完成数十页文档解析,保留跨页上下文。
    • 三种部署形态:提供 Hugging Face transformers、vLLM Docker 镜像、SGLang OpenAI 兼容服务三种开箱方案。
    • 通用解析机制:R-SWA 不局限于 OCR,论文指出同样适用于 ASR、翻译等需要长序列输出的任务。
    • 全链路开放:代码与模型权重均托管在 GitHub 与 Hugging Face,MIT 协议可商用。

    安装与快速上手

    项目环境要求:Python 3.12.3 + CUDA 12.9 通过验证;单张 NVIDIA GPU 即可体验。

    1. Transformers 快速体验

    # 依赖
    pip install torch==2.10.0 torchvision==0.25.0 transformers==4.57.1 Pillow==12.1.1
    pip install matplotlib==3.10.8 einops==0.8.2 addict==2.4.0 easydict==1.13 pymupdf==1.27.2.2 psutil==7.2.2
    
    # 加载模型
    from transformers import AutoModel, AutoTokenizer
    model_name = 'baidu/Unlimited-OCR'
    tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True)
    model = AutoModel.from_pretrained(model_name, trust_remote_code=True,
                                      use_safetensors=True, torch_dtype=torch.bfloat16).eval().cuda()
    
    # 单图解析(gundam 配置:base_size=1024, image_size=640, crop_mode=True)
    model.infer(tokenizer, prompt='<image>document parsing.',
                image_file='your_image.jpg', output_path='./outputs',
                base_size=1024, image_size=640, crop_mode=True,
                max_length=32768, save_results=True)
    
    # 多页 / PDF
    model.infer_multi(tokenizer, prompt='<image>Multi page parsing.',
                      image_files=['page1.png', 'page2.png'], output_path='./outputs',
                      image_size=1024, max_length=32768, save_results=True)
    

    2. vLLM 生产部署

    # CUDA 13.0
    docker pull vllm/vllm-openai:unlimited-ocr
    # Hopper GPU 使用 cu129 镜像
    docker pull vllm/vllm-openai:unlimited-ocr-cu129
    # 官方 recipe: https://recipes.vllm.ai/baidu/Unlimited-OCR
    

    3. SGLang 批处理服务

    uv venv --python 3.12
    source .venv/bin/activate
    uv pip install wheel/sglang-*.whl kernels==0.11.7 pymupdf==1.27.2.2
    
    python -m sglang.launch_server --model baidu/Unlimited-OCR --served-model-name Unlimited-OCR \
      --attention-backend fa3 --page-size 1 --context-length 32768 \
      --enable-custom-logit-processor --disable-overlap-schedule \
      --skip-server-warmup --host 0.0.0.0 --port 10000
    
    # 并发批跑目录或 PDF
    python infer.py --pdf ./examples/document.pdf --output_dir ./outputs --concurrency 8 --image_mode gundam
    

    典型使用场景

    1. 学术论文整本转 Markdown:把 30 页 PDF 直接丢给模型,一次前向输出带标题层级、公式占位、表格结构的 Markdown,省去分块合并。
    2. RAG 知识库文档预处理:批量解析合同、手册、财报,保留原文版面和段落结构,作为高质量向量库原始文本。
    3. 票据与表格版面结构化:针对扫描发票、银行流水、Excel 截图等,输出键值对或 JSON 结构化结果。

    推荐理由

    最近大家注意力都在 Coding Agent 上,OCR 赛道反而被低估。Unlimited-OCR 真正的价值在于把「长序列输出」这件事做扎实了——R-SWA 让 KV Cache 不再线性膨胀,这是端到端文档理解从 demo 走向生产的关键。

    另外百度这次放出了完整的训练、推理、部署、微调(ms-swift)链路,并且兼容 vLLM / SGLang 两大推理框架,对工程落地非常友好。如果你在做 RAG、知识库、文档数字化,它很可能成为你管道里的默认 OCR 组件。

    资源下载

    • GitHub 仓库:https://github.com/baidu/Unlimited-OCR
    • Hugging Face 模型:https://huggingface.co/baidu/Unlimited-OCR
    • 在线 Demo:https://huggingface.co/spaces/baidu/Unlimited-OCR
    • arXiv 论文:https://arxiv.org/abs/2606.23050
    • ModelScope 模型:https://modelscope.cn/models/PaddlePaddle/Unlimited-OCR
    • 百度智能云:https://cloud.baidu.com/doc/OCR/s/fmr1p39gb
  • book-to-skill:把任何技术书 PDF 变成 AI 智能体技能,实测省 24~51 倍 Token|GitHub 12.5K Stars 今日趋势榜第一

    book-to-skill:把任何技术书 PDF 变成 AI 智能体技能,实测省 24~51 倍 Token|GitHub 12.5K Stars 今日趋势榜第一

    book-to-skill 项目

    📌 项目简介

    book-to-skill 是一个能把任何技术书籍 PDF(以及 EPUB、DOCX、Markdown 等十余种格式)一键转换成 AI 智能体技能(Agent Skill)的开源工具——转换后你的 Claude Code、GitHub Copilot CLI 或 Amp 就能”读过这本书”,随时按需调取书中真实内容回答问题,彻底告别大模型幻觉和翻 PDF 的痛苦。项目基于 Python 开发,MIT 许可,2026 年 5 月开源以来已斩获 12,499 Stars,今日更以单日 +1,400 星登顶 GitHub Trending。

    book-to-skill Logo

    它解决的是一个所有技术人都懂的痛点:买了一本好书,读完一遍,三个月后连第 7 章讲什么都想不起来。直接把 PDF 扔给 AI?一本 400 页的书约 20 万 token,每轮对话都要全额付费,而且模型在超长上下文里”迷失中间”、精度骤降。book-to-skill 的思路是编译期一次性深度蒸馏:把书拆解成核心心智模型 + 按章节的知识文件 + 术语表 + 模式库 + 速查表,智能体按需加载,实测比整书塞上下文省 24~51 倍 token

    ⚙️ 安装要求和过程

    环境要求

    • Python 3 环境(纯文本/Markdown/reST/AsciiDoc 无需额外依赖)
    • PDF 提取:文字型书籍用 pdftotext(poppler)或 pip3 install pypdf;含代码/表格/公式的技术书推荐 pip3 install docling(可完整保留 Markdown 表格与代码块)
    • EPUB:pip3 install ebooklib beautifulsoup4(有内置 zipfile 兜底)
    • 宿主:支持开放 Agent Skills 标准的任意智能体——Claude Code、GitHub Copilot CLI、Amp 均可

    安装(作为智能体技能)

    # Claude Code
    git clone https://github.com/virgiliojr94/book-to-skill.git ~/.claude/skills/book-to-skill
    
    # GitHub Copilot CLI
    git clone https://github.com/virgiliojr94/book-to-skill.git ~/.copilot/skills/book-to-skill
    
    # 跨智能体通用路径(Copilot CLI 与 Amp 都能发现)
    git clone https://github.com/virgiliojr94/book-to-skill.git ~/.agents/skills/book-to-skill
    

    使用:三步把书变技能

    # 1. 指向一个文件、文件夹或 glob
    /book-to-skill ~/books/designing-data-intensive-apps.pdf
    
    # 2. 自动蒸馏为技能(框架、决策规则、反模式、分章文件)
    
    # 3. 之后随时按需调用
    /designing-data-intensive-apps replication   # 讲解某个主题
    /designing-data-intensive-apps ch05          # 深入第 5 章
    

    另有独立 CLI 模式:pip install "book-to-skill[pdf,epub,docx]",仅安装文本提取引擎用于脚本化处理(不注册斜杠命令)。运行 python3 scripts/extract.py --check 可一键检查各格式提取器安装情况。

    🚀 核心功能

    • 全格式文档蒸馏:支持 PDF、EPUB、DOCX、TXT、Markdown、reST、AsciiDoc、HTML、RTF、MOBI/AZW 等格式;可一次处理多个文件、整个文件夹或 glob 模式,合并成统一技能,还能向已有技能”折叠”新增材料(增量更新)
    • 结构化技能产物:生成 SKILL.md(约 4K token 的核心心智模型 + 章节索引)、每章约 1K token 的按需加载文件、术语表 glossary.md、技术模式库 patterns.md、决策速查表 cheatsheet.md——是”结构”而非”摘要”
    • 24~51 倍 token 节省(实测):内置 tools/discovery_tax.py 测量工具,在 Think Python 2、Working Backwards、AI Engineering 三本真书上实测:回答一个问题只需约 5K token(核心 + 单章),对比整书上下文倾倒 12 万~25.6 万 token
    • 智能提取管线:转换前自动询问书籍类型——技术书走 Docling(保留表格代码),纯文字书走 pdftotext 秒级提取;单个坏源自动跳过不影响批处理;一本书完整转换成本约 1 美元
    • 开放标准、一次安装多端通用:遵循开放 Agent Skills 标准(SKILL.md 格式),Claude Code、GitHub Copilot CLI、Amp 读取同一份技能,无厂商锁定

    💡 典型使用场景

    • 技术书籍随身参谋:把《DDIA》《Pro Git》这类工具书转成技能,写代码时直接 /ddia replication 让智能体基于书中真实章节讲解复制策略——不是幻觉,不是网页搜索,就是作者原文提炼的框架
    • 团队内部文档折叠:把整个 docs/ 文件夹(架构决策记录、Runbook、新人指南)合并成一个技能,新同事在编码会话里直接提问,替代翻 60 页 PDF 的品牌手册/规范文档
    • 研究资料簇管理:一摞论文加自己的笔记合成统一技能,新论文来了增量折叠进去;对比 RAG——RAG 适合”几十本书里找提到 X 的段落”(宽而浅),book-to-skill 适合”吃透一本书的 12 个框架并应用”(窄而深),两者互补

    ❤️ 推荐理由

    这个项目最打动我的是它把”AI 读书”从检索问题重构成了编译问题。RAG 是查询时相似度搜索,返回”和你问题相近的文本块”;book-to-skill 是编译时深度分析,输出”作者花几年构建的命名框架、适用条件和反模式”——前者是检索,后者是可推理的结构。README 里那句话很精辟:“RAG indexes a shelf, book-to-skill masters a spine”(RAG 索引一整架书,book-to-skill 吃透一本书的书脊)。

    工程上它也异常诚实:所有 token 节省数据都有可复现的测量脚本,README 明确写出”诚实警告”——章节自动切分需要显式的 Chapter N 标题、一次性阅读场景用普通 PDF 智能体就够了。在营销味十足的 AI 开源圈,这种”实测优先、有限承诺”的态度非常难得。如果你的 ~/.claude/skills 目录里只打算加一个新技能,让它是一个能把你书架搬进智能体的技能,很值。

    🔗 下载地址


    项目数据截至 2026 年 7 月 30 日:12,499 Stars · 1,405 Forks · Python · MIT 许可 · 今日 GitHub Trending 榜首(+1,428 星)

  • Hello-Agents:69K Star 的《从零开始构建智能体》——Datawhale 出品的中文 Agent 系统性实战教程

    Hello-Agents:69K Star 的《从零开始构建智能体》——Datawhale 出品的中文 Agent 系统性实战教程

    Hello-Agents 项目主视觉
    Hello-Agents——《从零开始构建智能体》开源教程

    项目简介

    Hello-Agents 是 Datawhale 开源社区出品的系统性智能体(AI Agent)中文实战教程——《从零开始构建智能体》,16 章内容从智能体原理、经典范式(ReAct / Plan-and-Solve / Reflection)一路讲到自研 Agent 框架、记忆与 RAG、MCP 通信协议、Agentic RL 训练与多智能体综合项目,目标是带你从大语言模型的”使用者”蜕变为智能体系统的”构建者”。目前已斩获 69,381 Stars,并曾登顶 GitHub Trending,是当下最热门的中文 Agent 学习资源之一。

    与 Dify、Coze、n8n 这类”流程驱动”的低代码 Agent 平台不同,Hello-Agents 的重心是教你构建 AI 原生(AI Native)智能体——真正以 LLM 推理驱动决策的 Agent。教程配套自研轻量框架 HelloAgents(基于 OpenAI 原生 API 从零实现),让你兼具”用轮子”与”造轮子”的能力。

    安装要求和过程

    环境要求

    • Python 3.10+(具备基础 Python 编程能力即可,无需模型训练背景)
    • 任意一个 LLM API Key(OpenAI 兼容接口,如 DeepSeek、通义千问、GLM 等国产模型均可)
    • 可选:Jupyter Notebook / VS Code,用于运行配套代码

    快速开始

    # 1. 克隆仓库(含全部 16 章文档 + 配套代码)
    git clone https://github.com/datawhalechina/hello-agents.git
    cd hello-agents
    
    # 2. 安装自研教学框架 HelloAgents(V1.0.0)
    pip install helloagents
    
    # 3. 配置模型 API(OpenAI 兼容接口均可)
    export LLM_API_KEY="your-api-key"
    export LLM_BASE_URL="https://api.deepseek.com/v1"
    
    # 4. 跟随章节运行 code/ 目录下的配套代码
    

    不想装环境?可直接在线阅读国内加速站 | GitHub Pages;官方还提供带 Datawhale 水印的免费 PDF 版本下载

    核心功能

    • 16 章完整学习路径:五大部分层层递进——智能体与 LLM 基础 → 亲手实现 ReAct / Plan-and-Solve / Reflection 经典范式 → 记忆·RAG·上下文工程·通信协议等高级技术 → 综合案例 → 毕业设计,每章配可运行代码。
    • 自研教学框架 HelloAgents:不依赖任何重型框架,基于 OpenAI 原生 API 从零构建 Agent 框架,穿透 LangGraph / AutoGen 等框架表象理解底层原理。
    • Agentic RL 训练实战:第十一章覆盖从 SFT 到 GRPO 的 LLM 训练全流程,是少有的把”训练智能体模型”讲透的中文教程。
    • MCP / A2A / ANP 协议解析:系统讲解智能体通信协议,配合智能旅行助手案例演示 MCP 与多智能体协作的真实应用。
    • 丰富的 Extra 番外篇:Agent 面试题总结、GUI Agent / Web Agent 实战、Agent Skills 与 MCP 对比、Agent 自进化、Skill 写作最佳实践等 13+ 篇社区共创内容持续更新。

    典型使用场景

    1. 系统学习 Agent 开发的工程师/学生:按五大部分循序渐进,从手写 ReAct 循环到构建自己的多智能体应用,毕业设计产出可写进简历的完整项目;番外篇的 Agent 面试题总结对求职者尤其实用。
    2. 复现深度研究智能体(DeepResearch Agent):第十四章手把手复现自动化深度研究智能体,理解 OpenAI Deep Research 类产品的任务规划、搜索、综合报告全链路。
    3. 构建多智能体模拟应用:第十五章”赛博小镇”将 Agent 与游戏结合,模拟社会动态,是学习 Generative Agents(斯坦福小镇)范式的中文最佳实践入口。

    推荐理由

    市面上 Agent 教程要么是框架 API 说明书,要么是零散博客,而 Hello-Agents 是我见过体系最完整的中文 Agent 教程:它不满足于教你调用 LangGraph,而是带你从零造一个框架出来——这种”造轮子”式学习对建立底层直觉极其有效。内容覆盖也足够前沿:上下文工程、MCP 协议、GRPO 训练、Agent 自进化这些 2025-2026 年的热点全部收录,且持续更新。Datawhale 社区运营成熟,配套读者群、视频课共创、社区精选投稿一应俱全,完全免费开源。一周内 Star 从 1 万飙到近 7 万足以说明其质量。给想在”Agent 元年”入场的中文开发者:这就是那本该收藏的教科书。

    下载地址

    项目数据:69,381 Stars | 语言:Python / Markdown | 出品:Datawhale 开源社区(数据截至 2026-07-29)

  • Agents Towards Production:21.2K Stars 的生产级 GenAI Agent 实战教程库

    Agents Towards Production:21.2K Stars 的生产级 GenAI Agent 实战教程库

    Agents Towards Production 封面

    项目简介

    Agents Towards Production 是 Nir Diamant 维护的一套开源、代码优先的教程合集,目标是帮助开发者把 GenAI Agent 从「能跑的原型」推进到「可上线的产品」。仓库目前包含 28 个生产级教程,覆盖工具集成、RAG、记忆、部署、安全、评估、UI 等 13 大模块,所有代码都以可运行的 Notebook 形式提供。

    安装要求和过程

    • 环境要求:Python 3.10+、Jupyter Notebook / JupyterLab、Git
    • 克隆仓库git clone https://github.com/NirDiamant/agents-towards-production.git
    • 进入对应教程目录,例如:cd tutorials/LangGraph-agent
    • 安装依赖:每个教程都有独立的 requirements.txt,执行 pip install -r requirements.txt
    • 启动 Jupyterjupyter notebook,按 Notebook 说明逐格运行即可

    核心功能

    • 端到端生产链路:从 Prompt 工程、状态化工作流、向量记忆,到 Docker/FastAPI 部署、GPU 扩展、安全防护,形成完整闭环。
    • 可运行教程:每个教程独立成册,直接提供 Notebook 与依赖文件,几分钟内就能从概念跑到可交互的 Agent。
    • 主流技术栈实战:涵盖 LangGraph、LangChain、MCP、Redis、Mem0、Cognee、LlamaFirewall、RunPod、AWS Bedrock、Streamlit 等。
    • 安全与可观测性:包含安全护栏、Apex 安全评估、LangSmith Tracing、IntellAgent 自动评估等实战内容。
    • 多智能体协作:讲解 A2A 协议下的智能体间通信与任务分发。

    典型使用场景

    • 企业 RAG 落地:Contextual AI 教程演示如何在 15 分钟内构建面向金融文档分析的企业级 RAG,包含文档处理、索引与 LMUnit 自动化评测。
    • 可部署 Agent 服务:Docker 容器化 + FastAPI 端点部署教程,教你把 LangGraph 工作流封装成可调用的 REST API。
    • 长记忆客服助手:结合 Redis 双记忆、Mem0 向量+图谱、Cognee 构建能持续学习用户偏好的对话 Agent。

    推荐理由

    这是一本「会动的书」:不是泛泛而谈的设计模式,而是把每个生产环节拆成可执行的 Notebook。对已经会用 LLM、但苦于不知道怎么把 Agent 真正交付到生产环境的人来说,它补全了从原型到运维之间最关键的拼图。21.2K Stars 和活跃的社区也证明了它的实用价值。

    13大模块内容地图

    三步快速上手

    下载地址

  • Claude Cookbooks:Anthropic 官方维护的 Claude 实战范例集(50K+ Stars)

    Claude Cookbooks:Anthropic 官方维护的 Claude 实战范例集(50K+ Stars)

    Claude Cookbooks

    Claude Cookbooks 是 Anthropic 官方在 GitHub 上开源维护的 Jupyter Notebook 范例集,已收获 50.4K+ Stars5.9K+ Forks,MIT 许可证。它像一本持续更新的”Claude 实战菜谱”,用可以直接复制运行的代码片段,手把手教开发者把 Claude API 用到生产里——覆盖文本分类、RAG、工具调用、Agent SDK、Skills、多模态、扩展思考、第三方集成等几乎所有主流场景。

    无论是刚接触 Claude API 的新手,还是要把 Claude 嵌入自家产品的资深工程师,都能在这里找到即拿即用的最佳实践。所有 Notebook 都用 Python 写成,但概念同样适用于任何支持 Claude API 的语言。

    Claude Cookbooks 内容地图

    为什么需要它?

    很多人第一次调用 Claude API 只能写出”问个问题拿个回答”的脚本——但生产里要面对的是:结构化输出、上下文管理、长文档解析、Agent 工作流、RAG 检索、工具调用循环、子智能体拆分…这些工程化能力的最佳范式,往往不是 API 文档里那几段示例能覆盖的。Cookbooks 正是 Anthropic 工程师团队把生产经验沉淀下来的”答案库”。

    安装要求和过程

    环境要求

    • Python 3.10+(项目用 uv 管理依赖)
    • Jupyter Lab / VS Code Jupyter 扩展
    • 一个 Anthropic API Key(前往 anthropic.com 免费注册)

    快速安装

    # 1. 克隆仓库
    git clone https://github.com/anthropics/claude-cookbooks.git
    cd claude-cookbooks
    
    # 2. 安装依赖(项目使用 uv,也可用 pip)
    pip install -r requirements-dev.txt
    # 或:uv sync
    
    # 3. 配置密钥
    cp .env.example .env
    # 编辑 .env 填入你的 ANTHROPIC_API_KEY
    
    # 4. 启动 Jupyter
    jupyter lab

    三步快速上手

    核心功能

    1. 基础能力 Recipes

    capabilities/ 目录里包含文本分类、RAG 检索增强、长文摘要、结构化 JSON 输出四大基础用法。每个 Recipe 都配了独立 Notebook,从最小调用示例一路演化到生产级实现。

    2. 工具调用与函数集成

    tool_use/ 演示了 Claude 如何调用外部工具——从最简单的计算器、SQL 查询,到完整的多步骤客服智能体。这是把 Claude 从”聊天机器人”升级成”可执行 Agent”的关键能力。

    3. Claude Agent SDK

    claude_agent_sdk/ 是新近加入的官方 Agent SDK 范例,示范如何用 Python SDK 构建可独立运行的智能体应用、调度工具、规划子任务。

    4. Agent Skills 技能系统

    skills/ 目录展示如何为 Claude 编写模块化技能——把专业能力封装成可复用的 Skills,让 Agent 在不同场景下按需调用。

    5. 多模态能力

    multimodal/ 覆盖图像理解、图表解读、表单/PDF 内容提取、视觉最佳实践等,配合 Claude 强大的视觉模型可直接处理扫描件、合同、PPT。

    6. 扩展思考与设计模式

    extended_thinking/patterns/ 深入推理模式、子智能体协作、提示词缓存、评估驱动开发(Eval-Driven Development)等高阶范式。

    7. 第三方集成

    third_party/ 给出Pinecone 向量数据库、Wikipedia、VoyageAI Embeddings等流行服务的对接范例,把 Claude 嵌入现有技术栈成本极低。

    8. 微调与可观测性

    finetuning/observability/ 提供模型微调生产链路观测的端到端代码,是把 Claude 部署到线上服务的最后一块拼图。

    典型使用场景

    场景 1:快速搭建企业知识库 RAG

    复制 capabilities/retrieval_augmented_generationthird_party/Pinecone 两个 Notebook,半天就能搭起一个基于 Pinecone + Claude 的企业知识问答系统。Notebook 里连如何切分文档、嵌入、检索、重排序、生成都一步步跑通。

    场景 2:构建带工具调用的客服 Agent

    参考 tool_use/customer_service_agent.ipynb 的代码结构,把你的订单查询 API、退款流程、商品库存接口注册成 Claude 可调用的工具,立即得到一个能回答”我的订单到哪了”的多轮 Agent。

    场景 3:批量处理 PDF/扫描件

    multimodal/ 里的 PDF 解析与表单提取 Recipe,配合 Claude 视觉模型,搭建合同关键条款抽取、发票识别、报告摘要等自动化工作流。

    场景 4:评估驱动的提示词迭代

    misc/building_evals.ipynb 给出用 Claude 自身来评估另一批 Claude 输出质量的工程范式——适合团队协作打磨生产级 Prompt,让提示词的优化变成可量化、可回归的过程。

    推荐理由

    用 Cookbooks 这半年,最大的感受是:它不是”玩具示例”,而是真正从生产里长出来的代码

    • 覆盖全面:从基础调用到 Agent SDK,从 RAG 到微调,几乎所有 Claude 应用方向都有现成 Recipe,避免重复造轮子。
    • 持续更新:紧跟 Anthropic 的功能发布(比如 Claude 4 系列、扩展思考、Agent SDK、Skills 都是最近几个月加入的新章节)。
    • 可读性极强:每个 Notebook 都是”一段说明 + 一段代码 + 一段输出”的节奏,能当教程读,也能当模板抄。
    • 社区友好:MIT 许可,欢迎提 PR;CLAUDE.md 里甚至写了让 Claude 帮忙做贡献的指南(meta!)
    • 企业可商用:MIT 协议允许商业使用,没有 Apache-2.0 那种专利条款的顾虑。

    对国内开发者来说,唯一需要注意的是 Anthropic API 的访问渠道——可以走官方、AWS Bedrock、Vertex AI 或合规中转服务。模型本身支持中文,是 Claude 进军中文 AI 应用开发的官方”最佳实践手册”。

    下载地址

    用 Cookbook 抄答案,把 Claude 真正用进生产——这可能是 2026 年最值得收藏的 AI 工程仓库之一。

  • MemPalace:57.7K Stars 的本地优先开源 AI 记忆系统,逐字存储 + 96.6% 检索召回,零 API 成本

    MemPalace:57.7K Stars 的本地优先开源 AI 记忆系统,逐字存储 + 96.6% 检索召回,零 API 成本

    MemPalace Logo

    项目简介

    MemPalace 是一款本地优先(Local-first)的开源 AI 记忆系统:它把你与 AI 的对话历史、项目文档以”逐字原文”的方式存进一座结构化的”记忆宫殿”,再用语义搜索精准召回——在权威长期记忆基准 LongMemEval 上,纯本地检索(不调用任何 LLM、不需要任何 API Key)就拿下了 96.6% R@5 的成绩,号称”基准测试打得最透明的开源 AI 记忆系统”。项目 2026 年 4 月上线,短短三个多月即斩获 57.7K+ Stars,MIT 许可,完全免费。

    与 Mem0、Zep 等”摘要式”记忆方案不同,MemPalace 的哲学是不摘要、不改写、不提炼——原文进、原文出。它借用”记忆宫殿”的记忆术概念组织索引:人物和项目是”侧厅(wings)”,主题是”房间(rooms)”,原始内容躺在”抽屉(drawers)”里,搜索可以按范围限定,而不是在一个扁平语料库里大海捞针。

    安装要求和过程

    环境要求:

    • Python 3.9+
    • 向量存储后端(默认内置 ChromaDB,零配置)
    • 约 300 MB 磁盘空间用于本地嵌入模型(推荐多语言的 embeddinggemma-300m,支持 100+ 语言;也可选 30 MB 的英文版 all-MiniLM-L6-v2)
    • 核心功能无需任何 API Key

    快速安装(推荐 uv,隔离环境防依赖冲突):

    # 方式一:uv(推荐)
    uv tool install mempalace
    mempalace init ~/projects/myapp
    
    # 方式二:pipx
    pipx install mempalace
    
    # 方式三:pip(虚拟环境内)
    python -m venv .venv && source .venv/bin/activate
    pip install mempalace

    Docker 部署(可直接作为 MCP 服务器运行):

    docker build -t mempalace .
    # MCP 服务器(stdio 模式,注意 -i 参数)
    docker run -i --rm -v mempalace-data:/data mempalace
    # 或直接跑 CLI 命令
    docker run --rm -v mempalace-data:/data mempalace search "why GraphQL"

    30 秒上手:

    # 把项目文件"挖"进记忆宫殿
    mempalace mine ~/projects/myapp
    # 挖掘 Claude Code 历史会话
    mempalace mine ~/.claude/projects/ --mode convos
    # 语义搜索
    mempalace search "当初为什么改用 GraphQL"
    # 新会话开始时加载上下文
    mempalace wake-up

    核心功能

    • 逐字原文存储 + 语义检索:不摘要、不改写,对话与文档按原文入库;LongMemEval 上纯语义检索 R@5 达 96.6%,混合管线(关键词加权 + 时间邻近加权)在留出集上达 98.4%,加 LLM 重排后 ≥99%——全部结果可用仓库内脚本复现。
    • 可插拔存储后端:默认 ChromaDB 零配置开箱即用,另支持 SQLite(精确匹配)、Milvus、Qdrant、pgvector,一个环境变量即可切换,接口契约独立于任何单一厂商。
    • 36 个 MCP 工具 + 时序知识图谱:内置 MCP 服务器覆盖宫殿读写、知识图谱操作(带有效期窗口的实体关系:添加/查询/失效/时间线)、跨侧厅导航和智能体日记,本地 SQLite 支撑。
    • 自动保存钩子(Auto-save Hooks):为 Claude Code、Codex CLI、Cursor IDE 提供钩子,定期保存并在上下文压缩前抢救现场——专治”Claude Code 会话 30 天过期”之痛。
    • 彻底本地、彻底免费:嵌入模型本地运行,数据不出机器(除非你主动选择),MIT 许可,无任何付费墙。

    典型使用场景

    场景一:给 Claude Code / Cursor 装上”永久记忆”。AI 编程工具的会话记录会过期、上下文会被压缩,三周前”为什么放弃方案 A 改用方案 B”的讨论早已无处可寻。装上 MemPalace 的自动保存钩子后,每次对话都逐字入库,新会话里一句 mempalace wake-up 或通过 MCP 工具即可召回全部历史决策。

    场景二:团队/个人的项目决策考古。把项目代码、文档、历史会话统统 mine 进宫殿,之后用自然语言问”当初为什么选 PostgreSQL 而不是 MongoDB”,直接命中当时的原始讨论原文——而不是某个 LLM 事后脑补的摘要。

    场景三:隐私敏感环境下的 AI 记忆层。法务、医疗、金融等不能把数据传到云端的场景,MemPalace 全链路本地运行(嵌入模型本地、向量库本地、检索本地),配合 Ollama 等本地模型即可搭出完全离线的”有记忆的 AI 助手”。

    推荐理由

    AI 记忆赛道今年异常拥挤(Mem0、Zep、Supermemory、Letta……),MemPalace 能三个月冲到 57K Stars,我认为靠的是两个字:诚实。它是少数把基准测试方法论、每道题的原始结果文件全部提交到仓库、并且主动说明”最后 0.6% 是看着错题调出来的所以我们不宣传 100%”的项目——甚至拒绝与竞品做不对等的表格对比。这种工程品味在营销味浓重的 AI 开源圈里非常稀缺。

    实际体验上,”逐字存储”这个反直觉的设计恰恰是最大亮点:摘要式记忆一旦摘错,信息就永久丢失;而 MemPalace 永远保留原文,检索层再怎么迭代都能吃到红利。加上零 API 成本、五种后端随意切换、36 个 MCP 工具即插即用,把它接进 Claude Code / Cursor 的成本极低。如果你只想给自己的 AI 工作流加一层”不会失忆”的保险,这是目前开箱体验最好的选择之一。唯一要提醒的是:官方明确警告有大量仿冒网站,请只从 GitHub、PyPI 和 mempalaceofficial.com 获取。

    下载地址

  • Wigolo:给 AI 编程智能体装上本地优先的「上网」引擎(开源 MCP)

    Wigolo:给 AI 编程智能体装上本地优先的「上网」引擎(开源 MCP)

    Wigolo 演示

    在 Claude Code、Cursor、Codex 这类编码智能体大行其道的今天,一个尴尬的现实是:它们很会写代码,却「看不见」互联网。想查一份报错、一份 API 文档、一个竞品定价,往往得开发者自己复制粘贴喂给模型。Wigolo 要做的,就是给 AI 智能体装上一双「眼睛和手」——一个本地优先、无需 API Key、按查询 0 计费的统一「上网」引擎。

    🦉 项目简介

    WigoloKnockOutEZ 开源的 AI 编程智能体本地优先「上网」引擎:以 MCP 服务器(或 REST / SDK)的形式运行在智能体身边,统一提供 搜索、抓取、爬取、提取、缓存、相似发现、研究、自主收集 等全套 Web 能力。核心理念是 no keys, no cloud, no metered bill——核心工具无需任何 API Key,所有数据留在本地 ~/.wigolo/,用得越多账单也不会涨。

    💻 安装要求与过程

    环境要求:Node.js ≥ 20,约 1.5 GB 空闲磁盘(首次运行会下载浏览器引擎等本地组件)。核心搜索 / 抓取 / 爬取无需任何外部 Key 即可使用;如需 researchagent 等高级研究能力,可选择性配置一个 LLM Provider(如 Gemini)。

    快速安装:

    # 初始化本地引擎(任意系统)
    npx wigolo init
    
    # 初始化并一键接入日常 agent(如 Claude Code + Cursor)
    npx wigolo init --agents=claude-code,cursor
    
    # 以 Docker 方式作为 stdio MCP 服务运行
    docker run -i --rm -v wigolo-data:/data ghcr.io/knockoutez/wigolo
    
    # 在自托管 box 上暴露 HTTP 服务(默认 127.0.0.1:3333)
    wigolo serve
    
    # 在你的应用里用 SDK 嵌入
    npm install wigolo-sdk     # TypeScript
    pip install wigolo         # Python

    常用运维命令:npx wigolo verify(健康检测)、npx wigolo warmup --all(重下引擎)、npx wigolo docto --fix(修复环境)。

    ⚙️ 核心功能

    Wigolo 核心工具全景

    1. 🔍 多引擎搜索 search:内置 18 个直连适配器,ML 重排 + 可解释评分,让智能体拿到「为什么是这条结果」。
    2. 🔗 抓取 & 爬取 fetch / crawl:分层路由获取单页并清洗为 markdown(含 PDF / 鉴权页处理);BFS / DFS / sitemap 多页爬取并自带限流保护。
    3. 🧩 提取 & 缓存 & 相似 extract / cache / find_similar:从页面抽取表格 / JSON-LD / Schema 等结构化数据;本地缓存已见内容,二次查询毫秒即回;关键词 + 语义 + 实时发现相似页面。
    4. 🤖 自主研究 research / agent:把一个问题自动分解成子查询、扇出检索、综合成报告;agent 工具则跑 search→fetch→extract→synthesize 的自主收集循环。
    5. 🔔 变更追踪 diff / watch:检测页面变化并推送 webhook,把「定时盯网页」变成可编排的事件。

    🚀 典型使用场景

    • 场景一 · 编码时实时联网:在 Claude Code / Cursor 里改代码时,智能体直接调用 search / fetch 查文档、查报错、查第三方 API,开发者不再手动复制粘贴;所有命中缓存在 ~/.wigolo/,隐私不出本机。
    • 场景二 · 自托管 Agent 的「联网大脑」:在自托管服务器上 wigolo serve 暴露 REST / MCP 端点,LangChain、CrewAI、n8n 等编排框架或任意 MCP client 统一调用,把分散在各处的抓取逻辑收敛成一个服务。
    • 场景三 · 持续竞品 / 文档监控:用 watch 盯住竞品定价页或文档页,diff 出变化并推 webhook 到飞书 / Slack / 自有系统,第一时间感知变更。

    💡 推荐理由

    我特别看好 Wigolo 的一点,是它真正把「本地优先」做到了极致:零 API Key、零按量账单,直接戳中「想让 agent 上网,却要为每家搜索引擎单独接 key、还要担心账单爆掉」的痛点。统一的 MCP 接口对 Claude Code / Cursor / Codex / Gemini CLI / VS Code / Zed 通吃,接入几乎零心智负担;数据默认留在本地,对重视隐私的开发者很友好;AGPL-3.0 开源、可完全自托管。如果你正想给自己的 coding agent 装上一双「眼睛和手」,Wigolo 是目前最省心的一站式方案。

    Wigolo 四种接入方式与差异化

    🔗 下载地址

  • 124K Star 的「AI 应用宝库」:awesome-llm-apps,100+ 个拿来即跑的 LLM / RAG 项目

    124K Star 的「AI 应用宝库」:awesome-llm-apps,100+ 个拿来即跑的 LLM / RAG 项目

    awesome-llm-apps 项目预览

    一、项目简介

    awesome-llm-apps 是一个收录了 100+ 个端到端测试过、Apache-2.0 协议的开源 AI Agent、Agent Skills 与 RAG 应用的精选仓库——clone、定制、上线,全部免费。它兼容 Claude、Gemini、GPT、DeepSeek、Llama、Qwen 以及各类本地开源模型,是当下 GitHub 上星标增长最快的 LLM 应用模板库之一(124K+ Star)。

    二、安装要求和过程

    环境要求

    • Python 3.8+(多数模板基于 Streamlit / 各厂商官方 SDK)
    • 一个 LLM API Key(Claude / Gemini / GPT / DeepSeek / Llama / Qwen 均可,部分模板支持本地模型)
    • Git 与可联网环境

    快速开始(跑一个 Agent,约 30 秒)

    git clone https://github.com/Shubhamsaboo/awesome-llm-apps.git
    cd awesome-llm-apps/starter_ai_agents/ai_travel_agent
    pip install -r requirements.txt
    streamlit run travel_agent.py

    或者,给编码助手装一个 Skill(约 10 秒)

    npx skills add https://github.com/Shubhamsaboo/awesome-llm-apps/tree/main/agent_skills/project-graveyard

    模板每周持续更新;项目模型无关,支持 Ollama 等本地推理,方便对比与替换。

    三、核心功能

    1. 100+ 端到端验证的开源应用:不是 demo 片段,而是每个都能 pip install && run 的完整项目,统一 Apache-2.0,可商用可修改。
    2. 15 大场景全覆盖:从单文件 Starter Agent,到多智能体团队、语音 Agent、MCP 工具调用、RAG 检索、记忆、微调、生成式 UI,再到 Autonomous 游戏 Agent。
    3. Agent Skills 一键安装:把可复用能力直接装进 Claude Code / Codex / Cursor,每条 Skill 都带真实代码并通过「安全 + 评测」CI 门禁。
    4. 模型无关:Claude、Gemini、GPT、DeepSeek、Llama、Qwen 乃至本地模型通吃,方便横向对比。
    5. 自带框架速成课:Google ADK、OpenAI Agents SDK 的 Crash Course,边抄边学编排范式。

    Project Graveyard Agent Skill

    Project Graveyard —— 帮你复盘每个弃坑副业、并找出最值得捡回来的那个的 Agent Skill

    四、典型使用场景

    • 30 分钟搭一个 AI 应用:想做旅行助手、数据分析 Agent、博客转播客?直接 clone 对应 starter 模板、改个 API Key 即可运行。
    • 给编码助手加能力:团队要一个「Scope Creep Detector(范围蔓延检测)」或「Commit Archaeologist(提交考古)」?npx skills add 一行搞定,立刻在 Claude Code / Cursor 里可用。
    • 系统学习 RAG / 多智能体:仓库内含 20+ 个 RAG 教程与多智能体团队模板,即开即用,省去从零搭脚手架。

    Always-on HN Briefing Agent

    Always-on HN Briefing Agent —— 按日程巡逻、把每天值得看的 Hacker News 推送到 Slack / 邮箱的后台 Agent

    Insurance Claim Live Agent Team

    Insurance Claim Live Agent Team —— 基于 Gemini Live 的实时语音理赔 Agent 团队

    五、推荐理由

    对一个想动手做 AI 应用、又不想从零啃文档的人,这是目前质量最高、最「能跑」的 LLM 应用模板库之一。每个模板都是真实可运行代码,省去脚手架与踩坑成本;模型无关意味着你可以拿自己的 Key 直接试;Agent Skills 的设计尤其实用——把沉淀下来的工程能力变成可复用 Skill,正好契合当下 coding agent 的工作流。

    Self-Improving Agent Skills

    Self-Improving Agent Skills —— 用 Gemini + ADK 让 Skill 针对评测自我重写的进阶玩法

    唯一要注意的是:部分模板依赖特定商业模型的 API,跑之前看一眼 requirements.txt 与 README 里的模型说明即可。

    六、下载地址

  • DeepTutor:把 AI 变成陪伴你终身的专属私教(HKUDS 开源)

    DeepTutor:把 AI 变成陪伴你终身的专属私教(HKUDS 开源)

    在 AI 辅导工具层出不穷的今天,大多数产品要么只做”问答”,要么只做”出题”,上下文在每次对话后便归零。香港大学数据科学团队 HKUDS(LightRAG、Vibe-Trading、nanobot 同门)开源的 DeepTutor,想解决的是更本质的问题——如何让 AI 真正”认识”你,并陪你长期、系统地学习。

    一、项目简介

    DeepTutor 是一个智能体原生(agent-native)的终身学习工作台:它将辅导对话、解题、出题测验、文献研究、可视化与掌握度训练整合进同一个可扩展系统,并用一套三层可审计记忆把”个性化”变得可见、可编辑、可追溯。

    DeepTutor Chat 工作台
    Chat 是默认入口:单条对话即可调用工具、挂载知识库、生成图片、咨询子智能体,并在多轮间保持同一上下文。

    二、安装要求与过程

    环境要求:Python 3.11+、Node.js 20+(PyPI 安装方式),或 Node.js 22 LTS(源码方式);Docker 方式无需本地 Python/Node。需要自备一个 LLM 提供商的 API Key,也支持 Ollama / LM Studio / vLLM / llama.cpp 等本地模型。

    官方提供 4 种安装路径,最推荐的是 PyPI 一键安装(完整本地 Web 应用 + CLI,无需克隆仓库):

    mkdir -p my-deeptutor && cd my-deeptutor
    pip install -U deeptutor
    deeptutor init     # 交互式设置端口、LLM 提供商与可选 embedding
    deeptutor start    # 启动后端+前端,默认访问 http://127.0.0.1:3782

    想要一条命令跑起来,也可以用官方 Docker 镜像(仅需暴露 3782 端口):

    docker run --rm --name deeptutor \
      -p 127.0.0.1:3782:3782 \
      -v deeptutor-data:/app/data \
      ghcr.io/hkuds/deeptutor:latest

    此外还有”源码安装(便于二次开发)”与”仅 CLI(无界面)”两种路径,且均可从同一工作区平滑升级到完整 Web 应用。配置全部以 JSON/YAML 形式存放在 data/user/settings/ 下,浏览器里的 Settings 页面即推荐编辑器。

    三、核心功能

    • 一个运行时,覆盖所有学习模式:Chat、Quiz、Research、Visualize、Solve、Mastery Path 共用同一个 Agent Loop,切换的是目标而非引擎,学习上下文始终跟随你。
    • 可连接的学习上下文:知识库、书籍、Co-Writer 草稿、笔记本、题库、人格(Persona)与记忆在各类工作流间共享,不再散落在彼此孤立的工具里。
    • 子智能体与 Partner 伙伴:可在任意对话中实时调用本地 Claude Code / Codex,或导入它们过往的对话记录;也能运行常驻 IM 伙伴(飞书、Telegram、Slack、Discord、钉钉、QQ、企业微信、WhatsApp、Matrix 等)。
    • 多引擎知识库(RAG):可选 LlamaIndex、PageIndex、GraphRAG、LightRAG,或直接挂载 Obsidian vault;文档解析引擎可切换(MinerU / Docling / markitdown 等),并支持版本化、可回滚的索引。
    • 可检视的三层记忆:L1 原始轨迹、L2 表层摘要、L3 跨面综合,层层引用溯源;配套的”记忆图谱”让任何一条个性化结论都能追溯到背后的原始依据。
    DeepTutor 知识中心
    知识中心支持多种检索引擎,每个知识库可独立选择引擎并版本化管理。
    DeepTutor 活书 Book
    Book 把资料一键编译成带测验卡、时间线、交互模块乃至 Manim 动画的”活书”。
    DeepTutor 伙伴 Partner
    Partner 是”有性格、有联系方式”的常驻伙伴,共享同一套大脑与记忆工具。

    四、典型使用场景

    1. 学生个性化辅导:把教材 PDF 建为知识库,让 DeepTutor 按”同伴 / 助教 / 老师”不同人格讲解难点,自动出测验题并给出带解析的参考答案;错题与偏好会沉淀进三层记忆,越用越懂你。

    2. 研究者 / 工程师的文献与写作助手:用 Research 生成带引用的综述,用 Co-Writer 做”选择即改写”的精准编辑(每次改动都是可接受的 diff),用 Book 把资料编译成带交互模块与动画的”活书”。

    3. 团队 / 班级的共享知识中枢:开启多用户鉴权后,一个 data 目录即可托管管理员工作区、彼此隔离的每用户工作区与伙伴工作区;管理员统一分配模型、知识库与技能,普通用户只看到被授权的只读选项,不暴露原始 API Key。

    五、推荐理由(个人使用心得)

    我最看重 DeepTutor 的,是它把”个性化”从一句营销话术变成了可看见、可审计、可编辑的东西。大多数 AI tutor 的记忆是个黑盒,而 DeepTutor 的三层记忆 + 记忆图谱让你能清楚看到”它为什么这么认为你”。对自学者来说,知识库多引擎可选 + 本地模型支持意味着敏感资料不必出网;对开发者来说,MCP、子智能体、CLI 与 EduHub 技能社区又留下了充足的二次创作空间。它不是一个”开箱即用的玩具”,而是一套能陪你长期生长的”学习操作系统”。

    六、下载地址