
📌 项目简介
book-to-skill 是一个能把任何技术书籍 PDF(以及 EPUB、DOCX、Markdown 等十余种格式)一键转换成 AI 智能体技能(Agent Skill)的开源工具——转换后你的 Claude Code、GitHub Copilot CLI 或 Amp 就能”读过这本书”,随时按需调取书中真实内容回答问题,彻底告别大模型幻觉和翻 PDF 的痛苦。项目基于 Python 开发,MIT 许可,2026 年 5 月开源以来已斩获 12,499 Stars,今日更以单日 +1,400 星登顶 GitHub Trending。

它解决的是一个所有技术人都懂的痛点:买了一本好书,读完一遍,三个月后连第 7 章讲什么都想不起来。直接把 PDF 扔给 AI?一本 400 页的书约 20 万 token,每轮对话都要全额付费,而且模型在超长上下文里”迷失中间”、精度骤降。book-to-skill 的思路是编译期一次性深度蒸馏:把书拆解成核心心智模型 + 按章节的知识文件 + 术语表 + 模式库 + 速查表,智能体按需加载,实测比整书塞上下文省 24~51 倍 token。
⚙️ 安装要求和过程
环境要求
- Python 3 环境(纯文本/Markdown/reST/AsciiDoc 无需额外依赖)
- PDF 提取:文字型书籍用
pdftotext(poppler)或pip3 install pypdf;含代码/表格/公式的技术书推荐pip3 install docling(可完整保留 Markdown 表格与代码块) - EPUB:
pip3 install ebooklib beautifulsoup4(有内置 zipfile 兜底) - 宿主:支持开放 Agent Skills 标准的任意智能体——Claude Code、GitHub Copilot CLI、Amp 均可
安装(作为智能体技能)
# Claude Code
git clone https://github.com/virgiliojr94/book-to-skill.git ~/.claude/skills/book-to-skill
# GitHub Copilot CLI
git clone https://github.com/virgiliojr94/book-to-skill.git ~/.copilot/skills/book-to-skill
# 跨智能体通用路径(Copilot CLI 与 Amp 都能发现)
git clone https://github.com/virgiliojr94/book-to-skill.git ~/.agents/skills/book-to-skill
使用:三步把书变技能
# 1. 指向一个文件、文件夹或 glob
/book-to-skill ~/books/designing-data-intensive-apps.pdf
# 2. 自动蒸馏为技能(框架、决策规则、反模式、分章文件)
# 3. 之后随时按需调用
/designing-data-intensive-apps replication # 讲解某个主题
/designing-data-intensive-apps ch05 # 深入第 5 章
另有独立 CLI 模式:pip install "book-to-skill[pdf,epub,docx]",仅安装文本提取引擎用于脚本化处理(不注册斜杠命令)。运行 python3 scripts/extract.py --check 可一键检查各格式提取器安装情况。
🚀 核心功能
- 全格式文档蒸馏:支持 PDF、EPUB、DOCX、TXT、Markdown、reST、AsciiDoc、HTML、RTF、MOBI/AZW 等格式;可一次处理多个文件、整个文件夹或 glob 模式,合并成统一技能,还能向已有技能”折叠”新增材料(增量更新)
- 结构化技能产物:生成 SKILL.md(约 4K token 的核心心智模型 + 章节索引)、每章约 1K token 的按需加载文件、术语表 glossary.md、技术模式库 patterns.md、决策速查表 cheatsheet.md——是”结构”而非”摘要”
- 24~51 倍 token 节省(实测):内置
tools/discovery_tax.py测量工具,在 Think Python 2、Working Backwards、AI Engineering 三本真书上实测:回答一个问题只需约 5K token(核心 + 单章),对比整书上下文倾倒 12 万~25.6 万 token - 智能提取管线:转换前自动询问书籍类型——技术书走 Docling(保留表格代码),纯文字书走 pdftotext 秒级提取;单个坏源自动跳过不影响批处理;一本书完整转换成本约 1 美元
- 开放标准、一次安装多端通用:遵循开放 Agent Skills 标准(SKILL.md 格式),Claude Code、GitHub Copilot CLI、Amp 读取同一份技能,无厂商锁定
💡 典型使用场景
- 技术书籍随身参谋:把《DDIA》《Pro Git》这类工具书转成技能,写代码时直接
/ddia replication让智能体基于书中真实章节讲解复制策略——不是幻觉,不是网页搜索,就是作者原文提炼的框架 - 团队内部文档折叠:把整个
docs/文件夹(架构决策记录、Runbook、新人指南)合并成一个技能,新同事在编码会话里直接提问,替代翻 60 页 PDF 的品牌手册/规范文档 - 研究资料簇管理:一摞论文加自己的笔记合成统一技能,新论文来了增量折叠进去;对比 RAG——RAG 适合”几十本书里找提到 X 的段落”(宽而浅),book-to-skill 适合”吃透一本书的 12 个框架并应用”(窄而深),两者互补
❤️ 推荐理由
这个项目最打动我的是它把”AI 读书”从检索问题重构成了编译问题。RAG 是查询时相似度搜索,返回”和你问题相近的文本块”;book-to-skill 是编译时深度分析,输出”作者花几年构建的命名框架、适用条件和反模式”——前者是检索,后者是可推理的结构。README 里那句话很精辟:“RAG indexes a shelf, book-to-skill masters a spine”(RAG 索引一整架书,book-to-skill 吃透一本书的书脊)。
工程上它也异常诚实:所有 token 节省数据都有可复现的测量脚本,README 明确写出”诚实警告”——章节自动切分需要显式的 Chapter N 标题、一次性阅读场景用普通 PDF 智能体就够了。在营销味十足的 AI 开源圈,这种”实测优先、有限承诺”的态度非常难得。如果你的 ~/.claude/skills 目录里只打算加一个新技能,让它是一个能把你书架搬进智能体的技能,很值。
🔗 下载地址
- GitHub 仓库:https://github.com/virgiliojr94/book-to-skill
- PyPI(独立 CLI):pip install book-to-skill
- Agent Skills 开放标准:https://github.com/agentskills/agentskills
项目数据截至 2026 年 7 月 30 日:12,499 Stars · 1,405 Forks · Python · MIT 许可 · 今日 GitHub Trending 榜首(+1,428 星)
发表回复