标签: 自然语言处理

  • Claude Cookbooks:Anthropic 官方维护的 Claude 实战范例集(50K+ Stars)

    Claude Cookbooks:Anthropic 官方维护的 Claude 实战范例集(50K+ Stars)

    Claude Cookbooks

    Claude Cookbooks 是 Anthropic 官方在 GitHub 上开源维护的 Jupyter Notebook 范例集,已收获 50.4K+ Stars5.9K+ Forks,MIT 许可证。它像一本持续更新的”Claude 实战菜谱”,用可以直接复制运行的代码片段,手把手教开发者把 Claude API 用到生产里——覆盖文本分类、RAG、工具调用、Agent SDK、Skills、多模态、扩展思考、第三方集成等几乎所有主流场景。

    无论是刚接触 Claude API 的新手,还是要把 Claude 嵌入自家产品的资深工程师,都能在这里找到即拿即用的最佳实践。所有 Notebook 都用 Python 写成,但概念同样适用于任何支持 Claude API 的语言。

    Claude Cookbooks 内容地图

    为什么需要它?

    很多人第一次调用 Claude API 只能写出”问个问题拿个回答”的脚本——但生产里要面对的是:结构化输出、上下文管理、长文档解析、Agent 工作流、RAG 检索、工具调用循环、子智能体拆分…这些工程化能力的最佳范式,往往不是 API 文档里那几段示例能覆盖的。Cookbooks 正是 Anthropic 工程师团队把生产经验沉淀下来的”答案库”。

    安装要求和过程

    环境要求

    • Python 3.10+(项目用 uv 管理依赖)
    • Jupyter Lab / VS Code Jupyter 扩展
    • 一个 Anthropic API Key(前往 anthropic.com 免费注册)

    快速安装

    # 1. 克隆仓库
    git clone https://github.com/anthropics/claude-cookbooks.git
    cd claude-cookbooks
    
    # 2. 安装依赖(项目使用 uv,也可用 pip)
    pip install -r requirements-dev.txt
    # 或:uv sync
    
    # 3. 配置密钥
    cp .env.example .env
    # 编辑 .env 填入你的 ANTHROPIC_API_KEY
    
    # 4. 启动 Jupyter
    jupyter lab

    三步快速上手

    核心功能

    1. 基础能力 Recipes

    capabilities/ 目录里包含文本分类、RAG 检索增强、长文摘要、结构化 JSON 输出四大基础用法。每个 Recipe 都配了独立 Notebook,从最小调用示例一路演化到生产级实现。

    2. 工具调用与函数集成

    tool_use/ 演示了 Claude 如何调用外部工具——从最简单的计算器、SQL 查询,到完整的多步骤客服智能体。这是把 Claude 从”聊天机器人”升级成”可执行 Agent”的关键能力。

    3. Claude Agent SDK

    claude_agent_sdk/ 是新近加入的官方 Agent SDK 范例,示范如何用 Python SDK 构建可独立运行的智能体应用、调度工具、规划子任务。

    4. Agent Skills 技能系统

    skills/ 目录展示如何为 Claude 编写模块化技能——把专业能力封装成可复用的 Skills,让 Agent 在不同场景下按需调用。

    5. 多模态能力

    multimodal/ 覆盖图像理解、图表解读、表单/PDF 内容提取、视觉最佳实践等,配合 Claude 强大的视觉模型可直接处理扫描件、合同、PPT。

    6. 扩展思考与设计模式

    extended_thinking/patterns/ 深入推理模式、子智能体协作、提示词缓存、评估驱动开发(Eval-Driven Development)等高阶范式。

    7. 第三方集成

    third_party/ 给出Pinecone 向量数据库、Wikipedia、VoyageAI Embeddings等流行服务的对接范例,把 Claude 嵌入现有技术栈成本极低。

    8. 微调与可观测性

    finetuning/observability/ 提供模型微调生产链路观测的端到端代码,是把 Claude 部署到线上服务的最后一块拼图。

    典型使用场景

    场景 1:快速搭建企业知识库 RAG

    复制 capabilities/retrieval_augmented_generationthird_party/Pinecone 两个 Notebook,半天就能搭起一个基于 Pinecone + Claude 的企业知识问答系统。Notebook 里连如何切分文档、嵌入、检索、重排序、生成都一步步跑通。

    场景 2:构建带工具调用的客服 Agent

    参考 tool_use/customer_service_agent.ipynb 的代码结构,把你的订单查询 API、退款流程、商品库存接口注册成 Claude 可调用的工具,立即得到一个能回答”我的订单到哪了”的多轮 Agent。

    场景 3:批量处理 PDF/扫描件

    multimodal/ 里的 PDF 解析与表单提取 Recipe,配合 Claude 视觉模型,搭建合同关键条款抽取、发票识别、报告摘要等自动化工作流。

    场景 4:评估驱动的提示词迭代

    misc/building_evals.ipynb 给出用 Claude 自身来评估另一批 Claude 输出质量的工程范式——适合团队协作打磨生产级 Prompt,让提示词的优化变成可量化、可回归的过程。

    推荐理由

    用 Cookbooks 这半年,最大的感受是:它不是”玩具示例”,而是真正从生产里长出来的代码

    • 覆盖全面:从基础调用到 Agent SDK,从 RAG 到微调,几乎所有 Claude 应用方向都有现成 Recipe,避免重复造轮子。
    • 持续更新:紧跟 Anthropic 的功能发布(比如 Claude 4 系列、扩展思考、Agent SDK、Skills 都是最近几个月加入的新章节)。
    • 可读性极强:每个 Notebook 都是”一段说明 + 一段代码 + 一段输出”的节奏,能当教程读,也能当模板抄。
    • 社区友好:MIT 许可,欢迎提 PR;CLAUDE.md 里甚至写了让 Claude 帮忙做贡献的指南(meta!)
    • 企业可商用:MIT 协议允许商业使用,没有 Apache-2.0 那种专利条款的顾虑。

    对国内开发者来说,唯一需要注意的是 Anthropic API 的访问渠道——可以走官方、AWS Bedrock、Vertex AI 或合规中转服务。模型本身支持中文,是 Claude 进军中文 AI 应用开发的官方”最佳实践手册”。

    下载地址

    用 Cookbook 抄答案,把 Claude 真正用进生产——这可能是 2026 年最值得收藏的 AI 工程仓库之一。

  • page-agent:阿里巴巴出品的页面内JS GUI代理,一行脚本让网页拥有AI操控能力(23K+Stars)

    page-agent:阿里巴巴出品的页面内JS GUI代理,一行脚本让网页拥有AI操控能力(23K+Stars)

    page-agent Logo

    ## 项目简介

    **page-agent** 是阿里巴巴出品的 **JavaScript 页面内 GUI 代理**,让 AI 通过自然语言直接控制 Web 界面。其核心理念是 —— *”The GUI Agent Living in Your Webpage”*,即:智能体不再运行在外部脚本或 Python 环境中,而是**活在页面内部**,用纯 JavaScript 操作 DOM,实现真正的轻量化 AI 能力嵌入。

    亮点概要:一行脚本接入、无需浏览器插件、无需 Python 环境、无需截图 —— 纯页面内 JS 实现的 GUI 代理,让任何 Web 应用瞬间拥有 AI 操作能力。

    ## 安装要求和过程

    ### 环境要求
    – **浏览器**:任意现代浏览器(Chrome/Edge/Firefox/Safari)
    – **Node.js**:≥ 18(仅 NPM 安装方式需要)
    – **LLM API**:支持接入任意兼容 OpenAI API 格式的大模型(默认可使用阿里云百炼、OpenAI、DeepSeek 等)

    ### 快速安装(一行脚本体验)

    最简单的方式,在任意网页的 HTML 中插入一行 `



    ```

    插入后刷新页面,即可看到 page-agent 的演示界面(使用官方免费测试 LLM)。

    > ⚠️ 免费测试 API 仅用于技术评估,生产使用请接入自有 LLM API Key。

    ### NPM 安装(生产使用)

    ```bash
    npm install page-agent
    ```

    ```javascript
    import { PageAgent } from 'page-agent'

    const agent = new PageAgent({
    model: 'qwen3.5-plus',
    baseURL: 'https://dashscope.aliyuncs.com/compatible-mode/v1',
    apiKey: 'YOUR_API_KEY',
    language: 'zh-CN',
    })

    await agent.execute('点击登录按钮')
    ```

    ## 核心功能

    1

    极低接入成本 —— 一行脚本即可嵌入

    无需浏览器插件、无需 Python 环境、无需无头浏览器,纯页面内 JavaScript 实现,所有功能都在当前网页内运行。仅需一行 <script> 标签即可为任意 Web 应用接入 AI 控制能力,CDN 和 NPM 包双重分发。

    2

    轻量交互模式 —— 基于 DOM 操作,无需截图

    摒弃了传统 GUI 代理依赖截图 + 多模态大模型的重量级方案,page-agent 直接基于 DOM 结构理解页面,用文本描述操作指令。优势:延迟更低、成本更低、无需特殊权限、不依赖视觉大模型。

    3

    自定义大模型支持 —— 无绑定,完全开放

    支持接入任意兼容 OpenAI API 格式的自有 LLM,无厂商绑定。推荐使用阿里云百炼 qwen3.5-plus,也可接入 OpenAI GPT、DeepSeek、Gemini 等主流大模型,灵活适配企业已有 AI 基础设施。

    4

    扩展能力 —— Chrome 扩展 + MCP Server(Beta)

    可选安装 Chrome 扩展,支持跨多页面任务调度;同时提供 Beta 版 MCP Server,允许外部 AI 系统通过 MCP 协议控制浏览器,与主流 AI Agent 框架无缝集成。

    ## 典型使用场景

    ### 场景一:SaaS AI Copilot 快速接入
    仅需少量代码即可为 SaaS 产品接入 AI 助手,用户可通过自然语言操控产品界面,无需重写后端逻辑。例如:在 CRM 系统中,用户说"创建一个跟进任务并设置明天的提醒",page-agent 即可自动完成一系列 DOM 操作。

    ### 场景二:智能表单填充
    将原本需要 20 次点击的复杂工作流简化为一句话指令,特别适合 ERP、CRM、后台管理系统等表单密集型应用。结合 LLM 的语义理解能力,page-agent 可自动识别表单字段并填入正确内容。

    ### 场景三:Web 应用无障碍适配
    通过自然语言、语音指令、屏幕阅读器,让任意 Web 应用实现无障碍使用,极大降低残障人士使用复杂 Web 应用的门槛。page-agent 作为页面内代理,可直接操作 DOM 实现无障碍导航。

    ### 场景四:MCP 协议集成
    通过 Beta 版 MCP Server,允许外部 AI Agent 客户端控制浏览器,实现"AI 操控 AI"的自动化链路。例如:让 Claude Code 通过 MCP 调用 page-agent,实现完整的端到端 Web 自动化测试。

    ## 推荐理由

    > 在传统方案里,让 AI 操控 Web 界面往往意味着:部署 Python 服务、运行无头浏览器、截图 + 多模态大模型理解、处理各种环境依赖……这套方案对中小企业和个人开发者极不友好。

    **page-agent 的最大价值在于"去重量化"** —— 它把 GUI 代理的核心能力塞进了一个 JS 脚本里,让任何能加载 JS 的网页都能获得 AI 操控能力。这对以下人群尤为有价值:

    - **前端开发者**:无需学习 Python 自动化框架,直接用 TypeScript 扩展 AI 能力
    - **SaaS 产品经理**:快速为产品 prototype 添加 AI Copilot,验证用户需求
    - **企业 IT**:为内部 ERP/CRM 系统添加自然语言操作界面,提升员工效率
    - **无障碍开发**:用最简单的方式为现有 Web 应用添加语音/自然语言操控

    此外,项目由 **阿里巴巴** 官方开源,采用 MIT 许可证,社区活跃,文档完善(在线 Demo、完整文档站、HN 讨论帖均已上线),值得长期关注。

    🔗 相关链接

    GitHub:github.com/alibaba/page-agent(23K+ Stars)

    在线演示:alibaba.github.io/page-agent

    官方文档:alibaba.github.io/page-agent/docs

    NPM 包:npmjs.com/package/page-agent

    许可证:MIT License(可自由商用、修改、分发)

  • Hugging Face Transformers – 161K+ Stars,现代AI开发的基石框架,统一百万预训练模型调用标准

    Hugging Face Transformers – 161K+ Stars,现代AI开发的基石框架,统一百万预训练模型调用标准

    Hugging Face Transformers

    GitHub OpenGraph Preview

    🤗 项目简介

    Hugging Face Transformers 是现代AI开发的基石框架,为文本、视觉、音频和多模态模型提供统一的模型定义标准,支持推理与训练全流程。只需掌握3个核心类,即可调用Hugging Face Hub上超过100万个预训练模型检查点。

    161K+
    GitHub Stars
    1M+
    预训练模型
    500+
    模型架构
    3
    核心类

    ⚙️ 安装要求与过程

    环境要求:

    • Python 3.10+
    • PyTorch 2.4+(或 JAX/TensorFlow 2.0+)
    • CUDA(可选,用于GPU加速)

    快速安装:

    # 使用 pip 安装(推荐)
    pip install "transformers[torch]"
    
    # 使用 uv 安装(更快)
    uv pip install "transformers[torch]"
    
    # 从源码安装最新版
    git clone https://github.com/huggingface/transformers.git
    cd transformers
    pip install '.[torch]'

    验证安装:

    import transformers
    print(transformers.__version__)  # 输出版本号即成功

    🚀 核心功能

    1. 统一的模型定义框架 🏗️

    Transformers 提供了统一的模型定义标准,只要模型被支持,就能兼容绝大多数训练框架(Axolotl、Unsloth、DeepSpeed等)、推理引擎(vLLM、SGLang、TGI等)以及相邻建模库(llama.cpp、mlx等)。

    2. 极简API设计 🎯

    只需学习 AutoModelAutoTokenizerPipeline 三个核心类,即可使用Hugging Face Hub上超过100万个预训练模型,覆盖NLP、CV、音频、多模态等任务。

    3. 跨框架无缝切换 🔄

    支持在PyTorch、JAX、TensorFlow 2.0之间随意切换模型,可针对不同阶段(训练、评估、生产)选择最合适的框架,3行代码即可训练前沿模型。

    4. 全模态Pipeline支持 🎨

    提供高层推理API Pipeline,支持文本生成、图像分类、音频识别、视频理解等多模态任务,自动处理输入预处理并返回对应输出。

    5. 高度可定制与可复现 🔬

    提供每个架构的官方结果复现示例,模型内部结构尽可能统一暴露,模型文件可脱离库独立使用,方便快速实验和研究。

    💡 典型使用场景

    场景一:快速原型开发 🏃

    使用Pipeline API,3行代码即可完成文本分类、命名实体识别、文本生成、图像分类等任务。无需关心模型架构细节,直接调用SOTA模型进行推理。

    from transformers import pipeline
    
    # 文本生成
    generator = pipeline("text-generation", model="gpt2")
    result = generator("AI will", max_length=50)
    
    # 图像分类
    classifier = pipeline("image-classification", model="google/vit-base-patch16-224")
    result = classifier("cat.jpg")

    场景二:模型微调与训练 🎓

    基于预训练模型进行下游任务微调,利用Hugging Face Trainer API或Accelerate库,轻松实现分布式训练和混合精度训练,大幅降低计算成本。

    from transformers import AutoModelForSequenceClassification, Trainer, TrainingArguments
    
    model = AutoModelForSequenceClassification.from_pretrained("bert-base-uncased")
    training_args = TrainingArguments(output_dir="./results", num_train_epochs=3)
    trainer = Trainer(model=model, args=training_args, train_dataset=dataset)
    trainer.train()

    🌟 推荐理由

    Hugging Face Transformers 是现代AI开发的”基础设施”,几乎每个AI开发者都或多或少用过它。它不仅提供了统一的模型定义标准,更重要的是构建了一个庞大的生态系统——Hugging Face Hub上超过100万个预训练模型,覆盖了从BERT到GPT、从ViT到CLIP、从Whisper到Llama的所有主流模型。

    作为一个AI开发者,掌握Transformers库是必修课。它的API设计非常优雅,只需3个核心类就能玩转绝大多数SOTA模型。而且,它对PyTorch/JAX/TF的跨框架支持,让你可以在不同场景下灵活选择最合适的后端。无论你是做研究还是做应用,Transformers都是不可或缺的工具。

    📄 许可证:Apache License 2.0(允许商业使用)
    💻 主要语言:Python
    🏢 开发方:Hugging Face Team