标签: 多模态

  • Claude Cookbooks:Anthropic 官方出品的 Claude 使用范例集,47.8K stars 让 AI 开发少走弯路

    Claude Cookbooks:Anthropic 官方出品的 Claude 使用范例集,47.8K stars 让 AI 开发少走弯路

    Claude Cookbooks

    Claude Cookbooks 是 Anthropic 官方维护的一组 Claude 使用范例/配方集(Jupyter Notebooks),用可直接复制、可运行的代码片段教会开发者如何用好 Claude API。它覆盖了文本分类、RAG、摘要、工具调用、多模态视觉、子代理、自动评估、JSON 模式、提示缓存等核心场景。截至 2026 年 7 月,仓库已收获 47.8K+ Stars、5.6K+ Forks,是学习和参考 Claude 官方最佳实践的必读项目。

    一、项目简介

    Claude Cookbooks 的定位非常清晰:它不是框架,也不是 SDK,而是一本「官方菜谱」。每个 Notebook 都围绕一个真实开发问题展开,例如「怎么用 Claude 做 RAG」「怎么让 Claude 调用外部工具」「怎么处理 PDF 与图片」「怎么自动评估生成结果」。你可以直接复制代码到自己的项目里,也可以把它当成学习 Claude API 的教程。

    二、安装要求和过程

    环境要求:

    • Python 3.10+(示例代码以 Python 为主);
    • 一个 Claude API Key(可在 Anthropic 官网 免费注册);
    • 仓库使用 uv 管理依赖,建议安装 uv(pip install uvcurl -LsSf https://astral.sh/uv/install.sh | sh);
    • 运行 Jupyter Notebook 需要浏览器或 VS Code Jupyter 插件。

    快速安装:

    # 1. 克隆仓库
    git clone https://github.com/anthropics/claude-cookbooks.git
    cd claude-cookbooks
    
    # 2. 用 uv 安装依赖
    uv sync
    
    # 3. 设置环境变量
    export ANTHROPIC_API_KEY="sk-ant-api03-..."
    
    # 4. 启动 Jupyter 浏览示例
    jupyter notebook

    如果你不想安装 uv,也可以直接用 pip:pip install anthropic jupyter,然后逐本运行 Notebook。

    三、核心功能

    • 覆盖 Claude 全能力的实战 Notebook:从基础的文本分类、摘要、RAG,到高级的工具调用(Tool Use)、JSON 模式、子代理(Sub-agents)、自动评估(Evals)和提示缓存,几乎囊括了 Claude 的所有核心能力。
    • 官方出品、持续更新:Anthropic 工程团队直接维护,Notebook 会跟随 Claude 3.5 / 3.7 / 4 系列模型和新 API 特性同步更新,避免你学到过时的写法。
    • 可复制、可扩展的代码片段:每个配方都提供最小可运行示例,代码结构清晰,方便你替换成自己的数据、提示词或业务逻辑。
    • 多模态与文档理解:包含视觉理解、图表解析、PDF 内容提取、表单识别等示例,适合需要处理非结构化数据的项目。
    • 评估与可观测性:提供自动评估 Cookbook 和 Agent 搜索基准复现(DeepSearchQA / BrowseComp),帮助你建立「改提示 → 跑评估 → 看指标」的迭代闭环。

    四、典型使用场景

    1. 快速上手 Claude API:如果你是第一次用 Claude API,直接打开 getting_started 或基础能力 Notebook,五分钟就能把第一条请求跑起来。
    2. 构建 RAG 与文档问答应用:参考 RAG 配方,把自有文档切分、嵌入、检索后交给 Claude 生成答案;也可以看多模态示例,直接让 Claude 读取 PDF 或图片并回答。
    3. 开发工具型 Agent:学习如何让 Claude 调用计算器、数据库、搜索引擎等外部工具,并进一步组合成多 Agent 协作系统(Coordinator + Sub-agents)。

    五、推荐理由

    Claude Cookbooks 给我的最大价值是「少走弯路」。网上关于 Claude 的教程很多,但官方示例在 Prompt 写法、参数选择、错误处理和成本控制上往往最贴近生产实践。特别是工具调用、JSON 模式和提示缓存这几个容易踩坑的场景,官方代码把最佳实践写得非常清楚。而且它完全开源(MIT),Notebook 形式读起来没有框架源码那么重,适合一边看一边改。

    六、下载地址

  • claude-video:让 Claude 真正“看懂”视频的 /watch 技能,6.4K Stars 把视频变成 AI 能读的输入

    claude-video:让 Claude 真正“看懂”视频的 /watch 技能,6.4K Stars 把视频变成 AI 能读的输入

    📌 项目简介

    claude-video 是一个让 Claude(以及 Codex、Cursor、Gemini CLI 等 50+ AI 编程工具)真正”看懂”视频的开源 Agent Skill。它的核心理念只有一句话:Claude 能读网页、能读 PDF、能读代码仓库,但默认它看不了视频——而 claude-video 把”看视频”这件事补上了。你丢给它一个 YouTube 链接或本地视频,它自动下载、抽帧、转写音频,再把画面帧 + 时间戳字幕一起喂给大模型,让 AI 基于真实视听觉内容来回答,而不是靠标题瞎猜。

    🛠 安装要求和过程

    环境要求:

    • Python 3.10+(核心脚本 watch.py / download.py / frames.py / transcribe.py 均为 Python 实现)
    • yt-dlp:负责从 YouTube、Loom、TikTok、X、Instagram 等站点下载视频(首次运行 macOS 上自动 brew 安装,Linux/Windows 会打印安装命令)
    • ffmpeg:负责抽帧、音频提取(同上,首次运行自动引导安装)
    • 带字幕的视频完全免费;无字幕时才需要 Whisper API Key(Groq whisper-large-v3 或 OpenAI whisper-1

    快速安装(三选一):

    方式一 · Claude Code(推荐):

    /plugin marketplace add bradautomates/claude-video
    /plugin install watch@claude-video

    方式二 · 任意 Agent Skills 宿主(Codex / Cursor / Copilot / Gemini CLI 等 50+ 工具):

    npx skills add bradautomates/claude-video -g

    方式三 · 手动 / 开发:

    git clone https://github.com/bradautomates/claude-video.git
    ln -s "$(pwd)/claude-video/skills/watch" ~/.claude/skills/watch
    # 或 ~/.codex/skills/watch

    首次运行会调用 scripts/setup.py --check 引导安装依赖,并在 ~/.config/watch/.env 中生成 GROQ_API_KEY / OPENAI_API_KEY 占位配置。

    ⚡ 核心功能

    1. 多源视频获取:支持 URL(yt-dlp 兼容的几乎所有视频站点)或本地路径(.mp4/.mov/.mkv/.webm),一条命令即可接入。
    2. 智能帧提取:用 ffmpeg 按细节模式抽帧——efficient(关键帧,约 0.5s)到 token-burner(场景切换检测);内置帧去重(默认开启,丢弃近重复帧)与自动 fps / token 预算控制。
    3. 双通道转写:优先用 yt-dlp 提取原生字幕(免费);无字幕时回退 Whisper API,并支持 >25MB 自动分块,确保长视频也能完整转写。
    4. 多模态交给大模型:脚本输出带 t=MM:SS 标记的帧路径 + 时间戳转写,Claude 并行 Read 图像,基于真实画面与声音作答。
    5. 细节模式可调节:--detail transcript|efficient|balanced|token-burner 权衡速度与 token 成本;支持 --start/--end 聚焦片段、--timestamps 指定时刻、--no-whisper 等精细控制。

    🎯 典型使用场景

    • 拆解爆款内容:把竞品发布会、广告片、干货视频丢给它,让它分析钩子结构、叙事节奏、真正的新功能,远快于 2x 倍速硬看。
    • 看录屏诊断 Bug:前端同学把屏幕录制喂给它,它能定位”出错的那一帧”,描述现象与可能原因,把视频变成可调试的输入。
    • 视频转结构化笔记:把一整个播放列表逐条摘要,自动构建可搜索的知识库;或剥离更新视频里的 hype,只提取”真正变了什么”。

    💡 推荐理由(个人使用心得)

    这是个”小而准”的工具,解决的痛点非常真实——我们天天让 AI 读文档读代码,但遇到一个视频链接就瞬间退化成”靠标题猜”。claude-video 最漂亮的设计是零配置起步:有字幕就白嫖字幕,没字幕才花一点点 Whisper 钱;帧去重 + 预算控制又避免了”把整个视频塞进上下文”的 token 爆炸。它本质上是在给 LLM 补上一双眼睛,而且是以”可复用技能包”的形式存在,Claude Code / Cursor / Codex 通吃。如果你经常需要让 AI 处理视频内容,这个 6.4K Star、MIT 协议、纯 Python 的小项目,值得一键装进你的工具箱。

    🔗 下载地址

    • GitHub:github.com/bradautomates/claude-video
    • 安装(Claude Code):/plugin marketplace add bradautomates/claude-video/plugin install watch@claude-video
    • 许可证:MIT(可自由商用、修改、分发)
  • LocalAI:免费开源OpenAI替代方案,在本地硬件上运行全模态AI模型,47K+ Stars让AI彻底私有化

    LocalAI:免费开源OpenAI替代方案,在本地硬件上运行全模态AI模型,47K+ Stars让AI彻底私有化

    今天介绍一个让AI彻底私有化的开源神器——LocalAI。它被誉为”免费的开源OpenAI替代方案”,可以在任意硬件上运行各类AI模型(LLM、视觉、语音、图像、视频),无需GPU,数据完全本地化。

    项目简介

    LocalAI 是开源AI引擎,可作为OpenAI/Anthropic API的直接替代品。它采用”小核心+按需加载后端”的可组合架构,支持在消费级硬件上运行大语言模型、图像生成、语音识别、语音合成等各类AI模型,数据完全留在本地,无需云服务。

    LocalAI Logo
    LocalAI – 免费开源AI引擎

    安装要求和过程

    环境要求

    • 操作系统:macOS、Linux、Windows
    • GPU:无需GPU!支持NVIDIA、AMD、Intel、Apple Silicon、Vulkan、纯CPU
    • 内存:8GB+ RAM(运行小模型);16GB+(运行中大模型)
    • 存储:至少10GB可用空间(模型文件较大)

    快速安装(Docker推荐)

    # CPU环境(最常用)
    docker run -ti --name local-ai -p 8080:8080 localai/localai:latest
    
    # NVIDIA GPU环境(CUDA 12)
    docker run -ti --name local-ai -p 8080:8080 --gpus all \
      localai/localai:latest-gpu-nvidia-cuda-12
    
    # macOS(下载DMG直接安装)
    # 从 GitHub Releases 下载 LocalAI.dmg
    

    快速开始

    # 启动LocalAI
    docker run -p 8080:8080 -ti localai/localai:latest
    
    # 在另一个终端,运行模型
    local-ai run llama-3.2-1b-instruct:q4_k_m
    
    # 启动交互式聊天
    local-ai chat --model llama-3.2-1b-instruct:q4_k_m
    
    # 从HuggingFace加载模型
    local-ai run huggingface://TheBloke/phi-2-GGUF/phi-2.Q8_0.gguf
    
    # 从Ollama仓库加载
    local-ai run ollama://gemma:2b
    

    核心功能

    1. OpenAI API完全兼容:可作为OpenAI API的直接替代品,现有应用和库无需修改即可迁移。支持文本生成、嵌入、图像处理、语音识别、语音合成等全套API。
    2. 无需GPU,消费级硬件即可运行:优化后的推理引擎(llama.cpp等)可在CPU上高效运行,无需昂贵GPU。支持Intel/AMD/Apple Silicon等各平台。
    3. 支持全模态AI模型:不仅支持LLM,还支持图像生成(Stable Diffusion)、语音识别(Whisper)、语音合成(TTS)、音乐生成(MusicGen)、目标检测等,真正的”全模态AI引擎”。
    4. 内置AI智能体:集成LocalAGI(自主智能体平台),支持工具调用、RAG、MCP协议、技能扩展。内置Agent Hub社区,可分享和下载智能体配置。
    5. 企业级功能:支持多用户、API密钥认证、用户配额、基于角色的访问控制(RBAC)。支持分布式模式(通过PostgreSQL+NATS实现水平扩展),适合企业生产环境。
    LocalAI Demo
    LocalAI 项目导览演示

    典型使用场景

    • 私有化AI助手部署:企业内部需要AI助手但担心数据泄露?LocalAI让你在内网部署完全私有的AI服务,支持OpenAI API兼容,现有应用无缝迁移。可用于代码辅助、文档问答、知识库检索等场景。
    • 替代云API降低成本:OpenAI API按调用次数收费,长期使用成本高昂。LocalAI让你在本地硬件上运行开源模型,一次部署无限使用,特别适合高频调用场景(如客服机器人、内容生成流水线)。

    推荐理由

    LocalAI 是我见过的最完整的本地AI部署解决方案。与Ollama相比,LocalAI支持更多模态(图像、语音、视频);与vLLM相比,LocalAI无需GPU且更易用;与text-generation-webui相比,LocalAI有完整的API兼容性和企业级功能。

    我最喜欢的设计是“小核心+按需加载后端”的架构。核心只有很小的基础功能,每个后端(llama.cpp、vLLM、whisper.cpp、stable-diffusion等)都是独立的OCI镜像,仅在需要时才拉取。这意味着你不会安装任何用不到的组件,资源占用极小。

    另外,MCP协议支持让LocalAI可以无缝对接各类AI智能体工具,而分布式模式则让它能够水平扩展,处理大规模并发请求。对于需要私有化部署AI服务的企业来说,LocalAI是目前最好的选择。

    下载地址

    许可协议:MIT License(完全开源,可自由使用、修改、分发)

    支持后端:llama.cpp、vLLM、whisper.cpp、stable-diffusion、MLX、TensorRT等60+推理后端


    如果你喜欢本地部署AI,LocalAI绝对值得一试。它让”私有化AI”变得简单可行,再也不用担心数据泄露和API费用了。

  • Hugging Face Transformers – 161K+ Stars,现代AI开发的基石框架,统一百万预训练模型调用标准

    Hugging Face Transformers – 161K+ Stars,现代AI开发的基石框架,统一百万预训练模型调用标准

    Hugging Face Transformers

    GitHub OpenGraph Preview

    🤗 项目简介

    Hugging Face Transformers 是现代AI开发的基石框架,为文本、视觉、音频和多模态模型提供统一的模型定义标准,支持推理与训练全流程。只需掌握3个核心类,即可调用Hugging Face Hub上超过100万个预训练模型检查点。

    161K+
    GitHub Stars
    1M+
    预训练模型
    500+
    模型架构
    3
    核心类

    ⚙️ 安装要求与过程

    环境要求:

    • Python 3.10+
    • PyTorch 2.4+(或 JAX/TensorFlow 2.0+)
    • CUDA(可选,用于GPU加速)

    快速安装:

    # 使用 pip 安装(推荐)
    pip install "transformers[torch]"
    
    # 使用 uv 安装(更快)
    uv pip install "transformers[torch]"
    
    # 从源码安装最新版
    git clone https://github.com/huggingface/transformers.git
    cd transformers
    pip install '.[torch]'

    验证安装:

    import transformers
    print(transformers.__version__)  # 输出版本号即成功

    🚀 核心功能

    1. 统一的模型定义框架 🏗️

    Transformers 提供了统一的模型定义标准,只要模型被支持,就能兼容绝大多数训练框架(Axolotl、Unsloth、DeepSpeed等)、推理引擎(vLLM、SGLang、TGI等)以及相邻建模库(llama.cpp、mlx等)。

    2. 极简API设计 🎯

    只需学习 AutoModelAutoTokenizerPipeline 三个核心类,即可使用Hugging Face Hub上超过100万个预训练模型,覆盖NLP、CV、音频、多模态等任务。

    3. 跨框架无缝切换 🔄

    支持在PyTorch、JAX、TensorFlow 2.0之间随意切换模型,可针对不同阶段(训练、评估、生产)选择最合适的框架,3行代码即可训练前沿模型。

    4. 全模态Pipeline支持 🎨

    提供高层推理API Pipeline,支持文本生成、图像分类、音频识别、视频理解等多模态任务,自动处理输入预处理并返回对应输出。

    5. 高度可定制与可复现 🔬

    提供每个架构的官方结果复现示例,模型内部结构尽可能统一暴露,模型文件可脱离库独立使用,方便快速实验和研究。

    💡 典型使用场景

    场景一:快速原型开发 🏃

    使用Pipeline API,3行代码即可完成文本分类、命名实体识别、文本生成、图像分类等任务。无需关心模型架构细节,直接调用SOTA模型进行推理。

    from transformers import pipeline
    
    # 文本生成
    generator = pipeline("text-generation", model="gpt2")
    result = generator("AI will", max_length=50)
    
    # 图像分类
    classifier = pipeline("image-classification", model="google/vit-base-patch16-224")
    result = classifier("cat.jpg")

    场景二:模型微调与训练 🎓

    基于预训练模型进行下游任务微调,利用Hugging Face Trainer API或Accelerate库,轻松实现分布式训练和混合精度训练,大幅降低计算成本。

    from transformers import AutoModelForSequenceClassification, Trainer, TrainingArguments
    
    model = AutoModelForSequenceClassification.from_pretrained("bert-base-uncased")
    training_args = TrainingArguments(output_dir="./results", num_train_epochs=3)
    trainer = Trainer(model=model, args=training_args, train_dataset=dataset)
    trainer.train()

    🌟 推荐理由

    Hugging Face Transformers 是现代AI开发的”基础设施”,几乎每个AI开发者都或多或少用过它。它不仅提供了统一的模型定义标准,更重要的是构建了一个庞大的生态系统——Hugging Face Hub上超过100万个预训练模型,覆盖了从BERT到GPT、从ViT到CLIP、从Whisper到Llama的所有主流模型。

    作为一个AI开发者,掌握Transformers库是必修课。它的API设计非常优雅,只需3个核心类就能玩转绝大多数SOTA模型。而且,它对PyTorch/JAX/TF的跨框架支持,让你可以在不同场景下灵活选择最合适的后端。无论你是做研究还是做应用,Transformers都是不可或缺的工具。

    📄 许可证:Apache License 2.0(允许商业使用)
    💻 主要语言:Python
    🏢 开发方:Hugging Face Team