标签: LLM

  • Claude Cookbooks:Anthropic 官方出品的 Claude 使用范例集,47.8K stars 让 AI 开发少走弯路

    Claude Cookbooks:Anthropic 官方出品的 Claude 使用范例集,47.8K stars 让 AI 开发少走弯路

    Claude Cookbooks

    Claude Cookbooks 是 Anthropic 官方维护的一组 Claude 使用范例/配方集(Jupyter Notebooks),用可直接复制、可运行的代码片段教会开发者如何用好 Claude API。它覆盖了文本分类、RAG、摘要、工具调用、多模态视觉、子代理、自动评估、JSON 模式、提示缓存等核心场景。截至 2026 年 7 月,仓库已收获 47.8K+ Stars、5.6K+ Forks,是学习和参考 Claude 官方最佳实践的必读项目。

    一、项目简介

    Claude Cookbooks 的定位非常清晰:它不是框架,也不是 SDK,而是一本「官方菜谱」。每个 Notebook 都围绕一个真实开发问题展开,例如「怎么用 Claude 做 RAG」「怎么让 Claude 调用外部工具」「怎么处理 PDF 与图片」「怎么自动评估生成结果」。你可以直接复制代码到自己的项目里,也可以把它当成学习 Claude API 的教程。

    二、安装要求和过程

    环境要求:

    • Python 3.10+(示例代码以 Python 为主);
    • 一个 Claude API Key(可在 Anthropic 官网 免费注册);
    • 仓库使用 uv 管理依赖,建议安装 uv(pip install uvcurl -LsSf https://astral.sh/uv/install.sh | sh);
    • 运行 Jupyter Notebook 需要浏览器或 VS Code Jupyter 插件。

    快速安装:

    # 1. 克隆仓库
    git clone https://github.com/anthropics/claude-cookbooks.git
    cd claude-cookbooks
    
    # 2. 用 uv 安装依赖
    uv sync
    
    # 3. 设置环境变量
    export ANTHROPIC_API_KEY="sk-ant-api03-..."
    
    # 4. 启动 Jupyter 浏览示例
    jupyter notebook

    如果你不想安装 uv,也可以直接用 pip:pip install anthropic jupyter,然后逐本运行 Notebook。

    三、核心功能

    • 覆盖 Claude 全能力的实战 Notebook:从基础的文本分类、摘要、RAG,到高级的工具调用(Tool Use)、JSON 模式、子代理(Sub-agents)、自动评估(Evals)和提示缓存,几乎囊括了 Claude 的所有核心能力。
    • 官方出品、持续更新:Anthropic 工程团队直接维护,Notebook 会跟随 Claude 3.5 / 3.7 / 4 系列模型和新 API 特性同步更新,避免你学到过时的写法。
    • 可复制、可扩展的代码片段:每个配方都提供最小可运行示例,代码结构清晰,方便你替换成自己的数据、提示词或业务逻辑。
    • 多模态与文档理解:包含视觉理解、图表解析、PDF 内容提取、表单识别等示例,适合需要处理非结构化数据的项目。
    • 评估与可观测性:提供自动评估 Cookbook 和 Agent 搜索基准复现(DeepSearchQA / BrowseComp),帮助你建立「改提示 → 跑评估 → 看指标」的迭代闭环。

    四、典型使用场景

    1. 快速上手 Claude API:如果你是第一次用 Claude API,直接打开 getting_started 或基础能力 Notebook,五分钟就能把第一条请求跑起来。
    2. 构建 RAG 与文档问答应用:参考 RAG 配方,把自有文档切分、嵌入、检索后交给 Claude 生成答案;也可以看多模态示例,直接让 Claude 读取 PDF 或图片并回答。
    3. 开发工具型 Agent:学习如何让 Claude 调用计算器、数据库、搜索引擎等外部工具,并进一步组合成多 Agent 协作系统(Coordinator + Sub-agents)。

    五、推荐理由

    Claude Cookbooks 给我的最大价值是「少走弯路」。网上关于 Claude 的教程很多,但官方示例在 Prompt 写法、参数选择、错误处理和成本控制上往往最贴近生产实践。特别是工具调用、JSON 模式和提示缓存这几个容易踩坑的场景,官方代码把最佳实践写得非常清楚。而且它完全开源(MIT),Notebook 形式读起来没有框架源码那么重,适合一边看一边改。

    六、下载地址

  • ComfyUI-Manager:ComfyUI 必备的插件管家,15.3K+ Stars 让节点安装一键搞定

    ComfyUI-Manager:ComfyUI 必备的插件管家,15.3K+ Stars 让节点安装一键搞定

    ComfyUI-Manager 主菜单

    项目简介

    ComfyUI-Manager 是 ComfyUI 生态的官方扩展「插件管家」,让你在图形界面里一键安装、更新、禁用、启用上千个自定义节点与模型,是每位 ComfyUI 用户都离不开的「应用商店」。项目由社区发起,现由 Comfy-Org 官方维护,已接入 registry.comfy.org 官方节点仓库,累计 15.3K+ Stars、2.3K+ Forks,采用 GPL-3.0 许可。

    安装要求和过程

    环境要求:已安装 ComfyUI;系统具备 Python 3Git 即可(无需额外依赖,纯 Python 实现)。

    方式一 · 通用安装(推荐)

    # 进入 ComfyUI 的自定义节点目录
    cd ComfyUI/custom_nodes
    git clone https://github.com/Comfy-Org/ComfyUI-Manager comfyui-manager
    # 重启 ComfyUI 即可在菜单看到 Manager 按钮

    方式二 · Windows 便携版:下载 install-manager-for-portable-version.bat 放入 ComfyUI_windows_portable 目录,右键「另存为」后双击运行。

    方式三 · comfy-cli 一并安装(最省心)

    python -m venv venv
    venv\Scripts\activate      # Linux/macOS 用 . venv/bin/activate
    pip install comfy-cli
    comfy install            # 同时装好 ComfyUI + ComfyUI-Manager

    方式四 · Linux + venv 脚本:下载 install-comfyui-venv-linux.sh 赋可执行权限后运行,自动完成 ComfyUI 与 Manager 的 venv 部署。

    核心功能

    • 一键管理自定义节点:内置 2000+ 节点库,图形界面中搜索、安装、更新、禁用、启用、卸载全部点点鼠标完成,告别手动 git clone + pip install
    • 模型一键下载与管理:集成模型库,直接在界面拉取常用模型权重,并可通过 extra_model_paths.yaml 统一管理模型路径。
    • 快照(Snapshot)管理:一键保存当前「节点 + 模型 + 配置」的完整状态,随时还原,是应对环境崩坏、多机一致的「救命功能」。
    • 缺失节点自动识别:导入他人工作流时,自动列出缺失的自定义节点并一键补齐,彻底解决「换个机器工作流就跑不起来」的问题。
    • 工作流分享 + 命令行 + 安全策略:支持分享到 comfyworkflows / OpenArt 等平台;提供 cm-cli 供高级用户脱离界面使用;security_level 与独立安装开关保障公共部署安全(V3.38 已迁移到受保护系统路径)。

    ComfyUI-Manager 安装对话框

    典型使用场景

    1. 新手快速搭建 AI 绘画工作流:刚装好 ComfyUI 不知道装什么?打开 Manager 搜索 ControlNet、AnimateDiff、IP-Adapter 等热门节点,一键安装即可开始出图。
    2. 团队 / 多机环境一致性:在一台机器调好所有节点后用快照保存,其他机器直接还原,杜绝「在我电脑上能跑」的玄学问题。
    3. 复现他人分享的工作流:从社区下载 .json 工作流,Manager 自动检测并安装其中缺失的节点,秒级复现大佬的节点组合。

    ComfyUI-Manager 模型安装

    推荐理由

    如果你用过 ComfyUI,一定体会过「满屏红字找不到节点」的痛苦。ComfyUI-Manager 把原本繁琐的命令行操作全部收敛为一个图形化面板,安装、更新、回滚一条龙,极大降低了 AI 绘画的入门门槛。个人最离不开的是它的快照功能——折腾节点把环境搞崩后,一个还原就能满血复活;而「缺失节点自动安装」让复现别人的工作流从半小时缩短到几秒钟。如今项目归入 Comfy-Org 官方维护、接入官方节点仓库,并更新了安全补丁,稳定性与可信度都上了一个台阶。一句话:装 ComfyUI 不装 Manager,等于买了手机不装应用商店。

    下载地址

  • Dify:开源 LLM 应用开发平台,148K Stars 把 AI 工作流从原型秒送生产

    Dify:开源 LLM 应用开发平台,148K Stars 把 AI 工作流从原型秒送生产

    Dify 一览

    在 AI 应用落地的草莽时代,几乎每个团队都在重复造轮子:接模型要写一遍适配、做检索要搭一套向量库、上生产还要自己补日志和监控。把这套东西拼起来,往往比业务本身还费劲。Dify 的出现,就是要把这件事彻底标准化。

    一、项目简介

    Dify 是一个开源的 LLM 应用开发平台,用一张可视化画布把 AI 工作流、RAG 检索增强、Agent 能力、模型管理与可观测性打包在一起,让你从原型到生产只差一次部署。目前 GitHub 已收获 148.4K Stars、23K+ Fork,是开源 LLM 应用开发领域当之无愧的头部项目。

    二、安装要求和过程

    环境要求:

    • CPU ≥ 2 核
    • 内存(RAM)≥ 4 GiB
    • 已安装 DockerDocker Compose
    • 操作系统:Linux / macOS / Windows(WSL2)

    快速安装(Docker Compose,官方最推荐方式):

    git clone https://github.com/langgenius/dify.git
    cd dify/docker
    cp .env.example .env
    docker compose up -d

    启动完成后,浏览器访问 http://localhost/install 即可进入初始化向导。如果你需要高可用部署,官方文档还提供了 Helm Chart、Terraform(Azure / GCP)、AWS CDK 以及阿里云计算巢等多种方案。

    三、核心功能

    1. 可视化工作流画布(Workflow)
    在画布上拖拽编排 AI 流程,节点可调试、可分支、可回放,复杂逻辑一目了然。

    2. 全面的模型支持
    无缝接入数百个闭源 / 开源大模型(GPT、Mistral、Llama3 及所有 OpenAI 兼容模型),覆盖几十家推理服务商与自托管方案,切换模型无需改代码。

    3. 开箱即用的 RAG 管线
    从文档摄入到检索全链路覆盖,原生支持 PDF、PPT 等常见格式的智能提取,几步就能搭出带引用来源的问答助手。

    4. 强大的 Agent 能力
    基于 Function Calling 或 ReAct 定义智能体,内置 50+ 工具(Google 搜索、DALL·E、Stable Diffusion、WolframAlpha 等),也可接入自定义工具。

    5. LLMOps 与 Backend-as-a-Service
    应用日志与性能可监控、可迭代;所有能力均提供对应 API,轻松把 AI 能力嵌入自有业务系统。

    四、典型使用场景

    1. 企业知识库问答 / 智能客服
    导入内部文档构建 RAG,几步搭出带引用来源、可溯源的客服助手,替代翻手册式的重复答疑。

    2. 可视化 Agent 工作流自动化
    把“检索 → 生成 → 调用工具 → 校验”串成一张画布,用可视化的方式替代脆弱的脚本编排。

    3. 快速原型 + API 集成
    先用 Dify 低成本验证想法,再通过 BaaS API 把打磨好的 AI 能力无缝嵌入现有产品。

    五、推荐理由

    个人使用下来,Dify 最打动我的是“把复杂度收敛到一个画布上”。它不要求你先成为向量数据库专家或 Prompt 工程师,普通开发者也能在半小时内跑通一个带 RAG 的可用应用;而当项目要上生产时,LLMOps 的日志、评估与 API 化能力又刚好补上团队最缺的那一环。对于想认真做 AI 产品的团队,它是目前最省心的一站式底座——既能自建私有化守住数据,也能平滑对接云端大模型。

    六、下载地址

    许可证:Dify Open Source License(基于 Apache 2.0,附加部分条款)。本文数据截至 2026-07-11,Stars 约 148.4K。

  • AI-Job-Search:基于 Claude Code 的 AI 求职框架,让 Agent 帮你改简历、写求职信、备战面试

    AI-Job-Search:基于 Claude Code 的 AI 求职框架,让 Agent 帮你改简历、写求职信、备战面试

    今天要介绍的项目是 ai-job-search——一个在 GitHub 今日趋势榜上以 +3,700 stars/天 的势头冲到 AI 类目前列的求职神器。它把当下最火的 AI Agent 能力,用到了每个人迟早都要面对的真实场景里:找工作。

    ai-job-search

    📌 项目简介

    ai-job-search 是一个构建在 Claude Code 之上的 AI 驱动求职申请框架。你只需要 Fork 仓库、填写个人档案,剩下的「评估岗位匹配度 → 定制简历 → 撰写求职信 → 模拟面试」全部交给 Claude 自动完成。它不是 Anthropic 官方项目,但是把 Claude Code 的 Skill / Agent 能力落进高频真实场景的范本作品。

    ai-job-search 演示动画

    ▲ ai-job-search 工作流演示(Fork → /setup → /scrape → /apply)

    💻 安装要求和过程

    环境要求

    • Claude Code CLI(Anthropic 官方命令行工具)
    • Python 3.10+
    • Bun(用于运行职位搜索 CLI)
    • LaTeX 发行版:需含 lualatexxelatex,推荐 TeX Live / MacTeX / TinyTeX / MiKTeX(CV 用 lualatex,求职信用 xelatex)
    • 可选:pdftotext(poppler),用于 ATS 文本层校验;缺失时自动降级为视觉检查

    快速安装

    # 1. Fork 并克隆仓库
    gh repo fork MadsLorentzen/ai-job-search --clone
    cd ai-job-search
    
    # 2. 安装职位搜索工具(需要 Bun)
    bun install
    
    # 3. 启动 Claude Code 并初始化个人档案
    claude
    # 在交互中执行 /setup(三种方式:导入 documents/ 文件夹、粘贴简历、AI 访谈引导)

    初始化完成后,即可用 /scrape 搜索职位、/apply <岗位URL> 或粘贴 JD 文本来发起申请。

    ✨ 核心功能

    • 🎯 草稿-评审申请工作流(/apply:强制 PDF 编译 + 可视化检查,内含 PDF 验证循环(防排版破碎)、ATS 文本层校验(用 pdftotext 抽取关键词与联系人)、按匹配度加权删减、起草与评审双 Agent 分离——直接解决 AI 写简历最易翻车的「排版崩了、关键词被吃」问题。
    • 🔍 多门户职位搜索与排序(/scrape/rank:跨多个招聘板抓取、去重、按适配度排序,并支持批量打分,把精力留给最匹配的岗位。
    • 🎤 面试备战(/interview:基于历史归档生成分阶段准备包与模拟面试,提前演练高频问题与回答要点。
    • 📈 档案增强与技能差距分析(/expand/upskill:从公开来源丰富个人档案,分析技能差距并生成针对性学习计划。
    • 🧰 可扩展模板与门户(/add-template/add-portal:注册自定义 LaTeX 模板,或生成本地招聘板搜索技能,轻松适配不同国家 / 地区市场(默认职位搜索面向丹麦,可替换)。

    🚀 典型使用场景

    • 海投变精准投递:把一份通用简历交给框架,针对每个岗位自动生成匹配度最高的定制版简历与求职信,告别「千人一面」。
    • 面试前冲刺:让 Agent 根据目标岗位和你的档案,生成模拟面试问题与回答要点,提前查漏补缺。
    • 求职数据闭环:用 /outcome 记录每个岗位的投递阶段、offer 与拒信,逐步沉淀属于自己的求职知识库。

    💡 推荐理由

    作为常年和 Agent 打交道的人,我第一眼就被它的「草稿-评审」双 Agent 设计打动——它没有一上来就让你无脑海投,而是把求职拆成「评估 → 定制 → 评审 → 面试」几个严肃环节。尤其是 PDF 验证循环 + ATS 文本层检查,精准命中了 AI 写简历最容易翻车的点。整套流程语言与国家无关,模板基于 moderncv 与自定义 cover 类,产出物专业度高。如果你正在找工作、或经常帮人改简历,这个项目值得立刻试一试。

    🔗 下载地址

    本文由自动化任务整理发布,数据截至 2026-07-10,stars 持续增长中。

  • Crawl4AI:把全网网页变成 LLM 能直接用的干净 Markdown,RAG 数据清洗一步到位(71.8K★)

    Crawl4AI:把全网网页变成 LLM 能直接用的干净 Markdown,RAG 数据清洗一步到位(71.8K★)

    Crawl4AI 项目封面

    一、项目简介

    Crawl4AI 是一个开源、对大模型友好的网页爬虫与抓取框架,能把任意网页一键转换成结构清晰、可直接喂给 LLM / RAG 的 Markdown,并支持结构化数据提取、截图、动态渲染等能力。对做检索增强、知识库、Agent 联网取数的人来说,它基本等于把”爬虫 + 清洗”两道工序合并了。

    二、安装要求和过程

    环境要求:Python 3.10 及以上;底层基于 Playwright(Chromium),首次使用需下载浏览器内核。

    快速安装(Python 包):

    # 安装
    pip install -U crawl4ai
    
    # 安装后执行一键浏览器配置
    crawl4ai-setup
    
    # 自检环境是否就绪
    crawl4ai-doctor
    
    # 若遇到浏览器相关报错,可手动补全
    python -m playwright install --with-deps chromium

    Docker 部署(推荐生产环境):

    docker pull unclecode/crawl4ai:latest
    docker run -d -p 11235:11235 --name crawl4ai --shm-size=1g unclecode/crawl4ai:latest
    # 监控面板: http://localhost:11235/dashboard
    # 交互 playground: http://localhost:11235/playground

    三、核心功能

    • LLM 就绪的 Markdown 输出:智能 Markdown 保留标题、表格、代码块,并提供 Fit Markdown(裁剪导航/广告等无关内容)、引用标注,以及基于 BM25 算法的内容过滤,正文噪声大幅降低。
    • 结构化数据提取:支持基于 LLM 的 Schema 提取、CSS 选择器提取、余弦相似度匹配,配合分块(Chunk)策略,直接产出 Pydantic 结构化对象,无需手写正则。
    • 真·浏览器级抓取:基于 Playwright 托管浏览器,支持会话保持、代理、Cookie、用户脚本、Hook、动态视口调整、懒加载处理,还能截图与生成 PDF。
    • 自适应爬取与调度:异步浏览器池 + 缓存机制,能学习网站结构、只爬该爬的页面;内置深度爬取与内存自适应调度,从单页到万级站点都能扛。
    • 部署灵活、可接 Agent:零密钥、CLI + Docker 双形态;新版 Docker 自带监控面板、浏览器池预热、Playground 与 MCP 集成,可直连 Claude Code 等 AI 编程工具。

    四、典型使用场景

    • 搭 RAG 知识库:把公司文档站、竞品官网、行业博客批量抓成干净 Markdown,直接喂进向量库做检索增强,省去大量手写清洗规则。
    • 生成 LLM 训练 / 微调语料:用 LLM 提取策略从定价页、榜单页抽取结构化字段(例如各家模型的价格表),产出干净的 JSON 数据集。
    • AI Agent 联网取数:通过 Docker + MCP 把 Crawl4AI 接进 Agent 工作流,让智能体实时抓取网页、执行 JS、截图后回写结果,补足大模型”看不见实时网页”的短板。

    五、推荐理由

    我自己踩过不少爬虫的坑:传统方案要么反爬头疼,要么抓下来的 Markdown 一堆导航/侧边栏噪音,接 RAG 前还得再写一层清洗。Crawl4AI 的 Fit Markdown + BM25 过滤基本把”正文 vs 杂质”这件事做对了,接检索增强时相当省心;异步 + 浏览器池的性能也不错,小规模到大规模都能用。Docker 镜像开箱即用,MCP 直连 Claude Code 这点对做 Agent 的人尤其香。小提醒:它依赖 Playwright/Chromium,首次部署体积不小;上生产建议走 0.9.0+ 的安全加固 Docker 镜像(已修复路径遍历 / SSRF / RCE)。

    六、下载地址

  • Ollama 又融了 6500 万美元:让开发者在自己电脑上跑大模型,这门生意成了

    在个人电脑上运行开源大模型的 Ollama
    在个人电脑上跑开源大模型,Ollama 想做成 AI 时代的「Docker」

    Ollama 这家公司的名字,做 AI 开发的人基本都听过,圈外知道的不多。最近它宣布完成 6500 万美元的 B 轮融资,领投方是 Theory Ventures。加上之前 Benchmark 的 Peter Fenton 领投的 1500 万 A 轮,这家公司前后总共融了 8800 万美元。

    从 Docker 出来的团队,给 AI 干了件类似的事

    Ollama 在 2023 年上线,做的事情其实很朴素:让开发者在自己的电脑上,几分钟就把开源大模型跑起来。它在 GitHub 上攒了 17.6 万颗 star、将近 1.7 万个 fork,被无数教程、视频和博客拿来当范例。

    创始人 Jeff Morgan 和 Michael Chiang 之前都在 Docker 干过,做过 Docker Desktop,后来公司被 Docker 收购。所以 Ollama 对 AI 模型干的事,基本就是 Docker 当年对云计算干的事——把那些麻烦的硬件配置、环境差异全给你屏蔽掉,开发者只管跑。

    「2023 年开源模型就出来了,但那时候真的很难用,都是给研究人员准备的,不是给程序员用的。想把它们跑起来特别费劲。」Morgan 说。

    近 900 万月活,团队却只有 14 个人

    上线三年,Ollama 现在每个月有 890 万开发者在用,85% 的财富 500 强公司都在用,而背后撑起这一切的团队,只有 14 个人。它能长到这么快,靠的就是「在本地电脑上更顺手地搭 AI」这件事本身的需求。

    商业模式上,桌面免费版一点没变,赚钱靠的是云端订阅,从免费到每月 100 美元分几档,按 GPU 时长而不是 token 计费。那些太大、在自己电脑上跑不动的开源模型,Ollama 就帮你在它的云上找算力跑。

    企业开始认真考虑「用便宜的,留贵的」

    Morgan 把 Ollama 真正像个生意跑起来,归因于今年 1 月 OpenClaw 爆火。那之后,开源模型突然能做 agentic 任务了,比如写代码,企业开始认真琢磨:是不是能把日常活儿交给更便宜的开源模型,只在必要时才掏钱用 Anthropic 那种闭源模型。

    Fenton 的观点是,开源和闭源不是二选一,两边都有的赚。但他也点出一个现实:凡是推理成本高、也就是用模型烧钱烧得狠的公司,都有一股「生存级」的动力往开源权重模型上搬。


    免费的还免费,但「开发工具堕落」的骂声已经有了

    不是所有粉丝都买账。大概一年前,就有一批博客和论坛帖子吐槽 Ollama 的云服务,说它把精力从心爱的免费项目上挪走,把这股风气叫「开发工具的 enshittification(逐渐变烂)」。

    Morgan 不这么看,他说云端是开源使命的延伸——那些顶尖的大模型你自家电脑跑不动,「那我们就帮你把算力找来」。Fenton 也补了一句:桌面上的免费核心产品,前提一点没变,该发现模型、该跑本地模型,还是那个地方。

    不管争议怎么走,Ollama 都算是 AI 催生出来的那一拨「开源项目长成公司」里的最新样本。和它差不多的还有做推理的 Inferact(vLLM)、RadixArk(SGLang),以及从零训自己开源模型的 Arcee。AI 这波浪潮,正在把一批本来免费的工具,一点点变成正经生意。

  • TencentDB Agent Memory:腾讯开源的 AI Agent 本地长期记忆引擎(7.8K+ Stars)

    TencentDB Agent Memory:腾讯开源的 AI Agent 本地长期记忆引擎(7.8K+ Stars)

    TencentDB Agent Memory

    TencentDB Agent Memory 是腾讯云开源的、为 AI Agent 提供完全本地化长期记忆的方案,通过四层渐进式记忆流水线让 Agent「记得住、说得清」,且零外部 API 依赖。它把散落的对话逐步蒸馏成结构化、可追溯的长期记忆,是当下少见的、能直接落地的 Agent 记忆引擎。

    安装要求和过程

    环境要求

    • Node.js ≥ 22.16(官方徽章要求)
    • 需配合 OpenClawHermes Agent 使用
    • 默认本地后端:SQLite + sqlite-vec(无需额外数据库服务)
    • 短上下文压缩需插件版本 ≥ 0.3.4;Hermes 的 Docker 部署需 Docker,Gateway 监听 :8420

    快速安装(OpenClaw,最常用)

    openclaw plugins install @tencentdb-agent-memory/memory-tencentdb
    openclaw gateway restart

    零配置启用,写入 ~/.openclaw/openclaw.json

    {
      "memory-tencentdb": { "enabled": true }
    }

    可选开启短上下文压缩(版本 ≥ 0.3.4):

    {
      "memory-tencentdb": { "config": { "offload": { "enabled": true } } }
    }

    Hermes Docker 部署

    cd docker/opensource
    docker build -f Dockerfile.hermes -t hermes-memory .
    docker run -d --name hermes-memory --restart unless-stopped -p 8420:8420 \
      -e MODEL_API_KEY="your-api-key" \
      -e MODEL_BASE_URL="https://api.lkeap.cloud.tencent.com/v1" \
      -e MODEL_NAME="deepseek-v3.2" \
      -e MODEL_PROVIDER="custom" \
      -v hermes_data:/opt/data hermes-memory
    curl http://localhost:8420/health

    核心功能

    1. 四层记忆架构(L0→L1→L2→L3):原始对话(L0)逐步蒸馏为原子事实(L1)、场景块(L2)、人物画像(L3),从宏观抽象一路保留到可追溯的真相证据。
    2. 符号化短期记忆(Symbolic Short-term Memory):把冗长的工具日志压缩成 Mermaid 符号图,并卸载历史,大幅降低 token 消耗。
    3. 白盒可调试(White-Box Debuggability):每一层都是可读文件——L2 场景是纯 Markdown、L3 画像在 persona.md、短任务画布是 Mermaid,原始负载通过 result_ref / node_id 可回溯,记忆不再是黑盒。
    4. 生产级工程(Production-Ready):OpenClaw 插件自动捕获/提取/召回 + Hermes Gateway 适配器(TdaiCore + HostAdapter)+ 本地 SQLite 后端 + BM25/向量/RRF 混合检索 + tdai_memory_search / tdai_conversation_search Agent 工具。
    5. 完全本地、零外部依赖:记忆全部存本地,隐私可控,不依赖任何外部 API 或云服务即可运行。

    典型使用场景

    • 长程连续任务:如 SWE-bench 单会话连续 50 个任务,Agent 跨会话记住项目背景与 SOP,无需反复解释。集成 OpenClaw 后 token 用量最高降 61.38%,成功率相对提升 51.52%,PersonaMem 长期记忆准确率从 48% 提升到 76%。
    • 个性化 AI 助手:跨会话持续沉淀用户画像(L3)、场景块(L2)、原子事实(L1),让 Agent「越用越懂你」,而非每次都从零开始。
    • 长任务上下文压缩:搜索结果、代码片段、错误栈等冗长日志通过 Mermaid 符号图卸载,显著降低 token 成本——基准上 WideSearch 成功率 33%→50%,SWE-bench 58.4%→64.2%,AA-LCR 44.0%→47.5%。

    推荐理由

    这是目前少数把「Agent 记忆」做成可落地工程、而非论文玩具的项目。四层金字塔设计既保留了宏观人物画像,又保留了可追溯的证据链(result_ref / node_id),白盒可调试对排查「它为什么记错了」极其友好。本地优先 + MIT 许可意味着可以放心用在私有数据场景,接入 OpenClaw / Hermes 几分钟就能跑起来。对做 AI 产品的团队来说,几乎是「给 Agent 装上长期记忆」的最低成本方案。

    架构一览

    TencentDB Agent Memory 检索下沉链路

    下载地址

  • Grok 4.5发布:马斯克说它比Opus更快、更省token

    Grok 4.5 大模型发布
    SpaceXAI 把 Grok 4.5 定位为一款”主力劳工型”大模型

    SpaceXAI——也就是原来那家 xAI,被马斯克并进 SpaceX 之后改的名——这周三把 Grok 4.5 放出来了。这是公司几周前上市之后的第一个新模型,也算是重组后对外界交出的第一份模型答卷。

    马斯克自己在 X 上(X 现在也是 SpaceXAI 旗下的)把它形容成”Opus 级别”的模型,意思是能跟 Anthropic 那档专攻复杂任务的顶级模型掰手腕。他在帖子里写得很直白:Grok 4.5 是 Opus 级的水平,但更快、更省 token、也更便宜。

    一款”什么活都接”的主力模型

    官方博客里,SpaceXAI 把 Grok 4.5 定义成”主力劳工型”模型:写代码、搭应用、办公杂活、做研究、写稿子,这些 AI 圈一直想自动化的活它都能接。但最值得盯的不是它能干多少事,而是效率——公司声称它的 token 效率是其他主流模型的两倍。

    对真正天天调模型的人来说,token 贵不贵早就成了绕不开的痛点。如果这”两倍效率”在真实场景里能兑现,Grok 4.5 的性价比优势就立住了,而这恰恰是 SpaceXAI 最想打的牌。

    “It is an Opus-class model, but faster, more token-efficient and lower cost.”——马斯克在 X 上的原话

    成绩单跟价格,都挺能打

    SpaceXAI 周三甩出了一堆基准测试成绩,看下来跟竞争对手的顶级模型咬得很紧,但离”全场第一”还差一口气。真正有冲击力的是定价:输入每百万 token 2 美元,输出 6 美元。

    作为对比,Anthropic 的 Opus 4.7 要 5 美元和 25 美元,OpenAI 的 GPT-5.6 里最贵的 Sol 是 5 美元和 30 美元。马斯克后来补了一句:内部评估 Grok 4.5 大概跟 Opus 4.7 一个水平,但快得多,”能力、速度、低价三样凑一起,才是它打市场的资本”。

    • Grok 4.5:输入 2 美元 / 输出 6 美元(每百万 token)
    • Opus 4.7:输入 5 美元 / 输出 25 美元
    • GPT-5.6 Sol:输入 5 美元 / 输出 30 美元

    这周简直是模型发布大周。OpenAI 的 GPT-5.6 也在周四准备上线,而且这模型之前还被特朗普政府卡了发布,理由是安全顾虑。一边是 Grok 4.5 打着低价快速度的旗号冲出来,一边是 GPT-5.6 顶着”史上最强”的名头解禁,大模型圈的价格和能力军备竞赛,眼看着又被点了一把火。

  • 特朗普松口,OpenAI GPT-5.6本周四全面开放:Sol、Terra、Luna三件套来了

    OpenAI GPT-5.6 模型发布概念图
    OpenAI GPT-5.6 模型套件公开上线(概念图)

    OpenAI 在周二深夜扔出一条重磅消息:GPT-5.6 要来了,而且这次是面向所有人的公开上线。按照公司的说法,旗舰模型 Sol,加上中端的 Terra 和走量的 Luna,会在本周四一起向公众开放。距离 6 月 26 日它第一次以”受限预览”的身份露面,还不到两周。

    一场由政府点头的”放行”

    这次放行背后,站着特朗普政府。据 Axios 报道,在 OpenAI 和美国商务部下属的”AI 标准与创新中心”又做了一轮测试、开了几轮会之后,政府才给了这次大规模发布的绿灯。OpenAI 还专门派了技术专家常驻华盛顿,随时准备回答监管方的疑问。

    其实上个月,特朗普政府就要求 OpenAI 搞”分批发布”——先把模型开放给政府批准的少数实体,普通人暂时摸不着。当时 OpenAI 就明说,这不是它喜欢的发布方式。

    有意思的是,白宫自己并不认”绿灯”这个说法。一位官员回应说,法律上根本不需要、也没发过什么许可,”放不放、怎么放,决定权完全在公司手里”,还搬出了 6 月 2 日那份 AI 行政令——里面明确禁止联邦层面对模型发布搞强制牌照或预审。换句话说,那些测试和会谈,都是”自愿”的。

    不只 OpenAI 一家被卡过

    把视线拉宽一点,你会发现这阵子最先进的模型几乎都被”限”过。6 月商务部直接禁止外国人使用 Anthropic 的 Mythos 和 Fable 模型,等于逼着它们退出部分市场;上周 Fable 的禁令才刚松绑,用户访问隔了一天就恢复。OpenAI 和 Anthropic 这两家头部公司,最近的处境出奇地像。

    实力与定价才是真看点

    抛开监管戏码,GPT-5.6 本身有两把刷子。OpenAI 说它在写代码、网络安全、生物这几个方向特别能打,长任务的代理(agentic)能力也比上代稳。Sol 还多了两个档位:一个叫”max”,专门做更深层的推理;一个叫”ultra”,能调度子代理——这明显有 OpenAI 收购的 OpenClaw 团队的手笔。

    • Sol:旗舰,主打高端任务,定价每百万 token 输入 5 美元、输出 30 美元。
    • Terra:中端,定位”高吞吐量工作”,价格正好是 Sol 的一半。
    • Luna:日常款,便宜又快,价格还不到 Terra 的一半。

    这个定价挺狠——Sol 的成本差不多只有 Anthropic 旗舰 Claude Fable 5(10/50 美元)的一半。在大家都在喊”token 太贵”的当口,OpenAI 直接把价码压了下来。


    安全方面,OpenAI 这次也下足了功夫。Sol 被训练成会拒绝违规的网络协助请求,包括用户试图伪装意图或”越狱”的情况;公司还投入了约 70 万块 A100e 等效 GPU 小时做自动化红队测试。OpenAI 自己也说,希望这种”政府点头才能发”的流程别变成长期常态——毕竟把最好的工具卡在门外,受影响的还有开发者、企业和网络安全防御方。

  • FunClip:阿里出品的 AI 视频剪辑神器,语音识别 + LLM 智能裁剪,5.9K Stars 让视频剪辑自动化

    FunClip:阿里出品的 AI 视频剪辑神器,语音识别 + LLM 智能裁剪,5.9K Stars 让视频剪辑自动化

    FunClip 界面

    做自媒体的朋友一定有过这样的痛苦:一段两小时的直播回放,只想剪出几句高光金句,却要在时间轴上反复拖拽、听写、对齐字幕。阿里通义语音实验室开源的 FunClip,用语音识别 + 大语言模型把这件事彻底自动化了——上传视频,复制你想保留的文字,点一下,片段就出来了。

    📌 项目简介

    FunClip 是一个完全开源、可本地部署的自动化视频剪辑工具,基于阿里巴巴通义语音实验室开源的 FunASR Paraformer 系列模型对视频做语音识别,用户自由选择识别文本片段或说话人,一键生成对应视频片段,并提供本地 Gradio Web 界面,支持 LLM 辅助智能剪辑。

    ⚙️ 安装要求与过程

    环境要求:仅需 Python 环境(推荐 Python 3.8+);如需内嵌字幕剪辑,需额外安装 ffmpeg 与 imagemagick 及中文字体文件。

    快速安装:

    # 克隆仓库
    git clone https://github.com/modelscope/FunClip.git
    cd FunClip
    # 安装依赖
    pip install -r ./requirements.txt
    
    # 启动本地 Gradio 服务(默认中文 Paraformer)
    python funclip/launch.py
    # 可选:-m fun-asr-nano (31语种) | -m sensevoice (情绪+事件) | -l en (英文)
    #       -p 端口号 | -s True (公网访问)

    启动后访问 localhost:7860 即可使用 Web 界面:上传视频 → 复制需剪辑文本到 “Text to Clip” → 调整字幕 → 点击 “Clip” 或 “Clip and Generate Subtitles”。

    ✨ 核心功能

    • 工业级中文 ASR(Paraformer-Large):阿里开源的顶尖中文语音识别模型,Modelscope 下载超 1300 万次,可精准预测时间戳,自动返回全视频与目标段 SRT 字幕。
    • 热词定制(SeACo-Paraformer):在识别过程中指定实体词、人名等热词,显著提升专有名词识别准确率。
    • 说话人分离(CAM++):集成说话人识别模型,可自动识别 speaker ID,一键剪出特定人物的全部发言片段。
    • LLM 智能剪辑:支持 qwen、GPT 等大模型,结合视频字幕自动推理出高光片段的时间戳;还可选 TwelveLabs Pegasus 视频理解模型,直接“看懂”画面而非仅依赖字幕。
    • 多模型与多语言:2026 年新增 Fun-ASR-Nano(31 种语言高精度)、SenseVoice(情绪识别 + 音频事件检测),并支持英文视频识别剪辑。

    🎬 典型使用场景

    • 自媒体长视频提取金句:把一场发布会、一次访谈原片丢进去,复制想保留的台词,FunClip 自动精准裁出对应时段并生成字幕,做短视频切片效率翻倍。
    • 会议 / 演讲按说话人剪辑:开启说话人分离后,直接剪出某位嘉宾的全部发言,用于整理观点、制作人物集锦,无需手动对照音轨。
    • 视频自动加字幕:识别后一键生成全片 SRT,并可内嵌硬字幕导出,省去逐句听写的繁琐,特别适合教程、纪录片类内容。

    💡 推荐理由

    我自己的使用感受是:FunClip 把“语音识别 → 文本选择 → 视频裁剪”这条链路做到了极简。它不像一些云端剪辑工具那样把数据传上去,而是完全本地运行,隐私可控;Gradio 界面几乎零学习成本,命令行模式又能轻松写进自动化流水线。对做内容创作、知识整理的人来说,它是那种“装好就天天想用”的效率利器。尤其 LLM 智能剪辑的加入,让“我要这段关于乡村振兴的发言”变成一句自然语言指令就能完成。

    🔗 下载地址

    许可协议:MIT(可自由商用与修改)