标签: MIT许可

  • AI Job Search:跑在你机器上的 AI 求职申请框架,让 Claude 帮你写简历、求职信、备战面试(21.2K⭐)

    AI Job Search:跑在你机器上的 AI 求职申请框架,让 Claude 帮你写简历、求职信、备战面试(21.2K⭐)

    AI Job Search

    AI Job Search 是一个完全跑在你自己机器上的 AI 求职申请框架,基于 Claude Code 构建。Fork 仓库、填好个人资料,Claude 就能帮你评估职位匹配度、定制简历、撰写求职信、准备面试——把最耗时的求职苦差事彻底工程化。

    📌 项目简介

    「The job search that runs on your machine.」作者 Mads Lorentzen 把 Claude Code 变成了一位全栈求职助理:核心工作流(自我画像 → 适配度评估 → 起草-评审申请管道)与语言、国家无关;内置的招聘门户搜索技能默认面向丹麦市场(Jobindex / Jobnet / Akademikernes Jobbank 等),但模式可被替换成你本地的招聘网站。项目没有任何加密货币、代币或付费赞助,仅通过 Ko-fi 捐赠支持,隐私与安全取向明确。

    💻 安装要求与过程

    环境要求

    • Claude Code CLI(需订阅 Anthropic)
    • Python 3.10+(薪资基准等脚本)
    • Bun(用于职位搜索 CLI 工具,bun.sh
    • LaTeX 发行版,需含 lualatexxelatex:TeX Live / MacTeX / TinyTeX / MiKTeX(简历用 lualatex 编译,求职信用 xelatex 编译)
    • 可选:pdftotext(来自 poppler)——用于 /apply 的 ATS 文本层校验;缺失时自动降级为视觉检查

    快速安装

    ① Fork 并克隆

    gh repo fork MadsLorentzen/ai-job-search --clone
    cd ai-job-search

    ② 安装职位搜索 CLI 工具(Bash / zsh / Git Bash)

    for tool in jobbank-search jobdanmark-search jobindex-search jobnet-search linkedin-search freehire-search; do
      cd .agents/skills/$tool/cli && bun install && cd ../../../..
    done

    ③ 进入 Claude Code 填写个人资料

    claude
    # 在 Claude Code 内执行:
    /setup

    ④ 搜索职位

    /scrape

    ⑤ 申请职位

    /apply https://jobindex.dk/job/1234567
    # 或粘贴完整 JD:
    /apply <粘贴完整职位描述>

    ⚡ 核心功能

    • 本地运行、可分叉自有:框架在你的机器上跑,Fork 后填入资料即可,无外部服务绑定,求职数据完全私有。
    • Drafter-Reviewer 双代理申请流:起草者用 LaTeX 写草稿,再由一个带全新上下文的独立 reviewer 代理调研公司、批判草稿,最后修订——避免单遍生成留下的套话与遗漏。
    • PDF 编译与视觉校验循环:自动把简历编译成精确的 2 页、求职信 1 页,并读取渲染页迭代修复版式错误(孤行标题、字体回退、溢页等),每次申请自动执行。
    • ATS 文本层校验:用 pdftotext 抽取简历文本层,按 ATS 解析器视角验证联系方式、阅读顺序与关键词覆盖;诚实规则——简历不支持的关键词绝不硬塞。
    • 相关性加权裁切 + 丰富命令生态:超页时按「与目标职位的相关度 / 文档内独特性 / 求职信依赖度」打分裁线,而非机械删旧;提供 /setup /scrape /apply /rank /interview /outcome /expand /upskill /add-template /add-portal /reset 等 10+ 命令。

    🎯 典型使用场景

    • 主动靶向申请/scrape 抓取丹麦/跨国职位板 → /rank 批量打分排序 → 选定目标 /apply <url> 一键产出定制简历与求职信。
    • 面试准备:某个申请进入面试后,对其归档记录跑 /interview,基于「面试官实际读到的简历/求职信 + 往轮反馈」生成阶段化准备包与模拟面试。
    • 职业差距规划:两次投递之间用 /upskill <URL>/upskill 分析个人画像与职位的差距,输出优先学习热图与带时间估计的学习计划。

    💡 推荐理由(个人心得)

    市面上「AI 帮你写简历」的工具不少,但大多只做一次性文本生成,排版一塌糊涂。AI Job Search 最打动我的是它把求职这件事当成一个严肃的软件工程问题:双代理互相挑刺、强制 PDF 编译校验、ATS 文本层检查,几乎杜绝了「.tex 看起来没问题、渲染出来全崩」的经典翻车。而且它真正跑在本地、Fork 即拥有,可深度定制(自定义 LaTeX 模板、自定义招聘门户 /add-portal),隐私与可控性拉满。

    当然也有门槛:依赖 LaTeX 环境 + Claude Code 订阅,初次搭建略繁琐;默认招聘门户偏丹麦市场(但 linkedin-search / freehire-search 是跨国、零依赖的,开箱即用)。如果你正在换工作、且本就有 Claude Code,这个项目能实打实省下大量写简历、改求职信的周日。

    📥 下载地址

    标签:AI · 开源 · AI Agent · Claude Code · 求职助手 · 简历优化 · 职业规划|许可证:MIT|语言:TypeScript / Python / LaTeX

  • Page Agent:阿里巴巴开源的“住在网页里的”GUI 智能体,一行脚本让网页自己动起来

    Page Agent:阿里巴巴开源的“住在网页里的”GUI 智能体,一行脚本让网页自己动起来

    Page Agent 项目横幅

    项目简介

    Page Agent 是阿里巴巴开源的一个运行在网页内部的 JavaScript GUI 智能体。只需一行脚本,就能让任意网页拥有自己的 AI 代理,用自然语言直接控制 Web 界面——点击按钮、填写表单、跳转页面,全部交给 AI 完成。项目当前已收获约 2.6 万 Star,采用 MIT 协议,主要使用 TypeScript 编写,运行时以纯前端 JavaScript 注入。

    “The GUI Agent Living in Your Webpage. One script gives any web page its own AI agent.”

    安装要求和过程

    环境要求

    • 任意支持 <script> 标签或 npm 的网页环境即可;
    • 无需浏览器扩展、Python 或无头浏览器,纯前端运行;
    • 如需自托管大模型,需一个可访问的模型 API(如通义千问 Qwen、本地模型等);
    • 使用 npm 安装 / 二次构建时需要 Node.js 环境。

    快速安装(三种方式)

    方式一:CDN 一行接入

    <script
        src="https://cdn.jsdelivr.net/npm/page-agent@1.12.1/dist/iife/page-agent.demo.js"
        crossorigin="anonymous"
    ></script>

    国内镜像:https://registry.npmmirror.com/page-agent/1.12.1/files/dist/iife/page-agent.demo.js

    方式二:NPM 安装

    npm install page-agent
    import { PageAgent } from 'page-agent'
    
    const agent = new PageAgent({
        model: 'qwen3.5-plus',
        baseURL: 'https://dashscope.aliyuncs.com/compatible-mode/v1',
        apiKey: 'YOUR_API_KEY',
        language: 'en-US',
    })
    
    await agent.execute('Click the login button')

    方式三:Chrome 扩展 —— 从 Chrome 网上应用店安装 Page Agent 扩展,用于跨多标签页的多页面任务。

    核心功能

    • 🎯 极简集成:纯页面内 JavaScript,不需要浏览器扩展、Python 或无头浏览器,几行代码即可嵌入。
    • 📖 基于文本的 DOM 操作:无需截图、不依赖多模态大模型或特殊权限,通过结构化 DOM 文本理解页面并执行操作。
    • 🧠 自带 LLM(BYO):支持绝大多数主流模型(含本地部署),模型选择完全自由。
    • 🐙 可选 Chrome 扩展:支持跨标签页的多页面任务编排。
    • 🔌 MCP Server(Beta):允许外部 Agent 客户端(如 Claude Code / Cursor)从外部控制你的浏览器。

    典型使用场景

    • SaaS AI Copilot:几行代码为自家产品嵌入 AI 助手,无需重写后端,立刻获得“对话式操作界面”能力。
    • 智能表单填充:把原本需要 20 步点击的流程压缩成一句话,特别适合 ERP / CRM / 后台管理系统等高频重复操作。
    • 无障碍访问:通过自然语言让任何 Web 应用变得可操作,配合语音 / 读屏为行动不便的用户打开大门。
    • 多页面自动化 / MCP 控制:借助 Chrome 扩展或 MCP Server,让 AI 跨页面完成复杂工作流(如比价、数据搬运)。

    推荐理由

    我第一次看到 Page Agent 时最直接的感受是:它把“浏览器自动化”这件事做得太轻了。传统方案(如 Playwright / Puppeteer 脚本、或无头浏览器方案)要么要写一堆选择器、要么要吃截图走多模态,门槛和成本都不低。Page Agent 反其道而行——它就活在页面里,用文本化的 DOM 理解来“读懂”界面,再用自然语言驱动操作,心智负担几乎为零。

    对前端 / 产品同学尤其友好:你想给后台加个“AI 帮我导这份报表”的入口,挂一段脚本就行,不用动架构。再加上它支持 BYO 模型、可接本地大模型,数据不出内网也能玩。如果你正琢磨怎么给产品接一个“会自己点页面”的 AI,Page Agent 是目前最省心、最贴近生产的选择之一。

    下载地址

  • Superpowers:让 AI 编程智能体「先想清楚再做」的开源方法论

    Superpowers:让 AI 编程智能体「先想清楚再做」的开源方法论

    Superpowers 是一套面向 AI 编程智能体(Claude Code、Cursor、Codex、Copilot CLI 等)的开源「方法论 + 技能框架」。它不写业务代码,而是把资深工程师的开发纪律——先脑暴、出设计、写计划,再以测试驱动与代码评审推进——固化成一组「强制触发」的技能(skills),让 Agent 不跳过任何关键步骤。一句话:它给 AI 编程助手外挂了一套工程纪律

    安装要求和过程

    环境要求

    • 任意支持「插件市场」的 AI 编程客户端:Claude Code、Cursor、Codex App/CLI、GitHub Copilot CLI、Kimi Code、OpenCode 等;
    • 无需额外运行时依赖——技能本身是纯 Markdown,零代码、零安装负担;
    • 最新版本 v6.1.1(2026-07-03),MIT 协议,可商用。

    快速安装

    以最常用的 Claude Code 为例,一条命令装好:

    plugin install superpowers@claude-plugins-official

    其他宿主的安装入口:

    • Cursor:在 Agent 聊天里执行 /add-plugin superpowers
    • Codex CLI/plugins 搜索 superpowers 安装;
    • Copilot CLI:注册市场后 copilot plugin install superpowers@superpowers-marketplace
    • OpenCode:读取并执行 https://raw.githubusercontent.com/obra/superpowers/refs/heads/main/.opencode/INSTALL.md

    装好后,正常对话提需求即可——智能体会自动激活内置技能链,无需你手动调用。

    核心功能

    • 自动触发的技能库:20+ 技能覆盖测试(TDD 红-绿-重构)、调试(系统化排查、完成前验证)、协作(脑暴、写计划、派发并行 Agent、请求/接收代码评审)等,全部「强制工作流」而非可选建议。
    • 「先想后做」工作流:脑暴出规格 → Git worktree 隔离 → 设计文档 → 细粒度实施计划 → 子智能体并行开发 → TDD → 代码评审 → 收尾分支,每一步都有验证门禁。
    • 跨宿主通用:一套技能同时兼容 Claude Code、Cursor、Codex、Copilot CLI、Kimi Code、OpenCode 等,换工具不丢方法论。
    • 子智能体驱动开发(Subagent-driven Development):把任务拆给并行子 Agent,主 Agent 只做编排与评审,效率和质量双升。
    • 可扩展元技能writing-skills 让你把自己的工作流封装成新技能,using-superpowers 教 Agent 怎么用这套框架——团队规范可沉淀复用。

    典型使用场景

    • 从一句话需求到可运行功能:让 Agent 先脑暴出规格文档、确认后再生成计划,最后自主开发并自测,避免「上来就写代码」导致的返工灾难。
    • 大型功能并行开发:用 worktree 隔离 + 派发多个子 Agent 同时推进不同模块,主 Agent 汇总与评审,单人也能扛起一个小组的吞吐。
    • 团队统一研发规范:把团队最佳实践写成技能,所有人(和人)用同一套流程,新人也能稳定产出老手质量的代码。

    推荐理由

    用过一堆「vibe coding」工具后,我的结论很朴素:最大的问题不是模型不够聪明,而是 Agent 没有纪律——直接上手写、不写测试、不评审。Superpowers 把「工程纪律」外挂给 Agent,强制它先脑暴、再计划、再 TDD,质量肉眼可见地提升。它不替你做判断,只是不让 Agent 跳过关键步骤。25 万+ star、今天还挂在 GitHub 热榜第一,MIT 协议,值得每个用 AI 写代码的人装一下。

    下载地址

  • Claude Cookbooks:Anthropic 官方出品的 Claude 使用范例集,47.8K stars 让 AI 开发少走弯路

    Claude Cookbooks:Anthropic 官方出品的 Claude 使用范例集,47.8K stars 让 AI 开发少走弯路

    Claude Cookbooks

    Claude Cookbooks 是 Anthropic 官方维护的一组 Claude 使用范例/配方集(Jupyter Notebooks),用可直接复制、可运行的代码片段教会开发者如何用好 Claude API。它覆盖了文本分类、RAG、摘要、工具调用、多模态视觉、子代理、自动评估、JSON 模式、提示缓存等核心场景。截至 2026 年 7 月,仓库已收获 47.8K+ Stars、5.6K+ Forks,是学习和参考 Claude 官方最佳实践的必读项目。

    一、项目简介

    Claude Cookbooks 的定位非常清晰:它不是框架,也不是 SDK,而是一本「官方菜谱」。每个 Notebook 都围绕一个真实开发问题展开,例如「怎么用 Claude 做 RAG」「怎么让 Claude 调用外部工具」「怎么处理 PDF 与图片」「怎么自动评估生成结果」。你可以直接复制代码到自己的项目里,也可以把它当成学习 Claude API 的教程。

    二、安装要求和过程

    环境要求:

    • Python 3.10+(示例代码以 Python 为主);
    • 一个 Claude API Key(可在 Anthropic 官网 免费注册);
    • 仓库使用 uv 管理依赖,建议安装 uv(pip install uvcurl -LsSf https://astral.sh/uv/install.sh | sh);
    • 运行 Jupyter Notebook 需要浏览器或 VS Code Jupyter 插件。

    快速安装:

    # 1. 克隆仓库
    git clone https://github.com/anthropics/claude-cookbooks.git
    cd claude-cookbooks
    
    # 2. 用 uv 安装依赖
    uv sync
    
    # 3. 设置环境变量
    export ANTHROPIC_API_KEY="sk-ant-api03-..."
    
    # 4. 启动 Jupyter 浏览示例
    jupyter notebook

    如果你不想安装 uv,也可以直接用 pip:pip install anthropic jupyter,然后逐本运行 Notebook。

    三、核心功能

    • 覆盖 Claude 全能力的实战 Notebook:从基础的文本分类、摘要、RAG,到高级的工具调用(Tool Use)、JSON 模式、子代理(Sub-agents)、自动评估(Evals)和提示缓存,几乎囊括了 Claude 的所有核心能力。
    • 官方出品、持续更新:Anthropic 工程团队直接维护,Notebook 会跟随 Claude 3.5 / 3.7 / 4 系列模型和新 API 特性同步更新,避免你学到过时的写法。
    • 可复制、可扩展的代码片段:每个配方都提供最小可运行示例,代码结构清晰,方便你替换成自己的数据、提示词或业务逻辑。
    • 多模态与文档理解:包含视觉理解、图表解析、PDF 内容提取、表单识别等示例,适合需要处理非结构化数据的项目。
    • 评估与可观测性:提供自动评估 Cookbook 和 Agent 搜索基准复现(DeepSearchQA / BrowseComp),帮助你建立「改提示 → 跑评估 → 看指标」的迭代闭环。

    四、典型使用场景

    1. 快速上手 Claude API:如果你是第一次用 Claude API,直接打开 getting_started 或基础能力 Notebook,五分钟就能把第一条请求跑起来。
    2. 构建 RAG 与文档问答应用:参考 RAG 配方,把自有文档切分、嵌入、检索后交给 Claude 生成答案;也可以看多模态示例,直接让 Claude 读取 PDF 或图片并回答。
    3. 开发工具型 Agent:学习如何让 Claude 调用计算器、数据库、搜索引擎等外部工具,并进一步组合成多 Agent 协作系统(Coordinator + Sub-agents)。

    五、推荐理由

    Claude Cookbooks 给我的最大价值是「少走弯路」。网上关于 Claude 的教程很多,但官方示例在 Prompt 写法、参数选择、错误处理和成本控制上往往最贴近生产实践。特别是工具调用、JSON 模式和提示缓存这几个容易踩坑的场景,官方代码把最佳实践写得非常清楚。而且它完全开源(MIT),Notebook 形式读起来没有框架源码那么重,适合一边看一边改。

    六、下载地址

  • Desktop Commander MCP:让 AI 直接掌控你的终端与文件系统

    Desktop Commander MCP:让 AI 直接掌控你的终端与文件系统

    Desktop Commander MCP

    一、项目简介

    Desktop Commander MCP 是一个为 Claude、Cursor、VS Code、Claude Code 等 AI 编程客户端提供「终端控制 + 文件系统搜索 + 差异文件编辑」能力的 MCP(Model Context Protocol)服务器。它让你的 AI 助手不再只会「动嘴」,而是能在你的本地电脑上真正「动手」——开终端、搜文件、改代码、跑命令、看结果,一条龙闭环。

    项目由 wonderwhy-er 维护,目前 GitHub 收获 6,700+ Stars、882 Forks,采用 MIT 协议开源,底层用 TypeScript 实现,跨 Windows / macOS / Linux 全平台可用。

    二、安装要求与过程

    环境要求

    • Node.js(推荐 18+;或改用 Docker 方式,无需安装 Node);
    • 一个支持 MCP 的客户端:Claude Desktop / Cursor / VS Code / Claude Code / Codex / Gemini CLI / Windsurf 等;
    • 操作系统:Windows、macOS、Linux 均可。

    快速安装(以 Claude Desktop 为例,npx 自动更新)

    npx @wonderwhy-er/desktop-commander@latest setup

    或手动在 claude_desktop_config.json 中添加:

    {
      "mcpServers": {
        "desktop-commander": {
          "command": "npx",
          "args": ["-y", "@wonderwhy-er/desktop-commander@latest"]
        }
      }
    }

    其他客户端一句话安装

    # Claude Code
    claude mcp add --scope user desktop-commander -- npx -y @wonderwhy-er/desktop-commander@latest
    
    # Codex
    codex mcp add desktop-commander -- npx -y @wonderwhy-er/desktop-commander@latest
    
    # Qwen Code
    qwen mcp add desktop-commander -- npx -y @wonderwhy-er/desktop-commander@latest

    不想装 Node?直接用 Docker 一键脚本(install-docker.sh / install-docker.ps1)启动;也可以通过 Smithery、Cursor 的 MCP 安装链接等图形化方式添加。

    三、核心功能

    1. 增强型终端控制:运行长时间命令、管理交互式进程(start_process / interact_with_process / read_process_output / force_terminate)、会话管理,并支持指定 bash / zsh 等 shell。
    2. 完整文件系统操作:读 / 写 / 移动 / 递归列目录、按文件名与内容搜索(基于 vscode-ripgrep 的递归搜索)、读取文件元数据、负偏移 tail 读取超大日志。
    3. 差异文件编辑(edit_block):精准 SEARCH/REPLACE 替换、模糊回退、字符级 diff、多文件与正则模式替换,像资深工程师一样做「外科手术式」修改,而不是整文件重写。
    4. 即时数据分析与办公文档:在内存中直接跑 Python / Node / R 代码;原生读写 Excel(.xlsx/.xls/.xlsm)、PDF、DOCX;直接分析 CSV / JSON,数据不出本机。
    5. 企业级安全与可观测:符号链接遍历防护、命令黑名单、Docker 隔离、全面审计日志(10MB 轮转)、动态配置无需重启。

    四、典型使用场景

    • 大型代码库重构:让 Claude 用 ripgrep 递归搜出所有调用某函数的地方,逐文件用 edit_block 做差异修改。社区里有用户用它一次性修完 23 个文件、76 个错误的 Svelte 5 项目,速度远超传统 AI 编码体验。
    • 本地数据分析:把 Downloads 里的 CSV 丢给 Agent,它直接在内存里跑 Python 做清洗、统计、画图,全程不离开本机,隐私可控。
    • 自动化日常办公:自动按文件类型整理 Downloads、找出重复照片、把 Excel 报表转成图表或 Markdown,把重复的体力活交给 AI。

    五、推荐理由

    一句话总结:这是目前我用过「最像把 AI 变成真同事」的 MCP 工具。它不只是一个文件服务器,而是把「读代码 → 改代码 → 跑命令 → 看结果」的闭环搬进了对话框。

    最香的是差异编辑(edit_block)——AI 不再整文件重写,而是精准打补丁,token 消耗更低、上下文更稳,长时间对话也不容易「翻车」。配合 Claude Code / Cursor,几乎可以取代一部分 IDE 操作,Vibe Coding 体验拉满。

    唯一要留意的是权限边界:它默认能跑任意终端命令,建议在配置里用 allowedDirectories 限定工作目录,并保持审计日志开启。整体来说,开源 MIT、跨平台、一行命令装好,强烈推荐给所有做 AI 编程的人。

    六、下载地址

  • AI-Job-Search:基于 Claude Code 的 AI 求职框架,让 Agent 帮你改简历、写求职信、备战面试

    AI-Job-Search:基于 Claude Code 的 AI 求职框架,让 Agent 帮你改简历、写求职信、备战面试

    今天要介绍的项目是 ai-job-search——一个在 GitHub 今日趋势榜上以 +3,700 stars/天 的势头冲到 AI 类目前列的求职神器。它把当下最火的 AI Agent 能力,用到了每个人迟早都要面对的真实场景里:找工作。

    ai-job-search

    📌 项目简介

    ai-job-search 是一个构建在 Claude Code 之上的 AI 驱动求职申请框架。你只需要 Fork 仓库、填写个人档案,剩下的「评估岗位匹配度 → 定制简历 → 撰写求职信 → 模拟面试」全部交给 Claude 自动完成。它不是 Anthropic 官方项目,但是把 Claude Code 的 Skill / Agent 能力落进高频真实场景的范本作品。

    ai-job-search 演示动画

    ▲ ai-job-search 工作流演示(Fork → /setup → /scrape → /apply)

    💻 安装要求和过程

    环境要求

    • Claude Code CLI(Anthropic 官方命令行工具)
    • Python 3.10+
    • Bun(用于运行职位搜索 CLI)
    • LaTeX 发行版:需含 lualatexxelatex,推荐 TeX Live / MacTeX / TinyTeX / MiKTeX(CV 用 lualatex,求职信用 xelatex)
    • 可选:pdftotext(poppler),用于 ATS 文本层校验;缺失时自动降级为视觉检查

    快速安装

    # 1. Fork 并克隆仓库
    gh repo fork MadsLorentzen/ai-job-search --clone
    cd ai-job-search
    
    # 2. 安装职位搜索工具(需要 Bun)
    bun install
    
    # 3. 启动 Claude Code 并初始化个人档案
    claude
    # 在交互中执行 /setup(三种方式:导入 documents/ 文件夹、粘贴简历、AI 访谈引导)

    初始化完成后,即可用 /scrape 搜索职位、/apply <岗位URL> 或粘贴 JD 文本来发起申请。

    ✨ 核心功能

    • 🎯 草稿-评审申请工作流(/apply:强制 PDF 编译 + 可视化检查,内含 PDF 验证循环(防排版破碎)、ATS 文本层校验(用 pdftotext 抽取关键词与联系人)、按匹配度加权删减、起草与评审双 Agent 分离——直接解决 AI 写简历最易翻车的「排版崩了、关键词被吃」问题。
    • 🔍 多门户职位搜索与排序(/scrape/rank:跨多个招聘板抓取、去重、按适配度排序,并支持批量打分,把精力留给最匹配的岗位。
    • 🎤 面试备战(/interview:基于历史归档生成分阶段准备包与模拟面试,提前演练高频问题与回答要点。
    • 📈 档案增强与技能差距分析(/expand/upskill:从公开来源丰富个人档案,分析技能差距并生成针对性学习计划。
    • 🧰 可扩展模板与门户(/add-template/add-portal:注册自定义 LaTeX 模板,或生成本地招聘板搜索技能,轻松适配不同国家 / 地区市场(默认职位搜索面向丹麦,可替换)。

    🚀 典型使用场景

    • 海投变精准投递:把一份通用简历交给框架,针对每个岗位自动生成匹配度最高的定制版简历与求职信,告别「千人一面」。
    • 面试前冲刺:让 Agent 根据目标岗位和你的档案,生成模拟面试问题与回答要点,提前查漏补缺。
    • 求职数据闭环:用 /outcome 记录每个岗位的投递阶段、offer 与拒信,逐步沉淀属于自己的求职知识库。

    💡 推荐理由

    作为常年和 Agent 打交道的人,我第一眼就被它的「草稿-评审」双 Agent 设计打动——它没有一上来就让你无脑海投,而是把求职拆成「评估 → 定制 → 评审 → 面试」几个严肃环节。尤其是 PDF 验证循环 + ATS 文本层检查,精准命中了 AI 写简历最容易翻车的点。整套流程语言与国家无关,模板基于 moderncv 与自定义 cover 类,产出物专业度高。如果你正在找工作、或经常帮人改简历,这个项目值得立刻试一试。

    🔗 下载地址

    本文由自动化任务整理发布,数据截至 2026-07-10,stars 持续增长中。

  • claude-video:让 Claude 真正“看懂”视频的 /watch 技能,6.4K Stars 把视频变成 AI 能读的输入

    claude-video:让 Claude 真正“看懂”视频的 /watch 技能,6.4K Stars 把视频变成 AI 能读的输入

    📌 项目简介

    claude-video 是一个让 Claude(以及 Codex、Cursor、Gemini CLI 等 50+ AI 编程工具)真正”看懂”视频的开源 Agent Skill。它的核心理念只有一句话:Claude 能读网页、能读 PDF、能读代码仓库,但默认它看不了视频——而 claude-video 把”看视频”这件事补上了。你丢给它一个 YouTube 链接或本地视频,它自动下载、抽帧、转写音频,再把画面帧 + 时间戳字幕一起喂给大模型,让 AI 基于真实视听觉内容来回答,而不是靠标题瞎猜。

    🛠 安装要求和过程

    环境要求:

    • Python 3.10+(核心脚本 watch.py / download.py / frames.py / transcribe.py 均为 Python 实现)
    • yt-dlp:负责从 YouTube、Loom、TikTok、X、Instagram 等站点下载视频(首次运行 macOS 上自动 brew 安装,Linux/Windows 会打印安装命令)
    • ffmpeg:负责抽帧、音频提取(同上,首次运行自动引导安装)
    • 带字幕的视频完全免费;无字幕时才需要 Whisper API Key(Groq whisper-large-v3 或 OpenAI whisper-1

    快速安装(三选一):

    方式一 · Claude Code(推荐):

    /plugin marketplace add bradautomates/claude-video
    /plugin install watch@claude-video

    方式二 · 任意 Agent Skills 宿主(Codex / Cursor / Copilot / Gemini CLI 等 50+ 工具):

    npx skills add bradautomates/claude-video -g

    方式三 · 手动 / 开发:

    git clone https://github.com/bradautomates/claude-video.git
    ln -s "$(pwd)/claude-video/skills/watch" ~/.claude/skills/watch
    # 或 ~/.codex/skills/watch

    首次运行会调用 scripts/setup.py --check 引导安装依赖,并在 ~/.config/watch/.env 中生成 GROQ_API_KEY / OPENAI_API_KEY 占位配置。

    ⚡ 核心功能

    1. 多源视频获取:支持 URL(yt-dlp 兼容的几乎所有视频站点)或本地路径(.mp4/.mov/.mkv/.webm),一条命令即可接入。
    2. 智能帧提取:用 ffmpeg 按细节模式抽帧——efficient(关键帧,约 0.5s)到 token-burner(场景切换检测);内置帧去重(默认开启,丢弃近重复帧)与自动 fps / token 预算控制。
    3. 双通道转写:优先用 yt-dlp 提取原生字幕(免费);无字幕时回退 Whisper API,并支持 >25MB 自动分块,确保长视频也能完整转写。
    4. 多模态交给大模型:脚本输出带 t=MM:SS 标记的帧路径 + 时间戳转写,Claude 并行 Read 图像,基于真实画面与声音作答。
    5. 细节模式可调节:--detail transcript|efficient|balanced|token-burner 权衡速度与 token 成本;支持 --start/--end 聚焦片段、--timestamps 指定时刻、--no-whisper 等精细控制。

    🎯 典型使用场景

    • 拆解爆款内容:把竞品发布会、广告片、干货视频丢给它,让它分析钩子结构、叙事节奏、真正的新功能,远快于 2x 倍速硬看。
    • 看录屏诊断 Bug:前端同学把屏幕录制喂给它,它能定位”出错的那一帧”,描述现象与可能原因,把视频变成可调试的输入。
    • 视频转结构化笔记:把一整个播放列表逐条摘要,自动构建可搜索的知识库;或剥离更新视频里的 hype,只提取”真正变了什么”。

    💡 推荐理由(个人使用心得)

    这是个”小而准”的工具,解决的痛点非常真实——我们天天让 AI 读文档读代码,但遇到一个视频链接就瞬间退化成”靠标题猜”。claude-video 最漂亮的设计是零配置起步:有字幕就白嫖字幕,没字幕才花一点点 Whisper 钱;帧去重 + 预算控制又避免了”把整个视频塞进上下文”的 token 爆炸。它本质上是在给 LLM 补上一双眼睛,而且是以”可复用技能包”的形式存在,Claude Code / Cursor / Codex 通吃。如果你经常需要让 AI 处理视频内容,这个 6.4K Star、MIT 协议、纯 Python 的小项目,值得一键装进你的工具箱。

    🔗 下载地址

    • GitHub:github.com/bradautomates/claude-video
    • 安装(Claude Code):/plugin marketplace add bradautomates/claude-video/plugin install watch@claude-video
    • 许可证:MIT(可自由商用、修改、分发)
  • TencentDB Agent Memory:腾讯开源的 AI Agent 本地长期记忆引擎(7.8K+ Stars)

    TencentDB Agent Memory:腾讯开源的 AI Agent 本地长期记忆引擎(7.8K+ Stars)

    TencentDB Agent Memory

    TencentDB Agent Memory 是腾讯云开源的、为 AI Agent 提供完全本地化长期记忆的方案,通过四层渐进式记忆流水线让 Agent「记得住、说得清」,且零外部 API 依赖。它把散落的对话逐步蒸馏成结构化、可追溯的长期记忆,是当下少见的、能直接落地的 Agent 记忆引擎。

    安装要求和过程

    环境要求

    • Node.js ≥ 22.16(官方徽章要求)
    • 需配合 OpenClawHermes Agent 使用
    • 默认本地后端:SQLite + sqlite-vec(无需额外数据库服务)
    • 短上下文压缩需插件版本 ≥ 0.3.4;Hermes 的 Docker 部署需 Docker,Gateway 监听 :8420

    快速安装(OpenClaw,最常用)

    openclaw plugins install @tencentdb-agent-memory/memory-tencentdb
    openclaw gateway restart

    零配置启用,写入 ~/.openclaw/openclaw.json

    {
      "memory-tencentdb": { "enabled": true }
    }

    可选开启短上下文压缩(版本 ≥ 0.3.4):

    {
      "memory-tencentdb": { "config": { "offload": { "enabled": true } } }
    }

    Hermes Docker 部署

    cd docker/opensource
    docker build -f Dockerfile.hermes -t hermes-memory .
    docker run -d --name hermes-memory --restart unless-stopped -p 8420:8420 \
      -e MODEL_API_KEY="your-api-key" \
      -e MODEL_BASE_URL="https://api.lkeap.cloud.tencent.com/v1" \
      -e MODEL_NAME="deepseek-v3.2" \
      -e MODEL_PROVIDER="custom" \
      -v hermes_data:/opt/data hermes-memory
    curl http://localhost:8420/health

    核心功能

    1. 四层记忆架构(L0→L1→L2→L3):原始对话(L0)逐步蒸馏为原子事实(L1)、场景块(L2)、人物画像(L3),从宏观抽象一路保留到可追溯的真相证据。
    2. 符号化短期记忆(Symbolic Short-term Memory):把冗长的工具日志压缩成 Mermaid 符号图,并卸载历史,大幅降低 token 消耗。
    3. 白盒可调试(White-Box Debuggability):每一层都是可读文件——L2 场景是纯 Markdown、L3 画像在 persona.md、短任务画布是 Mermaid,原始负载通过 result_ref / node_id 可回溯,记忆不再是黑盒。
    4. 生产级工程(Production-Ready):OpenClaw 插件自动捕获/提取/召回 + Hermes Gateway 适配器(TdaiCore + HostAdapter)+ 本地 SQLite 后端 + BM25/向量/RRF 混合检索 + tdai_memory_search / tdai_conversation_search Agent 工具。
    5. 完全本地、零外部依赖:记忆全部存本地,隐私可控,不依赖任何外部 API 或云服务即可运行。

    典型使用场景

    • 长程连续任务:如 SWE-bench 单会话连续 50 个任务,Agent 跨会话记住项目背景与 SOP,无需反复解释。集成 OpenClaw 后 token 用量最高降 61.38%,成功率相对提升 51.52%,PersonaMem 长期记忆准确率从 48% 提升到 76%。
    • 个性化 AI 助手:跨会话持续沉淀用户画像(L3)、场景块(L2)、原子事实(L1),让 Agent「越用越懂你」,而非每次都从零开始。
    • 长任务上下文压缩:搜索结果、代码片段、错误栈等冗长日志通过 Mermaid 符号图卸载,显著降低 token 成本——基准上 WideSearch 成功率 33%→50%,SWE-bench 58.4%→64.2%,AA-LCR 44.0%→47.5%。

    推荐理由

    这是目前少数把「Agent 记忆」做成可落地工程、而非论文玩具的项目。四层金字塔设计既保留了宏观人物画像,又保留了可追溯的证据链(result_ref / node_id),白盒可调试对排查「它为什么记错了」极其友好。本地优先 + MIT 许可意味着可以放心用在私有数据场景,接入 OpenClaw / Hermes 几分钟就能跑起来。对做 AI 产品的团队来说,几乎是「给 Agent 装上长期记忆」的最低成本方案。

    架构一览

    TencentDB Agent Memory 检索下沉链路

    下载地址

  • FunClip:阿里出品的 AI 视频剪辑神器,语音识别 + LLM 智能裁剪,5.9K Stars 让视频剪辑自动化

    FunClip:阿里出品的 AI 视频剪辑神器,语音识别 + LLM 智能裁剪,5.9K Stars 让视频剪辑自动化

    FunClip 界面

    做自媒体的朋友一定有过这样的痛苦:一段两小时的直播回放,只想剪出几句高光金句,却要在时间轴上反复拖拽、听写、对齐字幕。阿里通义语音实验室开源的 FunClip,用语音识别 + 大语言模型把这件事彻底自动化了——上传视频,复制你想保留的文字,点一下,片段就出来了。

    📌 项目简介

    FunClip 是一个完全开源、可本地部署的自动化视频剪辑工具,基于阿里巴巴通义语音实验室开源的 FunASR Paraformer 系列模型对视频做语音识别,用户自由选择识别文本片段或说话人,一键生成对应视频片段,并提供本地 Gradio Web 界面,支持 LLM 辅助智能剪辑。

    ⚙️ 安装要求与过程

    环境要求:仅需 Python 环境(推荐 Python 3.8+);如需内嵌字幕剪辑,需额外安装 ffmpeg 与 imagemagick 及中文字体文件。

    快速安装:

    # 克隆仓库
    git clone https://github.com/modelscope/FunClip.git
    cd FunClip
    # 安装依赖
    pip install -r ./requirements.txt
    
    # 启动本地 Gradio 服务(默认中文 Paraformer)
    python funclip/launch.py
    # 可选:-m fun-asr-nano (31语种) | -m sensevoice (情绪+事件) | -l en (英文)
    #       -p 端口号 | -s True (公网访问)

    启动后访问 localhost:7860 即可使用 Web 界面:上传视频 → 复制需剪辑文本到 “Text to Clip” → 调整字幕 → 点击 “Clip” 或 “Clip and Generate Subtitles”。

    ✨ 核心功能

    • 工业级中文 ASR(Paraformer-Large):阿里开源的顶尖中文语音识别模型,Modelscope 下载超 1300 万次,可精准预测时间戳,自动返回全视频与目标段 SRT 字幕。
    • 热词定制(SeACo-Paraformer):在识别过程中指定实体词、人名等热词,显著提升专有名词识别准确率。
    • 说话人分离(CAM++):集成说话人识别模型,可自动识别 speaker ID,一键剪出特定人物的全部发言片段。
    • LLM 智能剪辑:支持 qwen、GPT 等大模型,结合视频字幕自动推理出高光片段的时间戳;还可选 TwelveLabs Pegasus 视频理解模型,直接“看懂”画面而非仅依赖字幕。
    • 多模型与多语言:2026 年新增 Fun-ASR-Nano(31 种语言高精度)、SenseVoice(情绪识别 + 音频事件检测),并支持英文视频识别剪辑。

    🎬 典型使用场景

    • 自媒体长视频提取金句:把一场发布会、一次访谈原片丢进去,复制想保留的台词,FunClip 自动精准裁出对应时段并生成字幕,做短视频切片效率翻倍。
    • 会议 / 演讲按说话人剪辑:开启说话人分离后,直接剪出某位嘉宾的全部发言,用于整理观点、制作人物集锦,无需手动对照音轨。
    • 视频自动加字幕:识别后一键生成全片 SRT,并可内嵌硬字幕导出,省去逐句听写的繁琐,特别适合教程、纪录片类内容。

    💡 推荐理由

    我自己的使用感受是:FunClip 把“语音识别 → 文本选择 → 视频裁剪”这条链路做到了极简。它不像一些云端剪辑工具那样把数据传上去,而是完全本地运行,隐私可控;Gradio 界面几乎零学习成本,命令行模式又能轻松写进自动化流水线。对做内容创作、知识整理的人来说,它是那种“装好就天天想用”的效率利器。尤其 LLM 智能剪辑的加入,让“我要这段关于乡村振兴的发言”变成一句自然语言指令就能完成。

    🔗 下载地址

    许可协议:MIT(可自由商用与修改)

  • video-use:用 Claude Code 一句话剪辑视频,browser-use 团队出品,15.9K Stars 让 AI 成为你的剪辑师

    video-use:用 Claude Code 一句话剪辑视频,browser-use 团队出品,15.9K Stars 让 AI 成为你的剪辑师

    video-use

    把原始素材丢进文件夹,跟 Claude Code 聊两句,拿回成片 final.mp4 —— 这就是 video-use15.9K+ Stars,MIT 许可,100% 开源)。它由爆火的 browser-use 团队打造,把”对话式 AI 编程”的思路搬进了视频剪辑:不再和轨道、关键帧死磕,而是用自然语言描述你要的成片。


    🚀 项目简介

    video-use 是一个对话式视频编辑「技能(skill)」,让 LLM 通过阅读而非观看视频来完成剪辑。它把任意原始素材(口播、混剪、教程、旅行、采访)交给 Claude Code / Codex / Hermes 等任意带 shell 的 AI 编程智能体,自动产出可直接发布的成片,全程无需预设模板或复杂菜单。核心思想和 browser-use 一脉相承:给 LLM 一份结构化的「视频说明书」,而不是一堆看不懂的逐帧截图。


    ⚙️ 安装要求和过程

    环境要求

    • Python 3.12+(依赖 requests / librosa / matplotlib / pillow / numpy)
    • uv(推荐)或 pip 管理依赖
    • ffmpeg必需,渲染引擎)
    • yt-dlp(可选,用于下载在线素材)
    • ElevenLabs API Key(用于 Scribe 转写,按量计费)

    方式一:对话式安装(推荐)

    把官方 setup prompt 粘贴给 Claude Code / Codex / Hermes 等任意智能体,它会自动完成 clone、依赖安装、skill 注册,并在需要时提示你粘贴 ElevenLabs Key——你只需说”准备好了”等它通知。

    方式二:手动安装

    git clone https://github.com/browser-use/video-use ~/Developer/video-use
    ln -sfn ~/Developer/video-use ~/.claude/skills/video-use   # Claude Code
    # ln -sfn ~/Developer/video-use ~/.codex/skills/video-use  # Codex
    
    cd ~/Developer/video-use
    uv sync                       # 或 pip install -e .
    brew install ffmpeg           # 必需
    brew install yt-dlp           # 可选
    
    cp .env.example .env          # 填入 ELEVENLABS_API_KEY=...

    安装完成后,进入任意素材文件夹运行智能体,说一句”edit these into a launch video”,它就会盘点素材、给出剪辑策略、等你确认,再把 edit/final.mp4 生成在素材目录旁。


    💡 核心功能

    • 🧹 剔除填充词与死寂:自动删掉 umm / uh、假开场和片段间的空白,节奏立刻紧凑。
    • 🎨 自动调色:每段独立调色——暖色电影感 / 中性 punch / 任意自定义 ffmpeg 链,风格统一可控。
    • 🔇 无爆音剪辑:每个切点做 30ms 音频淡入淡出,彻底告别”咔哒”爆音。
    • 📝 烧录字幕:默认 2 词大写块样式,颜色、字体、排版完全可定制。
    • ✨ 动画叠层:通过 HyperFrames / Remotion / Manim / PIL 生成动画,每个动画派发并行子代理,互不阻塞。
    • 📖 「阅读」而非「观看」:LLM 只读转写文本 + 按需时间轴视图(约 12KB 文本 + 少量 PNG),而非逐帧分析 4500 万 token 噪声——这正是它又快又准的关键。
    • 🔁 自评估闭环:渲染后在每个切点自检画面跳变 / 音频爆音 / 字幕遮挡,最多自动重渲染 3 次,全部通过后你才看到预览。

    📦 典型使用场景

    🎤 场景一:口播 / 教程视频快速成片

    录完一镜到底的口播,丢给 video-use:它会自动剔除 umm、加好字幕、统一调色、消除爆音,几分钟产出可直接上传的成片,省掉 PR 里最枯燥的”听音修剪”。

    🎬 场景二:旅行 / 采访混剪

    多段原始素材自动编排成叙事线,配合 Remotion / Manim 生成的动画叠层,做出有质感的混剪,适合 Vlog、产品发布片、活动回顾。

    🤖 场景三:常驻远程剪辑

    通过 Browser Use Box 跑在自有 VPS 或 Telegram 上,随时丢素材、随时收成片,把剪辑变成一条常驻的消息流水线。


    ⭐ 推荐理由

    我特别欣赏它”给 LLM 一份视频说明书”的设计哲学——和 browser-use 把网页 DOM 喂给模型如出一辙,但对象换成了视频。传统”AI 剪辑”要么逐帧灌噪声、要么套预设模板;video-use 选择让模型读转写、按需看图,既省 token 又保精度,自评估闭环还兜住了质量下限。

    100% 开源、MIT 许可,能挂在任何 AI 编程智能体上,本地文件零上传(只有转写调用 ElevenLabs)。如果你已经用 Claude Code 写代码,顺手把它变成分身剪辑师,几乎零学习成本。唯一门槛是 ElevenLabs 转写按量计费,但换来的是真正”对话即剪辑”的体验。


    📧 下载地址