标签: 开源

  • AI-Job-Search:基于 Claude Code 的 AI 求职框架,让 Agent 帮你改简历、写求职信、备战面试

    AI-Job-Search:基于 Claude Code 的 AI 求职框架,让 Agent 帮你改简历、写求职信、备战面试

    今天要介绍的项目是 ai-job-search——一个在 GitHub 今日趋势榜上以 +3,700 stars/天 的势头冲到 AI 类目前列的求职神器。它把当下最火的 AI Agent 能力,用到了每个人迟早都要面对的真实场景里:找工作。

    ai-job-search

    📌 项目简介

    ai-job-search 是一个构建在 Claude Code 之上的 AI 驱动求职申请框架。你只需要 Fork 仓库、填写个人档案,剩下的「评估岗位匹配度 → 定制简历 → 撰写求职信 → 模拟面试」全部交给 Claude 自动完成。它不是 Anthropic 官方项目,但是把 Claude Code 的 Skill / Agent 能力落进高频真实场景的范本作品。

    ai-job-search 演示动画

    ▲ ai-job-search 工作流演示(Fork → /setup → /scrape → /apply)

    💻 安装要求和过程

    环境要求

    • Claude Code CLI(Anthropic 官方命令行工具)
    • Python 3.10+
    • Bun(用于运行职位搜索 CLI)
    • LaTeX 发行版:需含 lualatexxelatex,推荐 TeX Live / MacTeX / TinyTeX / MiKTeX(CV 用 lualatex,求职信用 xelatex)
    • 可选:pdftotext(poppler),用于 ATS 文本层校验;缺失时自动降级为视觉检查

    快速安装

    # 1. Fork 并克隆仓库
    gh repo fork MadsLorentzen/ai-job-search --clone
    cd ai-job-search
    
    # 2. 安装职位搜索工具(需要 Bun)
    bun install
    
    # 3. 启动 Claude Code 并初始化个人档案
    claude
    # 在交互中执行 /setup(三种方式:导入 documents/ 文件夹、粘贴简历、AI 访谈引导)

    初始化完成后,即可用 /scrape 搜索职位、/apply <岗位URL> 或粘贴 JD 文本来发起申请。

    ✨ 核心功能

    • 🎯 草稿-评审申请工作流(/apply:强制 PDF 编译 + 可视化检查,内含 PDF 验证循环(防排版破碎)、ATS 文本层校验(用 pdftotext 抽取关键词与联系人)、按匹配度加权删减、起草与评审双 Agent 分离——直接解决 AI 写简历最易翻车的「排版崩了、关键词被吃」问题。
    • 🔍 多门户职位搜索与排序(/scrape/rank:跨多个招聘板抓取、去重、按适配度排序,并支持批量打分,把精力留给最匹配的岗位。
    • 🎤 面试备战(/interview:基于历史归档生成分阶段准备包与模拟面试,提前演练高频问题与回答要点。
    • 📈 档案增强与技能差距分析(/expand/upskill:从公开来源丰富个人档案,分析技能差距并生成针对性学习计划。
    • 🧰 可扩展模板与门户(/add-template/add-portal:注册自定义 LaTeX 模板,或生成本地招聘板搜索技能,轻松适配不同国家 / 地区市场(默认职位搜索面向丹麦,可替换)。

    🚀 典型使用场景

    • 海投变精准投递:把一份通用简历交给框架,针对每个岗位自动生成匹配度最高的定制版简历与求职信,告别「千人一面」。
    • 面试前冲刺:让 Agent 根据目标岗位和你的档案,生成模拟面试问题与回答要点,提前查漏补缺。
    • 求职数据闭环:用 /outcome 记录每个岗位的投递阶段、offer 与拒信,逐步沉淀属于自己的求职知识库。

    💡 推荐理由

    作为常年和 Agent 打交道的人,我第一眼就被它的「草稿-评审」双 Agent 设计打动——它没有一上来就让你无脑海投,而是把求职拆成「评估 → 定制 → 评审 → 面试」几个严肃环节。尤其是 PDF 验证循环 + ATS 文本层检查,精准命中了 AI 写简历最容易翻车的点。整套流程语言与国家无关,模板基于 moderncv 与自定义 cover 类,产出物专业度高。如果你正在找工作、或经常帮人改简历,这个项目值得立刻试一试。

    🔗 下载地址

    本文由自动化任务整理发布,数据截至 2026-07-10,stars 持续增长中。

  • Crawl4AI:把全网网页变成 LLM 能直接用的干净 Markdown,RAG 数据清洗一步到位(71.8K★)

    Crawl4AI:把全网网页变成 LLM 能直接用的干净 Markdown,RAG 数据清洗一步到位(71.8K★)

    Crawl4AI 项目封面

    一、项目简介

    Crawl4AI 是一个开源、对大模型友好的网页爬虫与抓取框架,能把任意网页一键转换成结构清晰、可直接喂给 LLM / RAG 的 Markdown,并支持结构化数据提取、截图、动态渲染等能力。对做检索增强、知识库、Agent 联网取数的人来说,它基本等于把”爬虫 + 清洗”两道工序合并了。

    二、安装要求和过程

    环境要求:Python 3.10 及以上;底层基于 Playwright(Chromium),首次使用需下载浏览器内核。

    快速安装(Python 包):

    # 安装
    pip install -U crawl4ai
    
    # 安装后执行一键浏览器配置
    crawl4ai-setup
    
    # 自检环境是否就绪
    crawl4ai-doctor
    
    # 若遇到浏览器相关报错,可手动补全
    python -m playwright install --with-deps chromium

    Docker 部署(推荐生产环境):

    docker pull unclecode/crawl4ai:latest
    docker run -d -p 11235:11235 --name crawl4ai --shm-size=1g unclecode/crawl4ai:latest
    # 监控面板: http://localhost:11235/dashboard
    # 交互 playground: http://localhost:11235/playground

    三、核心功能

    • LLM 就绪的 Markdown 输出:智能 Markdown 保留标题、表格、代码块,并提供 Fit Markdown(裁剪导航/广告等无关内容)、引用标注,以及基于 BM25 算法的内容过滤,正文噪声大幅降低。
    • 结构化数据提取:支持基于 LLM 的 Schema 提取、CSS 选择器提取、余弦相似度匹配,配合分块(Chunk)策略,直接产出 Pydantic 结构化对象,无需手写正则。
    • 真·浏览器级抓取:基于 Playwright 托管浏览器,支持会话保持、代理、Cookie、用户脚本、Hook、动态视口调整、懒加载处理,还能截图与生成 PDF。
    • 自适应爬取与调度:异步浏览器池 + 缓存机制,能学习网站结构、只爬该爬的页面;内置深度爬取与内存自适应调度,从单页到万级站点都能扛。
    • 部署灵活、可接 Agent:零密钥、CLI + Docker 双形态;新版 Docker 自带监控面板、浏览器池预热、Playground 与 MCP 集成,可直连 Claude Code 等 AI 编程工具。

    四、典型使用场景

    • 搭 RAG 知识库:把公司文档站、竞品官网、行业博客批量抓成干净 Markdown,直接喂进向量库做检索增强,省去大量手写清洗规则。
    • 生成 LLM 训练 / 微调语料:用 LLM 提取策略从定价页、榜单页抽取结构化字段(例如各家模型的价格表),产出干净的 JSON 数据集。
    • AI Agent 联网取数:通过 Docker + MCP 把 Crawl4AI 接进 Agent 工作流,让智能体实时抓取网页、执行 JS、截图后回写结果,补足大模型”看不见实时网页”的短板。

    五、推荐理由

    我自己踩过不少爬虫的坑:传统方案要么反爬头疼,要么抓下来的 Markdown 一堆导航/侧边栏噪音,接 RAG 前还得再写一层清洗。Crawl4AI 的 Fit Markdown + BM25 过滤基本把”正文 vs 杂质”这件事做对了,接检索增强时相当省心;异步 + 浏览器池的性能也不错,小规模到大规模都能用。Docker 镜像开箱即用,MCP 直连 Claude Code 这点对做 Agent 的人尤其香。小提醒:它依赖 Playwright/Chromium,首次部署体积不小;上生产建议走 0.9.0+ 的安全加固 Docker 镜像(已修复路径遍历 / SSRF / RCE)。

    六、下载地址

  • Zvec:阿里开源轻量级进程内向量数据库,一行 pip install 搞定十亿级向量检索

    Zvec:阿里开源轻量级进程内向量数据库,一行 pip install 搞定十亿级向量检索

    📌 项目简介

    Zvec 是阿里巴巴开源的轻量级进程内向量数据库(In-process Vector Database)——无需启动独立服务,直接嵌入你的应用代码中运行。它以闪电般的速度完成数十亿级向量的相似性搜索,同时支持密集向量、稀疏向量、混合检索和全文搜索,是构建 RAG 应用、AI Agent 记忆系统和语义搜索引擎的理想底层引擎。

    经过阿里巴巴集团内部生产环境验证,Zvec 在保持极简部署的同时提供了企业级的低延迟和高吞吐能力。

    ⚙️ 安装要求和过程

    环境要求

    • 操作系统:Linux(x86_64 / ARM64)、macOS(ARM64)、Windows(x86_64)
    • Python 版本:3.10 ~ 3.14(pip 安装方式)
    • Node.js / Go / Rust / Dart:均有官方 SDK 支持

    快速安装(Python)

    # 一行命令安装
    pip install zvec
    
    # 验证安装
    python -c "import zvec; print('Zvec OK')"

    一分钟上手示例

    import zvec
    
    # 定义集合 Schema
    schema = zvec.CollectionSchema(
        name="example",
        vectors=zvec.VectorSchema("embedding", zvec.DataType.VECTOR_FP32, 4),
    )
    
    # 创建集合
    collection = zvec.create_and_open(path="./zvec_example", schema=schema)
    
    # 插入文档
    collection.insert([
        zvec.Doc(id="doc_1", vectors={"embedding": [0.1, 0.2, 0.3, 0.4]}),
        zvec.Doc(id="doc_2", vectors={"embedding": [0.2, 0.3, 0.4, 0.1]}),
    ])
    
    # 向量相似度搜索
    results = collection.query(
        zvec.Query(field_name="embedding", vector=[0.4, 0.3, 0.3, 0.1]),
        topk=10
    )
    print(results)

    📦 其他语言 SDK

    • Node.jsnpm install @zvec/zvec
    • Rustzvec-rust
    • Gozvec-go
    • Dart/Flutterflutter pub add zvec

    🔥 核心功能

    1. 极速检索 —— 十亿级向量毫秒级响应
      基于 HNSW 等高效索引算法,在数十亿向量规模下仍能实现毫秒级延迟的相似度搜索。
    2. 密集 + 稀疏向量双模态支持
      同时支持 Dense Vector(浮点密集向量)和 Sparse Vector(稀疏向量),适配不同 Embedding 模型输出格式。
    3. 原生全文搜索(FTS)
      v0.5.0 新增!可为任意字符串字段附加 FTS 索引,支持自然语言或结构化表达式查询,无需外部搜索引擎。
    4. 混合检索(Hybrid Search)
      单次 MultiQuery 融合向量相似度、全文搜索、标量过滤和多维度排序,返回精确结果。
    5. DiskANN 磁盘索引
      v0.5.0 新增!将大部分索引数据放在磁盘上,大幅降低大规模数据集的内存占用。
    6. 持久化存储(WAL 日志)
      Write-Ahead Logging 保证崩溃安全——即使进程异常退出或断电,数据也绝不丢失。
    7. 多语言生态 + 可视化工具
      官方提供 Python / Node.js / Go / Rust / Dart 五种 SDK,另有 Zvec Studio 图形化管理工具。

    💡 典型使用场景

    场景一:RAG 检索增强生成系统

    将文档切片后的 Embedding 向量存入 Zvec,用户提问时先做语义检索召回相关片段,再送入 LLM 生成回答。Zvec 的本地化特性意味着零网络延迟、零外部依赖,特别适合隐私敏感的企业 RAG 场景。

    场景二:AI Agent 长期记忆

    为 AI Agent 构建持久化的记忆库——将用户交互、偏好、历史决策编码为向量存入 Zvec,Agent 启动时自动加载记忆上下文。WAL 持久化确保记忆永不丢失,混合检索支持按时间、主题、情感等多维度精准回忆。

    场景三:边缘设备 / 本地优先语义搜索

    作为进程内库嵌入到笔记本 App、IoT 设备或 CLI 工具中,实现离线语义搜索能力。无服务端依赖资源占用极小,支持 ARM64 和 RISC-V 架构,从云端到边缘全覆盖。

    ✨ 推荐理由

    用过不少向量数据库后,Zvec 的设计哲学让我印象深刻:“Just Works”——不需要配置服务器、不需要 Docker、不需要外部依赖。一个 pip install zvec 就能开始使用。

    对比同类方案:

    特性 Zvec 传统向量数据库
    部署方式 一行 pip install 独立服务 + 配置集群
    外部依赖 零依赖 Redis/Elasticsearch 等
    全文搜索 内置 FTS 需额外集成 ES
    混合检索 原生支持 需自行编排
    适用场景 RAG / Agent / 本地应用 大规模分布式检索

    v0.5.0 更是加入了全文搜索 + DiskANN + 多语言 SDK三大重磅功能,让 Zvec 从一个纯粹的向量数据库进化为全能型本地搜索引擎。对于正在搭建 RAG 系统、AI Agent 或需要本地语义搜索能力的开发者来说,Zvec 是目前最值得尝试的选择之一。

    🔗 下载地址

  • claude-video:让 Claude 真正“看懂”视频的 /watch 技能,6.4K Stars 把视频变成 AI 能读的输入

    claude-video:让 Claude 真正“看懂”视频的 /watch 技能,6.4K Stars 把视频变成 AI 能读的输入

    📌 项目简介

    claude-video 是一个让 Claude(以及 Codex、Cursor、Gemini CLI 等 50+ AI 编程工具)真正”看懂”视频的开源 Agent Skill。它的核心理念只有一句话:Claude 能读网页、能读 PDF、能读代码仓库,但默认它看不了视频——而 claude-video 把”看视频”这件事补上了。你丢给它一个 YouTube 链接或本地视频,它自动下载、抽帧、转写音频,再把画面帧 + 时间戳字幕一起喂给大模型,让 AI 基于真实视听觉内容来回答,而不是靠标题瞎猜。

    🛠 安装要求和过程

    环境要求:

    • Python 3.10+(核心脚本 watch.py / download.py / frames.py / transcribe.py 均为 Python 实现)
    • yt-dlp:负责从 YouTube、Loom、TikTok、X、Instagram 等站点下载视频(首次运行 macOS 上自动 brew 安装,Linux/Windows 会打印安装命令)
    • ffmpeg:负责抽帧、音频提取(同上,首次运行自动引导安装)
    • 带字幕的视频完全免费;无字幕时才需要 Whisper API Key(Groq whisper-large-v3 或 OpenAI whisper-1

    快速安装(三选一):

    方式一 · Claude Code(推荐):

    /plugin marketplace add bradautomates/claude-video
    /plugin install watch@claude-video

    方式二 · 任意 Agent Skills 宿主(Codex / Cursor / Copilot / Gemini CLI 等 50+ 工具):

    npx skills add bradautomates/claude-video -g

    方式三 · 手动 / 开发:

    git clone https://github.com/bradautomates/claude-video.git
    ln -s "$(pwd)/claude-video/skills/watch" ~/.claude/skills/watch
    # 或 ~/.codex/skills/watch

    首次运行会调用 scripts/setup.py --check 引导安装依赖,并在 ~/.config/watch/.env 中生成 GROQ_API_KEY / OPENAI_API_KEY 占位配置。

    ⚡ 核心功能

    1. 多源视频获取:支持 URL(yt-dlp 兼容的几乎所有视频站点)或本地路径(.mp4/.mov/.mkv/.webm),一条命令即可接入。
    2. 智能帧提取:用 ffmpeg 按细节模式抽帧——efficient(关键帧,约 0.5s)到 token-burner(场景切换检测);内置帧去重(默认开启,丢弃近重复帧)与自动 fps / token 预算控制。
    3. 双通道转写:优先用 yt-dlp 提取原生字幕(免费);无字幕时回退 Whisper API,并支持 >25MB 自动分块,确保长视频也能完整转写。
    4. 多模态交给大模型:脚本输出带 t=MM:SS 标记的帧路径 + 时间戳转写,Claude 并行 Read 图像,基于真实画面与声音作答。
    5. 细节模式可调节:--detail transcript|efficient|balanced|token-burner 权衡速度与 token 成本;支持 --start/--end 聚焦片段、--timestamps 指定时刻、--no-whisper 等精细控制。

    🎯 典型使用场景

    • 拆解爆款内容:把竞品发布会、广告片、干货视频丢给它,让它分析钩子结构、叙事节奏、真正的新功能,远快于 2x 倍速硬看。
    • 看录屏诊断 Bug:前端同学把屏幕录制喂给它,它能定位”出错的那一帧”,描述现象与可能原因,把视频变成可调试的输入。
    • 视频转结构化笔记:把一整个播放列表逐条摘要,自动构建可搜索的知识库;或剥离更新视频里的 hype,只提取”真正变了什么”。

    💡 推荐理由(个人使用心得)

    这是个”小而准”的工具,解决的痛点非常真实——我们天天让 AI 读文档读代码,但遇到一个视频链接就瞬间退化成”靠标题猜”。claude-video 最漂亮的设计是零配置起步:有字幕就白嫖字幕,没字幕才花一点点 Whisper 钱;帧去重 + 预算控制又避免了”把整个视频塞进上下文”的 token 爆炸。它本质上是在给 LLM 补上一双眼睛,而且是以”可复用技能包”的形式存在,Claude Code / Cursor / Codex 通吃。如果你经常需要让 AI 处理视频内容,这个 6.4K Star、MIT 协议、纯 Python 的小项目,值得一键装进你的工具箱。

    🔗 下载地址

    • GitHub:github.com/bradautomates/claude-video
    • 安装(Claude Code):/plugin marketplace add bradautomates/claude-video/plugin install watch@claude-video
    • 许可证:MIT(可自由商用、修改、分发)
  • TencentDB Agent Memory:腾讯开源的 AI Agent 本地长期记忆引擎(7.8K+ Stars)

    TencentDB Agent Memory:腾讯开源的 AI Agent 本地长期记忆引擎(7.8K+ Stars)

    TencentDB Agent Memory

    TencentDB Agent Memory 是腾讯云开源的、为 AI Agent 提供完全本地化长期记忆的方案,通过四层渐进式记忆流水线让 Agent「记得住、说得清」,且零外部 API 依赖。它把散落的对话逐步蒸馏成结构化、可追溯的长期记忆,是当下少见的、能直接落地的 Agent 记忆引擎。

    安装要求和过程

    环境要求

    • Node.js ≥ 22.16(官方徽章要求)
    • 需配合 OpenClawHermes Agent 使用
    • 默认本地后端:SQLite + sqlite-vec(无需额外数据库服务)
    • 短上下文压缩需插件版本 ≥ 0.3.4;Hermes 的 Docker 部署需 Docker,Gateway 监听 :8420

    快速安装(OpenClaw,最常用)

    openclaw plugins install @tencentdb-agent-memory/memory-tencentdb
    openclaw gateway restart

    零配置启用,写入 ~/.openclaw/openclaw.json

    {
      "memory-tencentdb": { "enabled": true }
    }

    可选开启短上下文压缩(版本 ≥ 0.3.4):

    {
      "memory-tencentdb": { "config": { "offload": { "enabled": true } } }
    }

    Hermes Docker 部署

    cd docker/opensource
    docker build -f Dockerfile.hermes -t hermes-memory .
    docker run -d --name hermes-memory --restart unless-stopped -p 8420:8420 \
      -e MODEL_API_KEY="your-api-key" \
      -e MODEL_BASE_URL="https://api.lkeap.cloud.tencent.com/v1" \
      -e MODEL_NAME="deepseek-v3.2" \
      -e MODEL_PROVIDER="custom" \
      -v hermes_data:/opt/data hermes-memory
    curl http://localhost:8420/health

    核心功能

    1. 四层记忆架构(L0→L1→L2→L3):原始对话(L0)逐步蒸馏为原子事实(L1)、场景块(L2)、人物画像(L3),从宏观抽象一路保留到可追溯的真相证据。
    2. 符号化短期记忆(Symbolic Short-term Memory):把冗长的工具日志压缩成 Mermaid 符号图,并卸载历史,大幅降低 token 消耗。
    3. 白盒可调试(White-Box Debuggability):每一层都是可读文件——L2 场景是纯 Markdown、L3 画像在 persona.md、短任务画布是 Mermaid,原始负载通过 result_ref / node_id 可回溯,记忆不再是黑盒。
    4. 生产级工程(Production-Ready):OpenClaw 插件自动捕获/提取/召回 + Hermes Gateway 适配器(TdaiCore + HostAdapter)+ 本地 SQLite 后端 + BM25/向量/RRF 混合检索 + tdai_memory_search / tdai_conversation_search Agent 工具。
    5. 完全本地、零外部依赖:记忆全部存本地,隐私可控,不依赖任何外部 API 或云服务即可运行。

    典型使用场景

    • 长程连续任务:如 SWE-bench 单会话连续 50 个任务,Agent 跨会话记住项目背景与 SOP,无需反复解释。集成 OpenClaw 后 token 用量最高降 61.38%,成功率相对提升 51.52%,PersonaMem 长期记忆准确率从 48% 提升到 76%。
    • 个性化 AI 助手:跨会话持续沉淀用户画像(L3)、场景块(L2)、原子事实(L1),让 Agent「越用越懂你」,而非每次都从零开始。
    • 长任务上下文压缩:搜索结果、代码片段、错误栈等冗长日志通过 Mermaid 符号图卸载,显著降低 token 成本——基准上 WideSearch 成功率 33%→50%,SWE-bench 58.4%→64.2%,AA-LCR 44.0%→47.5%。

    推荐理由

    这是目前少数把「Agent 记忆」做成可落地工程、而非论文玩具的项目。四层金字塔设计既保留了宏观人物画像,又保留了可追溯的证据链(result_ref / node_id),白盒可调试对排查「它为什么记错了」极其友好。本地优先 + MIT 许可意味着可以放心用在私有数据场景,接入 OpenClaw / Hermes 几分钟就能跑起来。对做 AI 产品的团队来说,几乎是「给 Agent 装上长期记忆」的最低成本方案。

    架构一览

    TencentDB Agent Memory 检索下沉链路

    下载地址

  • CubeSandbox:给 AI Agent 的 60ms 硬件级安全沙箱,腾讯云开源(8.9K Stars)

    CubeSandbox:给 AI Agent 的 60ms 硬件级安全沙箱,腾讯云开源(8.9K Stars)

    CubeSandbox

    📌 项目简介

    CubeSandbox 是腾讯云开源的、面向 AI Agent 的即时、并发、安全、轻量沙箱服务。它基于自研的 RustVMM + KVM 微虚拟机(MicroVM)构建,主打「硬件级隔离」——每个沙箱都跑在独立的 Guest OS 内核里,从根上杜绝了 Docker 共享内核的逃逸风险。平均冷启动 <60ms、单实例内存开销 <5MB,可以放心拿它来跑 LLM 生成的不受信任代码、Agent 自动执行等高风险任务。

    🛠 安装要求与过程

    环境要求:

    • x86_64 Linux 服务器(推荐 OpenCloudOS 9,Ubuntu / Debian / CentOS 同样支持)
    • ≥ 4 核 CPU、≥ 8 GB 内存,建议挂载独立数据盘给 /data/cubelet
    • 需要 KVM 支持(云服务器若无 /dev/kvm,可开启腾讯云 PVM 嵌套虚拟化)
    • v0.5.0 起原生支持 ARM64 全栈

    一键安装:

    # 标准安装(需 /dev/kvm)
    curl -sL https://github.com/tencentcloud/CubeSandbox/raw/master/deploy/one-click/online-install.sh | bash
    
    # 云服务器无嵌套虚拟化时,开启 PVM 安装
    curl -sL https://github.com/tencentcloud/CubeSandbox/raw/master/deploy/one-click/online-install.sh   | CUBE_PVM_ENABLE=1 bash
    
    # 国内加速镜像
    curl -sL https://cnb.cool/CubeSandbox/CubeSandbox/-/git/raw/master/deploy/one-click/online-install.sh   | CUBE_PVM_ENABLE=1 MIRROR=cn bash

    安装完成后打开 Web 控制台:http://<控制节点IP>:12088,三步即可上手:查看 Overview → 从 Template Store 准备模板 → 创建沙箱(Sandboxes → + New sandbox)。

    如果只想在本地 Python 里玩,也可以 pip install cubesandbox 拉起组件做开发联调。

    ⚡ 核心功能

    • 亚 60ms 冷启动 + 高密度:单实例开销 <5MB,支持空闲自动挂起/唤醒(AutoPause/AutoResume),单机可并发跑成百上千个沙箱。
    • 硬件级隔离:每个实例独立 Guest OS 内核,基于 KVM MicroVM + eBPF 虚拟交换机(CubeVS)做内核级网络隔离,不存在容器共享内核的逃逸面。
    • 无缝兼容 E2B SDK:原生兼容 E2B 协议,业务代码零改动——只把 E2B_API_URL / E2B_API_KEY 指向你自己的 CubeSandbox 即可迁移。
    • 企业级安全:凭据保险库(密钥不进沙箱/上下文/日志)、出口控制(域名白名单 + 未授权出口即时阻断 + 审计日志)。
    • 快照·克隆·回滚:基于 CubeCoW 写时复制引擎,百毫秒级打检查点,可回滚或开分支,Agent 试错零成本。

    🎯 典型使用场景

    1. 跑 LLM/Agent 生成的不受信任代码

    把模型吐出来的 Python/Shell 丢进沙箱执行,硬件隔离 + 出口白名单保证即使代码作恶也伤不到宿主。E2B 兼容意味着你现在的 Code Interpreter 代码直接换环境变量就能用:

    export E2B_API_URL=http://<你的控制节点IP>:12088
    export E2B_API_KEY=<你的API Key>
    
    from e2b_code_interpreter import Sandbox
    sandbox = Sandbox()
    execution = sandbox.run_code("x = 1 + 1; print('result =', x)")
    print(execution.logs.stdout)   # result = 2

    2. 浏览器自动化 / 数据抓取 Agent

    给爬虫、RPA、AI 操作员一人一个干净隔离的浏览器环境,跑完即销毁,避免指纹污染和横向污染。配合 Template Store 预置好带登录态的镜像,开箱即用。

    3. 强化学习 / SWE-Bench 类大规模评测

    官方用 CubeSandbox 做 SWE-Bench RL 训练,上千个独立环境并发创建、秒级回收,单节点高密度把评测成本打下来。

    💡 推荐理由

    这两年「让 Agent 自己写代码自己跑」成了标配,但把模型生成的代码直接丢宿主机执行,等于把大门钥匙交给一个偶尔会发疯的实习生。CubeSandbox 的价值就在于:它把「隔离」这件事做到了又快又便宜又省心——60ms 启动让你几乎感觉不到沙箱的存在,<5MB 开销让并发成本可控,而 E2B 兼容意味着你不用重写一行业务代码就能把云端沙箱换成自建的、数据不出域的版本。

    对国内团队尤其友好:有 CN 镜像、有 PVM 解决云厂商嵌套虚拟化痛点、有中文文档和微信社群。想自建一套「AI 代码执行底座」,CubeSandbox 是目前最省事的开源选择之一。

    📥 下载地址

    许可:Apache-2.0(仓库主协议,部分组件为其他开源协议)。当前 Star 数约 8.9K,仍在快速增长中。

  • OfficeCLI:让 AI Agent 一句话掌控 Word / Excel / PowerPoint 的开源办公套件

    OfficeCLI:让 AI Agent 一句话掌控 Word / Excel / PowerPoint 的开源办公套件

    release license

    📌 项目简介

    OfficeCLI 是全球首个专为 AI Agent 打造的 Office 办公套件,用一行命令就能让任意 AI 智能体读取、编辑、自动化生成 Word / Excel / PowerPoint 文档。它采用单一可执行文件、无需安装 Microsoft Office、零依赖、跨平台运行,目前已斩获 11.5K+ Stars(Apache-2.0 协议)。

    “OfficeCLI’s built-in HTML rendering engine reproduces documents with high fidelity —— and that’s what gives AI eyes.”

    ⚙️ 安装要求和过程

    环境要求

    • 单一二进制:自包含可执行文件,无需安装 Microsoft Office无需 .NET 运行时
    • 跨平台:macOS / Linux / Windows 均可运行。
    • 仅需基础的命令行环境,内存占用极低。

    快速安装

    # macOS / Linux
    curl -fsSL https://raw.githubusercontent.com/iOfficeAI/OfficeCLI/main/install.sh | bash
    
    # Windows (PowerShell)
    irm https://raw.githubusercontent.com/iOfficeAI/OfficeCLI/main/install.ps1 | iex
    
    # 或任选其一
    brew install officecli
    npm install -g @officecli/officecli

    安装后运行 officecli install 将二进制加入 PATH,并自动把 officecli skill 注入 Claude Code、Cursor、Windsurf、GitHub Copilot 等 AI 编程工具,Agent 立刻就能替你创建 / 读取 / 编辑 Office 文档。

    30 秒上手

    # 1. 创建一个空白 PPT
    officecli create deck.pptx
    
    # 2. 启动实时预览(浏览器打开 http://localhost:26315)
    officecli watch deck.pptx
    
    # 3. 另开终端添加一页,浏览器即时刷新
    officecli add deck.pptx / --type slide --prop title="Hello, World!"

    ✨ 核心功能

    • 三格式全读写改:Word(.docx)、Excel(.xlsx)、PowerPoint(.pptx) 全部支持创建、读取(文本 / 结构 / 样式 / 公式)、修改与重组,告别 python-pptx 等一堆库。
    • 内置 HTML 渲染引擎:把文档渲染成 HTML / PNG,给 AI 装上“眼睛”,形成 渲染 → 看 → 改 的闭环,AI 能看见自己生成的成品并自动修正。
    • 路径寻址 + 结构化 JSON:用 /slide[1]/shape[1] 这样的 XPath 式路径精准定位任意元素,并可输出结构化 JSON,便于程序化操作。
    • 实时预览officecli watch 启动本地预览服务(localhost:26315),每次 add / set / remove 命令即时刷新浏览器,所见即所得。
    • 为 Agent 而生:一行 curl -fsSL https://officecli.ai/SKILL.md 即可让 AI Agent 自动读取技能文件并安装使用;自动把 skill 装进主流 AI 编程工具。

    🎯 典型使用场景

    1. AI 自动生成汇报 PPT:让 Agent 一句话产出季度汇报、融资路演、技术分享等演示文稿,自动处理排版、配色与图表。
    2. 批量处理 Excel 报表:自动生成预算表、成绩册、销售看板,支持公式、图表与条件格式。
    3. 程序化生成 Word 文档:一键产出学术论文、项目方案、年度报告,支持多语言 i18n 与 RTL 从右到左排版。

    💡 推荐理由

    以前用 python-pptx 写个 PPT 要 50 行代码还容易错位,OfficeCLI 一行命令就搞定;更关键的是它自带渲染闭环,让 AI 能“看见”自己生成的样子并自我修正——这对想给 Agent 接上“办公能力”的开发者几乎是开箱即用的利器。Apache-2.0 协议、单一二进制、零依赖,本地运行也保障了文档隐私。如果你正在做 AI 办公自动化、RPA 或 Agent 工具链,非常值得一试。

    🔗 下载地址

  • FunClip:阿里出品的 AI 视频剪辑神器,语音识别 + LLM 智能裁剪,5.9K Stars 让视频剪辑自动化

    FunClip:阿里出品的 AI 视频剪辑神器,语音识别 + LLM 智能裁剪,5.9K Stars 让视频剪辑自动化

    FunClip 界面

    做自媒体的朋友一定有过这样的痛苦:一段两小时的直播回放,只想剪出几句高光金句,却要在时间轴上反复拖拽、听写、对齐字幕。阿里通义语音实验室开源的 FunClip,用语音识别 + 大语言模型把这件事彻底自动化了——上传视频,复制你想保留的文字,点一下,片段就出来了。

    📌 项目简介

    FunClip 是一个完全开源、可本地部署的自动化视频剪辑工具,基于阿里巴巴通义语音实验室开源的 FunASR Paraformer 系列模型对视频做语音识别,用户自由选择识别文本片段或说话人,一键生成对应视频片段,并提供本地 Gradio Web 界面,支持 LLM 辅助智能剪辑。

    ⚙️ 安装要求与过程

    环境要求:仅需 Python 环境(推荐 Python 3.8+);如需内嵌字幕剪辑,需额外安装 ffmpeg 与 imagemagick 及中文字体文件。

    快速安装:

    # 克隆仓库
    git clone https://github.com/modelscope/FunClip.git
    cd FunClip
    # 安装依赖
    pip install -r ./requirements.txt
    
    # 启动本地 Gradio 服务(默认中文 Paraformer)
    python funclip/launch.py
    # 可选:-m fun-asr-nano (31语种) | -m sensevoice (情绪+事件) | -l en (英文)
    #       -p 端口号 | -s True (公网访问)

    启动后访问 localhost:7860 即可使用 Web 界面:上传视频 → 复制需剪辑文本到 “Text to Clip” → 调整字幕 → 点击 “Clip” 或 “Clip and Generate Subtitles”。

    ✨ 核心功能

    • 工业级中文 ASR(Paraformer-Large):阿里开源的顶尖中文语音识别模型,Modelscope 下载超 1300 万次,可精准预测时间戳,自动返回全视频与目标段 SRT 字幕。
    • 热词定制(SeACo-Paraformer):在识别过程中指定实体词、人名等热词,显著提升专有名词识别准确率。
    • 说话人分离(CAM++):集成说话人识别模型,可自动识别 speaker ID,一键剪出特定人物的全部发言片段。
    • LLM 智能剪辑:支持 qwen、GPT 等大模型,结合视频字幕自动推理出高光片段的时间戳;还可选 TwelveLabs Pegasus 视频理解模型,直接“看懂”画面而非仅依赖字幕。
    • 多模型与多语言:2026 年新增 Fun-ASR-Nano(31 种语言高精度)、SenseVoice(情绪识别 + 音频事件检测),并支持英文视频识别剪辑。

    🎬 典型使用场景

    • 自媒体长视频提取金句:把一场发布会、一次访谈原片丢进去,复制想保留的台词,FunClip 自动精准裁出对应时段并生成字幕,做短视频切片效率翻倍。
    • 会议 / 演讲按说话人剪辑:开启说话人分离后,直接剪出某位嘉宾的全部发言,用于整理观点、制作人物集锦,无需手动对照音轨。
    • 视频自动加字幕:识别后一键生成全片 SRT,并可内嵌硬字幕导出,省去逐句听写的繁琐,特别适合教程、纪录片类内容。

    💡 推荐理由

    我自己的使用感受是:FunClip 把“语音识别 → 文本选择 → 视频裁剪”这条链路做到了极简。它不像一些云端剪辑工具那样把数据传上去,而是完全本地运行,隐私可控;Gradio 界面几乎零学习成本,命令行模式又能轻松写进自动化流水线。对做内容创作、知识整理的人来说,它是那种“装好就天天想用”的效率利器。尤其 LLM 智能剪辑的加入,让“我要这段关于乡村振兴的发言”变成一句自然语言指令就能完成。

    🔗 下载地址

    许可协议:MIT(可自由商用与修改)

  • video-use:用 Claude Code 一句话剪辑视频,browser-use 团队出品,15.9K Stars 让 AI 成为你的剪辑师

    video-use:用 Claude Code 一句话剪辑视频,browser-use 团队出品,15.9K Stars 让 AI 成为你的剪辑师

    video-use

    把原始素材丢进文件夹,跟 Claude Code 聊两句,拿回成片 final.mp4 —— 这就是 video-use15.9K+ Stars,MIT 许可,100% 开源)。它由爆火的 browser-use 团队打造,把”对话式 AI 编程”的思路搬进了视频剪辑:不再和轨道、关键帧死磕,而是用自然语言描述你要的成片。


    🚀 项目简介

    video-use 是一个对话式视频编辑「技能(skill)」,让 LLM 通过阅读而非观看视频来完成剪辑。它把任意原始素材(口播、混剪、教程、旅行、采访)交给 Claude Code / Codex / Hermes 等任意带 shell 的 AI 编程智能体,自动产出可直接发布的成片,全程无需预设模板或复杂菜单。核心思想和 browser-use 一脉相承:给 LLM 一份结构化的「视频说明书」,而不是一堆看不懂的逐帧截图。


    ⚙️ 安装要求和过程

    环境要求

    • Python 3.12+(依赖 requests / librosa / matplotlib / pillow / numpy)
    • uv(推荐)或 pip 管理依赖
    • ffmpeg必需,渲染引擎)
    • yt-dlp(可选,用于下载在线素材)
    • ElevenLabs API Key(用于 Scribe 转写,按量计费)

    方式一:对话式安装(推荐)

    把官方 setup prompt 粘贴给 Claude Code / Codex / Hermes 等任意智能体,它会自动完成 clone、依赖安装、skill 注册,并在需要时提示你粘贴 ElevenLabs Key——你只需说”准备好了”等它通知。

    方式二:手动安装

    git clone https://github.com/browser-use/video-use ~/Developer/video-use
    ln -sfn ~/Developer/video-use ~/.claude/skills/video-use   # Claude Code
    # ln -sfn ~/Developer/video-use ~/.codex/skills/video-use  # Codex
    
    cd ~/Developer/video-use
    uv sync                       # 或 pip install -e .
    brew install ffmpeg           # 必需
    brew install yt-dlp           # 可选
    
    cp .env.example .env          # 填入 ELEVENLABS_API_KEY=...

    安装完成后,进入任意素材文件夹运行智能体,说一句”edit these into a launch video”,它就会盘点素材、给出剪辑策略、等你确认,再把 edit/final.mp4 生成在素材目录旁。


    💡 核心功能

    • 🧹 剔除填充词与死寂:自动删掉 umm / uh、假开场和片段间的空白,节奏立刻紧凑。
    • 🎨 自动调色:每段独立调色——暖色电影感 / 中性 punch / 任意自定义 ffmpeg 链,风格统一可控。
    • 🔇 无爆音剪辑:每个切点做 30ms 音频淡入淡出,彻底告别”咔哒”爆音。
    • 📝 烧录字幕:默认 2 词大写块样式,颜色、字体、排版完全可定制。
    • ✨ 动画叠层:通过 HyperFrames / Remotion / Manim / PIL 生成动画,每个动画派发并行子代理,互不阻塞。
    • 📖 「阅读」而非「观看」:LLM 只读转写文本 + 按需时间轴视图(约 12KB 文本 + 少量 PNG),而非逐帧分析 4500 万 token 噪声——这正是它又快又准的关键。
    • 🔁 自评估闭环:渲染后在每个切点自检画面跳变 / 音频爆音 / 字幕遮挡,最多自动重渲染 3 次,全部通过后你才看到预览。

    📦 典型使用场景

    🎤 场景一:口播 / 教程视频快速成片

    录完一镜到底的口播,丢给 video-use:它会自动剔除 umm、加好字幕、统一调色、消除爆音,几分钟产出可直接上传的成片,省掉 PR 里最枯燥的”听音修剪”。

    🎬 场景二:旅行 / 采访混剪

    多段原始素材自动编排成叙事线,配合 Remotion / Manim 生成的动画叠层,做出有质感的混剪,适合 Vlog、产品发布片、活动回顾。

    🤖 场景三:常驻远程剪辑

    通过 Browser Use Box 跑在自有 VPS 或 Telegram 上,随时丢素材、随时收成片,把剪辑变成一条常驻的消息流水线。


    ⭐ 推荐理由

    我特别欣赏它”给 LLM 一份视频说明书”的设计哲学——和 browser-use 把网页 DOM 喂给模型如出一辙,但对象换成了视频。传统”AI 剪辑”要么逐帧灌噪声、要么套预设模板;video-use 选择让模型读转写、按需看图,既省 token 又保精度,自评估闭环还兜住了质量下限。

    100% 开源、MIT 许可,能挂在任何 AI 编程智能体上,本地文件零上传(只有转写调用 ElevenLabs)。如果你已经用 Claude Code 写代码,顺手把它变成分身剪辑师,几乎零学习成本。唯一门槛是 ElevenLabs 转写按量计费,但换来的是真正”对话即剪辑”的体验。


    📧 下载地址

  • Zed:用 Rust 重写的高性能 AI 代码编辑器,86.6K Stars 让 VS Code 也坐不住了

    Zed:用 Rust 重写的高性能 AI 代码编辑器,86.6K Stars 让 VS Code 也坐不住了

    Zed 代码编辑器

    项目简介:Zed 是由 Atom 与 Tree-sitter 创始人 Nathan Sobo 团队打造的高性能、多人协作代码编辑器,用 Rust + GPU 加速实现极致流畅的编码体验,并原生集成了 AI 助手与智能体能力。

    📦 安装要求与过程

    环境要求

    • 操作系统:macOS 10.15+ / Linux(glibc 2.28+)/ Windows 10+
    • 架构:x86_64 与 arm64 均支持
    • 零额外依赖:自带 GPUI 渲染引擎,无需预装 Node 或 Electron

    快速安装

    • macOSbrew install --cask zed
    • Windows:Microsoft Store 或 winget install Zed.Zed
    • Linux:官网提供 .deb / .rpm / AppImage,或参考 Linux 安装文档
    • 通用:访问 zed.dev/download 直接下载安装包

    如需从源码构建,克隆仓库后执行 cargo run 即可(需 Rust 工具链)。详见各平台 开发文档

    ⚡ 核心功能

    1. 极速编辑体验:Rust 编写 + GPU 渲染,多光标编辑、百万行大文件秒开,输入延迟低至亚毫秒级,彻底告别卡顿。
    2. 原生多人协作:实时共同编辑、跟随模式(follow)、内置语音频道,无需安装插件即可远程结对编程。
    3. AI 深度集成:内置 Agent 面板、内联补全(Inline Assistant)与命令面板 AI,支持 OpenAI / Anthropic / Ollama 等自定义模型。
    4. Agent Panel 智能体:让 AI 在编辑器内直接读写文件、运行命令、多步迭代修改代码,把编码助理变成真正的协作者。
    5. 基于 GPUI 框架:自研 UI 框架,扩展能力强;配合 Tree-sitter 实现精准的语法高亮与增量解析。

    🎯 典型使用场景

    • 团队结对编程:多人实时共编 + 内置语音,分布在不同城市的同事协作如坐同一间办公室。
    • AI 辅助开发:用 Agent Panel 让 AI 完成函数重构、生成单元测试、解释复杂模块,效率翻倍。
    • 大型项目快速导航:在海量代码库中秒级全局搜索与跳转,老旧大型工程也能流畅编辑。

    💡 推荐理由

    我实际体验过 Zed,最深的感受就是两个字——「丝滑」。打开几十 MB 的日志文件、全局搜索几乎零等待;它的 AI 能力不是外挂插件,而是编辑器原生的一部分,Agent Panel 真能在编辑器里完成多步任务、自己改文件跑命令。对于受够编辑器卡顿、又想要「AI 就在手边」的开发者,Zed 非常值得一试。2026 年 4 月它已发布 1.0 正式版,稳定性和生态都在快速成熟。

    🔗 下载地址

    本文由自动化工作流整理发布 · 许可证:GPL-3.0-or-later(含 Apache-2.0 组件)