标签: GitHub

  • PPT Master:AI 把文档一键变成真正可编辑的原生 PowerPoint

    PPT Master:AI 把文档一键变成真正可编辑的原生 PowerPoint

    PPT Master 示例:Global AI Capital 2026 数据新闻风 deck

    示例:用 PPT Master 一键生成的《Global AI Capital 2026》数据新闻风演示(Bloomberg 风格深色仪表盘,图表驱动)

    项目简介

    PPT Master 是 Hugo He 开源的一个 AI 工作流,它运行在任意具备 Agent 能力的 AI 工具(Claude / GPT / Gemini / Kimi 等)中,把你的文档或主题直接生成真正可在 PowerPoint 里继续编辑的原生演示文稿——不只是「可编辑」,而是拥有原生形状、图表、表格、母版与过渡动画的完整 PPT 对象模型。当前 GitHub 45.4K★、MIT 许可、Python 实现。

    安装要求与快速开始

    环境要求:只需手动安装 Python 3.10+(唯一需要的环境);一个具备 Agent 能力的 AI 工具(官方推荐 Claude Code,也可用 Cursor、Codex CLI、Gemini CLI 等);可选:AI 生图(如 gpt-image-2)与联网搜图所需的 API Key。数据全程本地,无订阅、无平台锁定。

    快速安装:

    git clone https://github.com/hugohe3/ppt-master.git
    cd ppt-master
    pip install -r requirements.txt

    在该目录下打开你的 AI Agent,把材料放进 projects/ 目录,对它说「用 projects/xxx.pdf 做个 PPT」即可。Windows 用户可参考官方《Windows 安装指南》,10 分钟从零到成片。模型推荐大上下文窗口的 Kimi K3 或 Claude,配合 gpt-image-2 生图质量最佳。

    核心功能

    • 原生 PowerPoint 对象模型:输出真正的 slide master、原生形状与连接器、文本框,点击任意元素都能当作原生 PPT 对象继续修改,而不是扁平图片或套模板。
    • 数据驱动的图表与表格:可导出为真实的 PowerPoint Chart / Table 对象,支持「编辑数据」与对象级控制,跨应用视觉一致。
    • 跑在任意 AI Agent 里:Claude、GPT、Gemini、Kimi 均可驱动,无平台锁定;免费开源,成本只有模型调用费。
    • 数据留在本地:除与大模型通信外,整条流水线都在本机运行。
    • 复用你的模板 + 旁白/动画:可填充现有 .pptx 保留原设计,支持演讲者备注转语音旁白,甚至生成自动讲解视频。

    PPT Master 核心亮点

    典型使用场景

    • 从资料直接出片:把一沓 PDF / DOCX / 网页丢进去,让 AI 先梳理论点结构再做视觉设计,输出包含数据图表的完整 deck。
    • 套用公司模板:把已有的品牌 .pptx 交给它,只填新内容、保留原设计,导出你选中的页面。
    • 给成片加旁白:对做好的 deck 追加原生过渡、动画与语音旁白,直接生成可自动播放讲解的演示。

    推荐理由

    作者 Hugo He 是一位金融从业者(CPA·CPV·咨询工程师),他做这个工具的初衷很朴素:市面上的「AI 做 PPT」大多把幻灯片拍扁成图片或硬套模板,二次编辑体验很差;他想要的是在 PowerPoint 里依然能改的原生成品。这与我的痛点高度一致——「可编辑」早已是标配,真正的分水岭是「原生深度」。PPT Master 的方向就是持续向 PowerPoint 本身收敛,一个版本一个版本补上更多原生能力。

    作为日常生产力工具,它最打动我的是三点:免费开源、数据本地、无平台锁定——你不必把资料上交某个云平台,就能把最枯燥的排版活交给 AI。建议搭配大上下文模型(Kimi K3 / Claude)+ gpt-image-2 生图,质量最好;便宜模型也能跑,只是留给你的润色活更多。它不是「许愿池」,但能替你卸掉大部分重复劳动。

    下载地址

  • AOS Community Edition:开源智能体操作系统,让 AI Agent 拥有自己的 OS

    AOS Community Edition:开源智能体操作系统,让 AI Agent 拥有自己的 OS

    AOS 核心亮点

    项目简介

    AOS Community Edition 是 Unicity 团队开源的「智能体操作系统」(Agent Operating System),为需要可检视、可组合环境的 AI 智能体提供完整的运行时基础设施。它包含 aos CLI 命令行、HTTP API、21 个官方 Capsule 组件、MCP 边缘入口以及 Unicity Audit 安全审计能力,全部以 Rust 编写并采用 MIT/Apache-2.0 双许可发布。

    安装要求与快速开始

    AOS 支持主流 Unix 系统(macOS / Linux)和 Windows。安装只需两步:

    # 1. 安装 aos CLI(含固定运行时和 21 个 CE capsule)
    curl --proto '=https' --tlsv1.2 -fsSL https://aos.unicity.ai/install.sh | sh
    
    # 2. 初始化工作区(从本地版本化资产置备 ~/.aos)
    aos init

    安装器会自动下载并锁定精确的运行时版本。每次发布附带校验和、Sigstore 签名包和 GitHub 构建溯源证明,签名前一律 fail-closed——未经验证的版本绝不会进入 stable 通道。

    升级同样简单:

    aos update          # 协调式产品升级(Homebrew 安装亦可)

    核心功能

    aos 命令速览
    • 统一的 aos CLI 与 HTTP API:一条命令管理一切——init / status / update / daemon / mcp / capsule build / doctor。命令边界清晰,产品自有实现与底层运行时无缝衔接。
    • 21 个官方 Capsule 组件:开箱即用的用户态构件,可被自由编排成 harness、meta-harness、connector 或服务。每个 capsule 以最小权限组合,能力粒度精细可控。
    • 一等公民的 MCP 支持aos mcp serve 是 Codex、Claude、Grok 共享的产品边缘入口。本地决策面在 macOS 提供 AppKit、Windows 提供原生对话框、Linux 使用 Pinentry——绝不收集密码与 URL
    • Forge 操作系统级构建工具:新智能体能检视运行中的系统、学习 capsule 模型、识别真实能力缺口,并用 Forge 构建验证最小权限 capsule。内置 meta-harness 技能教会智能体如何治理自己的世界。
    • 供应链安全与可验证发布:Sigstore 签名包 + GitHub 构建溯源证明 + runtime-compatibility.toml 锁定运行时/WIT 提交,fail-closed 策略确保只有经过完整验证的版本才能发布。

    典型使用场景

    场景一:多模型编码智能体的统一运行时

    你的团队同时使用 Codex、Claude Code 和 Grok 作为编程助手。通过 AOS 的 aos mcp serve,三个客户端共享同一套 MCP 工具链和审批策略,无需重复配置。每个智能体在隔离的 principal 下运行,操作员身份与目标环境分离——aos --principal operator init --target-principal alice 即可完成多租户置备。

    场景二:企业级智能体安全部署

    企业环境要求所有 AI 操作可审计、可回溯。AOS 的 Unicity Audit 能力配合 Sigstore 签名和 GitHub 构建溯源,让每个 capsule 的来源、权限边界、执行记录完全透明。aos doctor 可随时诊断运行态健康度,aos status --json 输出机器可读状态供 SIEM 集成。

    场景三:智能体自主扩展能力

    当现有 capsules 无法满足新需求时,智能体可以主动调用 Forge:检视当前系统 → 识别缺口 → 构建 capsule → 验证最小权限 → 注册到 harness。这形成了一个自进化的智能体操作系统——meta-harness 技能让智能体学会如何改进自己的世界模型。

    推荐理由

    AOS 解决了一个真正痛点:智能体缺乏像传统软件那样的操作系统级抽象。目前大多数 AI Agent 框架要么是 SDK 库(如 LangChain),要么是编排层(如 CrewAI),但它们都没有提供「进程管理、权限隔离、组件注册、供应链安全」这些 OS 级别的基础设施。

    AOS 用 Rust 从零构建了这套基础设施,Capsule 模型比 Docker 容器更轻量、比 npm 包更结构化。MCP 一等公民支持让它天然适配当前最热的 AI 互操作标准。加上 fail-closed 发布策略和 Unicity Audit,这在开源 AI 项目中是罕见的安全意识

    如果你正在构建生产级智能体系统,或者对 AI Agent 的工程化治理感兴趣,AOS 值得花一个周末深入体验。

    下载地址

  • aisuite:吴恩达开源的统一大模型调用库,一行代码切换 10+ 厂商

    aisuite:吴恩达开源的统一大模型调用库,一行代码切换 10+ 厂商

    aisuite 项目封面

    做 AI 应用的同学大概率都踩过同一个坑:今天想用 GPT-4o,明天想换 Claude,后天又想试试 Gemini,每换一家就得重写一整套 SDK 调用、参数映射、错误处理。吴恩达(Andrew Ng)团队开源的 aisuite,就是把这件事彻底变简单的那把钥匙——一套统一接口,调遍十余家大模型。

    项目简介

    aisuite 是一个轻量级 Python 库,提供两层能力:底层是跨厂商统一的 Chat Completions API,上层是带工具与 MCP 的 Agents API。它同时是桌面 AI 同事 OpenWorker 的底层基座。一句话概括:用一套 OpenAI 风格的接口,调用 OpenAI、Anthropic、Google 等所有主流大模型。

    安装要求和过程

    环境要求

    • Python 3.10 及以上
    • pip 包管理器
    • 对应厂商的 API Key(或本地运行 Ollama 免 Key)

    快速安装

    基础包(不含任何厂商 SDK):

    pip install aisuite

    按需安装指定厂商 SDK,或一次性装全:

    pip install 'aisuite[anthropic]'   # 仅 Anthropic SDK
    pip install 'aisuite[all]'         # 所有厂商 SDK

    配置 API Key(以环境变量为例):

    export OPENAI_API_KEY=sk-...
    export ANTHROPIC_API_KEY=sk-...

    一行调用示例——切换模型只改字符串:

    import aisuite as ai
    client = ai.Client()
    
    models = ["openai:gpt-4o", "anthropic:claude-3-5-sonnet-20240620"]
    messages = [
        {"role": "system", "content": "用海盗英语回答。"},
        {"role": "user", "content": "讲个笑话。"},
    ]
    for model in models:
        resp = client.chat.completions.create(
            model=model, messages=messages, temperature=0.75)
        print(resp.choices[0].message.content)

    核心功能

    aisuite 核心能力

    1. 统一 Chat Completions API:provider-agnostic 的 OpenAI 风格接口,模型名采用 <provider>:<model-name> 格式,aisuite 自动路由到正确的厂商与参数,切换模型只需改一个字符串。
    2. Agents API + Toolkits:把普通 Python 函数直接当工具,自动生成 schema、执行调用并回传结果;内置 files / git / shell 沙箱工具包;提供工具策略(审批、黑白名单)与状态持久化(内存 / 文件 / Postgres)。
    3. 原生 MCP 支持pip install 'aisuite[mcp]' 后,任意 MCP Server 的工具都能直接交给模型,无需胶水代码。
    4. 流式与异步stream=True 跨厂商统一分块输出,acreate 提供异步变体,工具调用同样可流式处理。
    5. 可扩展 Provider 适配器:按命名约定实现 <provider>_provider.py + <Provider>Provider 类即可被自动发现加载,轻松接入新厂商。

    支持的模型厂商

    aisuite 支持的模型厂商

    典型使用场景

    1. 多模型横向对比 / A/B 评测:同一段业务逻辑只改 model 字符串,就能对比 GPT-4o、Claude、Gemini 的输出质量与成本,非常适合做模型选型与回归测试。
    2. 本地优先 + 多云的 Agent 应用:aisuite 是 OpenWorker 的基座,可接入 Ollama 完全本地运行(数据不出本机),也能在云端多厂商间灵活切换,兼顾合规与弹性。
    3. 快速挂载 MCP 工具做文件 / 代码操作:一行声明 filesystem MCP,即可让模型列举目录、读写文件、执行 git 命令,省去繁琐的适配代码。

    推荐理由

    我个人非常看重 aisuite 解决的一个真实痛点:厂商锁定。在真实项目里,模型能力此消彼长,今天这家强、明天那家反超,aisuite 让你把”换模型”从”改一堆 SDK 代码”降级成”改一个字符串”,产品的可移植性直接拉满。

    它不只是简单的接口封装:Agents API 把工具调用、MCP、工具策略、状态持久化收敛到一套统一范式里,意味着你写一次 Agent,就能在多家模型间稳健落地;底层还能私有化(Ollama)满足数据合规需求。MIT 协议商用友好,对创业团队和个人开发者都很友好,强烈建议作为 AI 应用的默认底座。

    下载地址

    项目数据:★16.1K · 1.7K Fork · Python · MIT · 创建于 2024-06,最近更新 2026-07。

  • img2threejs:把参考图重建为代码级 Three.js 模型的 AI 工作流(10,323★)

    img2threejs:把参考图重建为代码级 Three.js 模型的 AI 工作流(10,323★)

    项目简介

    img2threejs 是一个 AI 驱动的图像→Three.js 代码重建工作流。给一张参考图,它不会输出 OBJ/GLTF 网格或贴图,而是生成由基元几何体、程序化材质组成的 TypeScript 工厂函数 createObjectModel(),返回一个可直接在浏览器运行、可动画化的 THREE.Group。项目核心理念是“代码即模型”:结果可读、可 diff、可版本控制,而非几兆的静态网格文件。

    img2threejs 核心亮点

    安装要求与快速开始

    环境要求

    • Python 3.10+(纯标准库,无需 pip 安装)
    • Claude Code / Codex / OpenCode(作为 skill 调用)或任意终端
    • Three.js 运行时(浏览器即可)

    作为 Claude Code Skill 使用

    1. 克隆到 skills 目录:
    git clone https://github.com/img2threejs/img2threejs.git ~/.claude/skills/img2threejs
    1. 贴入参考图,在对话中运行:
    /img2threejs Rebuild this object as a Three.js model, keep the proportions, angles, and colours.

    独立脚本模式(零依赖)

    python3 forge/stage1_intake/probe_image.py <image>
    python3 forge/stage2_spec/new_pre_spec_assessment.py "Name" --image <image> --out assessment.json
    python3 forge/stage2_spec/new_sculpt_spec.py "Name" --image <image> --assessment assessment.json --out spec.json
    python3 forge/stage2_spec/validate_sculpt_spec.py spec.json --strict-quality
    python3 forge/stage3_build/generate_threejs_factory.py spec.json --out src/createObjectModel.ts

    所有脚本仅使用 Python 标准库,没有 PIL、numpy、Playwright 等依赖。

    核心功能

    • 代码即模型(Reconstruction-by-Code):用 Three.js 基元 + 程序化着色器生成工厂代码,而非摄影测量或网格提取。
    • 八阶段雕刻流水线blockout → structural → form → material → surface → lighting → interaction → optimization,每阶段生成后视觉评审,不达标则返回修正。
    • 严格质量门控--strict-quality 在写第一行 Three.js 代码前拦截规格不足的浅请求,避免浪费 token。
    • 极致 Token 高效:Python 标准库脚本负责校验、门控、规格生成和比对打包;模型只做一件事——看“参考图 vs 渲染图”对照表并判定通过/打回。
    • Agent 无关:在 Claude Code、Codex、OpenCode 中都能作为 skill 运行,也提供独立终端脚本。
    • 动画就绪 + 多主题:输出暴露 pivots、sockets、userData.tick,支持硬表面物体、人形角色、四足/禽类/飞龙/蛇形生物以及 CS2 武器家族。

    img2threejs 八阶段雕刻流水线

    典型使用场景

    • 游戏/3D 资产快速原型:给一张枪械、载具或道具参考图,直接拿到能在浏览器里跑、可交互的 Three.js 模型。
    • AI 编码助手工作流:作为 skill 嵌入 Claude Code / Codex,贴图即可在对话中完成“重建为代码”,省掉 Blender 建模或网格下载。
    • 教学与可视化演示:官方 Live Demo Gallery 展示了从 Glock-18、BMX 自行车到哆啦A梦房子的纯代码重建案例。

    推荐理由

    img2threejs 的“重建为代码”思路非常克制而实用:把机械重复工作交给纯标准库 Python,把真正的视觉判断留给大模型,从而在 LLM agent 循环中保持 token 高效。八阶段门控设计让输出可预期,README 也诚实地声明了限制——单图无法保证隐藏面精度,硬表面强、角色偏风格化。今天(2026-08-09)仍活跃推送,v1.4.4 正朝 v1.5 角色重建更新。适合已经使用 Claude Code / Codex 的开发者扩展自己的 AI 工作流。

    下载地址

  • OpenWorker:吴恩达开源的本地优先 AI 同事,交付「已完成的工作」而非聊天

    OpenWorker:吴恩达开源的本地优先 AI 同事,交付「已完成的工作」而非聊天

    OpenWorker 品牌图

    OpenWorker 是深度学习之父吴恩达(Andrew Ng)开源的一款”本地优先”的 AI 同事(AI coworker)桌面应用。它不只想跟你聊天,而是要跨文件、终端和 25+ 应用连接器,真正把一件日常任务做完——交付一份排版好的文档、一条带数据的 Slack 回复、一份更新好的日历,或一个分诊完毕的收件箱。它运行在你的机器上,不锁定任何模型,用自己的 API Key(OpenAI / Anthropic / Google / 开源权重)或本地 Ollama 即可驱动。

    🖼️ 它是怎么工作的

    OpenWorker 工作原理

    桌面应用外壳(原生 GUI + Tauri)之下,是一套本地运行的 Python Agent 服务:引擎、工具、连接器都构建在吴恩达自己的 aisuite 之上;你的文件、终端、25+ 连接器与任意模型提供商,全部在你的机器上、用你的密钥运转。

    📦 安装要求和过程

    方式一:直接下载安装包(推荐)

    • macOS(Apple Silicon,12+):已签名公证、自动更新 → download.openworker.com/mac
    • Windows 10/11(x64):构建尚未代码签名,SmartScreen 会警告(签名进行中)→ download.openworker.com/windows
    • 打开应用 → 添加模型 Key(或指向 Ollama)→ 直接提出一个真实需求即可。

    方式二:从源码构建

    前置环境:Python 3.10+Node 20+,以及(桌面壳)通过 rustup 安装的 Rust 工具链。

    git clone https://github.com/andrewyng/openworker
    cd openworker
    
    # 1. 一次性引导,创建 Python venv(Windows 用 Git Bash / WSL)
    bash packaging/setup_dev_env.sh
    
    # 2. 启动本地 Agent 服务
    .venv/bin/openworker-server --cwd ~/some/project --port 8765
    #    Windows: .venv\Scripts\openworker-server.exe
    
    # 3. 另一个终端启动 UI
    cd surfaces/gui
    npm install
    npm run dev        # 浏览器 UI(Vite 端口)
    
    # 想跑完整桌面应用: npm run tauri dev

    ✨ 核心功能

    OpenWorker 核心亮点

    • 交付真实成果:文档、表格、报告、网页直接落地为可打开、可分享的文件,而不是一堆待办清单。
    • 25+ 应用连接器:GitHub、Slack、Jira、Notion、Linear、HubSpot、Outlook、monday.com、Gmail、Google Calendar,加上你的终端与本地文件;任何可通过 MCP 接入的工具都能插进来,并按工具粒度授权。
    • 自带模型密钥(BYOK):OpenAI、Anthropic、Gemini、Inkling、GLM、DeepSeek、Kimi、Qwen、MiniMax、Mistral、Grok,以及通过 Together / Fireworks 的开源权重模型,和 Ollama 本地模型;自带经工具调用验证的推荐清单。
    • 行动前先确认:写文件、发消息、执行命令都走审批门控;无人值守运行会把待办”问询”暂存到收件箱,绝不擅自行动。隐私本地优先——agent 循环、对话、连接器令牌、模型 Key 都留在本地密钥库。
    • 定时自动化:晨报、周报、频道值守等周期性任务按计划运行,结果带完整转录落回应用。

    🎯 典型使用场景

    1. Slack 里 @OpenWorker:在频道提及它,桌面自动开一个会话,用你的工具把活干完,答案作为线程回复回到频道。
    2. “准备一份客户简报””理清我的日历””跨 Jira 和 GitHub 看看发布进展到哪了”——它把任务拆成步骤,跨桌面、文件和已连接应用推进,重要动作前先与你确认。
    3. 定时晨报 / 周报:把重复性工作面交给自动化,每天/每周固定产出带完整记录的交付物。

    💡 推荐理由

    吴恩达出品,天然带着”让 AI 真正替你把事做完“的产品哲学。最打动我的是三点:一是本地优先 + 自带模型密钥,数据只通过你选定的模型和集成离开本机,隐私可控;二是“行动前确认”的克制设计,把 AI 代理从”话痨”拉回到”靠谱同事”;三是底层基于他自己的 aisuite(统一多模型 + Agent/MCP 层),想自己搭 Agent harness 的人也能拿它当参考实现。目前处于开放 Beta:可用、会自动更新、社区活跃,适合想把日常办公流程交给 AI 自动化、又不想把数据锁进某家云端的朋友尝鲜。

    🔗 下载地址

  • Codex Security:OpenAI 开源的 AI 代码安全审计工具(CLI + SDK)

    Codex Security:OpenAI 开源的 AI 代码安全审计工具(CLI + SDK)

    代码安全审计,正在从传统 SAST 工具的”正则匹配”走向 Agent 式的”语义理解”。OpenAI 刚开源的 Codex Security,就是这一方向的代表作——它把”发现、验证、修复漏洞”三件事,打包成一个 CLI 与 TypeScript SDK,让 AI 真正读懂你的代码。

    📌 项目简介

    Codex Security 是 OpenAI 推出的 AI 安全审计工具(CLI + TypeScript SDK),能在你的代码库中发现、验证并修复安全漏洞,把代码安全从”工具扫描”升级为”智能体审计”。

    💻 安装要求与过程

    环境要求

    • Node.js 22.13.0+(22.x 发布线)、24.x 或 26.x
    • Python 3.10 及以上
    • 可用的 Codex Security 访问权限(ChatGPT 登录或 API Key;部分安全请求需通过 Trusted Access for Cyber 审批)
    • npm 环境(用于安装与运行)

    快速安装

    # 1. 安装(本地或全局)
    npm install @openai/codex-security
    
    # 2. 登录 OpenAI / ChatGPT 账号
    npx @openai/codex-security login
    
    # 3. 扫描当前目录
    npx @openai/codex-security scan .
    
    # 4. 高精度深度扫描
    npx @openai/codex-security scan . --model gpt-5.6-terra --effort high

    在 CI 中无需登录,直接注入环境变量即可:OPENAI_API_KEYCODEX_API_KEY,密钥仅用于本次扫描,不会写入凭证目录。

    ✨ 核心功能

    Codex Security 核心能力

    1. 发现 · 验证 · 修复三合一:不止于”扫出告警”,更能跨文件理解语义、定位漏洞根因,并给出可直接落地的修复建议。
    2. CLI + TypeScript SDK 双形态:命令行随手扫描,SDK 可嵌入自有平台、工单系统与安全中台,安全能力随取随用。
    3. 深度扫描 / 多智能体并行--mode deep 下多 worker、subagent 并行深挖调用链,复杂漏洞也不放过。
    4. 多推理提供商自由切换:OpenAI / OpenRouter / Fireworks / Amazon Bedrock,模型与厂商不再被锁定。
    5. 扫描对比 scans compare:按根因智能匹配历次结果,清晰追踪”已解决 / 新增 / 复现 / 未知”的漏洞。

    🎯 典型使用场景

    • 开发者本地自检:提交前跑一句 npx @openai/codex-security scan .,把高危漏洞挡在合入之前,比事后救火省心得多。
    • CI/CD 安全门禁:在流水线中用环境变量注入 API Key 自动扫描,配合 --auth api-key 做非交互式审计,高危漏洞直接阻断合入。
    • 安全团队批量审计:用官方镜像 + Docker Compose 对多个仓库(锁定到不可变 Git revision)做可断点续扫,再用 scans compare 跟踪修复效果。

    💡 推荐理由

    我用过不少 SAST 工具,最大的痛点是”告警一堆、误报一堆、修复靠自己”。Codex Security 的聪明之处在于它把漏洞审计做成了Agent 式工作流:能理解业务语义、跨文件追踪根因、直接给修复方案,SDK 形态又方便嵌进自己的平台。多提供商支持则避免了被单一模型绑定——对注重供应链安全与自主可控的团队尤其友好。

    📥 下载地址

    本文数据来自 GitHub 公开 API(统计于 2026-08-06)。

  • LiveKit Agents:用 Python 构建实时语音 AI 智能体的开源框架

    LiveKit Agents:用 Python 构建实时语音 AI 智能体的开源框架

    在语音助手、AI 客服、实时翻译早已不是新鲜事的今天,真正难的是:如何用一个干净、可编排、可私有部署的框架,把 STT、LLM、TTS 串成一次低延迟、不打断、能“看见”的实时对话。LiveKit Agents 正是为这件事而生。

    📌 项目简介

    LiveKit Agents 是一个用于构建实时、可编程的多模态语音 AI 智能体的开源框架,运行在服务器端,让智能体具备“看、听、理解”的能力。它把语音识别(STT)、大模型(LLM)、语音合成(TTS)以及实时模型(Realtime API)抽象成可自由替换的组件,并提供任务调度、工具调用、测试框架等一整套生产级能力。

    💻 安装要求与过程

    环境要求

    • Python 3.9+
    • 一个 LiveKit 服务器:可用 LiveKit Cloud,也可用开源的 livekit 自托管
    • 至少一家模型服务商的密钥:如 Deepgram(STT)、OpenAI / Google(LLM)、Cartesia(TTS)等
    • 如需电话接入,可启用 LiveKit 的 SIP / 电话栈

    快速安装

    pip install "livekit-agents[openai,deepgram,cartesia]"

    三种运行模式

    # 终端本地测试:无需外部服务器,直接验证交互
    python myagent.py console
    
    # 开发模式:连接 LiveKit 云/自托管,支持热重载
    python myagent.py dev
    
    # 生产部署:生产级优化
    python myagent.py start

    开发 / 生产模式需配置环境变量:LIVEKIT_URLLIVEKIT_API_KEYLIVEKIT_API_SECRET(以及对应模型服务商的 Key)。也可用 Agents Playground 快速体验。

    ✨ 核心功能

    • 灵活集成:完整的插件生态,自由混搭最合适的 STT、LLM、TTS 与 Realtime API。
    • 内置任务调度:通过 Dispatch API 自动做任务分配与分发,把终端用户连接到对应智能体。
    • 语义轮流检测(Turn Detection):用 Transformer 模型判断用户是否说完,显著降低误打断。
    • 原生 MCP 支持:一行代码即可把 MCP 服务器提供的工具接入智能体。
    • 内置测试框架:用断言(expect)配合 LLM 评判(judge)编写测试,对抗 LLM 的非确定性。
    • 全平台 WebRTC 客户端 + 电话集成:覆盖浏览器、iOS、Android、Flutter 等,并可拨打 / 接听电话。

    🎯 典型使用场景

    • 语音客服 / 订餐机器人:内置 restaurant_agent 范例,可处理来电订餐与预约,直接对接电话线路。
    • 外呼电话机器人:Outbound Caller 范例可自动批量拨打电话、播报与收集信息。
    • 多智能体接力(Handoff):多个 Agent 按流程交接(如先收集信息、再切换讲故事 Agent),适合工单分流、复杂客服。
    • 视频数字人:通过 Tavus、Bithuman、LemonSlice 等接入 AI 虚拟形象,做出“能说话的脸”。
    • 实时视觉 Agent:结合 Gemini Live 等,做出能“看见”环境并对话的助手(含 iOS 端范例)。

    💡 推荐理由

    我自己折腾过不少语音 Agent 方案,LiveKit Agents 最打动我的是它的“把复杂留给自己、把简单交给开发者”:一个 AgentSession 把你想要的 STT/LLM/TTS 一行声明完,多智能体切换、工具调用、打断检测都有官方最佳实践兜底;更关键的是整套栈可私有化——连媒体服务器都是开源的,数据不出自己的机房,对企业场景非常友好。再加上官方提供的 LiveKit Docs MCPAgent Skill,用 AI 编程助手来搭语音应用也顺手很多。如果你打算认真做一个“能听会说”的产品,它值得作为底座首选。

    🔗 下载地址

    LiveKit Agents 核心亮点

  • TRELLIS.2:微软开源 4B 参数图像到 3D 生成模型,3 秒生成高保真纹理资产

    TRELLIS.2:微软开源 4B 参数图像到 3D 生成模型,3 秒生成高保真纹理资产

    TRELLIS.2

    项目简介

    TRELLIS.2 是微软研究院开源的 4B 参数大规模 3D 生成模型,专注于图像到 3D(image-to-3D)资产生成。它抛弃了传统等值面场的限制,提出一种名为 O-Voxel 的“无场”稀疏体素结构,能够原生重建和生成具有复杂拓扑、锐利细节以及完整 PBR 材质的 3D 模型。

    安装要求和过程

    目前官方仅验证过 Linux 环境,GPU 显存至少 24GB(推荐 A100 / H100),需要 CUDA 12.4 和 Conda。

    1. 克隆仓库:
      git clone -b main https://github.com/microsoft/TRELLIS.2.git --recursive
      cd TRELLIS.2
    2. 创建 conda 环境并安装依赖:
      . ./setup.sh --new-env --basic --flash-attn --nvdiffrast --nvdiffrec --cumesh --o-voxel --flexgemm
    3. 从 Hugging Face 下载 4B 预训练权重:
      https://huggingface.co/microsoft/TRELLIS.2-4B

    核心功能

    • 高保真生成:40 亿参数 DiT 模型 + 16× 下采样稀疏 3D VAE,可直接生成 512³ 到 1536³ 分辨率的带纹理 3D 资产。
    • O-Voxel 拓扑自由:原生支持开放曲面、非流形几何和内部封闭结构,无需像传统 NeRF/SDF 那样进行有损转换。
    • PBR 材质建模:不仅生成基础色,还输出 Roughness、Metallic、Opacity 等属性,支持透明与真实感渲染。
    • 极简后处理:纹理网格转 O-Voxel 单 CPU <10 秒,O-Voxel 转纹理网格在 CUDA 上 <100 毫秒。
    • 完整训练代码:开源 SC-VAE、形状/纹理 Flow Model 训练脚本,可用 Objaverse-XL 等数据从头训练或微调。

    TRELLIS.2 核心特性

    典型使用场景

    • 游戏/影视资产快速出稿:原画师只需提供一张概念图,即可在数秒内获得带 PBR 材质的可用 3D 模型,大幅缩短原型迭代周期。
    • 电商/虚拟展示:把产品照片自动转换为可旋转的 GLB 3D 资产,用于网页 AR、虚拟展厅和商品详情页。
    • 3D 内容创作者工具链:结合 ComfyUI、Blender 等工具,将 TRELLIS.2 作为 AI 建模节点,批量生成风格化道具和场景元素。

    推荐理由

    TRELLIS.2 给我的最大惊喜是“快”和“全”:快在 H100 上 3 秒就能跑出 512³ 的高质量模型;全在从模型权重到训练代码全部开源,还配有 Hugging Face Demo。相比之前很多只能生成封闭几何体的方案,它对开放曲面、衣物、叶片等复杂拓扑的处理明显更稳。对于想要在本地做 3D AIGC 的同学来说,这是目前最值得入手的工程基座之一。

    下载地址

  • GitHub Copilot SDK:一套 Agent 运行时,六种语言官方 SDK

    GitHub Copilot SDK:一套 Agent 运行时,六种语言官方 SDK

    GitHub Copilot SDK

    项目简介

    GitHub Copilot SDK 是 GitHub 官方发布的多平台 Agent 运行时 SDK,让你在自己的应用中嵌入 Copilot CLI 的完整智能体引擎。支持 TypeScript、Python、Go、.NET(C#)、Java、Rust 六种语言,通过 JSON-RPC 与 Copilot CLI server 模式通信,SDK 自动管理进程生命周期——你只需定义 Agent 行为,Copilot 负责规划、工具调用和文件编辑。

    一句话:把 Copilot CLI 的 Agent 能力,以 SDK 形式嵌入任何应用。

    六语言SDK速览

    安装要求与过程

    环境要求

    • Node.js / TypeScript:Node.js ^20.19.0 或 ≥22.12.0
    • Python:Python 3.11+
    • .NET:.NET 8+ SDK
    • Go / Rust / Java:对应语言工具链 + 需额外安装 Copilot CLI
    • 认证:GitHub Copilot 订阅,或 BYOK 自带模型 API Key

    快速安装

    # Node.js / TypeScript
    npm install @github/copilot-sdk
    
    # Python
    pip install github-copilot-sdk
    python -m copilot download-runtime   # 下载运行时二进制
    
    # .NET
    dotnet add package GitHub.Copilot.SDK
    
    # Go
    go get github.com/github/copilot-sdk/go
    
    # Rust
    cargo add github-copilot-sdk
    
    # Java (Maven)
    <dependency>
      <groupId>com.github</groupId>
      <artifactId>copilot-sdk-java</artifactId>
    </dependency>

    Python 快速上手示例

    import asyncio
    from copilot import CopilotClient
    from copilot.session_events import AssistantMessageData, SessionIdleData
    from copilot.session import PermissionHandler
    
    async def main():
        async with CopilotClient() as client:
            async with await client.create_session(
                on_permission_request=PermissionHandler.approve_all,
                model="gpt-5",
            ) as session:
                done = asyncio.Event()
                def on_event(event):
                    match event.data:
                        case AssistantMessageData() as data:
                            print(data.content)
                        case SessionIdleData():
                            done.set()
                session.on(on_event)
                await session.send("What is 2+2?")
                await done.wait()
    
    asyncio.run(main())

    核心功能

    1. 六语言官方 SDK:TypeScript/Python/Go/.NET/Java/Rust 全部由 GitHub 官方维护,统一 API 设计,语义化版本管理(GA 状态)。
    2. Agent Loop 完整循环:内置完整的工具调用循环(Tool Use Loop),自动处理回合(Turn)与完成信号,无需自建编排层。
    3. Hooks 拦截机制:可在工具调用前后拦截、改写结果、处理错误——实现权限控制、日志审计、输出过滤等中间件逻辑。
    4. Custom Agents + Fleet Mode:定义带独立工具集和指令的子智能体;Fleet Mode 支持并行派发多个子智能体处理大型独立任务流。
    5. MCP Servers 集成:原生接入 Model Context Protocol 服务器,扩展外部工具能力;同时支持 Skills 提示词模块与 Plugin Directories 插件打包。
    6. 40+ Streaming Events:实时订阅会话事件流(assistant.message、tool.call、session.idle 等),构建响应式 UI。
    架构与核心能力

    典型使用场景

    场景一:IDE 插件内嵌 AI 编程助手

    在 VS Code / JetBrains 插件中集成 Copilot Agent,用户选中代码后调用 SDK 发起对话,Agent 自动读取文件上下文、执行重构建议、直接编辑文件。相比自己对接 LLM API + 构建工具链,SDK 已封装好文件读写、终端命令、Git 操作等全套工具。

    场景二:CI/CD 流水线中的自动化 Review Bot

    在 GitHub Actions 中用 Python SDK 启动 Copilot Session,将 PR diff 作为输入发送给 Agent,让它分析变更影响、生成 review 评论。通过 Hooks 可限制 Agent 只读不写,确保安全可控。

    场景三:SaaS 产品中的 AI 功能模块

    在 Web 后端通过 TypeScript SDK 创建带预算限制的 Session(Session Limits),为每个用户分配 AI Credits 配额。结合 Remote Sessions 功能,让用户在浏览器中实时看到 Agent 工作过程。BYOK 模式下可使用自有模型 Key,降低运营成本。

    推荐理由

    作为 GitHub 官方出品,Copilot SDK 的最大优势是「不用重复造轮子」。过去要在应用里嵌入 AI Agent 能力,你需要自己处理模型选择、提示词模板、工具定义、权限控制、错误恢复……现在这些全部由 Copilot CLI 引擎托管,SDK 只暴露简洁的 Session API。

    六种语言的覆盖面也令人印象深刻——从脚本到企业级后端,从前端到系统编程,几乎覆盖了主流开发栈。特别是 Python 和 TypeScript SDK 内置了 CLI 二进制,开箱即用体验非常顺滑。

    当然,它需要 Copilot 订阅或 BYOK 配置,不是完全免费的方案。但考虑到它提供的生产级 Agent 运行时能力,这个成本是合理的。如果你正在评估「如何在产品中加入 AI Agent 能力」,Copilot SDK 值得作为首选方案之一认真试用。

    下载地址

  • Claude Cookbooks:Anthropic 官方维护的 Claude 实战范例集(50K+ Stars)

    Claude Cookbooks:Anthropic 官方维护的 Claude 实战范例集(50K+ Stars)

    Claude Cookbooks

    Claude Cookbooks 是 Anthropic 官方在 GitHub 上开源维护的 Jupyter Notebook 范例集,已收获 50.4K+ Stars5.9K+ Forks,MIT 许可证。它像一本持续更新的”Claude 实战菜谱”,用可以直接复制运行的代码片段,手把手教开发者把 Claude API 用到生产里——覆盖文本分类、RAG、工具调用、Agent SDK、Skills、多模态、扩展思考、第三方集成等几乎所有主流场景。

    无论是刚接触 Claude API 的新手,还是要把 Claude 嵌入自家产品的资深工程师,都能在这里找到即拿即用的最佳实践。所有 Notebook 都用 Python 写成,但概念同样适用于任何支持 Claude API 的语言。

    Claude Cookbooks 内容地图

    为什么需要它?

    很多人第一次调用 Claude API 只能写出”问个问题拿个回答”的脚本——但生产里要面对的是:结构化输出、上下文管理、长文档解析、Agent 工作流、RAG 检索、工具调用循环、子智能体拆分…这些工程化能力的最佳范式,往往不是 API 文档里那几段示例能覆盖的。Cookbooks 正是 Anthropic 工程师团队把生产经验沉淀下来的”答案库”。

    安装要求和过程

    环境要求

    • Python 3.10+(项目用 uv 管理依赖)
    • Jupyter Lab / VS Code Jupyter 扩展
    • 一个 Anthropic API Key(前往 anthropic.com 免费注册)

    快速安装

    # 1. 克隆仓库
    git clone https://github.com/anthropics/claude-cookbooks.git
    cd claude-cookbooks
    
    # 2. 安装依赖(项目使用 uv,也可用 pip)
    pip install -r requirements-dev.txt
    # 或:uv sync
    
    # 3. 配置密钥
    cp .env.example .env
    # 编辑 .env 填入你的 ANTHROPIC_API_KEY
    
    # 4. 启动 Jupyter
    jupyter lab

    三步快速上手

    核心功能

    1. 基础能力 Recipes

    capabilities/ 目录里包含文本分类、RAG 检索增强、长文摘要、结构化 JSON 输出四大基础用法。每个 Recipe 都配了独立 Notebook,从最小调用示例一路演化到生产级实现。

    2. 工具调用与函数集成

    tool_use/ 演示了 Claude 如何调用外部工具——从最简单的计算器、SQL 查询,到完整的多步骤客服智能体。这是把 Claude 从”聊天机器人”升级成”可执行 Agent”的关键能力。

    3. Claude Agent SDK

    claude_agent_sdk/ 是新近加入的官方 Agent SDK 范例,示范如何用 Python SDK 构建可独立运行的智能体应用、调度工具、规划子任务。

    4. Agent Skills 技能系统

    skills/ 目录展示如何为 Claude 编写模块化技能——把专业能力封装成可复用的 Skills,让 Agent 在不同场景下按需调用。

    5. 多模态能力

    multimodal/ 覆盖图像理解、图表解读、表单/PDF 内容提取、视觉最佳实践等,配合 Claude 强大的视觉模型可直接处理扫描件、合同、PPT。

    6. 扩展思考与设计模式

    extended_thinking/patterns/ 深入推理模式、子智能体协作、提示词缓存、评估驱动开发(Eval-Driven Development)等高阶范式。

    7. 第三方集成

    third_party/ 给出Pinecone 向量数据库、Wikipedia、VoyageAI Embeddings等流行服务的对接范例,把 Claude 嵌入现有技术栈成本极低。

    8. 微调与可观测性

    finetuning/observability/ 提供模型微调生产链路观测的端到端代码,是把 Claude 部署到线上服务的最后一块拼图。

    典型使用场景

    场景 1:快速搭建企业知识库 RAG

    复制 capabilities/retrieval_augmented_generationthird_party/Pinecone 两个 Notebook,半天就能搭起一个基于 Pinecone + Claude 的企业知识问答系统。Notebook 里连如何切分文档、嵌入、检索、重排序、生成都一步步跑通。

    场景 2:构建带工具调用的客服 Agent

    参考 tool_use/customer_service_agent.ipynb 的代码结构,把你的订单查询 API、退款流程、商品库存接口注册成 Claude 可调用的工具,立即得到一个能回答”我的订单到哪了”的多轮 Agent。

    场景 3:批量处理 PDF/扫描件

    multimodal/ 里的 PDF 解析与表单提取 Recipe,配合 Claude 视觉模型,搭建合同关键条款抽取、发票识别、报告摘要等自动化工作流。

    场景 4:评估驱动的提示词迭代

    misc/building_evals.ipynb 给出用 Claude 自身来评估另一批 Claude 输出质量的工程范式——适合团队协作打磨生产级 Prompt,让提示词的优化变成可量化、可回归的过程。

    推荐理由

    用 Cookbooks 这半年,最大的感受是:它不是”玩具示例”,而是真正从生产里长出来的代码

    • 覆盖全面:从基础调用到 Agent SDK,从 RAG 到微调,几乎所有 Claude 应用方向都有现成 Recipe,避免重复造轮子。
    • 持续更新:紧跟 Anthropic 的功能发布(比如 Claude 4 系列、扩展思考、Agent SDK、Skills 都是最近几个月加入的新章节)。
    • 可读性极强:每个 Notebook 都是”一段说明 + 一段代码 + 一段输出”的节奏,能当教程读,也能当模板抄。
    • 社区友好:MIT 许可,欢迎提 PR;CLAUDE.md 里甚至写了让 Claude 帮忙做贡献的指南(meta!)
    • 企业可商用:MIT 协议允许商业使用,没有 Apache-2.0 那种专利条款的顾虑。

    对国内开发者来说,唯一需要注意的是 Anthropic API 的访问渠道——可以走官方、AWS Bedrock、Vertex AI 或合规中转服务。模型本身支持中文,是 Claude 进军中文 AI 应用开发的官方”最佳实践手册”。

    下载地址

    用 Cookbook 抄答案,把 Claude 真正用进生产——这可能是 2026 年最值得收藏的 AI 工程仓库之一。