标签: AI开源项目

  • PPT Master:AI 把文档一键变成真正可编辑的原生 PowerPoint

    PPT Master:AI 把文档一键变成真正可编辑的原生 PowerPoint

    PPT Master 示例:Global AI Capital 2026 数据新闻风 deck

    示例:用 PPT Master 一键生成的《Global AI Capital 2026》数据新闻风演示(Bloomberg 风格深色仪表盘,图表驱动)

    项目简介

    PPT Master 是 Hugo He 开源的一个 AI 工作流,它运行在任意具备 Agent 能力的 AI 工具(Claude / GPT / Gemini / Kimi 等)中,把你的文档或主题直接生成真正可在 PowerPoint 里继续编辑的原生演示文稿——不只是「可编辑」,而是拥有原生形状、图表、表格、母版与过渡动画的完整 PPT 对象模型。当前 GitHub 45.4K★、MIT 许可、Python 实现。

    安装要求与快速开始

    环境要求:只需手动安装 Python 3.10+(唯一需要的环境);一个具备 Agent 能力的 AI 工具(官方推荐 Claude Code,也可用 Cursor、Codex CLI、Gemini CLI 等);可选:AI 生图(如 gpt-image-2)与联网搜图所需的 API Key。数据全程本地,无订阅、无平台锁定。

    快速安装:

    git clone https://github.com/hugohe3/ppt-master.git
    cd ppt-master
    pip install -r requirements.txt

    在该目录下打开你的 AI Agent,把材料放进 projects/ 目录,对它说「用 projects/xxx.pdf 做个 PPT」即可。Windows 用户可参考官方《Windows 安装指南》,10 分钟从零到成片。模型推荐大上下文窗口的 Kimi K3 或 Claude,配合 gpt-image-2 生图质量最佳。

    核心功能

    • 原生 PowerPoint 对象模型:输出真正的 slide master、原生形状与连接器、文本框,点击任意元素都能当作原生 PPT 对象继续修改,而不是扁平图片或套模板。
    • 数据驱动的图表与表格:可导出为真实的 PowerPoint Chart / Table 对象,支持「编辑数据」与对象级控制,跨应用视觉一致。
    • 跑在任意 AI Agent 里:Claude、GPT、Gemini、Kimi 均可驱动,无平台锁定;免费开源,成本只有模型调用费。
    • 数据留在本地:除与大模型通信外,整条流水线都在本机运行。
    • 复用你的模板 + 旁白/动画:可填充现有 .pptx 保留原设计,支持演讲者备注转语音旁白,甚至生成自动讲解视频。

    PPT Master 核心亮点

    典型使用场景

    • 从资料直接出片:把一沓 PDF / DOCX / 网页丢进去,让 AI 先梳理论点结构再做视觉设计,输出包含数据图表的完整 deck。
    • 套用公司模板:把已有的品牌 .pptx 交给它,只填新内容、保留原设计,导出你选中的页面。
    • 给成片加旁白:对做好的 deck 追加原生过渡、动画与语音旁白,直接生成可自动播放讲解的演示。

    推荐理由

    作者 Hugo He 是一位金融从业者(CPA·CPV·咨询工程师),他做这个工具的初衷很朴素:市面上的「AI 做 PPT」大多把幻灯片拍扁成图片或硬套模板,二次编辑体验很差;他想要的是在 PowerPoint 里依然能改的原生成品。这与我的痛点高度一致——「可编辑」早已是标配,真正的分水岭是「原生深度」。PPT Master 的方向就是持续向 PowerPoint 本身收敛,一个版本一个版本补上更多原生能力。

    作为日常生产力工具,它最打动我的是三点:免费开源、数据本地、无平台锁定——你不必把资料上交某个云平台,就能把最枯燥的排版活交给 AI。建议搭配大上下文模型(Kimi K3 / Claude)+ gpt-image-2 生图,质量最好;便宜模型也能跑,只是留给你的润色活更多。它不是「许愿池」,但能替你卸掉大部分重复劳动。

    下载地址

  • AOS Community Edition:开源智能体操作系统,让 AI Agent 拥有自己的 OS

    AOS Community Edition:开源智能体操作系统,让 AI Agent 拥有自己的 OS

    AOS 核心亮点

    项目简介

    AOS Community Edition 是 Unicity 团队开源的「智能体操作系统」(Agent Operating System),为需要可检视、可组合环境的 AI 智能体提供完整的运行时基础设施。它包含 aos CLI 命令行、HTTP API、21 个官方 Capsule 组件、MCP 边缘入口以及 Unicity Audit 安全审计能力,全部以 Rust 编写并采用 MIT/Apache-2.0 双许可发布。

    安装要求与快速开始

    AOS 支持主流 Unix 系统(macOS / Linux)和 Windows。安装只需两步:

    # 1. 安装 aos CLI(含固定运行时和 21 个 CE capsule)
    curl --proto '=https' --tlsv1.2 -fsSL https://aos.unicity.ai/install.sh | sh
    
    # 2. 初始化工作区(从本地版本化资产置备 ~/.aos)
    aos init

    安装器会自动下载并锁定精确的运行时版本。每次发布附带校验和、Sigstore 签名包和 GitHub 构建溯源证明,签名前一律 fail-closed——未经验证的版本绝不会进入 stable 通道。

    升级同样简单:

    aos update          # 协调式产品升级(Homebrew 安装亦可)

    核心功能

    aos 命令速览
    • 统一的 aos CLI 与 HTTP API:一条命令管理一切——init / status / update / daemon / mcp / capsule build / doctor。命令边界清晰,产品自有实现与底层运行时无缝衔接。
    • 21 个官方 Capsule 组件:开箱即用的用户态构件,可被自由编排成 harness、meta-harness、connector 或服务。每个 capsule 以最小权限组合,能力粒度精细可控。
    • 一等公民的 MCP 支持aos mcp serve 是 Codex、Claude、Grok 共享的产品边缘入口。本地决策面在 macOS 提供 AppKit、Windows 提供原生对话框、Linux 使用 Pinentry——绝不收集密码与 URL
    • Forge 操作系统级构建工具:新智能体能检视运行中的系统、学习 capsule 模型、识别真实能力缺口,并用 Forge 构建验证最小权限 capsule。内置 meta-harness 技能教会智能体如何治理自己的世界。
    • 供应链安全与可验证发布:Sigstore 签名包 + GitHub 构建溯源证明 + runtime-compatibility.toml 锁定运行时/WIT 提交,fail-closed 策略确保只有经过完整验证的版本才能发布。

    典型使用场景

    场景一:多模型编码智能体的统一运行时

    你的团队同时使用 Codex、Claude Code 和 Grok 作为编程助手。通过 AOS 的 aos mcp serve,三个客户端共享同一套 MCP 工具链和审批策略,无需重复配置。每个智能体在隔离的 principal 下运行,操作员身份与目标环境分离——aos --principal operator init --target-principal alice 即可完成多租户置备。

    场景二:企业级智能体安全部署

    企业环境要求所有 AI 操作可审计、可回溯。AOS 的 Unicity Audit 能力配合 Sigstore 签名和 GitHub 构建溯源,让每个 capsule 的来源、权限边界、执行记录完全透明。aos doctor 可随时诊断运行态健康度,aos status --json 输出机器可读状态供 SIEM 集成。

    场景三:智能体自主扩展能力

    当现有 capsules 无法满足新需求时,智能体可以主动调用 Forge:检视当前系统 → 识别缺口 → 构建 capsule → 验证最小权限 → 注册到 harness。这形成了一个自进化的智能体操作系统——meta-harness 技能让智能体学会如何改进自己的世界模型。

    推荐理由

    AOS 解决了一个真正痛点:智能体缺乏像传统软件那样的操作系统级抽象。目前大多数 AI Agent 框架要么是 SDK 库(如 LangChain),要么是编排层(如 CrewAI),但它们都没有提供「进程管理、权限隔离、组件注册、供应链安全」这些 OS 级别的基础设施。

    AOS 用 Rust 从零构建了这套基础设施,Capsule 模型比 Docker 容器更轻量、比 npm 包更结构化。MCP 一等公民支持让它天然适配当前最热的 AI 互操作标准。加上 fail-closed 发布策略和 Unicity Audit,这在开源 AI 项目中是罕见的安全意识

    如果你正在构建生产级智能体系统,或者对 AI Agent 的工程化治理感兴趣,AOS 值得花一个周末深入体验。

    下载地址

  • aisuite:吴恩达开源的统一大模型调用库,一行代码切换 10+ 厂商

    aisuite:吴恩达开源的统一大模型调用库,一行代码切换 10+ 厂商

    aisuite 项目封面

    做 AI 应用的同学大概率都踩过同一个坑:今天想用 GPT-4o,明天想换 Claude,后天又想试试 Gemini,每换一家就得重写一整套 SDK 调用、参数映射、错误处理。吴恩达(Andrew Ng)团队开源的 aisuite,就是把这件事彻底变简单的那把钥匙——一套统一接口,调遍十余家大模型。

    项目简介

    aisuite 是一个轻量级 Python 库,提供两层能力:底层是跨厂商统一的 Chat Completions API,上层是带工具与 MCP 的 Agents API。它同时是桌面 AI 同事 OpenWorker 的底层基座。一句话概括:用一套 OpenAI 风格的接口,调用 OpenAI、Anthropic、Google 等所有主流大模型。

    安装要求和过程

    环境要求

    • Python 3.10 及以上
    • pip 包管理器
    • 对应厂商的 API Key(或本地运行 Ollama 免 Key)

    快速安装

    基础包(不含任何厂商 SDK):

    pip install aisuite

    按需安装指定厂商 SDK,或一次性装全:

    pip install 'aisuite[anthropic]'   # 仅 Anthropic SDK
    pip install 'aisuite[all]'         # 所有厂商 SDK

    配置 API Key(以环境变量为例):

    export OPENAI_API_KEY=sk-...
    export ANTHROPIC_API_KEY=sk-...

    一行调用示例——切换模型只改字符串:

    import aisuite as ai
    client = ai.Client()
    
    models = ["openai:gpt-4o", "anthropic:claude-3-5-sonnet-20240620"]
    messages = [
        {"role": "system", "content": "用海盗英语回答。"},
        {"role": "user", "content": "讲个笑话。"},
    ]
    for model in models:
        resp = client.chat.completions.create(
            model=model, messages=messages, temperature=0.75)
        print(resp.choices[0].message.content)

    核心功能

    aisuite 核心能力

    1. 统一 Chat Completions API:provider-agnostic 的 OpenAI 风格接口,模型名采用 <provider>:<model-name> 格式,aisuite 自动路由到正确的厂商与参数,切换模型只需改一个字符串。
    2. Agents API + Toolkits:把普通 Python 函数直接当工具,自动生成 schema、执行调用并回传结果;内置 files / git / shell 沙箱工具包;提供工具策略(审批、黑白名单)与状态持久化(内存 / 文件 / Postgres)。
    3. 原生 MCP 支持pip install 'aisuite[mcp]' 后,任意 MCP Server 的工具都能直接交给模型,无需胶水代码。
    4. 流式与异步stream=True 跨厂商统一分块输出,acreate 提供异步变体,工具调用同样可流式处理。
    5. 可扩展 Provider 适配器:按命名约定实现 <provider>_provider.py + <Provider>Provider 类即可被自动发现加载,轻松接入新厂商。

    支持的模型厂商

    aisuite 支持的模型厂商

    典型使用场景

    1. 多模型横向对比 / A/B 评测:同一段业务逻辑只改 model 字符串,就能对比 GPT-4o、Claude、Gemini 的输出质量与成本,非常适合做模型选型与回归测试。
    2. 本地优先 + 多云的 Agent 应用:aisuite 是 OpenWorker 的基座,可接入 Ollama 完全本地运行(数据不出本机),也能在云端多厂商间灵活切换,兼顾合规与弹性。
    3. 快速挂载 MCP 工具做文件 / 代码操作:一行声明 filesystem MCP,即可让模型列举目录、读写文件、执行 git 命令,省去繁琐的适配代码。

    推荐理由

    我个人非常看重 aisuite 解决的一个真实痛点:厂商锁定。在真实项目里,模型能力此消彼长,今天这家强、明天那家反超,aisuite 让你把”换模型”从”改一堆 SDK 代码”降级成”改一个字符串”,产品的可移植性直接拉满。

    它不只是简单的接口封装:Agents API 把工具调用、MCP、工具策略、状态持久化收敛到一套统一范式里,意味着你写一次 Agent,就能在多家模型间稳健落地;底层还能私有化(Ollama)满足数据合规需求。MIT 协议商用友好,对创业团队和个人开发者都很友好,强烈建议作为 AI 应用的默认底座。

    下载地址

    项目数据:★16.1K · 1.7K Fork · Python · MIT · 创建于 2024-06,最近更新 2026-07。

  • img2threejs:把参考图重建为代码级 Three.js 模型的 AI 工作流(10,323★)

    img2threejs:把参考图重建为代码级 Three.js 模型的 AI 工作流(10,323★)

    项目简介

    img2threejs 是一个 AI 驱动的图像→Three.js 代码重建工作流。给一张参考图,它不会输出 OBJ/GLTF 网格或贴图,而是生成由基元几何体、程序化材质组成的 TypeScript 工厂函数 createObjectModel(),返回一个可直接在浏览器运行、可动画化的 THREE.Group。项目核心理念是“代码即模型”:结果可读、可 diff、可版本控制,而非几兆的静态网格文件。

    img2threejs 核心亮点

    安装要求与快速开始

    环境要求

    • Python 3.10+(纯标准库,无需 pip 安装)
    • Claude Code / Codex / OpenCode(作为 skill 调用)或任意终端
    • Three.js 运行时(浏览器即可)

    作为 Claude Code Skill 使用

    1. 克隆到 skills 目录:
    git clone https://github.com/img2threejs/img2threejs.git ~/.claude/skills/img2threejs
    1. 贴入参考图,在对话中运行:
    /img2threejs Rebuild this object as a Three.js model, keep the proportions, angles, and colours.

    独立脚本模式(零依赖)

    python3 forge/stage1_intake/probe_image.py <image>
    python3 forge/stage2_spec/new_pre_spec_assessment.py "Name" --image <image> --out assessment.json
    python3 forge/stage2_spec/new_sculpt_spec.py "Name" --image <image> --assessment assessment.json --out spec.json
    python3 forge/stage2_spec/validate_sculpt_spec.py spec.json --strict-quality
    python3 forge/stage3_build/generate_threejs_factory.py spec.json --out src/createObjectModel.ts

    所有脚本仅使用 Python 标准库,没有 PIL、numpy、Playwright 等依赖。

    核心功能

    • 代码即模型(Reconstruction-by-Code):用 Three.js 基元 + 程序化着色器生成工厂代码,而非摄影测量或网格提取。
    • 八阶段雕刻流水线blockout → structural → form → material → surface → lighting → interaction → optimization,每阶段生成后视觉评审,不达标则返回修正。
    • 严格质量门控--strict-quality 在写第一行 Three.js 代码前拦截规格不足的浅请求,避免浪费 token。
    • 极致 Token 高效:Python 标准库脚本负责校验、门控、规格生成和比对打包;模型只做一件事——看“参考图 vs 渲染图”对照表并判定通过/打回。
    • Agent 无关:在 Claude Code、Codex、OpenCode 中都能作为 skill 运行,也提供独立终端脚本。
    • 动画就绪 + 多主题:输出暴露 pivots、sockets、userData.tick,支持硬表面物体、人形角色、四足/禽类/飞龙/蛇形生物以及 CS2 武器家族。

    img2threejs 八阶段雕刻流水线

    典型使用场景

    • 游戏/3D 资产快速原型:给一张枪械、载具或道具参考图,直接拿到能在浏览器里跑、可交互的 Three.js 模型。
    • AI 编码助手工作流:作为 skill 嵌入 Claude Code / Codex,贴图即可在对话中完成“重建为代码”,省掉 Blender 建模或网格下载。
    • 教学与可视化演示:官方 Live Demo Gallery 展示了从 Glock-18、BMX 自行车到哆啦A梦房子的纯代码重建案例。

    推荐理由

    img2threejs 的“重建为代码”思路非常克制而实用:把机械重复工作交给纯标准库 Python,把真正的视觉判断留给大模型,从而在 LLM agent 循环中保持 token 高效。八阶段门控设计让输出可预期,README 也诚实地声明了限制——单图无法保证隐藏面精度,硬表面强、角色偏风格化。今天(2026-08-09)仍活跃推送,v1.4.4 正朝 v1.5 角色重建更新。适合已经使用 Claude Code / Codex 的开发者扩展自己的 AI 工作流。

    下载地址

  • OpenWorker:吴恩达开源的本地优先 AI 同事,交付「已完成的工作」而非聊天

    OpenWorker:吴恩达开源的本地优先 AI 同事,交付「已完成的工作」而非聊天

    OpenWorker 品牌图

    OpenWorker 是深度学习之父吴恩达(Andrew Ng)开源的一款”本地优先”的 AI 同事(AI coworker)桌面应用。它不只想跟你聊天,而是要跨文件、终端和 25+ 应用连接器,真正把一件日常任务做完——交付一份排版好的文档、一条带数据的 Slack 回复、一份更新好的日历,或一个分诊完毕的收件箱。它运行在你的机器上,不锁定任何模型,用自己的 API Key(OpenAI / Anthropic / Google / 开源权重)或本地 Ollama 即可驱动。

    🖼️ 它是怎么工作的

    OpenWorker 工作原理

    桌面应用外壳(原生 GUI + Tauri)之下,是一套本地运行的 Python Agent 服务:引擎、工具、连接器都构建在吴恩达自己的 aisuite 之上;你的文件、终端、25+ 连接器与任意模型提供商,全部在你的机器上、用你的密钥运转。

    📦 安装要求和过程

    方式一:直接下载安装包(推荐)

    • macOS(Apple Silicon,12+):已签名公证、自动更新 → download.openworker.com/mac
    • Windows 10/11(x64):构建尚未代码签名,SmartScreen 会警告(签名进行中)→ download.openworker.com/windows
    • 打开应用 → 添加模型 Key(或指向 Ollama)→ 直接提出一个真实需求即可。

    方式二:从源码构建

    前置环境:Python 3.10+Node 20+,以及(桌面壳)通过 rustup 安装的 Rust 工具链。

    git clone https://github.com/andrewyng/openworker
    cd openworker
    
    # 1. 一次性引导,创建 Python venv(Windows 用 Git Bash / WSL)
    bash packaging/setup_dev_env.sh
    
    # 2. 启动本地 Agent 服务
    .venv/bin/openworker-server --cwd ~/some/project --port 8765
    #    Windows: .venv\Scripts\openworker-server.exe
    
    # 3. 另一个终端启动 UI
    cd surfaces/gui
    npm install
    npm run dev        # 浏览器 UI(Vite 端口)
    
    # 想跑完整桌面应用: npm run tauri dev

    ✨ 核心功能

    OpenWorker 核心亮点

    • 交付真实成果:文档、表格、报告、网页直接落地为可打开、可分享的文件,而不是一堆待办清单。
    • 25+ 应用连接器:GitHub、Slack、Jira、Notion、Linear、HubSpot、Outlook、monday.com、Gmail、Google Calendar,加上你的终端与本地文件;任何可通过 MCP 接入的工具都能插进来,并按工具粒度授权。
    • 自带模型密钥(BYOK):OpenAI、Anthropic、Gemini、Inkling、GLM、DeepSeek、Kimi、Qwen、MiniMax、Mistral、Grok,以及通过 Together / Fireworks 的开源权重模型,和 Ollama 本地模型;自带经工具调用验证的推荐清单。
    • 行动前先确认:写文件、发消息、执行命令都走审批门控;无人值守运行会把待办”问询”暂存到收件箱,绝不擅自行动。隐私本地优先——agent 循环、对话、连接器令牌、模型 Key 都留在本地密钥库。
    • 定时自动化:晨报、周报、频道值守等周期性任务按计划运行,结果带完整转录落回应用。

    🎯 典型使用场景

    1. Slack 里 @OpenWorker:在频道提及它,桌面自动开一个会话,用你的工具把活干完,答案作为线程回复回到频道。
    2. “准备一份客户简报””理清我的日历””跨 Jira 和 GitHub 看看发布进展到哪了”——它把任务拆成步骤,跨桌面、文件和已连接应用推进,重要动作前先与你确认。
    3. 定时晨报 / 周报:把重复性工作面交给自动化,每天/每周固定产出带完整记录的交付物。

    💡 推荐理由

    吴恩达出品,天然带着”让 AI 真正替你把事做完“的产品哲学。最打动我的是三点:一是本地优先 + 自带模型密钥,数据只通过你选定的模型和集成离开本机,隐私可控;二是“行动前确认”的克制设计,把 AI 代理从”话痨”拉回到”靠谱同事”;三是底层基于他自己的 aisuite(统一多模型 + Agent/MCP 层),想自己搭 Agent harness 的人也能拿它当参考实现。目前处于开放 Beta:可用、会自动更新、社区活跃,适合想把日常办公流程交给 AI 自动化、又不想把数据锁进某家云端的朋友尝鲜。

    🔗 下载地址

  • DwarfStar (ds4):antirez 打造的 DeepSeek V4 原生本地推理引擎

    DwarfStar (ds4):antirez 打造的 DeepSeek V4 原生本地推理引擎

    DwarfStar ds4

    📌 项目简介

    DwarfStar(简称 ds4)是 Redis 作者 antirez(Salvatore Sanfilippo)开源的一个原生本地推理引擎,专门为 DeepSeek V4 Flash / PROGLM 5.2 这类开源权重打造。它不追求做成通用 GGUF 运行器,而是把模型加载、分词、工具调用、KV 缓存、HTTP 服务乃至内置编码智能体垂直打通、一起调优;整个引擎用纯 C 编写、单文件二进制、零外部运行时依赖,在 Metal / CUDA / ROCm 三大后端上都能跑。

    DwarfStar 项目速览

    ⚙️ 安装要求和过程

    环境要求

    • 硬件后端:Apple Silicon(Metal,96 GB 以上内存最佳,小内存可走 SSD 流式加载);NVIDIA CUDA 显卡(含 DGX Spark / GB10 多卡);AMD ROCm(Strix Halo,如 Framework Desktop)。
    • 工具链:C 编译器(clang / gcc);CUDA 需 nvcc,ROCm 需 hipcc。仅依赖系统工具链,无外部运行时依赖
    • 模型权重:需单独从 Hugging Face(antirez/deepseek-v4-gguf)下载对应的 GGUF 文件,引擎不内置权重。

    快速安装

    # 克隆仓库
    git clone https://github.com/antirez/ds4
    cd ds4
    
    # macOS(默认 Metal 后端)
    make
    
    # NVIDIA CUDA:DGX Spark / GB10
    make cuda-spark
    # 或通用本地 CUDA 构建
    make cuda CUDA_ARCH=native
    
    # AMD ROCm(Strix Halo / Framework Desktop,gfx1151)
    make rocm
    
    # CPU 参考 / 调试路径(非生产用途)
    make cpu

    下载模型权重

    # 下载一个主模型(推荐 imatrix 版)
    ./download_model.sh ds4f-q2          # 96 / 128 GB 内存机器
    ./download_model.sh ds4f-q2-q4       # 末 6 层专家用 q4
    ./download_model.sh ds4f-q4          # ≥ 256 GB 内存
    ./download_model.sh ds4f-mxfp4       # 原生 MXFP4 专家,约 156 GB
    ./download_model.sh pro-q2-imatrix   # 512 GB 内存,PRO q2 imatrix 量化

    运行

    # 单条提示
    ./ds4 -p "用一段话解释 Redis Stream。"
    
    # 进入多轮交互式对话
    ./ds4
    ds4> /help
    
    # 启动 OpenAI / Anthropic 兼容的本地服务
    ./ds4-server --ctx 100000 --kv-disk-dir /tmp/ds4-kv --kv-disk-space-mb 8192

    ✨ 核心功能

    DwarfStar 核心能力

    1. 贴近模型的「专用」引擎:不为通用 GGUF 设计,模型加载 / 分词 / 工具调用 / KV 缓存 / HTTP 服务 / 编码智能体垂直打通,针对少数量身优化的开源权重做专项调优。
    2. 三大后端原生加速:Metal(主战场,Mac 96 GB+)、NVIDIA CUDA(含多卡 / DGX Spark)、ROCm(Strix Halo);内存不足的机器还能用 SSD 流式加载权重。
    3. 分布式推理:管道并行把多台机器的内存叠加起来跑更大的模型;基于 RDMA 的张量并行甚至能让两台 128 GB MacBook 合力运行 4-bit 的 DeepSeek Flash 或 GLM 5.2。
    4. 内置原生编码智能体:推理由智能体内部直接驱动、没有 socket / API 边界,会话本身就是磁盘上的 KV 缓存;工具调用走原生 LLM 格式,延迟极低、KV 永不错位,还能用 /save /switch 续上历史会话。
    5. OpenAI / Anthropic 兼容服务ds4-server 提供 /v1/chat/completions/v1/responses 等端点,支持多会话批处理与磁盘 KV 缓存,可完全私有化部署。

    DwarfStar 性能实测

    实测参考(q2 量化,意大利语长文本输入):MacBook Pro M5 Max(128 GB,Metal)在 2K 上下文下预填约 790 t/s、生成约 39 t/s;DGX Spark GB10 预填可达 826 t/s。128 GB 内存即可流畅跑 DeepSeek V4 Flash。

    🎯 典型使用场景

    DwarfStar 适用场景

    1. 个人高端 Mac / 工作站本地跑强模型:MacBook M5 Max、Mac Studio M3 Ultra、DGX Spark、Framework Desktop 用户,无需联网、隐私不出本机即可使用 DeepSeek V4 级别的大模型。
    2. 把闲置旧 CUDA 卡变成多用户服务器:借助 CUDA 多卡与 ds4-server 的微批处理,把不再被 vLLM 支持的旧 Ada 架构显卡(如 8×L40S)改造成公司内部的多用户 LLM 服务。
    3. 企业内网私有化部署:用 OpenAI 兼容端点 + 磁盘 KV 缓存,配合工具调用承载客服、知识库问答、本地编码助手等智能体,数据全程不出内网。

    💡 推荐理由

    作为 Redis 作者的最新作品,ds4 最打动我的是它的「克制与专注」:它坦然承认自己不是万能的通用推理器,而是把一件事做到极致——让 DeepSeek V4 这类前沿开源权重在消费级 / 工作站级硬件上跑得又快又稳。对一个 C 写的单文件引擎来说,开箱即用的交互式 CLI、兼容 OpenAI 的服务端、甚至原生编码智能体全部到位,体验相当完整。

    特别加分的是项目的坦诚:antirez 在 README 里明确做了「AI 全程披露」,说明代码大量借助 GPT / Claude 完成、但由人类把握方向与测试,同时也郑重致谢 llama.cpp 与 GGML——这种开源精神值得点赞。需要提醒的是,项目目前仍处快速迭代的 beta 阶段、文档也在持续补全,适合愿意折腾、想把手里高端硬件榨干的朋友尝鲜。

    🔗 下载地址

  • Codex Security:OpenAI 开源的 AI 代码安全审计工具(CLI + SDK)

    Codex Security:OpenAI 开源的 AI 代码安全审计工具(CLI + SDK)

    代码安全审计,正在从传统 SAST 工具的”正则匹配”走向 Agent 式的”语义理解”。OpenAI 刚开源的 Codex Security,就是这一方向的代表作——它把”发现、验证、修复漏洞”三件事,打包成一个 CLI 与 TypeScript SDK,让 AI 真正读懂你的代码。

    📌 项目简介

    Codex Security 是 OpenAI 推出的 AI 安全审计工具(CLI + TypeScript SDK),能在你的代码库中发现、验证并修复安全漏洞,把代码安全从”工具扫描”升级为”智能体审计”。

    💻 安装要求与过程

    环境要求

    • Node.js 22.13.0+(22.x 发布线)、24.x 或 26.x
    • Python 3.10 及以上
    • 可用的 Codex Security 访问权限(ChatGPT 登录或 API Key;部分安全请求需通过 Trusted Access for Cyber 审批)
    • npm 环境(用于安装与运行)

    快速安装

    # 1. 安装(本地或全局)
    npm install @openai/codex-security
    
    # 2. 登录 OpenAI / ChatGPT 账号
    npx @openai/codex-security login
    
    # 3. 扫描当前目录
    npx @openai/codex-security scan .
    
    # 4. 高精度深度扫描
    npx @openai/codex-security scan . --model gpt-5.6-terra --effort high

    在 CI 中无需登录,直接注入环境变量即可:OPENAI_API_KEYCODEX_API_KEY,密钥仅用于本次扫描,不会写入凭证目录。

    ✨ 核心功能

    Codex Security 核心能力

    1. 发现 · 验证 · 修复三合一:不止于”扫出告警”,更能跨文件理解语义、定位漏洞根因,并给出可直接落地的修复建议。
    2. CLI + TypeScript SDK 双形态:命令行随手扫描,SDK 可嵌入自有平台、工单系统与安全中台,安全能力随取随用。
    3. 深度扫描 / 多智能体并行--mode deep 下多 worker、subagent 并行深挖调用链,复杂漏洞也不放过。
    4. 多推理提供商自由切换:OpenAI / OpenRouter / Fireworks / Amazon Bedrock,模型与厂商不再被锁定。
    5. 扫描对比 scans compare:按根因智能匹配历次结果,清晰追踪”已解决 / 新增 / 复现 / 未知”的漏洞。

    🎯 典型使用场景

    • 开发者本地自检:提交前跑一句 npx @openai/codex-security scan .,把高危漏洞挡在合入之前,比事后救火省心得多。
    • CI/CD 安全门禁:在流水线中用环境变量注入 API Key 自动扫描,配合 --auth api-key 做非交互式审计,高危漏洞直接阻断合入。
    • 安全团队批量审计:用官方镜像 + Docker Compose 对多个仓库(锁定到不可变 Git revision)做可断点续扫,再用 scans compare 跟踪修复效果。

    💡 推荐理由

    我用过不少 SAST 工具,最大的痛点是”告警一堆、误报一堆、修复靠自己”。Codex Security 的聪明之处在于它把漏洞审计做成了Agent 式工作流:能理解业务语义、跨文件追踪根因、直接给修复方案,SDK 形态又方便嵌进自己的平台。多提供商支持则避免了被单一模型绑定——对注重供应链安全与自主可控的团队尤其友好。

    📥 下载地址

    本文数据来自 GitHub 公开 API(统计于 2026-08-06)。

  • LiveKit Agents:用 Python 构建实时语音 AI 智能体的开源框架

    LiveKit Agents:用 Python 构建实时语音 AI 智能体的开源框架

    在语音助手、AI 客服、实时翻译早已不是新鲜事的今天,真正难的是:如何用一个干净、可编排、可私有部署的框架,把 STT、LLM、TTS 串成一次低延迟、不打断、能“看见”的实时对话。LiveKit Agents 正是为这件事而生。

    📌 项目简介

    LiveKit Agents 是一个用于构建实时、可编程的多模态语音 AI 智能体的开源框架,运行在服务器端,让智能体具备“看、听、理解”的能力。它把语音识别(STT)、大模型(LLM)、语音合成(TTS)以及实时模型(Realtime API)抽象成可自由替换的组件,并提供任务调度、工具调用、测试框架等一整套生产级能力。

    💻 安装要求与过程

    环境要求

    • Python 3.9+
    • 一个 LiveKit 服务器:可用 LiveKit Cloud,也可用开源的 livekit 自托管
    • 至少一家模型服务商的密钥:如 Deepgram(STT)、OpenAI / Google(LLM)、Cartesia(TTS)等
    • 如需电话接入,可启用 LiveKit 的 SIP / 电话栈

    快速安装

    pip install "livekit-agents[openai,deepgram,cartesia]"

    三种运行模式

    # 终端本地测试:无需外部服务器,直接验证交互
    python myagent.py console
    
    # 开发模式:连接 LiveKit 云/自托管,支持热重载
    python myagent.py dev
    
    # 生产部署:生产级优化
    python myagent.py start

    开发 / 生产模式需配置环境变量:LIVEKIT_URLLIVEKIT_API_KEYLIVEKIT_API_SECRET(以及对应模型服务商的 Key)。也可用 Agents Playground 快速体验。

    ✨ 核心功能

    • 灵活集成:完整的插件生态,自由混搭最合适的 STT、LLM、TTS 与 Realtime API。
    • 内置任务调度:通过 Dispatch API 自动做任务分配与分发,把终端用户连接到对应智能体。
    • 语义轮流检测(Turn Detection):用 Transformer 模型判断用户是否说完,显著降低误打断。
    • 原生 MCP 支持:一行代码即可把 MCP 服务器提供的工具接入智能体。
    • 内置测试框架:用断言(expect)配合 LLM 评判(judge)编写测试,对抗 LLM 的非确定性。
    • 全平台 WebRTC 客户端 + 电话集成:覆盖浏览器、iOS、Android、Flutter 等,并可拨打 / 接听电话。

    🎯 典型使用场景

    • 语音客服 / 订餐机器人:内置 restaurant_agent 范例,可处理来电订餐与预约,直接对接电话线路。
    • 外呼电话机器人:Outbound Caller 范例可自动批量拨打电话、播报与收集信息。
    • 多智能体接力(Handoff):多个 Agent 按流程交接(如先收集信息、再切换讲故事 Agent),适合工单分流、复杂客服。
    • 视频数字人:通过 Tavus、Bithuman、LemonSlice 等接入 AI 虚拟形象,做出“能说话的脸”。
    • 实时视觉 Agent:结合 Gemini Live 等,做出能“看见”环境并对话的助手(含 iOS 端范例)。

    💡 推荐理由

    我自己折腾过不少语音 Agent 方案,LiveKit Agents 最打动我的是它的“把复杂留给自己、把简单交给开发者”:一个 AgentSession 把你想要的 STT/LLM/TTS 一行声明完,多智能体切换、工具调用、打断检测都有官方最佳实践兜底;更关键的是整套栈可私有化——连媒体服务器都是开源的,数据不出自己的机房,对企业场景非常友好。再加上官方提供的 LiveKit Docs MCPAgent Skill,用 AI 编程助手来搭语音应用也顺手很多。如果你打算认真做一个“能听会说”的产品,它值得作为底座首选。

    🔗 下载地址

    LiveKit Agents 核心亮点

  • DeepSeek-Reasonix:围绕前缀缓存稳定性打造的 DeepSeek 原生终端 AI 编程智能体

    DeepSeek-Reasonix:围绕前缀缓存稳定性打造的 DeepSeek 原生终端 AI 编程智能体

    DeepSeek-Reasonix 核心亮点

    DeepSeek-Reasonix(npm 包名 reasonix)是一个深度围绕 DeepSeek 前缀缓存稳定性打造的开源终端 AI 编程智能体:把 Agent 跑成长会话也不心疼 token,单文件 Go 二进制即装即用。

    📊 项目速览

    • ⭐ Stars:30.6K | Fork:1.97K | 语言:Go | 协议:MIT | 首个版本:2026-04
    • 🏷️ 定位:终端 / TUI / 桌面 / VS Code 四端共用同一本地引擎的 Coding Agent
    • 🔗 官网:https://reasonix.io/

    🔧 安装要求与过程

    环境要求

    • 支持 macOS / Linux / Windows(amd64 与 arm64)
    • 方式 A 需 Node.js(用于 npm)或 macOS 上的 Homebrew;方式 D 源码编译需 Go 工具链
    • 一个 DeepSeek(或任意 OpenAI 兼容)API Key,通过 reasonix setup 配置

    快速安装(推荐 CLI / TUI)

    # 任意系统,拉取预编译原生二进制
    npm i -g reasonix
    
    # 或 macOS 用 Homebrew
    brew install esengine/reasonix/reasonix

    其他安装方式:① 桌面端 到官网下载页取 .dmg/.exe/.deb/.tar.gz;② VS Code 扩展 在 Marketplace 搜 SivanLiu.reasonix-agent;③ 源码编译

    git clone https://github.com/esengine/DeepSeek-Reasonix.git
    cd DeepSeek-Reasonix
    make build      # -> bin/reasonix
    make cross      # -> dist/ (darwin|linux|windows x amd64|arm64)

    三步上手

    reasonix setup                      # 配置 provider 与模型
    reasonix                            # 启动交互式会话
    reasonix run "implement the TODOs in main.go"   # 一次性跑任务

    交互会话里执行 /init 可让 Reasonix 自动生成项目说明文件。

    ✨ 核心功能

    1. 配置驱动:Provider、Agent、启用的工具与插件全部声明在 reasonix.toml,没有任何硬编码模型,换模型只是改一行配置。
    2. 多模型可组合:DeepSeek 是预置项;任意 OpenAI 兼容端点都是一条配置而非新代码;还可让两个模型(执行器 + 规划器)在各自缓存稳定的会话里协同工作。
    3. 插件驱动:外部工具以子进程方式经 stdio JSON-RPC 运行(兼容 MCP 协议);内置工具在编译期自注册,扩展能力零摩擦。
    4. 缓存感知的上下文维护:启动时注入一份稳定的环境摘要,压缩摘要前先裁剪陈旧的工具输出,让长会话的前缀缓存命中率保持高位、token 成本维持低位。
    5. 零摩擦分发CGO_ENABLED=0 产出单文件静态二进制,一条命令交叉编译到 6 个平台目标,唯一的外部依赖只是一个 TOML 解析器。

    🎯 典型使用场景

    • 长会话大型重构:把 Reasonix 一直开着,前缀缓存让「边聊边改」一整天也花不了多少 token;适合跨多文件的模块重构与迁移。
    • 双模型协作攻坚:用 DeepSeek 当执行器、再挂一个规划器模型,分别在缓存稳定的会话里做「想」与「做」的分工,复杂任务更稳。
    • 纯终端原生工作流:无需 IDE,命令行直接驱动;需要时也能借 VS Code 扩展获得编辑器上下文、工具调用审批与模型切换。

    💡 推荐理由

    我比较看重它三点:一是真的为 DeepSeek 优化过——前缀缓存稳定性不是口头标语,长会话成本明显比通用 Agent 低;二是单文件二进制零运行时依赖,在公司受限环境或远程机器上一拷就能跑,比一堆 Node/Python 依赖的 Agent 省心;三是配置与插件都走开放协议(TOML + MCP 兼容),不锁死模型,想接哪个 OpenAI 兼容端点都行。要说短板,项目 2026 年 4 月才起步,生态与社区体量还比不上 Claude Code / Cursor 那类老牌选手,但长势很猛(上线数月已 30K+ Star)。如果你常驻终端、又想用便宜强推理的 DeepSeek 干活,它值得一试。

    📥 下载地址

  • AirLLM:单张 4GB 显卡跑起 70B 大模型,无需量化不损精度

    AirLLM:单张 4GB 显卡跑起 70B 大模型,无需量化不损精度

    如果你手头只有一张 4GB 显存的消费级显卡(比如 RTX 3050 / 4060),却想本地跑 70B 级别的大模型,AirLLM 是目前最省心的解法之一。它不靠量化、蒸馏或剪枝来”阉割”模型,而是用逐层加载的巧思,把推理所需的显存从”整个模型”压到”单层”,让穷人也能在本地玩转大模型。

    📌 项目简介

    AirLLM 是一个低显存大模型推理框架。它核心思路是一次只在 GPU 上保留一层权重,配合稀疏 MoE 的专家流式加载,使显存占用取决于”单层大小”而非”模型总大小”。因此在原生精度、零精度损失的前提下,单张 4GB 显卡就能跑 70B 模型,8GB 跑 405B,约 12GB 跑 DeepSeek-V3(671B)。

    🛠 安装要求和过程

    环境要求

    • Python 3.8+ 与 PyTorch(CUDA 可用 GPU,或 MacOS Apple Silicon 上的 MLX)
    • HuggingFace transformers 等依赖(仓库 requirements.txt 已列)
    • 需能联网拉取 HuggingFace 模型权重

    快速安装

    pip install airllm

    如需开启模型压缩加速(必须 airllm 2.0.0+):

    pip install -U bitsandbytes
    pip install -U airllm

    ⚡ 核心功能

    1. 极低显存推理:70B≈4GB、405B≈8GB、DeepSeek-V3 671B≈12GB、Kimi K3 2.8T 低于 4GB。
    2. 无量化/蒸馏/剪枝:原生精度运行,彻底告别量化带来的精度焦虑。
    3. 模型压缩加速:基于分块量化的 4bit/8bit 压缩,最高约 3× 推理加速,精度损失可忽略。
    4. AutoModel 统一接口:一行 from_pretrained 切换 Llama / Qwen / DeepSeek / Mistral / Phi / Gemma / ChatGLM 等。
    5. 多平台 + 预取:支持 Linux 与 MacOS(Apple silicon);加载与计算重叠预取提速;稀疏 MoE 专家流式加载。
    AirLLM 模型压缩 3x 推理加速
    AirLLM 基于分块量化的 4bit/8bit 压缩可带来最高约 3× 推理加速,精度损失可忽略

    🎯 典型使用场景

    • 个人本地推理:开发者用 4–8GB 显卡在本地跑 70B/405B 模型做聊天、RAG、Agent,无需租用云 GPU。
    • 低成本大模型服务:在显存受限的边缘/低成本服务器上部署 DeepSeek-V3(671B)这类超大模型对外提供能力。
    • 教学与演示:在普通笔记本上现场演示大模型推理流程,无需昂贵的 A100/H100,课堂与 workshop 友好。

    💡 推荐理由(个人使用心得)

    AirLLM 真正把”穷人也能玩大模型”变成了现实——4GB 显卡就能跑 70B,门槛低到惊人。相比各种量化方案,它保留全精度输出,结果更可靠、更可复现;而且 AutoModel 接口与 HuggingFace transformers 几乎一致,迁移成本几乎为零。两点提醒:一是逐层加载牺牲了速度,更偏 demo / 研究,不适合高并发生产;二是需要能拉取 HF 权重,且开启压缩加速要额外装 bitsandbytes。整体而言,是入门本地大模型的极佳首选。

    🔗 下载地址