标签: Apache许可

  • AOS Community Edition:开源智能体操作系统,让 AI Agent 拥有自己的 OS

    AOS Community Edition:开源智能体操作系统,让 AI Agent 拥有自己的 OS

    AOS 核心亮点

    项目简介

    AOS Community Edition 是 Unicity 团队开源的「智能体操作系统」(Agent Operating System),为需要可检视、可组合环境的 AI 智能体提供完整的运行时基础设施。它包含 aos CLI 命令行、HTTP API、21 个官方 Capsule 组件、MCP 边缘入口以及 Unicity Audit 安全审计能力,全部以 Rust 编写并采用 MIT/Apache-2.0 双许可发布。

    安装要求与快速开始

    AOS 支持主流 Unix 系统(macOS / Linux)和 Windows。安装只需两步:

    # 1. 安装 aos CLI(含固定运行时和 21 个 CE capsule)
    curl --proto '=https' --tlsv1.2 -fsSL https://aos.unicity.ai/install.sh | sh
    
    # 2. 初始化工作区(从本地版本化资产置备 ~/.aos)
    aos init

    安装器会自动下载并锁定精确的运行时版本。每次发布附带校验和、Sigstore 签名包和 GitHub 构建溯源证明,签名前一律 fail-closed——未经验证的版本绝不会进入 stable 通道。

    升级同样简单:

    aos update          # 协调式产品升级(Homebrew 安装亦可)

    核心功能

    aos 命令速览
    • 统一的 aos CLI 与 HTTP API:一条命令管理一切——init / status / update / daemon / mcp / capsule build / doctor。命令边界清晰,产品自有实现与底层运行时无缝衔接。
    • 21 个官方 Capsule 组件:开箱即用的用户态构件,可被自由编排成 harness、meta-harness、connector 或服务。每个 capsule 以最小权限组合,能力粒度精细可控。
    • 一等公民的 MCP 支持aos mcp serve 是 Codex、Claude、Grok 共享的产品边缘入口。本地决策面在 macOS 提供 AppKit、Windows 提供原生对话框、Linux 使用 Pinentry——绝不收集密码与 URL
    • Forge 操作系统级构建工具:新智能体能检视运行中的系统、学习 capsule 模型、识别真实能力缺口,并用 Forge 构建验证最小权限 capsule。内置 meta-harness 技能教会智能体如何治理自己的世界。
    • 供应链安全与可验证发布:Sigstore 签名包 + GitHub 构建溯源证明 + runtime-compatibility.toml 锁定运行时/WIT 提交,fail-closed 策略确保只有经过完整验证的版本才能发布。

    典型使用场景

    场景一:多模型编码智能体的统一运行时

    你的团队同时使用 Codex、Claude Code 和 Grok 作为编程助手。通过 AOS 的 aos mcp serve,三个客户端共享同一套 MCP 工具链和审批策略,无需重复配置。每个智能体在隔离的 principal 下运行,操作员身份与目标环境分离——aos --principal operator init --target-principal alice 即可完成多租户置备。

    场景二:企业级智能体安全部署

    企业环境要求所有 AI 操作可审计、可回溯。AOS 的 Unicity Audit 能力配合 Sigstore 签名和 GitHub 构建溯源,让每个 capsule 的来源、权限边界、执行记录完全透明。aos doctor 可随时诊断运行态健康度,aos status --json 输出机器可读状态供 SIEM 集成。

    场景三:智能体自主扩展能力

    当现有 capsules 无法满足新需求时,智能体可以主动调用 Forge:检视当前系统 → 识别缺口 → 构建 capsule → 验证最小权限 → 注册到 harness。这形成了一个自进化的智能体操作系统——meta-harness 技能让智能体学会如何改进自己的世界模型。

    推荐理由

    AOS 解决了一个真正痛点:智能体缺乏像传统软件那样的操作系统级抽象。目前大多数 AI Agent 框架要么是 SDK 库(如 LangChain),要么是编排层(如 CrewAI),但它们都没有提供「进程管理、权限隔离、组件注册、供应链安全」这些 OS 级别的基础设施。

    AOS 用 Rust 从零构建了这套基础设施,Capsule 模型比 Docker 容器更轻量、比 npm 包更结构化。MCP 一等公民支持让它天然适配当前最热的 AI 互操作标准。加上 fail-closed 发布策略和 Unicity Audit,这在开源 AI 项目中是罕见的安全意识

    如果你正在构建生产级智能体系统,或者对 AI Agent 的工程化治理感兴趣,AOS 值得花一个周末深入体验。

    下载地址

  • img2threejs:把参考图重建为代码级 Three.js 模型的 AI 工作流(10,323★)

    img2threejs:把参考图重建为代码级 Three.js 模型的 AI 工作流(10,323★)

    项目简介

    img2threejs 是一个 AI 驱动的图像→Three.js 代码重建工作流。给一张参考图,它不会输出 OBJ/GLTF 网格或贴图,而是生成由基元几何体、程序化材质组成的 TypeScript 工厂函数 createObjectModel(),返回一个可直接在浏览器运行、可动画化的 THREE.Group。项目核心理念是“代码即模型”:结果可读、可 diff、可版本控制,而非几兆的静态网格文件。

    img2threejs 核心亮点

    安装要求与快速开始

    环境要求

    • Python 3.10+(纯标准库,无需 pip 安装)
    • Claude Code / Codex / OpenCode(作为 skill 调用)或任意终端
    • Three.js 运行时(浏览器即可)

    作为 Claude Code Skill 使用

    1. 克隆到 skills 目录:
    git clone https://github.com/img2threejs/img2threejs.git ~/.claude/skills/img2threejs
    1. 贴入参考图,在对话中运行:
    /img2threejs Rebuild this object as a Three.js model, keep the proportions, angles, and colours.

    独立脚本模式(零依赖)

    python3 forge/stage1_intake/probe_image.py <image>
    python3 forge/stage2_spec/new_pre_spec_assessment.py "Name" --image <image> --out assessment.json
    python3 forge/stage2_spec/new_sculpt_spec.py "Name" --image <image> --assessment assessment.json --out spec.json
    python3 forge/stage2_spec/validate_sculpt_spec.py spec.json --strict-quality
    python3 forge/stage3_build/generate_threejs_factory.py spec.json --out src/createObjectModel.ts

    所有脚本仅使用 Python 标准库,没有 PIL、numpy、Playwright 等依赖。

    核心功能

    • 代码即模型(Reconstruction-by-Code):用 Three.js 基元 + 程序化着色器生成工厂代码,而非摄影测量或网格提取。
    • 八阶段雕刻流水线blockout → structural → form → material → surface → lighting → interaction → optimization,每阶段生成后视觉评审,不达标则返回修正。
    • 严格质量门控--strict-quality 在写第一行 Three.js 代码前拦截规格不足的浅请求,避免浪费 token。
    • 极致 Token 高效:Python 标准库脚本负责校验、门控、规格生成和比对打包;模型只做一件事——看“参考图 vs 渲染图”对照表并判定通过/打回。
    • Agent 无关:在 Claude Code、Codex、OpenCode 中都能作为 skill 运行,也提供独立终端脚本。
    • 动画就绪 + 多主题:输出暴露 pivots、sockets、userData.tick,支持硬表面物体、人形角色、四足/禽类/飞龙/蛇形生物以及 CS2 武器家族。

    img2threejs 八阶段雕刻流水线

    典型使用场景

    • 游戏/3D 资产快速原型:给一张枪械、载具或道具参考图,直接拿到能在浏览器里跑、可交互的 Three.js 模型。
    • AI 编码助手工作流:作为 skill 嵌入 Claude Code / Codex,贴图即可在对话中完成“重建为代码”,省掉 Blender 建模或网格下载。
    • 教学与可视化演示:官方 Live Demo Gallery 展示了从 Glock-18、BMX 自行车到哆啦A梦房子的纯代码重建案例。

    推荐理由

    img2threejs 的“重建为代码”思路非常克制而实用:把机械重复工作交给纯标准库 Python,把真正的视觉判断留给大模型,从而在 LLM agent 循环中保持 token 高效。八阶段门控设计让输出可预期,README 也诚实地声明了限制——单图无法保证隐藏面精度,硬表面强、角色偏风格化。今天(2026-08-09)仍活跃推送,v1.4.4 正朝 v1.5 角色重建更新。适合已经使用 Claude Code / Codex 的开发者扩展自己的 AI 工作流。

    下载地址

  • Codex Security:OpenAI 开源的 AI 代码安全审计工具(CLI + SDK)

    Codex Security:OpenAI 开源的 AI 代码安全审计工具(CLI + SDK)

    代码安全审计,正在从传统 SAST 工具的”正则匹配”走向 Agent 式的”语义理解”。OpenAI 刚开源的 Codex Security,就是这一方向的代表作——它把”发现、验证、修复漏洞”三件事,打包成一个 CLI 与 TypeScript SDK,让 AI 真正读懂你的代码。

    📌 项目简介

    Codex Security 是 OpenAI 推出的 AI 安全审计工具(CLI + TypeScript SDK),能在你的代码库中发现、验证并修复安全漏洞,把代码安全从”工具扫描”升级为”智能体审计”。

    💻 安装要求与过程

    环境要求

    • Node.js 22.13.0+(22.x 发布线)、24.x 或 26.x
    • Python 3.10 及以上
    • 可用的 Codex Security 访问权限(ChatGPT 登录或 API Key;部分安全请求需通过 Trusted Access for Cyber 审批)
    • npm 环境(用于安装与运行)

    快速安装

    # 1. 安装(本地或全局)
    npm install @openai/codex-security
    
    # 2. 登录 OpenAI / ChatGPT 账号
    npx @openai/codex-security login
    
    # 3. 扫描当前目录
    npx @openai/codex-security scan .
    
    # 4. 高精度深度扫描
    npx @openai/codex-security scan . --model gpt-5.6-terra --effort high

    在 CI 中无需登录,直接注入环境变量即可:OPENAI_API_KEYCODEX_API_KEY,密钥仅用于本次扫描,不会写入凭证目录。

    ✨ 核心功能

    Codex Security 核心能力

    1. 发现 · 验证 · 修复三合一:不止于”扫出告警”,更能跨文件理解语义、定位漏洞根因,并给出可直接落地的修复建议。
    2. CLI + TypeScript SDK 双形态:命令行随手扫描,SDK 可嵌入自有平台、工单系统与安全中台,安全能力随取随用。
    3. 深度扫描 / 多智能体并行--mode deep 下多 worker、subagent 并行深挖调用链,复杂漏洞也不放过。
    4. 多推理提供商自由切换:OpenAI / OpenRouter / Fireworks / Amazon Bedrock,模型与厂商不再被锁定。
    5. 扫描对比 scans compare:按根因智能匹配历次结果,清晰追踪”已解决 / 新增 / 复现 / 未知”的漏洞。

    🎯 典型使用场景

    • 开发者本地自检:提交前跑一句 npx @openai/codex-security scan .,把高危漏洞挡在合入之前,比事后救火省心得多。
    • CI/CD 安全门禁:在流水线中用环境变量注入 API Key 自动扫描,配合 --auth api-key 做非交互式审计,高危漏洞直接阻断合入。
    • 安全团队批量审计:用官方镜像 + Docker Compose 对多个仓库(锁定到不可变 Git revision)做可断点续扫,再用 scans compare 跟踪修复效果。

    💡 推荐理由

    我用过不少 SAST 工具,最大的痛点是”告警一堆、误报一堆、修复靠自己”。Codex Security 的聪明之处在于它把漏洞审计做成了Agent 式工作流:能理解业务语义、跨文件追踪根因、直接给修复方案,SDK 形态又方便嵌进自己的平台。多提供商支持则避免了被单一模型绑定——对注重供应链安全与自主可控的团队尤其友好。

    📥 下载地址

    本文数据来自 GitHub 公开 API(统计于 2026-08-06)。

  • LiveKit Agents:用 Python 构建实时语音 AI 智能体的开源框架

    LiveKit Agents:用 Python 构建实时语音 AI 智能体的开源框架

    在语音助手、AI 客服、实时翻译早已不是新鲜事的今天,真正难的是:如何用一个干净、可编排、可私有部署的框架,把 STT、LLM、TTS 串成一次低延迟、不打断、能“看见”的实时对话。LiveKit Agents 正是为这件事而生。

    📌 项目简介

    LiveKit Agents 是一个用于构建实时、可编程的多模态语音 AI 智能体的开源框架,运行在服务器端,让智能体具备“看、听、理解”的能力。它把语音识别(STT)、大模型(LLM)、语音合成(TTS)以及实时模型(Realtime API)抽象成可自由替换的组件,并提供任务调度、工具调用、测试框架等一整套生产级能力。

    💻 安装要求与过程

    环境要求

    • Python 3.9+
    • 一个 LiveKit 服务器:可用 LiveKit Cloud,也可用开源的 livekit 自托管
    • 至少一家模型服务商的密钥:如 Deepgram(STT)、OpenAI / Google(LLM)、Cartesia(TTS)等
    • 如需电话接入,可启用 LiveKit 的 SIP / 电话栈

    快速安装

    pip install "livekit-agents[openai,deepgram,cartesia]"

    三种运行模式

    # 终端本地测试:无需外部服务器,直接验证交互
    python myagent.py console
    
    # 开发模式:连接 LiveKit 云/自托管,支持热重载
    python myagent.py dev
    
    # 生产部署:生产级优化
    python myagent.py start

    开发 / 生产模式需配置环境变量:LIVEKIT_URLLIVEKIT_API_KEYLIVEKIT_API_SECRET(以及对应模型服务商的 Key)。也可用 Agents Playground 快速体验。

    ✨ 核心功能

    • 灵活集成:完整的插件生态,自由混搭最合适的 STT、LLM、TTS 与 Realtime API。
    • 内置任务调度:通过 Dispatch API 自动做任务分配与分发,把终端用户连接到对应智能体。
    • 语义轮流检测(Turn Detection):用 Transformer 模型判断用户是否说完,显著降低误打断。
    • 原生 MCP 支持:一行代码即可把 MCP 服务器提供的工具接入智能体。
    • 内置测试框架:用断言(expect)配合 LLM 评判(judge)编写测试,对抗 LLM 的非确定性。
    • 全平台 WebRTC 客户端 + 电话集成:覆盖浏览器、iOS、Android、Flutter 等,并可拨打 / 接听电话。

    🎯 典型使用场景

    • 语音客服 / 订餐机器人:内置 restaurant_agent 范例,可处理来电订餐与预约,直接对接电话线路。
    • 外呼电话机器人:Outbound Caller 范例可自动批量拨打电话、播报与收集信息。
    • 多智能体接力(Handoff):多个 Agent 按流程交接(如先收集信息、再切换讲故事 Agent),适合工单分流、复杂客服。
    • 视频数字人:通过 Tavus、Bithuman、LemonSlice 等接入 AI 虚拟形象,做出“能说话的脸”。
    • 实时视觉 Agent:结合 Gemini Live 等,做出能“看见”环境并对话的助手(含 iOS 端范例)。

    💡 推荐理由

    我自己折腾过不少语音 Agent 方案,LiveKit Agents 最打动我的是它的“把复杂留给自己、把简单交给开发者”:一个 AgentSession 把你想要的 STT/LLM/TTS 一行声明完,多智能体切换、工具调用、打断检测都有官方最佳实践兜底;更关键的是整套栈可私有化——连媒体服务器都是开源的,数据不出自己的机房,对企业场景非常友好。再加上官方提供的 LiveKit Docs MCPAgent Skill,用 AI 编程助手来搭语音应用也顺手很多。如果你打算认真做一个“能听会说”的产品,它值得作为底座首选。

    🔗 下载地址

    LiveKit Agents 核心亮点

  • AirLLM:单张 4GB 显卡跑起 70B 大模型,无需量化不损精度

    AirLLM:单张 4GB 显卡跑起 70B 大模型,无需量化不损精度

    如果你手头只有一张 4GB 显存的消费级显卡(比如 RTX 3050 / 4060),却想本地跑 70B 级别的大模型,AirLLM 是目前最省心的解法之一。它不靠量化、蒸馏或剪枝来”阉割”模型,而是用逐层加载的巧思,把推理所需的显存从”整个模型”压到”单层”,让穷人也能在本地玩转大模型。

    📌 项目简介

    AirLLM 是一个低显存大模型推理框架。它核心思路是一次只在 GPU 上保留一层权重,配合稀疏 MoE 的专家流式加载,使显存占用取决于”单层大小”而非”模型总大小”。因此在原生精度、零精度损失的前提下,单张 4GB 显卡就能跑 70B 模型,8GB 跑 405B,约 12GB 跑 DeepSeek-V3(671B)。

    🛠 安装要求和过程

    环境要求

    • Python 3.8+ 与 PyTorch(CUDA 可用 GPU,或 MacOS Apple Silicon 上的 MLX)
    • HuggingFace transformers 等依赖(仓库 requirements.txt 已列)
    • 需能联网拉取 HuggingFace 模型权重

    快速安装

    pip install airllm

    如需开启模型压缩加速(必须 airllm 2.0.0+):

    pip install -U bitsandbytes
    pip install -U airllm

    ⚡ 核心功能

    1. 极低显存推理:70B≈4GB、405B≈8GB、DeepSeek-V3 671B≈12GB、Kimi K3 2.8T 低于 4GB。
    2. 无量化/蒸馏/剪枝:原生精度运行,彻底告别量化带来的精度焦虑。
    3. 模型压缩加速:基于分块量化的 4bit/8bit 压缩,最高约 3× 推理加速,精度损失可忽略。
    4. AutoModel 统一接口:一行 from_pretrained 切换 Llama / Qwen / DeepSeek / Mistral / Phi / Gemma / ChatGLM 等。
    5. 多平台 + 预取:支持 Linux 与 MacOS(Apple silicon);加载与计算重叠预取提速;稀疏 MoE 专家流式加载。
    AirLLM 模型压缩 3x 推理加速
    AirLLM 基于分块量化的 4bit/8bit 压缩可带来最高约 3× 推理加速,精度损失可忽略

    🎯 典型使用场景

    • 个人本地推理:开发者用 4–8GB 显卡在本地跑 70B/405B 模型做聊天、RAG、Agent,无需租用云 GPU。
    • 低成本大模型服务:在显存受限的边缘/低成本服务器上部署 DeepSeek-V3(671B)这类超大模型对外提供能力。
    • 教学与演示:在普通笔记本上现场演示大模型推理流程,无需昂贵的 A100/H100,课堂与 workshop 友好。

    💡 推荐理由(个人使用心得)

    AirLLM 真正把”穷人也能玩大模型”变成了现实——4GB 显卡就能跑 70B,门槛低到惊人。相比各种量化方案,它保留全精度输出,结果更可靠、更可复现;而且 AutoModel 接口与 HuggingFace transformers 几乎一致,迁移成本几乎为零。两点提醒:一是逐层加载牺牲了速度,更偏 demo / 研究,不适合高并发生产;二是需要能拉取 HF 权重,且开启压缩加速要额外装 bitsandbytes。整体而言,是入门本地大模型的极佳首选。

    🔗 下载地址

  • colibri:用纯 C 把 744B~2.8T MoE 大模型跑到本地

    colibri:用纯 C 把 744B~2.8T MoE 大模型跑到本地

    colibri 是近期 GitHub 上热度最高的本地推理引擎之一:只用纯 C 编写、零运行时依赖,就能把 744B 到 2.8T 参数的 MoE(混合专家)大模型跑在你现有的硬件上。它不是把模型硬塞进显存,而是把 VRAM、RAM 和 NVMe 当作同一层级来管理,按需从磁盘流式加载专家权重。项目上线一个月已收获 21.9K Stars,并支持 GLM-5.2、Inkling、Kimi K3、OLMoE 四大模型家族。

    本期我们就来拆解:colibri 是怎么让“本地运行千亿 MoE”这件事从神话变成可复现实验的。

    项目简介

    colibri 是一个面向前沿 MoE 模型的本地推理引擎。它用“存储即内存层级”的思路替代传统的“模型必须全进显存”假设:密集注意力层常驻 RAM,19456 个路由专家放在磁盘,只有在路由器真正需要时才被预取到 RAM/VRAM。这样一台只有 25 GB 内存的常规电脑也能把 744B 的 GLM-5.2 跑起来,而高端工作站则可以把全部专家驻留 GPU,达到接近数据中心的吞吐。

    配图速览

    colibri 核心速览
    colibri 核心数据一览
    三层存储层级
    colibri 把专家权重分布在 VRAM / RAM / NVMe 三个层级,速度随硬件变化,语义保持不变。

    安装要求和过程

    环境要求

    • 操作系统:Linux、macOS、Windows 11
    • 内存:最低 25 GB RAM(仅 CPU 流式);推荐 128 GB 或更高,配合多 GPU 可获得更好体验
    • 磁盘:GLM-5.2 int4 容器约 372 GB;Kimi K3 原始检查点约 1.6 TB
    • 软件:Python 3(仅用于 launcher 和转换脚本);编译源码需要 gcc/clang + OpenMP
    • GPU(可选):CUDA、Metal(Apple Silicon)、Vulkan 1.2(含 AMD RADV)后端均可选

    快速安装

    1. 下载对应平台的预编译 release 并解压:
    mkdir colibri && tar xzf colibri-v1.1.0-linux-x86_64.tar.gz -C colibri && cd colibri
    python3 coli info
    1. 或从源码构建:
    git clone https://github.com/JustVugg/colibri && cd colibri/c
    ./setup.sh
    1. 下载 GLM-5.2 int4 gs64 容器(推荐带 int8 MTP 头的版本):
    # 推荐从 Hugging Face 拉取 mastouri/GLM-5.2-colibri-int4-g64-with-int8-mtp
    # 约 372 GB,放 NVMe 上最佳
    1. 运行交互式聊天、API 服务或 Web 面板:
    COLI_MODEL=/nvme/glm52_i4 ./coli chat
    COLI_MODEL=/nvme/glm52_i4 ./coli serve    # OpenAI-compatible API
    ./coli web --model /nvme/glm52_i4          # API + 可视化 dashboard

    核心功能

    1. 存储即内存层级
      把 VRAM、RAM、NVMe 统一成专家权重的放置策略。缺显存不会悄悄改模型精度或路由语义,只会影响速度。
    2. 按需流式加载专家
      MoE 每层只激活少量专家。colibri 让 19456 个专家中的绝大部分常驻磁盘,通过 per-layer LRU、学习到的热专家 pinned set 和一层提前预取(PILOT)减少磁盘等待。
    3. 纯 C 零依赖引擎
      每个模型对应一个 C 文件(如 c/glm.c),无 BLAS、无运行时 Python、无 GPU 也能跑。
    4. 多后端异构执行
      支持 CPU、CUDA、Metal、Vulkan 四种后端,可组合使用;双 SSD 镜像可把只读专家读取带宽翻倍。
    5. 学习缓存与压缩状态
      引擎记录你的工作负载路由历史(.coli_usage),越用越快;MLA KV 状态压缩到原来的 1/57,并能持久化对话上下文。

    典型使用场景

    场景一:个人开发者跑前沿模型做实验

    你只有一台 64 GB RAM + 1 TB NVMe 的台式机。传统 vLLM/llama.cpp 会把 744B 模型拒之门外;colibri 让你用 COLI_MODEL=/nvme/glm52_i4 ./coli chat 直接对话,虽然 token/s 不高,但足以做提示工程、长文本探索和小批量评估。

    场景二:工作室搭建本地私有 API

    在多卡工作站(如 6× RTX 5090)上,把专家全部驻留 GPU,colibri 可提供 5.8–6.8 tok/s 的解码速度和 1.6 s 的 TTFT。通过 coli serve 提供 OpenAI-compatible API,内部团队就能在不联网的情况下调用千亿模型。

    场景三:MoE 推理系统研究

    colibri 把放置策略、调度、I/O、CPU/GPU 重叠都做成可测量的实验参数。研究者可以替换缓存策略、测试双 SSD 镜像、评估 int4/int8/MXFP4 格式对质量的影响,并把结果以 issue 形式回馈社区。

    推荐理由

    colibri 最打动我的不是“跑 744B 模型”这个噱头,而是它把“本地推理”重新定义为系统优化问题:不盲目堆硬件,而是认真测量每一个瓶颈——磁盘带宽、专家命中率、KV 压缩、CPU/GPU 重叠、量化质量——并用可复现的 A/B 来做决策。README 里反复出现的不是营销数字,而是“这个功能在哪台机器上、用什么 commit、跑什么 prompt 测出来的”。

    对于国内用户,它还有一个隐性好处:GLM-5.2、Kimi K3、Qwen3 MoE(roadmap)等模型天然和中国模型生态更近,未来可以更低成本地跑开源中文大模型。

    当然,它现在还是研究导向的项目:没有 SLA 保证速度,配置参数很多,对磁盘和内存仍有一定要求。但如果你既想摸到前沿模型,又不想把数据送出去,colibri 是 2026 年最值得关注的本地推理引擎之一。

    下载地址

  • HTML Anything:让本地 AI 智能体一键生成可发布的 HTML(8K+ Stars)

    HTML Anything:让本地 AI 智能体一键生成可发布的 HTML(8K+ Stars)

    HTML Anythingnexu-io 开源的本地优先(local-first)AI HTML 编辑器:你只需提供 Markdown、CSV、Excel、JSON 或零散笔记,按下 ⌘+Enter,本地已登录的编码智能体就会把内容渲染成可直接发布的单文件 HTML。

    HTML Anything — 智能体时代的 HTML 编辑器
    HTML Anything — 智能体时代的 HTML 编辑器

    项目简介

    它不做模型、不卖 API,而是把你已经装好的 Claude Code、Cursor Agent、Codex、Gemini CLI、GitHub Copilot CLI、OpenCode、Qwen Coder、Aider、IBM Bob 等 9 款编码智能体 CLI 当作后端,通过 75 个可组合技能模板,输出 9 种常见“交付形态”:杂志文章、演示文稿、简历、海报、小红书卡片、推文卡片、网页原型、数据报告、Hyperframes 视频帧。生成结果支持一键粘贴到微信公众号、知乎、X / 微博 / 小红书,或下载 .html / .png。

    核心亮点速览:9 CLI / 75 技能 / 9 交付形态 / 零 API Key / 一键导出
    核心亮点速览:9 CLI / 75 技能 / 9 交付形态 / 零 API Key / 一键导出

    安装要求与快速开始

    环境要求

    • Node.js ≥ 18,推荐安装 pnpm
    • 任意一款已登录的编码智能体 CLI(如 claude / cursor-agent / codex / gemini / copilot 等)
    • 不需要额外 API Key,复用你已登录的会话

    快速安装

    git clone https://github.com/nexu-io/html-anything
    cd html-anything
    pnpm install
    pnpm -F @html-anything/next dev
    # → http://localhost:3000
    

    启动后浏览器会自动扫描 PATH(包括 ~/.local/bin/opt/homebrew/bin 等 GUI 应用常忽略的目录),并在顶部工具栏列出可识别的 CLI。选一个模板、贴入内容、⌘+Enter 即可。

    主界面:左侧编辑器 / 中间模板选择器 / 右侧实时 iframe 预览
    主界面:左侧编辑器 / 中间模板选择器 / 右侧实时 iframe 预览

    核心功能

    • 零 API Key:复用本地已登录的编码智能体会话,边际成本为 0。
    • 9 大智能体自动检测:Claude Code、Cursor、Codex、Gemini、Copilot、OpenCode、Qwen、Aider、IBM Bob,顶部一键切换。
    • 75 个技能模板:覆盖 prototype / deck / frame / social / office / doc / mockup / vfx 等模式,从 SaaS 落地页到财务报告、从瑞士国际主义幻灯片到 Hyperframes 视频帧都有现成模板。
    • 9 种交付形态:杂志文章、演示文稿、简历、海报、小红书卡片、推文卡片、网页原型、数据报告、Hyperframes 视频帧。
    • 实时 SSE 流式渲染:智能体输出 JSON-line,服务端转成 Server-Sent Events,浏览器实时追加到 iframe srcdoc,像看 AI 打字一样看网页生成。
    • 沙箱预览:用户 HTML 运行在 <iframe sandbox> 中,脚本仍可执行,但 cookies/localStorage 与宿主隔离。
    • 一键导出:juice 内联 CSS → 微信公众号 / 知乎;modern-screenshot 2× PNG → X / 微博 / 小红书;另可下载单文件 .html 或 .png。
    一键导出:微信公众号 · X/微博 · 知乎 · 小红书 · HTML · PNG
    一键导出:微信公众号 · X/微博 · 知乎 · 小红书 · HTML · PNG

    典型使用场景

    场景 1:公众号长文排版

    写好 Markdown 初稿,选择 article-magazinedoc-kami-parchment 技能,智能体会自动套用 CJK 优先字体栈、8px 基线网格、对比度 ≥4.5 的配色,生成可直接粘贴到公众号编辑器的 HTML,无需二次调样式。

    场景 2:小红书 / X 卡片

    把一段金句或数据结论贴进去,选择 card-xiaohongshusocial-x-post-card 模板,即可生成 1080×1080 或 1600×900 的高清 PNG,复制后直接进入小红书 / X 发布界面,避免手动修图。

    场景 3:投资人路演 PPT

    输入产品要点,选择 deck-pitchdeck-swiss-internationaldeck-open-slide-canvas,自动产出 1920×1080 的横向幻灯片,支持键盘左右翻页、演讲者备注和 PDF 导出。

    幻灯片模式:内置 20 套主题,可直接导出或路演
    幻灯片模式:内置 20 套主题,可直接导出或路演

    推荐理由

    它是目前把“本地 AI 智能体”和“中文内容创作”结合得最顺手的开源工具之一:不绑 API、不抢隐私,复用你已经付费订阅的 Claude / Cursor / Copilot;针对微信公众号、知乎、小红书等中文平台做了专门适配,解决了 Markdown 转公众号格式崩坏、转小红书要手动修图的老大难问题;技能模板基于 SKILL.md 协议,新增模板只需复制一个文件夹、改一段 frontmatter,社区扩展门槛低。如果你平时需要大量产出图文、PPT、产品原型,把它接进工作流能省不少时间。

    下载与资源

  • PixelRAG:用网页截图做检索增强,让模型“看图说话”

    PixelRAG:用网页截图做检索增强,让模型“看图说话”

    PixelRAG 配图

    项目简介

    PixelRAG 是伯克利 SkyLab / BAIR 团队开源的视觉检索增强生成框架。它把网页、PDF、图片渲染成截图块,再用视觉语言模型直接在“像素”上检索,从而绕过传统文本 RAG 的 HTML 解析问题,把表格、图表、版式、信息图原样保留给读者模型。仓库还附带一个已建好的 828 万维基百科页面视觉索引,以及免费的在线 API,真正做到了开箱即用。

    安装要求和过程

    环境要求

    • Python 3.10+
    • Linux(CUDA)或 macOS(Apple Silicon / MPS),CPU 亦可作为 fallback
    • 可选:Playwright / CDP 用于网页渲染
    • 可选:用于本地索引构建的 GPU,或直接使用 api.pixelrag.ai 线上服务

    快速安装

    # 1. 基础包:像素化截图工具 pixelshot
    pip install pixelrag
    
    # 2. 带向量化:用于本地构建 FAISS 索引
    pip install 'pixelrag'
    
    # 3. 完整流水线:source → ingest → embed → index
    pip install 'pixelrag[index]'
    
    # 4. 本地搜索 API 服务
    pip install 'pixelrag[serve]'
    

    如果想让 pixelshot 始终处在 PATH 里供 Claude 调用,官方推荐用 uv toolpipx

    uv tool install pixelrag   # pipx install pixelrag
    

    核心功能

    1. 像素级文档渲染: 通过 pixelshot 把网页、PDF 转成截图块,保留文本 RAG 会丢失的视觉结构与版式。
    2. 视觉语义检索: 基于 Qwen3-VL-Embedding-2B 微调后的嵌入模型,将页面图片映射到可检索向量空间。
    3. 828 万维基百科预建索引: 官方已建好并托管了 api.pixelrag.ai,无需任何配置即可搜索,还支持“以图搜图”。
    4. 本地自建索引: 通过 pixelrag index build 处理本地文档(网页 / PDF / 图片),再 pixelrag serve 启动 FastAPI 搜索服务。
    5. Claude Code 插件: pixelbrowse skill 让 Claude 直接截图并阅读页面,告别原始 HTML。

    传统文本RAG vs PixelRAG

    传统文本RAG会丢失表格等视觉结构,PixelRAG通过截图块保留完整版式。

    PixelRAG 关键速览

    典型使用场景

    场景 1:财报 / 论文中的表格问答

    传统文本 RAG 把 PDF 表格拆成凌乱文字后,模型经常找不到数字。PixelRAG 直接截取表格区域截图,检索相关页并交给 VLM 读取,数字、单位、行列关系一目了然。

    场景 2:Claude 浏览复杂网页

    安装 pixelbrowse skill 后,Claude 能够对任意页面执行 /screenshot https://example.com,然后“看图”总结新闻、解读产品页或提取图表结论,而不再受限于 HTML 标签提取不全的问题。

    场景 3:内部知识库可视化搜索

    把企业内的产品手册、设计稿、UI 截图、架构图做成 PixelRAG 索引。用户上传一张截图或输入图片描述,即可召回相关视觉文档,适用于设计系统、运维监控面板、竞品分析资料库。

    推荐理由

    PixelRAG 给我最大的启发是:当大家都在卷“更好的 HTML 解析器”时,它直接换了一条赛道——让模型像人一样“看”网页。这不是炫技,而是切中了 RAG 的实际痛点:大量网页的表格、图表、公式和交互组件一旦转成纯文本就面目全非。配合已经训练好的视觉嵌入模型和 828 万维基百科索引,从实验到落地只需要几条命令。

    对于 Claude / Cursor / Codex 等 Coding Agent 用户来说,pixelbrowse skill 是一个润物细无声的能力升级:它不需要 MCP server,也不依赖后端服务,只是让 Agent 多了一双“眼睛”。如果你正在做多模态知识库、网页问答或文档理解,PixelRAG 值得放进候选清单。

    下载地址

    —— 本文由 WorkBuddy 整理发布。

  • Headroom:让 AI 智能体少花 90% Token 的上下文压缩层

    Headroom:让 AI 智能体少花 90% Token 的上下文压缩层

    项目简介

    Headroom 是一个为 AI 智能体(AI Agent)打造的上下文压缩层。它在提示词、工具输出、日志、RAG 检索片段、文件和对话历史到达大模型之前进行压缩,让你在获得相同答案的同时, Token 成本大幅下降。官方实测:JSON 类数据可减少 60–95% 的 Token,编码类智能体可减少 15–20%。

    核心功能

    • 多种部署形态:Python/TypeScript 内联库、headroom proxy 零代码代理、headroom wrap 一键包装 Claude/Codex/Cursor/Aider/Cline 等主流 Agent,以及原生 MCP Server。
    • 内容感知压缩SmartCrusher 专攻 JSON,CodeCompressor 基于 AST 压缩代码,Kompress-v2-base 用自研 HuggingFace 模型处理自然语言。
    • 可逆压缩(CCR):原始内容本地缓存,LLM 可通过 headroom_retrieve 按需取回,绝不丢失信息。
    • 跨 Agent 记忆:同一台机器上 Claude、Codex、Grok、Gemini 等工具可共享记忆库并自动去重。
    • 输出 Token 优化:通过 Verbosity steering 和 Effort routing,自动削减模型废话、重复代码和过度思考,进一步降低输出侧成本。
    • headroom learn:自动挖掘失败会话,把纠偏规则写入 CLAUDE.local.mdAGENTS.mdGEMINI.md,让 Agent 越用越聪明。

    安装要求和过程

    环境要求:Python 3.10+。推荐用 uvpip 安装;TypeScript 开发者也可用 npm 安装 SDK(仅库,无 CLI)。

    # 推荐:uv 全局工具安装(隔离环境)
    uv tool install --python 3.13 "headroom-ai[all]"
    
    # 或者 pip
    pip install "headroom-ai[all]"
    
    # TypeScript SDK(仅库)
    npm install headroom-ai
    

    启动方式三选一:

    # 一键部署 + 自动配置 Agent
    headroom deploy
    
    # 包装 Claude Code(自动启动本地代理并注入配置)
    headroom wrap claude
    
    # 零代码 drop-in 代理
    headroom proxy --port 8787
    

    验证:

    headroom doctor    # 健康检查
    headroom perf      # 性能报告
    headroom dashboard # 实时节省看板
    

    典型使用场景

    Headroom 工作原理

    场景 1:AI 编码助手降本增效
    你每天用 Claude Code、Cursor 或 Codex 处理大型代码库。代码搜索结果、RAG 片段、测试日志动辄几万 Token。Headroom 自动压缩输入内容,代码搜索场景可减少 92% Token,而答案质量不变。配合 headroom learn,它还能把常见误操作自动写入项目本地规则文件。

    场景 2:SRE 事故排查
    排查线上事故时,需要把大量日志、监控输出、GitHub Issue、运行时报错塞进上下文。Headroom 对日志和结构化数据压缩率极高,65k Token 的排查材料可压缩到 5k 左右,让智能体在上下文窗口内“看完全部证据”,而不是被截断。

    场景 3:多 Agent 共享记忆
    你在同一项目里混用 Claude Code、Codex、Grok CLI 和 Aider。Headroom 提供跨 Agent 的共享记忆存储,避免每个工具重复读取文件、重复建立上下文,真正实现“一次理解,处处可用”。

    Headroom 压缩效果

    推荐理由

    Headroom 最让我喜欢的一点是“不绑架你的工作流”。它既可以是库,也可以是代理,还可以一键 wrap 你已有的 Agent,不需要重写 prompt 或迁移模型。而且它是本地优先的,原始内容不会离开你的机器,企业敏感代码也能放心使用。

    更难得的是,它在省钱的同时还做了“可逆压缩”和“失败学习”:前者保证信息不丢,后者让 Agent 越用越准。对于已经在用 Claude Code、Cursor、Codex 等工具的开发者来说,Headroom 几乎是“装完就能省钱”的基础设施。

    下载地址

    Headroom 采用 Apache 2.0 协议开源,当前 Stars 约 63.2K,主要语言为 Python。

  • ZeroClaw:32.4K Stars 的 Rust 全自主个人 AI 助理基础设施,6.6MB 单二进制、30+ 渠道、数据完全自持

    ZeroClaw:32.4K Stars 的 Rust 全自主个人 AI 助理基础设施,6.6MB 单二进制、30+ 渠道、数据完全自持

    ZeroClaw Banner

    项目简介

    ZeroClaw 是一个用 Rust 编写的全自主个人 AI 助理基础设施(Agent Runtime)——一个体积小、速度快的单二进制程序,让你在自己的机器上跑一个 7×24 小时在线的私人 AI 助理:它对接 Anthropic、OpenAI、Ollama 等 20 余家模型提供商,通过 Discord、Telegram、Matrix、邮件、语音、Webhook 等 30+ 渠道与你对话,并能调用 Shell、浏览器、HTTP、硬件外设与自定义 MCP 服务器执行真实操作。项目口号非常直白:“You own the agent. You own the data. You own the machine it runs on.”(智能体是你的,数据是你的,机器也是你的。)

    项目诞生于 2026 年 2 月,由 Harvard、MIT 与 Sundai Club 社区孵化,短短 5 个多月即斩获 32,400+ Stars、4,800+ Fork,是当下最火的 Rust AI 项目之一。采用 MIT OR Apache-2.0 双许可,可自由选择。

    安装要求和过程

    环境要求

    • 操作系统:Linux / macOS / Windows / FreeBSD / NixOS / Docker 全平台支持,也可跑在树莓派等单板机上
    • 运行环境:预编译二进制开箱即用;从源码构建需 Rust(edition 2024)工具链
    • 体积:minimal 内核预设仅约 6.6 MB,资源占用极低
    • 模型接入:任一 LLM 提供商的 API Key,或本地 Ollama(可完全离线)

    快速安装

    # 一键安装(自动选择预编译二进制,失败则回退源码构建)
    curl -fsSL https://raw.githubusercontent.com/zeroclaw-labs/zeroclaw/master/install.sh | bash
    
    # 或克隆后安装(可交互选择组件和特性)
    git clone https://github.com/zeroclaw-labs/zeroclaw.git
    cd zeroclaw
    ./install.sh
    
    # 极简内核(约6.6MB)
    ./install.sh --preset minimal
    

    快速上手

    zeroclaw quickstart           # 一站式配置:选择模型提供商,生成可用配置
    zeroclaw agent -a <alias>     # 交互式对话
    zeroclaw service install      # 注册为 systemd/launchctl/Windows 服务
    zeroclaw service start        # 后台常驻运行
    

    所有配置集中在一个 TOML 文件(~/.zeroclaw/config.toml),支持 Codex 订阅、Claude Max setup-token 等多种认证方式导入。

    核心功能

    • 多渠道统一接入:Discord、Telegram、Matrix、邮件、语音、Webhook、CLI 等 30+ 渠道适配器,全部消息汇入同一个智能体循环,一个助理全端响应
    • 模型提供商无关:可插拔接入 Anthropic、OpenAI、本地 Ollama 及任意 OpenAI 兼容端点约 20+ 家,支持故障回退链与智能路由,单家挂掉不影响服务
    • 安全优先架构:默认 supervised 监督模式——中风险操作需审批、高风险直接拦截;工作区边界、命令策略、OS 级沙箱(Landlock/Bubblewrap/Seatbelt/Docker)加密码学工具回执(Tool Receipts)记录每一次操作;开发机可切 YOLO 模式放飞
    • 硬件控制能力:通过 Peripheral trait 支持树莓派、STM32、Arduino、ESP32 的 GPIO/I2C/SPI/USB,AI 助理可以直接操控物理硬件
    • SOP 引擎 + 网关面板:事件触发的标准作业程序(MQTT/Webhook/Cron/外设触发,带审批门与断点续跑);HTTP/WebSocket 网关配 Web 仪表盘,可视化管理对话、记忆、配置与定时任务;另有 ACP 协议支持 IDE 集成

    ZeroClaw 硬件架构
    ZeroClaw 硬件接入架构:从单板机 GPIO 到智能体循环

    典型使用场景

    1. 私有化全天候个人助理:在家庭服务器或 VPS 上以 systemd 服务常驻运行,用 Telegram/Discord 随时召唤——查资料、跑脚本、管日程、收发邮件,所有数据和 API Key 都留在自己机器上,零云端依赖
    2. 智能家居与硬件自动化中枢:跑在树莓派上,结合 SOP 引擎的 MQTT/Cron/外设触发器,让 AI 根据传感器读数自动执行标准作业流程(如温度异常告警并开启风扇),审批门保证关键操作人工确认
    3. 离线/内网 AI 运维助手:搭配本地 Ollama 在无外网环境下运行,通过 Shell 与 HTTP 工具执行巡检、日志分析等任务,沙箱与工具回执满足安全审计要求

    推荐理由

    体验下来最深的感受是「」和「」:相比动辄上 GB 依赖的 Python Agent 框架,ZeroClaw 一个 6.6MB 起步的 Rust 二进制就能常驻后台,树莓派也毫无压力;配置只有一个 TOML 文件,quickstart 三分钟跑通。它的安全设计是我见过的开源助理里最认真的——默认监督模式、OS 级沙箱、每次工具调用都有加密回执,敢放心给它 Shell 权限。多渠道 + 多提供商 + 故障回退的组合意味着它真的能当”基础设施”用,而不只是玩具 Demo。如果你想要一个数据完全自持、能接硬件、7×24 在线的私人 Jarvis,ZeroClaw 是目前 Rust 生态里最值得入手的选择。注意:官方仓库只有 zeroclaw-labs/zeroclaw 一个,谨防仿冒包。

    下载地址