标签: LLM

  • aisuite:吴恩达开源的统一大模型调用库,一行代码切换 10+ 厂商

    aisuite:吴恩达开源的统一大模型调用库,一行代码切换 10+ 厂商

    aisuite 项目封面

    做 AI 应用的同学大概率都踩过同一个坑:今天想用 GPT-4o,明天想换 Claude,后天又想试试 Gemini,每换一家就得重写一整套 SDK 调用、参数映射、错误处理。吴恩达(Andrew Ng)团队开源的 aisuite,就是把这件事彻底变简单的那把钥匙——一套统一接口,调遍十余家大模型。

    项目简介

    aisuite 是一个轻量级 Python 库,提供两层能力:底层是跨厂商统一的 Chat Completions API,上层是带工具与 MCP 的 Agents API。它同时是桌面 AI 同事 OpenWorker 的底层基座。一句话概括:用一套 OpenAI 风格的接口,调用 OpenAI、Anthropic、Google 等所有主流大模型。

    安装要求和过程

    环境要求

    • Python 3.10 及以上
    • pip 包管理器
    • 对应厂商的 API Key(或本地运行 Ollama 免 Key)

    快速安装

    基础包(不含任何厂商 SDK):

    pip install aisuite

    按需安装指定厂商 SDK,或一次性装全:

    pip install 'aisuite[anthropic]'   # 仅 Anthropic SDK
    pip install 'aisuite[all]'         # 所有厂商 SDK

    配置 API Key(以环境变量为例):

    export OPENAI_API_KEY=sk-...
    export ANTHROPIC_API_KEY=sk-...

    一行调用示例——切换模型只改字符串:

    import aisuite as ai
    client = ai.Client()
    
    models = ["openai:gpt-4o", "anthropic:claude-3-5-sonnet-20240620"]
    messages = [
        {"role": "system", "content": "用海盗英语回答。"},
        {"role": "user", "content": "讲个笑话。"},
    ]
    for model in models:
        resp = client.chat.completions.create(
            model=model, messages=messages, temperature=0.75)
        print(resp.choices[0].message.content)

    核心功能

    aisuite 核心能力

    1. 统一 Chat Completions API:provider-agnostic 的 OpenAI 风格接口,模型名采用 <provider>:<model-name> 格式,aisuite 自动路由到正确的厂商与参数,切换模型只需改一个字符串。
    2. Agents API + Toolkits:把普通 Python 函数直接当工具,自动生成 schema、执行调用并回传结果;内置 files / git / shell 沙箱工具包;提供工具策略(审批、黑白名单)与状态持久化(内存 / 文件 / Postgres)。
    3. 原生 MCP 支持pip install 'aisuite[mcp]' 后,任意 MCP Server 的工具都能直接交给模型,无需胶水代码。
    4. 流式与异步stream=True 跨厂商统一分块输出,acreate 提供异步变体,工具调用同样可流式处理。
    5. 可扩展 Provider 适配器:按命名约定实现 <provider>_provider.py + <Provider>Provider 类即可被自动发现加载,轻松接入新厂商。

    支持的模型厂商

    aisuite 支持的模型厂商

    典型使用场景

    1. 多模型横向对比 / A/B 评测:同一段业务逻辑只改 model 字符串,就能对比 GPT-4o、Claude、Gemini 的输出质量与成本,非常适合做模型选型与回归测试。
    2. 本地优先 + 多云的 Agent 应用:aisuite 是 OpenWorker 的基座,可接入 Ollama 完全本地运行(数据不出本机),也能在云端多厂商间灵活切换,兼顾合规与弹性。
    3. 快速挂载 MCP 工具做文件 / 代码操作:一行声明 filesystem MCP,即可让模型列举目录、读写文件、执行 git 命令,省去繁琐的适配代码。

    推荐理由

    我个人非常看重 aisuite 解决的一个真实痛点:厂商锁定。在真实项目里,模型能力此消彼长,今天这家强、明天那家反超,aisuite 让你把”换模型”从”改一堆 SDK 代码”降级成”改一个字符串”,产品的可移植性直接拉满。

    它不只是简单的接口封装:Agents API 把工具调用、MCP、工具策略、状态持久化收敛到一套统一范式里,意味着你写一次 Agent,就能在多家模型间稳健落地;底层还能私有化(Ollama)满足数据合规需求。MIT 协议商用友好,对创业团队和个人开发者都很友好,强烈建议作为 AI 应用的默认底座。

    下载地址

    项目数据:★16.1K · 1.7K Fork · Python · MIT · 创建于 2024-06,最近更新 2026-07。

  • img2threejs:把参考图重建为代码级 Three.js 模型的 AI 工作流(10,323★)

    img2threejs:把参考图重建为代码级 Three.js 模型的 AI 工作流(10,323★)

    项目简介

    img2threejs 是一个 AI 驱动的图像→Three.js 代码重建工作流。给一张参考图,它不会输出 OBJ/GLTF 网格或贴图,而是生成由基元几何体、程序化材质组成的 TypeScript 工厂函数 createObjectModel(),返回一个可直接在浏览器运行、可动画化的 THREE.Group。项目核心理念是“代码即模型”:结果可读、可 diff、可版本控制,而非几兆的静态网格文件。

    img2threejs 核心亮点

    安装要求与快速开始

    环境要求

    • Python 3.10+(纯标准库,无需 pip 安装)
    • Claude Code / Codex / OpenCode(作为 skill 调用)或任意终端
    • Three.js 运行时(浏览器即可)

    作为 Claude Code Skill 使用

    1. 克隆到 skills 目录:
    git clone https://github.com/img2threejs/img2threejs.git ~/.claude/skills/img2threejs
    1. 贴入参考图,在对话中运行:
    /img2threejs Rebuild this object as a Three.js model, keep the proportions, angles, and colours.

    独立脚本模式(零依赖)

    python3 forge/stage1_intake/probe_image.py <image>
    python3 forge/stage2_spec/new_pre_spec_assessment.py "Name" --image <image> --out assessment.json
    python3 forge/stage2_spec/new_sculpt_spec.py "Name" --image <image> --assessment assessment.json --out spec.json
    python3 forge/stage2_spec/validate_sculpt_spec.py spec.json --strict-quality
    python3 forge/stage3_build/generate_threejs_factory.py spec.json --out src/createObjectModel.ts

    所有脚本仅使用 Python 标准库,没有 PIL、numpy、Playwright 等依赖。

    核心功能

    • 代码即模型(Reconstruction-by-Code):用 Three.js 基元 + 程序化着色器生成工厂代码,而非摄影测量或网格提取。
    • 八阶段雕刻流水线blockout → structural → form → material → surface → lighting → interaction → optimization,每阶段生成后视觉评审,不达标则返回修正。
    • 严格质量门控--strict-quality 在写第一行 Three.js 代码前拦截规格不足的浅请求,避免浪费 token。
    • 极致 Token 高效:Python 标准库脚本负责校验、门控、规格生成和比对打包;模型只做一件事——看“参考图 vs 渲染图”对照表并判定通过/打回。
    • Agent 无关:在 Claude Code、Codex、OpenCode 中都能作为 skill 运行,也提供独立终端脚本。
    • 动画就绪 + 多主题:输出暴露 pivots、sockets、userData.tick,支持硬表面物体、人形角色、四足/禽类/飞龙/蛇形生物以及 CS2 武器家族。

    img2threejs 八阶段雕刻流水线

    典型使用场景

    • 游戏/3D 资产快速原型:给一张枪械、载具或道具参考图,直接拿到能在浏览器里跑、可交互的 Three.js 模型。
    • AI 编码助手工作流:作为 skill 嵌入 Claude Code / Codex,贴图即可在对话中完成“重建为代码”,省掉 Blender 建模或网格下载。
    • 教学与可视化演示:官方 Live Demo Gallery 展示了从 Glock-18、BMX 自行车到哆啦A梦房子的纯代码重建案例。

    推荐理由

    img2threejs 的“重建为代码”思路非常克制而实用:把机械重复工作交给纯标准库 Python,把真正的视觉判断留给大模型,从而在 LLM agent 循环中保持 token 高效。八阶段门控设计让输出可预期,README 也诚实地声明了限制——单图无法保证隐藏面精度,硬表面强、角色偏风格化。今天(2026-08-09)仍活跃推送,v1.4.4 正朝 v1.5 角色重建更新。适合已经使用 Claude Code / Codex 的开发者扩展自己的 AI 工作流。

    下载地址

  • OpenWorker:吴恩达开源的本地优先 AI 同事,交付「已完成的工作」而非聊天

    OpenWorker:吴恩达开源的本地优先 AI 同事,交付「已完成的工作」而非聊天

    OpenWorker 品牌图

    OpenWorker 是深度学习之父吴恩达(Andrew Ng)开源的一款”本地优先”的 AI 同事(AI coworker)桌面应用。它不只想跟你聊天,而是要跨文件、终端和 25+ 应用连接器,真正把一件日常任务做完——交付一份排版好的文档、一条带数据的 Slack 回复、一份更新好的日历,或一个分诊完毕的收件箱。它运行在你的机器上,不锁定任何模型,用自己的 API Key(OpenAI / Anthropic / Google / 开源权重)或本地 Ollama 即可驱动。

    🖼️ 它是怎么工作的

    OpenWorker 工作原理

    桌面应用外壳(原生 GUI + Tauri)之下,是一套本地运行的 Python Agent 服务:引擎、工具、连接器都构建在吴恩达自己的 aisuite 之上;你的文件、终端、25+ 连接器与任意模型提供商,全部在你的机器上、用你的密钥运转。

    📦 安装要求和过程

    方式一:直接下载安装包(推荐)

    • macOS(Apple Silicon,12+):已签名公证、自动更新 → download.openworker.com/mac
    • Windows 10/11(x64):构建尚未代码签名,SmartScreen 会警告(签名进行中)→ download.openworker.com/windows
    • 打开应用 → 添加模型 Key(或指向 Ollama)→ 直接提出一个真实需求即可。

    方式二:从源码构建

    前置环境:Python 3.10+Node 20+,以及(桌面壳)通过 rustup 安装的 Rust 工具链。

    git clone https://github.com/andrewyng/openworker
    cd openworker
    
    # 1. 一次性引导,创建 Python venv(Windows 用 Git Bash / WSL)
    bash packaging/setup_dev_env.sh
    
    # 2. 启动本地 Agent 服务
    .venv/bin/openworker-server --cwd ~/some/project --port 8765
    #    Windows: .venv\Scripts\openworker-server.exe
    
    # 3. 另一个终端启动 UI
    cd surfaces/gui
    npm install
    npm run dev        # 浏览器 UI(Vite 端口)
    
    # 想跑完整桌面应用: npm run tauri dev

    ✨ 核心功能

    OpenWorker 核心亮点

    • 交付真实成果:文档、表格、报告、网页直接落地为可打开、可分享的文件,而不是一堆待办清单。
    • 25+ 应用连接器:GitHub、Slack、Jira、Notion、Linear、HubSpot、Outlook、monday.com、Gmail、Google Calendar,加上你的终端与本地文件;任何可通过 MCP 接入的工具都能插进来,并按工具粒度授权。
    • 自带模型密钥(BYOK):OpenAI、Anthropic、Gemini、Inkling、GLM、DeepSeek、Kimi、Qwen、MiniMax、Mistral、Grok,以及通过 Together / Fireworks 的开源权重模型,和 Ollama 本地模型;自带经工具调用验证的推荐清单。
    • 行动前先确认:写文件、发消息、执行命令都走审批门控;无人值守运行会把待办”问询”暂存到收件箱,绝不擅自行动。隐私本地优先——agent 循环、对话、连接器令牌、模型 Key 都留在本地密钥库。
    • 定时自动化:晨报、周报、频道值守等周期性任务按计划运行,结果带完整转录落回应用。

    🎯 典型使用场景

    1. Slack 里 @OpenWorker:在频道提及它,桌面自动开一个会话,用你的工具把活干完,答案作为线程回复回到频道。
    2. “准备一份客户简报””理清我的日历””跨 Jira 和 GitHub 看看发布进展到哪了”——它把任务拆成步骤,跨桌面、文件和已连接应用推进,重要动作前先与你确认。
    3. 定时晨报 / 周报:把重复性工作面交给自动化,每天/每周固定产出带完整记录的交付物。

    💡 推荐理由

    吴恩达出品,天然带着”让 AI 真正替你把事做完“的产品哲学。最打动我的是三点:一是本地优先 + 自带模型密钥,数据只通过你选定的模型和集成离开本机,隐私可控;二是“行动前确认”的克制设计,把 AI 代理从”话痨”拉回到”靠谱同事”;三是底层基于他自己的 aisuite(统一多模型 + Agent/MCP 层),想自己搭 Agent harness 的人也能拿它当参考实现。目前处于开放 Beta:可用、会自动更新、社区活跃,适合想把日常办公流程交给 AI 自动化、又不想把数据锁进某家云端的朋友尝鲜。

    🔗 下载地址

  • DwarfStar (ds4):antirez 打造的 DeepSeek V4 原生本地推理引擎

    DwarfStar (ds4):antirez 打造的 DeepSeek V4 原生本地推理引擎

    DwarfStar ds4

    📌 项目简介

    DwarfStar(简称 ds4)是 Redis 作者 antirez(Salvatore Sanfilippo)开源的一个原生本地推理引擎,专门为 DeepSeek V4 Flash / PROGLM 5.2 这类开源权重打造。它不追求做成通用 GGUF 运行器,而是把模型加载、分词、工具调用、KV 缓存、HTTP 服务乃至内置编码智能体垂直打通、一起调优;整个引擎用纯 C 编写、单文件二进制、零外部运行时依赖,在 Metal / CUDA / ROCm 三大后端上都能跑。

    DwarfStar 项目速览

    ⚙️ 安装要求和过程

    环境要求

    • 硬件后端:Apple Silicon(Metal,96 GB 以上内存最佳,小内存可走 SSD 流式加载);NVIDIA CUDA 显卡(含 DGX Spark / GB10 多卡);AMD ROCm(Strix Halo,如 Framework Desktop)。
    • 工具链:C 编译器(clang / gcc);CUDA 需 nvcc,ROCm 需 hipcc。仅依赖系统工具链,无外部运行时依赖
    • 模型权重:需单独从 Hugging Face(antirez/deepseek-v4-gguf)下载对应的 GGUF 文件,引擎不内置权重。

    快速安装

    # 克隆仓库
    git clone https://github.com/antirez/ds4
    cd ds4
    
    # macOS(默认 Metal 后端)
    make
    
    # NVIDIA CUDA:DGX Spark / GB10
    make cuda-spark
    # 或通用本地 CUDA 构建
    make cuda CUDA_ARCH=native
    
    # AMD ROCm(Strix Halo / Framework Desktop,gfx1151)
    make rocm
    
    # CPU 参考 / 调试路径(非生产用途)
    make cpu

    下载模型权重

    # 下载一个主模型(推荐 imatrix 版)
    ./download_model.sh ds4f-q2          # 96 / 128 GB 内存机器
    ./download_model.sh ds4f-q2-q4       # 末 6 层专家用 q4
    ./download_model.sh ds4f-q4          # ≥ 256 GB 内存
    ./download_model.sh ds4f-mxfp4       # 原生 MXFP4 专家,约 156 GB
    ./download_model.sh pro-q2-imatrix   # 512 GB 内存,PRO q2 imatrix 量化

    运行

    # 单条提示
    ./ds4 -p "用一段话解释 Redis Stream。"
    
    # 进入多轮交互式对话
    ./ds4
    ds4> /help
    
    # 启动 OpenAI / Anthropic 兼容的本地服务
    ./ds4-server --ctx 100000 --kv-disk-dir /tmp/ds4-kv --kv-disk-space-mb 8192

    ✨ 核心功能

    DwarfStar 核心能力

    1. 贴近模型的「专用」引擎:不为通用 GGUF 设计,模型加载 / 分词 / 工具调用 / KV 缓存 / HTTP 服务 / 编码智能体垂直打通,针对少数量身优化的开源权重做专项调优。
    2. 三大后端原生加速:Metal(主战场,Mac 96 GB+)、NVIDIA CUDA(含多卡 / DGX Spark)、ROCm(Strix Halo);内存不足的机器还能用 SSD 流式加载权重。
    3. 分布式推理:管道并行把多台机器的内存叠加起来跑更大的模型;基于 RDMA 的张量并行甚至能让两台 128 GB MacBook 合力运行 4-bit 的 DeepSeek Flash 或 GLM 5.2。
    4. 内置原生编码智能体:推理由智能体内部直接驱动、没有 socket / API 边界,会话本身就是磁盘上的 KV 缓存;工具调用走原生 LLM 格式,延迟极低、KV 永不错位,还能用 /save /switch 续上历史会话。
    5. OpenAI / Anthropic 兼容服务ds4-server 提供 /v1/chat/completions/v1/responses 等端点,支持多会话批处理与磁盘 KV 缓存,可完全私有化部署。

    DwarfStar 性能实测

    实测参考(q2 量化,意大利语长文本输入):MacBook Pro M5 Max(128 GB,Metal)在 2K 上下文下预填约 790 t/s、生成约 39 t/s;DGX Spark GB10 预填可达 826 t/s。128 GB 内存即可流畅跑 DeepSeek V4 Flash。

    🎯 典型使用场景

    DwarfStar 适用场景

    1. 个人高端 Mac / 工作站本地跑强模型:MacBook M5 Max、Mac Studio M3 Ultra、DGX Spark、Framework Desktop 用户,无需联网、隐私不出本机即可使用 DeepSeek V4 级别的大模型。
    2. 把闲置旧 CUDA 卡变成多用户服务器:借助 CUDA 多卡与 ds4-server 的微批处理,把不再被 vLLM 支持的旧 Ada 架构显卡(如 8×L40S)改造成公司内部的多用户 LLM 服务。
    3. 企业内网私有化部署:用 OpenAI 兼容端点 + 磁盘 KV 缓存,配合工具调用承载客服、知识库问答、本地编码助手等智能体,数据全程不出内网。

    💡 推荐理由

    作为 Redis 作者的最新作品,ds4 最打动我的是它的「克制与专注」:它坦然承认自己不是万能的通用推理器,而是把一件事做到极致——让 DeepSeek V4 这类前沿开源权重在消费级 / 工作站级硬件上跑得又快又稳。对一个 C 写的单文件引擎来说,开箱即用的交互式 CLI、兼容 OpenAI 的服务端、甚至原生编码智能体全部到位,体验相当完整。

    特别加分的是项目的坦诚:antirez 在 README 里明确做了「AI 全程披露」,说明代码大量借助 GPT / Claude 完成、但由人类把握方向与测试,同时也郑重致谢 llama.cpp 与 GGML——这种开源精神值得点赞。需要提醒的是,项目目前仍处快速迭代的 beta 阶段、文档也在持续补全,适合愿意折腾、想把手里高端硬件榨干的朋友尝鲜。

    🔗 下载地址

  • LiveKit Agents:用 Python 构建实时语音 AI 智能体的开源框架

    LiveKit Agents:用 Python 构建实时语音 AI 智能体的开源框架

    在语音助手、AI 客服、实时翻译早已不是新鲜事的今天,真正难的是:如何用一个干净、可编排、可私有部署的框架,把 STT、LLM、TTS 串成一次低延迟、不打断、能“看见”的实时对话。LiveKit Agents 正是为这件事而生。

    📌 项目简介

    LiveKit Agents 是一个用于构建实时、可编程的多模态语音 AI 智能体的开源框架,运行在服务器端,让智能体具备“看、听、理解”的能力。它把语音识别(STT)、大模型(LLM)、语音合成(TTS)以及实时模型(Realtime API)抽象成可自由替换的组件,并提供任务调度、工具调用、测试框架等一整套生产级能力。

    💻 安装要求与过程

    环境要求

    • Python 3.9+
    • 一个 LiveKit 服务器:可用 LiveKit Cloud,也可用开源的 livekit 自托管
    • 至少一家模型服务商的密钥:如 Deepgram(STT)、OpenAI / Google(LLM)、Cartesia(TTS)等
    • 如需电话接入,可启用 LiveKit 的 SIP / 电话栈

    快速安装

    pip install "livekit-agents[openai,deepgram,cartesia]"

    三种运行模式

    # 终端本地测试:无需外部服务器,直接验证交互
    python myagent.py console
    
    # 开发模式:连接 LiveKit 云/自托管,支持热重载
    python myagent.py dev
    
    # 生产部署:生产级优化
    python myagent.py start

    开发 / 生产模式需配置环境变量:LIVEKIT_URLLIVEKIT_API_KEYLIVEKIT_API_SECRET(以及对应模型服务商的 Key)。也可用 Agents Playground 快速体验。

    ✨ 核心功能

    • 灵活集成:完整的插件生态,自由混搭最合适的 STT、LLM、TTS 与 Realtime API。
    • 内置任务调度:通过 Dispatch API 自动做任务分配与分发,把终端用户连接到对应智能体。
    • 语义轮流检测(Turn Detection):用 Transformer 模型判断用户是否说完,显著降低误打断。
    • 原生 MCP 支持:一行代码即可把 MCP 服务器提供的工具接入智能体。
    • 内置测试框架:用断言(expect)配合 LLM 评判(judge)编写测试,对抗 LLM 的非确定性。
    • 全平台 WebRTC 客户端 + 电话集成:覆盖浏览器、iOS、Android、Flutter 等,并可拨打 / 接听电话。

    🎯 典型使用场景

    • 语音客服 / 订餐机器人:内置 restaurant_agent 范例,可处理来电订餐与预约,直接对接电话线路。
    • 外呼电话机器人:Outbound Caller 范例可自动批量拨打电话、播报与收集信息。
    • 多智能体接力(Handoff):多个 Agent 按流程交接(如先收集信息、再切换讲故事 Agent),适合工单分流、复杂客服。
    • 视频数字人:通过 Tavus、Bithuman、LemonSlice 等接入 AI 虚拟形象,做出“能说话的脸”。
    • 实时视觉 Agent:结合 Gemini Live 等,做出能“看见”环境并对话的助手(含 iOS 端范例)。

    💡 推荐理由

    我自己折腾过不少语音 Agent 方案,LiveKit Agents 最打动我的是它的“把复杂留给自己、把简单交给开发者”:一个 AgentSession 把你想要的 STT/LLM/TTS 一行声明完,多智能体切换、工具调用、打断检测都有官方最佳实践兜底;更关键的是整套栈可私有化——连媒体服务器都是开源的,数据不出自己的机房,对企业场景非常友好。再加上官方提供的 LiveKit Docs MCPAgent Skill,用 AI 编程助手来搭语音应用也顺手很多。如果你打算认真做一个“能听会说”的产品,它值得作为底座首选。

    🔗 下载地址

    LiveKit Agents 核心亮点

  • DeepSeek-Reasonix:围绕前缀缓存稳定性打造的 DeepSeek 原生终端 AI 编程智能体

    DeepSeek-Reasonix:围绕前缀缓存稳定性打造的 DeepSeek 原生终端 AI 编程智能体

    DeepSeek-Reasonix 核心亮点

    DeepSeek-Reasonix(npm 包名 reasonix)是一个深度围绕 DeepSeek 前缀缓存稳定性打造的开源终端 AI 编程智能体:把 Agent 跑成长会话也不心疼 token,单文件 Go 二进制即装即用。

    📊 项目速览

    • ⭐ Stars:30.6K | Fork:1.97K | 语言:Go | 协议:MIT | 首个版本:2026-04
    • 🏷️ 定位:终端 / TUI / 桌面 / VS Code 四端共用同一本地引擎的 Coding Agent
    • 🔗 官网:https://reasonix.io/

    🔧 安装要求与过程

    环境要求

    • 支持 macOS / Linux / Windows(amd64 与 arm64)
    • 方式 A 需 Node.js(用于 npm)或 macOS 上的 Homebrew;方式 D 源码编译需 Go 工具链
    • 一个 DeepSeek(或任意 OpenAI 兼容)API Key,通过 reasonix setup 配置

    快速安装(推荐 CLI / TUI)

    # 任意系统,拉取预编译原生二进制
    npm i -g reasonix
    
    # 或 macOS 用 Homebrew
    brew install esengine/reasonix/reasonix

    其他安装方式:① 桌面端 到官网下载页取 .dmg/.exe/.deb/.tar.gz;② VS Code 扩展 在 Marketplace 搜 SivanLiu.reasonix-agent;③ 源码编译

    git clone https://github.com/esengine/DeepSeek-Reasonix.git
    cd DeepSeek-Reasonix
    make build      # -> bin/reasonix
    make cross      # -> dist/ (darwin|linux|windows x amd64|arm64)

    三步上手

    reasonix setup                      # 配置 provider 与模型
    reasonix                            # 启动交互式会话
    reasonix run "implement the TODOs in main.go"   # 一次性跑任务

    交互会话里执行 /init 可让 Reasonix 自动生成项目说明文件。

    ✨ 核心功能

    1. 配置驱动:Provider、Agent、启用的工具与插件全部声明在 reasonix.toml,没有任何硬编码模型,换模型只是改一行配置。
    2. 多模型可组合:DeepSeek 是预置项;任意 OpenAI 兼容端点都是一条配置而非新代码;还可让两个模型(执行器 + 规划器)在各自缓存稳定的会话里协同工作。
    3. 插件驱动:外部工具以子进程方式经 stdio JSON-RPC 运行(兼容 MCP 协议);内置工具在编译期自注册,扩展能力零摩擦。
    4. 缓存感知的上下文维护:启动时注入一份稳定的环境摘要,压缩摘要前先裁剪陈旧的工具输出,让长会话的前缀缓存命中率保持高位、token 成本维持低位。
    5. 零摩擦分发CGO_ENABLED=0 产出单文件静态二进制,一条命令交叉编译到 6 个平台目标,唯一的外部依赖只是一个 TOML 解析器。

    🎯 典型使用场景

    • 长会话大型重构:把 Reasonix 一直开着,前缀缓存让「边聊边改」一整天也花不了多少 token;适合跨多文件的模块重构与迁移。
    • 双模型协作攻坚:用 DeepSeek 当执行器、再挂一个规划器模型,分别在缓存稳定的会话里做「想」与「做」的分工,复杂任务更稳。
    • 纯终端原生工作流:无需 IDE,命令行直接驱动;需要时也能借 VS Code 扩展获得编辑器上下文、工具调用审批与模型切换。

    💡 推荐理由

    我比较看重它三点:一是真的为 DeepSeek 优化过——前缀缓存稳定性不是口头标语,长会话成本明显比通用 Agent 低;二是单文件二进制零运行时依赖,在公司受限环境或远程机器上一拷就能跑,比一堆 Node/Python 依赖的 Agent 省心;三是配置与插件都走开放协议(TOML + MCP 兼容),不锁死模型,想接哪个 OpenAI 兼容端点都行。要说短板,项目 2026 年 4 月才起步,生态与社区体量还比不上 Claude Code / Cursor 那类老牌选手,但长势很猛(上线数月已 30K+ Star)。如果你常驻终端、又想用便宜强推理的 DeepSeek 干活,它值得一试。

    📥 下载地址

  • AirLLM:单张 4GB 显卡跑起 70B 大模型,无需量化不损精度

    AirLLM:单张 4GB 显卡跑起 70B 大模型,无需量化不损精度

    如果你手头只有一张 4GB 显存的消费级显卡(比如 RTX 3050 / 4060),却想本地跑 70B 级别的大模型,AirLLM 是目前最省心的解法之一。它不靠量化、蒸馏或剪枝来”阉割”模型,而是用逐层加载的巧思,把推理所需的显存从”整个模型”压到”单层”,让穷人也能在本地玩转大模型。

    📌 项目简介

    AirLLM 是一个低显存大模型推理框架。它核心思路是一次只在 GPU 上保留一层权重,配合稀疏 MoE 的专家流式加载,使显存占用取决于”单层大小”而非”模型总大小”。因此在原生精度、零精度损失的前提下,单张 4GB 显卡就能跑 70B 模型,8GB 跑 405B,约 12GB 跑 DeepSeek-V3(671B)。

    🛠 安装要求和过程

    环境要求

    • Python 3.8+ 与 PyTorch(CUDA 可用 GPU,或 MacOS Apple Silicon 上的 MLX)
    • HuggingFace transformers 等依赖(仓库 requirements.txt 已列)
    • 需能联网拉取 HuggingFace 模型权重

    快速安装

    pip install airllm

    如需开启模型压缩加速(必须 airllm 2.0.0+):

    pip install -U bitsandbytes
    pip install -U airllm

    ⚡ 核心功能

    1. 极低显存推理:70B≈4GB、405B≈8GB、DeepSeek-V3 671B≈12GB、Kimi K3 2.8T 低于 4GB。
    2. 无量化/蒸馏/剪枝:原生精度运行,彻底告别量化带来的精度焦虑。
    3. 模型压缩加速:基于分块量化的 4bit/8bit 压缩,最高约 3× 推理加速,精度损失可忽略。
    4. AutoModel 统一接口:一行 from_pretrained 切换 Llama / Qwen / DeepSeek / Mistral / Phi / Gemma / ChatGLM 等。
    5. 多平台 + 预取:支持 Linux 与 MacOS(Apple silicon);加载与计算重叠预取提速;稀疏 MoE 专家流式加载。
    AirLLM 模型压缩 3x 推理加速
    AirLLM 基于分块量化的 4bit/8bit 压缩可带来最高约 3× 推理加速,精度损失可忽略

    🎯 典型使用场景

    • 个人本地推理:开发者用 4–8GB 显卡在本地跑 70B/405B 模型做聊天、RAG、Agent,无需租用云 GPU。
    • 低成本大模型服务:在显存受限的边缘/低成本服务器上部署 DeepSeek-V3(671B)这类超大模型对外提供能力。
    • 教学与演示:在普通笔记本上现场演示大模型推理流程,无需昂贵的 A100/H100,课堂与 workshop 友好。

    💡 推荐理由(个人使用心得)

    AirLLM 真正把”穷人也能玩大模型”变成了现实——4GB 显卡就能跑 70B,门槛低到惊人。相比各种量化方案,它保留全精度输出,结果更可靠、更可复现;而且 AutoModel 接口与 HuggingFace transformers 几乎一致,迁移成本几乎为零。两点提醒:一是逐层加载牺牲了速度,更偏 demo / 研究,不适合高并发生产;二是需要能拉取 HF 权重,且开启压缩加速要额外装 bitsandbytes。整体而言,是入门本地大模型的极佳首选。

    🔗 下载地址

  • colibri:用纯 C 把 744B~2.8T MoE 大模型跑到本地

    colibri:用纯 C 把 744B~2.8T MoE 大模型跑到本地

    colibri 是近期 GitHub 上热度最高的本地推理引擎之一:只用纯 C 编写、零运行时依赖,就能把 744B 到 2.8T 参数的 MoE(混合专家)大模型跑在你现有的硬件上。它不是把模型硬塞进显存,而是把 VRAM、RAM 和 NVMe 当作同一层级来管理,按需从磁盘流式加载专家权重。项目上线一个月已收获 21.9K Stars,并支持 GLM-5.2、Inkling、Kimi K3、OLMoE 四大模型家族。

    本期我们就来拆解:colibri 是怎么让“本地运行千亿 MoE”这件事从神话变成可复现实验的。

    项目简介

    colibri 是一个面向前沿 MoE 模型的本地推理引擎。它用“存储即内存层级”的思路替代传统的“模型必须全进显存”假设:密集注意力层常驻 RAM,19456 个路由专家放在磁盘,只有在路由器真正需要时才被预取到 RAM/VRAM。这样一台只有 25 GB 内存的常规电脑也能把 744B 的 GLM-5.2 跑起来,而高端工作站则可以把全部专家驻留 GPU,达到接近数据中心的吞吐。

    配图速览

    colibri 核心速览
    colibri 核心数据一览
    三层存储层级
    colibri 把专家权重分布在 VRAM / RAM / NVMe 三个层级,速度随硬件变化,语义保持不变。

    安装要求和过程

    环境要求

    • 操作系统:Linux、macOS、Windows 11
    • 内存:最低 25 GB RAM(仅 CPU 流式);推荐 128 GB 或更高,配合多 GPU 可获得更好体验
    • 磁盘:GLM-5.2 int4 容器约 372 GB;Kimi K3 原始检查点约 1.6 TB
    • 软件:Python 3(仅用于 launcher 和转换脚本);编译源码需要 gcc/clang + OpenMP
    • GPU(可选):CUDA、Metal(Apple Silicon)、Vulkan 1.2(含 AMD RADV)后端均可选

    快速安装

    1. 下载对应平台的预编译 release 并解压:
    mkdir colibri && tar xzf colibri-v1.1.0-linux-x86_64.tar.gz -C colibri && cd colibri
    python3 coli info
    1. 或从源码构建:
    git clone https://github.com/JustVugg/colibri && cd colibri/c
    ./setup.sh
    1. 下载 GLM-5.2 int4 gs64 容器(推荐带 int8 MTP 头的版本):
    # 推荐从 Hugging Face 拉取 mastouri/GLM-5.2-colibri-int4-g64-with-int8-mtp
    # 约 372 GB,放 NVMe 上最佳
    1. 运行交互式聊天、API 服务或 Web 面板:
    COLI_MODEL=/nvme/glm52_i4 ./coli chat
    COLI_MODEL=/nvme/glm52_i4 ./coli serve    # OpenAI-compatible API
    ./coli web --model /nvme/glm52_i4          # API + 可视化 dashboard

    核心功能

    1. 存储即内存层级
      把 VRAM、RAM、NVMe 统一成专家权重的放置策略。缺显存不会悄悄改模型精度或路由语义,只会影响速度。
    2. 按需流式加载专家
      MoE 每层只激活少量专家。colibri 让 19456 个专家中的绝大部分常驻磁盘,通过 per-layer LRU、学习到的热专家 pinned set 和一层提前预取(PILOT)减少磁盘等待。
    3. 纯 C 零依赖引擎
      每个模型对应一个 C 文件(如 c/glm.c),无 BLAS、无运行时 Python、无 GPU 也能跑。
    4. 多后端异构执行
      支持 CPU、CUDA、Metal、Vulkan 四种后端,可组合使用;双 SSD 镜像可把只读专家读取带宽翻倍。
    5. 学习缓存与压缩状态
      引擎记录你的工作负载路由历史(.coli_usage),越用越快;MLA KV 状态压缩到原来的 1/57,并能持久化对话上下文。

    典型使用场景

    场景一:个人开发者跑前沿模型做实验

    你只有一台 64 GB RAM + 1 TB NVMe 的台式机。传统 vLLM/llama.cpp 会把 744B 模型拒之门外;colibri 让你用 COLI_MODEL=/nvme/glm52_i4 ./coli chat 直接对话,虽然 token/s 不高,但足以做提示工程、长文本探索和小批量评估。

    场景二:工作室搭建本地私有 API

    在多卡工作站(如 6× RTX 5090)上,把专家全部驻留 GPU,colibri 可提供 5.8–6.8 tok/s 的解码速度和 1.6 s 的 TTFT。通过 coli serve 提供 OpenAI-compatible API,内部团队就能在不联网的情况下调用千亿模型。

    场景三:MoE 推理系统研究

    colibri 把放置策略、调度、I/O、CPU/GPU 重叠都做成可测量的实验参数。研究者可以替换缓存策略、测试双 SSD 镜像、评估 int4/int8/MXFP4 格式对质量的影响,并把结果以 issue 形式回馈社区。

    推荐理由

    colibri 最打动我的不是“跑 744B 模型”这个噱头,而是它把“本地推理”重新定义为系统优化问题:不盲目堆硬件,而是认真测量每一个瓶颈——磁盘带宽、专家命中率、KV 压缩、CPU/GPU 重叠、量化质量——并用可复现的 A/B 来做决策。README 里反复出现的不是营销数字,而是“这个功能在哪台机器上、用什么 commit、跑什么 prompt 测出来的”。

    对于国内用户,它还有一个隐性好处:GLM-5.2、Kimi K3、Qwen3 MoE(roadmap)等模型天然和中国模型生态更近,未来可以更低成本地跑开源中文大模型。

    当然,它现在还是研究导向的项目:没有 SLA 保证速度,配置参数很多,对磁盘和内存仍有一定要求。但如果你既想摸到前沿模型,又不想把数据送出去,colibri 是 2026 年最值得关注的本地推理引擎之一。

    下载地址

  • TRELLIS.2:微软开源 4B 参数图像到 3D 生成模型,3 秒生成高保真纹理资产

    TRELLIS.2:微软开源 4B 参数图像到 3D 生成模型,3 秒生成高保真纹理资产

    TRELLIS.2

    项目简介

    TRELLIS.2 是微软研究院开源的 4B 参数大规模 3D 生成模型,专注于图像到 3D(image-to-3D)资产生成。它抛弃了传统等值面场的限制,提出一种名为 O-Voxel 的“无场”稀疏体素结构,能够原生重建和生成具有复杂拓扑、锐利细节以及完整 PBR 材质的 3D 模型。

    安装要求和过程

    目前官方仅验证过 Linux 环境,GPU 显存至少 24GB(推荐 A100 / H100),需要 CUDA 12.4 和 Conda。

    1. 克隆仓库:
      git clone -b main https://github.com/microsoft/TRELLIS.2.git --recursive
      cd TRELLIS.2
    2. 创建 conda 环境并安装依赖:
      . ./setup.sh --new-env --basic --flash-attn --nvdiffrast --nvdiffrec --cumesh --o-voxel --flexgemm
    3. 从 Hugging Face 下载 4B 预训练权重:
      https://huggingface.co/microsoft/TRELLIS.2-4B

    核心功能

    • 高保真生成:40 亿参数 DiT 模型 + 16× 下采样稀疏 3D VAE,可直接生成 512³ 到 1536³ 分辨率的带纹理 3D 资产。
    • O-Voxel 拓扑自由:原生支持开放曲面、非流形几何和内部封闭结构,无需像传统 NeRF/SDF 那样进行有损转换。
    • PBR 材质建模:不仅生成基础色,还输出 Roughness、Metallic、Opacity 等属性,支持透明与真实感渲染。
    • 极简后处理:纹理网格转 O-Voxel 单 CPU <10 秒,O-Voxel 转纹理网格在 CUDA 上 <100 毫秒。
    • 完整训练代码:开源 SC-VAE、形状/纹理 Flow Model 训练脚本,可用 Objaverse-XL 等数据从头训练或微调。

    TRELLIS.2 核心特性

    典型使用场景

    • 游戏/影视资产快速出稿:原画师只需提供一张概念图,即可在数秒内获得带 PBR 材质的可用 3D 模型,大幅缩短原型迭代周期。
    • 电商/虚拟展示:把产品照片自动转换为可旋转的 GLB 3D 资产,用于网页 AR、虚拟展厅和商品详情页。
    • 3D 内容创作者工具链:结合 ComfyUI、Blender 等工具,将 TRELLIS.2 作为 AI 建模节点,批量生成风格化道具和场景元素。

    推荐理由

    TRELLIS.2 给我的最大惊喜是“快”和“全”:快在 H100 上 3 秒就能跑出 512³ 的高质量模型;全在从模型权重到训练代码全部开源,还配有 Hugging Face Demo。相比之前很多只能生成封闭几何体的方案,它对开放曲面、衣物、叶片等复杂拓扑的处理明显更稳。对于想要在本地做 3D AIGC 的同学来说,这是目前最值得入手的工程基座之一。

    下载地址

  • HTML Anything:让本地 AI 智能体一键生成可发布的 HTML(8K+ Stars)

    HTML Anything:让本地 AI 智能体一键生成可发布的 HTML(8K+ Stars)

    HTML Anythingnexu-io 开源的本地优先(local-first)AI HTML 编辑器:你只需提供 Markdown、CSV、Excel、JSON 或零散笔记,按下 ⌘+Enter,本地已登录的编码智能体就会把内容渲染成可直接发布的单文件 HTML。

    HTML Anything — 智能体时代的 HTML 编辑器
    HTML Anything — 智能体时代的 HTML 编辑器

    项目简介

    它不做模型、不卖 API,而是把你已经装好的 Claude Code、Cursor Agent、Codex、Gemini CLI、GitHub Copilot CLI、OpenCode、Qwen Coder、Aider、IBM Bob 等 9 款编码智能体 CLI 当作后端,通过 75 个可组合技能模板,输出 9 种常见“交付形态”:杂志文章、演示文稿、简历、海报、小红书卡片、推文卡片、网页原型、数据报告、Hyperframes 视频帧。生成结果支持一键粘贴到微信公众号、知乎、X / 微博 / 小红书,或下载 .html / .png。

    核心亮点速览:9 CLI / 75 技能 / 9 交付形态 / 零 API Key / 一键导出
    核心亮点速览:9 CLI / 75 技能 / 9 交付形态 / 零 API Key / 一键导出

    安装要求与快速开始

    环境要求

    • Node.js ≥ 18,推荐安装 pnpm
    • 任意一款已登录的编码智能体 CLI(如 claude / cursor-agent / codex / gemini / copilot 等)
    • 不需要额外 API Key,复用你已登录的会话

    快速安装

    git clone https://github.com/nexu-io/html-anything
    cd html-anything
    pnpm install
    pnpm -F @html-anything/next dev
    # → http://localhost:3000
    

    启动后浏览器会自动扫描 PATH(包括 ~/.local/bin/opt/homebrew/bin 等 GUI 应用常忽略的目录),并在顶部工具栏列出可识别的 CLI。选一个模板、贴入内容、⌘+Enter 即可。

    主界面:左侧编辑器 / 中间模板选择器 / 右侧实时 iframe 预览
    主界面:左侧编辑器 / 中间模板选择器 / 右侧实时 iframe 预览

    核心功能

    • 零 API Key:复用本地已登录的编码智能体会话,边际成本为 0。
    • 9 大智能体自动检测:Claude Code、Cursor、Codex、Gemini、Copilot、OpenCode、Qwen、Aider、IBM Bob,顶部一键切换。
    • 75 个技能模板:覆盖 prototype / deck / frame / social / office / doc / mockup / vfx 等模式,从 SaaS 落地页到财务报告、从瑞士国际主义幻灯片到 Hyperframes 视频帧都有现成模板。
    • 9 种交付形态:杂志文章、演示文稿、简历、海报、小红书卡片、推文卡片、网页原型、数据报告、Hyperframes 视频帧。
    • 实时 SSE 流式渲染:智能体输出 JSON-line,服务端转成 Server-Sent Events,浏览器实时追加到 iframe srcdoc,像看 AI 打字一样看网页生成。
    • 沙箱预览:用户 HTML 运行在 <iframe sandbox> 中,脚本仍可执行,但 cookies/localStorage 与宿主隔离。
    • 一键导出:juice 内联 CSS → 微信公众号 / 知乎;modern-screenshot 2× PNG → X / 微博 / 小红书;另可下载单文件 .html 或 .png。
    一键导出:微信公众号 · X/微博 · 知乎 · 小红书 · HTML · PNG
    一键导出:微信公众号 · X/微博 · 知乎 · 小红书 · HTML · PNG

    典型使用场景

    场景 1:公众号长文排版

    写好 Markdown 初稿,选择 article-magazinedoc-kami-parchment 技能,智能体会自动套用 CJK 优先字体栈、8px 基线网格、对比度 ≥4.5 的配色,生成可直接粘贴到公众号编辑器的 HTML,无需二次调样式。

    场景 2:小红书 / X 卡片

    把一段金句或数据结论贴进去,选择 card-xiaohongshusocial-x-post-card 模板,即可生成 1080×1080 或 1600×900 的高清 PNG,复制后直接进入小红书 / X 发布界面,避免手动修图。

    场景 3:投资人路演 PPT

    输入产品要点,选择 deck-pitchdeck-swiss-internationaldeck-open-slide-canvas,自动产出 1920×1080 的横向幻灯片,支持键盘左右翻页、演讲者备注和 PDF 导出。

    幻灯片模式:内置 20 套主题,可直接导出或路演
    幻灯片模式:内置 20 套主题,可直接导出或路演

    推荐理由

    它是目前把“本地 AI 智能体”和“中文内容创作”结合得最顺手的开源工具之一:不绑 API、不抢隐私,复用你已经付费订阅的 Claude / Cursor / Copilot;针对微信公众号、知乎、小红书等中文平台做了专门适配,解决了 Markdown 转公众号格式崩坏、转小红书要手动修图的老大难问题;技能模板基于 SKILL.md 协议,新增模板只需复制一个文件夹、改一段 frontmatter,社区扩展门槛低。如果你平时需要大量产出图文、PPT、产品原型,把它接进工作流能省不少时间。

    下载与资源