标签: 开发者工具

  • PPT Master:AI 把文档一键变成真正可编辑的原生 PowerPoint

    PPT Master:AI 把文档一键变成真正可编辑的原生 PowerPoint

    PPT Master 示例:Global AI Capital 2026 数据新闻风 deck

    示例:用 PPT Master 一键生成的《Global AI Capital 2026》数据新闻风演示(Bloomberg 风格深色仪表盘,图表驱动)

    项目简介

    PPT Master 是 Hugo He 开源的一个 AI 工作流,它运行在任意具备 Agent 能力的 AI 工具(Claude / GPT / Gemini / Kimi 等)中,把你的文档或主题直接生成真正可在 PowerPoint 里继续编辑的原生演示文稿——不只是「可编辑」,而是拥有原生形状、图表、表格、母版与过渡动画的完整 PPT 对象模型。当前 GitHub 45.4K★、MIT 许可、Python 实现。

    安装要求与快速开始

    环境要求:只需手动安装 Python 3.10+(唯一需要的环境);一个具备 Agent 能力的 AI 工具(官方推荐 Claude Code,也可用 Cursor、Codex CLI、Gemini CLI 等);可选:AI 生图(如 gpt-image-2)与联网搜图所需的 API Key。数据全程本地,无订阅、无平台锁定。

    快速安装:

    git clone https://github.com/hugohe3/ppt-master.git
    cd ppt-master
    pip install -r requirements.txt

    在该目录下打开你的 AI Agent,把材料放进 projects/ 目录,对它说「用 projects/xxx.pdf 做个 PPT」即可。Windows 用户可参考官方《Windows 安装指南》,10 分钟从零到成片。模型推荐大上下文窗口的 Kimi K3 或 Claude,配合 gpt-image-2 生图质量最佳。

    核心功能

    • 原生 PowerPoint 对象模型:输出真正的 slide master、原生形状与连接器、文本框,点击任意元素都能当作原生 PPT 对象继续修改,而不是扁平图片或套模板。
    • 数据驱动的图表与表格:可导出为真实的 PowerPoint Chart / Table 对象,支持「编辑数据」与对象级控制,跨应用视觉一致。
    • 跑在任意 AI Agent 里:Claude、GPT、Gemini、Kimi 均可驱动,无平台锁定;免费开源,成本只有模型调用费。
    • 数据留在本地:除与大模型通信外,整条流水线都在本机运行。
    • 复用你的模板 + 旁白/动画:可填充现有 .pptx 保留原设计,支持演讲者备注转语音旁白,甚至生成自动讲解视频。

    PPT Master 核心亮点

    典型使用场景

    • 从资料直接出片:把一沓 PDF / DOCX / 网页丢进去,让 AI 先梳理论点结构再做视觉设计,输出包含数据图表的完整 deck。
    • 套用公司模板:把已有的品牌 .pptx 交给它,只填新内容、保留原设计,导出你选中的页面。
    • 给成片加旁白:对做好的 deck 追加原生过渡、动画与语音旁白,直接生成可自动播放讲解的演示。

    推荐理由

    作者 Hugo He 是一位金融从业者(CPA·CPV·咨询工程师),他做这个工具的初衷很朴素:市面上的「AI 做 PPT」大多把幻灯片拍扁成图片或硬套模板,二次编辑体验很差;他想要的是在 PowerPoint 里依然能改的原生成品。这与我的痛点高度一致——「可编辑」早已是标配,真正的分水岭是「原生深度」。PPT Master 的方向就是持续向 PowerPoint 本身收敛,一个版本一个版本补上更多原生能力。

    作为日常生产力工具,它最打动我的是三点:免费开源、数据本地、无平台锁定——你不必把资料上交某个云平台,就能把最枯燥的排版活交给 AI。建议搭配大上下文模型(Kimi K3 / Claude)+ gpt-image-2 生图,质量最好;便宜模型也能跑,只是留给你的润色活更多。它不是「许愿池」,但能替你卸掉大部分重复劳动。

    下载地址

  • AOS Community Edition:开源智能体操作系统,让 AI Agent 拥有自己的 OS

    AOS Community Edition:开源智能体操作系统,让 AI Agent 拥有自己的 OS

    AOS 核心亮点

    项目简介

    AOS Community Edition 是 Unicity 团队开源的「智能体操作系统」(Agent Operating System),为需要可检视、可组合环境的 AI 智能体提供完整的运行时基础设施。它包含 aos CLI 命令行、HTTP API、21 个官方 Capsule 组件、MCP 边缘入口以及 Unicity Audit 安全审计能力,全部以 Rust 编写并采用 MIT/Apache-2.0 双许可发布。

    安装要求与快速开始

    AOS 支持主流 Unix 系统(macOS / Linux)和 Windows。安装只需两步:

    # 1. 安装 aos CLI(含固定运行时和 21 个 CE capsule)
    curl --proto '=https' --tlsv1.2 -fsSL https://aos.unicity.ai/install.sh | sh
    
    # 2. 初始化工作区(从本地版本化资产置备 ~/.aos)
    aos init

    安装器会自动下载并锁定精确的运行时版本。每次发布附带校验和、Sigstore 签名包和 GitHub 构建溯源证明,签名前一律 fail-closed——未经验证的版本绝不会进入 stable 通道。

    升级同样简单:

    aos update          # 协调式产品升级(Homebrew 安装亦可)

    核心功能

    aos 命令速览
    • 统一的 aos CLI 与 HTTP API:一条命令管理一切——init / status / update / daemon / mcp / capsule build / doctor。命令边界清晰,产品自有实现与底层运行时无缝衔接。
    • 21 个官方 Capsule 组件:开箱即用的用户态构件,可被自由编排成 harness、meta-harness、connector 或服务。每个 capsule 以最小权限组合,能力粒度精细可控。
    • 一等公民的 MCP 支持aos mcp serve 是 Codex、Claude、Grok 共享的产品边缘入口。本地决策面在 macOS 提供 AppKit、Windows 提供原生对话框、Linux 使用 Pinentry——绝不收集密码与 URL
    • Forge 操作系统级构建工具:新智能体能检视运行中的系统、学习 capsule 模型、识别真实能力缺口,并用 Forge 构建验证最小权限 capsule。内置 meta-harness 技能教会智能体如何治理自己的世界。
    • 供应链安全与可验证发布:Sigstore 签名包 + GitHub 构建溯源证明 + runtime-compatibility.toml 锁定运行时/WIT 提交,fail-closed 策略确保只有经过完整验证的版本才能发布。

    典型使用场景

    场景一:多模型编码智能体的统一运行时

    你的团队同时使用 Codex、Claude Code 和 Grok 作为编程助手。通过 AOS 的 aos mcp serve,三个客户端共享同一套 MCP 工具链和审批策略,无需重复配置。每个智能体在隔离的 principal 下运行,操作员身份与目标环境分离——aos --principal operator init --target-principal alice 即可完成多租户置备。

    场景二:企业级智能体安全部署

    企业环境要求所有 AI 操作可审计、可回溯。AOS 的 Unicity Audit 能力配合 Sigstore 签名和 GitHub 构建溯源,让每个 capsule 的来源、权限边界、执行记录完全透明。aos doctor 可随时诊断运行态健康度,aos status --json 输出机器可读状态供 SIEM 集成。

    场景三:智能体自主扩展能力

    当现有 capsules 无法满足新需求时,智能体可以主动调用 Forge:检视当前系统 → 识别缺口 → 构建 capsule → 验证最小权限 → 注册到 harness。这形成了一个自进化的智能体操作系统——meta-harness 技能让智能体学会如何改进自己的世界模型。

    推荐理由

    AOS 解决了一个真正痛点:智能体缺乏像传统软件那样的操作系统级抽象。目前大多数 AI Agent 框架要么是 SDK 库(如 LangChain),要么是编排层(如 CrewAI),但它们都没有提供「进程管理、权限隔离、组件注册、供应链安全」这些 OS 级别的基础设施。

    AOS 用 Rust 从零构建了这套基础设施,Capsule 模型比 Docker 容器更轻量、比 npm 包更结构化。MCP 一等公民支持让它天然适配当前最热的 AI 互操作标准。加上 fail-closed 发布策略和 Unicity Audit,这在开源 AI 项目中是罕见的安全意识

    如果你正在构建生产级智能体系统,或者对 AI Agent 的工程化治理感兴趣,AOS 值得花一个周末深入体验。

    下载地址

  • aisuite:吴恩达开源的统一大模型调用库,一行代码切换 10+ 厂商

    aisuite:吴恩达开源的统一大模型调用库,一行代码切换 10+ 厂商

    aisuite 项目封面

    做 AI 应用的同学大概率都踩过同一个坑:今天想用 GPT-4o,明天想换 Claude,后天又想试试 Gemini,每换一家就得重写一整套 SDK 调用、参数映射、错误处理。吴恩达(Andrew Ng)团队开源的 aisuite,就是把这件事彻底变简单的那把钥匙——一套统一接口,调遍十余家大模型。

    项目简介

    aisuite 是一个轻量级 Python 库,提供两层能力:底层是跨厂商统一的 Chat Completions API,上层是带工具与 MCP 的 Agents API。它同时是桌面 AI 同事 OpenWorker 的底层基座。一句话概括:用一套 OpenAI 风格的接口,调用 OpenAI、Anthropic、Google 等所有主流大模型。

    安装要求和过程

    环境要求

    • Python 3.10 及以上
    • pip 包管理器
    • 对应厂商的 API Key(或本地运行 Ollama 免 Key)

    快速安装

    基础包(不含任何厂商 SDK):

    pip install aisuite

    按需安装指定厂商 SDK,或一次性装全:

    pip install 'aisuite[anthropic]'   # 仅 Anthropic SDK
    pip install 'aisuite[all]'         # 所有厂商 SDK

    配置 API Key(以环境变量为例):

    export OPENAI_API_KEY=sk-...
    export ANTHROPIC_API_KEY=sk-...

    一行调用示例——切换模型只改字符串:

    import aisuite as ai
    client = ai.Client()
    
    models = ["openai:gpt-4o", "anthropic:claude-3-5-sonnet-20240620"]
    messages = [
        {"role": "system", "content": "用海盗英语回答。"},
        {"role": "user", "content": "讲个笑话。"},
    ]
    for model in models:
        resp = client.chat.completions.create(
            model=model, messages=messages, temperature=0.75)
        print(resp.choices[0].message.content)

    核心功能

    aisuite 核心能力

    1. 统一 Chat Completions API:provider-agnostic 的 OpenAI 风格接口,模型名采用 <provider>:<model-name> 格式,aisuite 自动路由到正确的厂商与参数,切换模型只需改一个字符串。
    2. Agents API + Toolkits:把普通 Python 函数直接当工具,自动生成 schema、执行调用并回传结果;内置 files / git / shell 沙箱工具包;提供工具策略(审批、黑白名单)与状态持久化(内存 / 文件 / Postgres)。
    3. 原生 MCP 支持pip install 'aisuite[mcp]' 后,任意 MCP Server 的工具都能直接交给模型,无需胶水代码。
    4. 流式与异步stream=True 跨厂商统一分块输出,acreate 提供异步变体,工具调用同样可流式处理。
    5. 可扩展 Provider 适配器:按命名约定实现 <provider>_provider.py + <Provider>Provider 类即可被自动发现加载,轻松接入新厂商。

    支持的模型厂商

    aisuite 支持的模型厂商

    典型使用场景

    1. 多模型横向对比 / A/B 评测:同一段业务逻辑只改 model 字符串,就能对比 GPT-4o、Claude、Gemini 的输出质量与成本,非常适合做模型选型与回归测试。
    2. 本地优先 + 多云的 Agent 应用:aisuite 是 OpenWorker 的基座,可接入 Ollama 完全本地运行(数据不出本机),也能在云端多厂商间灵活切换,兼顾合规与弹性。
    3. 快速挂载 MCP 工具做文件 / 代码操作:一行声明 filesystem MCP,即可让模型列举目录、读写文件、执行 git 命令,省去繁琐的适配代码。

    推荐理由

    我个人非常看重 aisuite 解决的一个真实痛点:厂商锁定。在真实项目里,模型能力此消彼长,今天这家强、明天那家反超,aisuite 让你把”换模型”从”改一堆 SDK 代码”降级成”改一个字符串”,产品的可移植性直接拉满。

    它不只是简单的接口封装:Agents API 把工具调用、MCP、工具策略、状态持久化收敛到一套统一范式里,意味着你写一次 Agent,就能在多家模型间稳健落地;底层还能私有化(Ollama)满足数据合规需求。MIT 协议商用友好,对创业团队和个人开发者都很友好,强烈建议作为 AI 应用的默认底座。

    下载地址

    项目数据:★16.1K · 1.7K Fork · Python · MIT · 创建于 2024-06,最近更新 2026-07。

  • img2threejs:把参考图重建为代码级 Three.js 模型的 AI 工作流(10,323★)

    img2threejs:把参考图重建为代码级 Three.js 模型的 AI 工作流(10,323★)

    项目简介

    img2threejs 是一个 AI 驱动的图像→Three.js 代码重建工作流。给一张参考图,它不会输出 OBJ/GLTF 网格或贴图,而是生成由基元几何体、程序化材质组成的 TypeScript 工厂函数 createObjectModel(),返回一个可直接在浏览器运行、可动画化的 THREE.Group。项目核心理念是“代码即模型”:结果可读、可 diff、可版本控制,而非几兆的静态网格文件。

    img2threejs 核心亮点

    安装要求与快速开始

    环境要求

    • Python 3.10+(纯标准库,无需 pip 安装)
    • Claude Code / Codex / OpenCode(作为 skill 调用)或任意终端
    • Three.js 运行时(浏览器即可)

    作为 Claude Code Skill 使用

    1. 克隆到 skills 目录:
    git clone https://github.com/img2threejs/img2threejs.git ~/.claude/skills/img2threejs
    1. 贴入参考图,在对话中运行:
    /img2threejs Rebuild this object as a Three.js model, keep the proportions, angles, and colours.

    独立脚本模式(零依赖)

    python3 forge/stage1_intake/probe_image.py <image>
    python3 forge/stage2_spec/new_pre_spec_assessment.py "Name" --image <image> --out assessment.json
    python3 forge/stage2_spec/new_sculpt_spec.py "Name" --image <image> --assessment assessment.json --out spec.json
    python3 forge/stage2_spec/validate_sculpt_spec.py spec.json --strict-quality
    python3 forge/stage3_build/generate_threejs_factory.py spec.json --out src/createObjectModel.ts

    所有脚本仅使用 Python 标准库,没有 PIL、numpy、Playwright 等依赖。

    核心功能

    • 代码即模型(Reconstruction-by-Code):用 Three.js 基元 + 程序化着色器生成工厂代码,而非摄影测量或网格提取。
    • 八阶段雕刻流水线blockout → structural → form → material → surface → lighting → interaction → optimization,每阶段生成后视觉评审,不达标则返回修正。
    • 严格质量门控--strict-quality 在写第一行 Three.js 代码前拦截规格不足的浅请求,避免浪费 token。
    • 极致 Token 高效:Python 标准库脚本负责校验、门控、规格生成和比对打包;模型只做一件事——看“参考图 vs 渲染图”对照表并判定通过/打回。
    • Agent 无关:在 Claude Code、Codex、OpenCode 中都能作为 skill 运行,也提供独立终端脚本。
    • 动画就绪 + 多主题:输出暴露 pivots、sockets、userData.tick,支持硬表面物体、人形角色、四足/禽类/飞龙/蛇形生物以及 CS2 武器家族。

    img2threejs 八阶段雕刻流水线

    典型使用场景

    • 游戏/3D 资产快速原型:给一张枪械、载具或道具参考图,直接拿到能在浏览器里跑、可交互的 Three.js 模型。
    • AI 编码助手工作流:作为 skill 嵌入 Claude Code / Codex,贴图即可在对话中完成“重建为代码”,省掉 Blender 建模或网格下载。
    • 教学与可视化演示:官方 Live Demo Gallery 展示了从 Glock-18、BMX 自行车到哆啦A梦房子的纯代码重建案例。

    推荐理由

    img2threejs 的“重建为代码”思路非常克制而实用:把机械重复工作交给纯标准库 Python,把真正的视觉判断留给大模型,从而在 LLM agent 循环中保持 token 高效。八阶段门控设计让输出可预期,README 也诚实地声明了限制——单图无法保证隐藏面精度,硬表面强、角色偏风格化。今天(2026-08-09)仍活跃推送,v1.4.4 正朝 v1.5 角色重建更新。适合已经使用 Claude Code / Codex 的开发者扩展自己的 AI 工作流。

    下载地址

  • LiveKit Agents:用 Python 构建实时语音 AI 智能体的开源框架

    LiveKit Agents:用 Python 构建实时语音 AI 智能体的开源框架

    在语音助手、AI 客服、实时翻译早已不是新鲜事的今天,真正难的是:如何用一个干净、可编排、可私有部署的框架,把 STT、LLM、TTS 串成一次低延迟、不打断、能“看见”的实时对话。LiveKit Agents 正是为这件事而生。

    📌 项目简介

    LiveKit Agents 是一个用于构建实时、可编程的多模态语音 AI 智能体的开源框架,运行在服务器端,让智能体具备“看、听、理解”的能力。它把语音识别(STT)、大模型(LLM)、语音合成(TTS)以及实时模型(Realtime API)抽象成可自由替换的组件,并提供任务调度、工具调用、测试框架等一整套生产级能力。

    💻 安装要求与过程

    环境要求

    • Python 3.9+
    • 一个 LiveKit 服务器:可用 LiveKit Cloud,也可用开源的 livekit 自托管
    • 至少一家模型服务商的密钥:如 Deepgram(STT)、OpenAI / Google(LLM)、Cartesia(TTS)等
    • 如需电话接入,可启用 LiveKit 的 SIP / 电话栈

    快速安装

    pip install "livekit-agents[openai,deepgram,cartesia]"

    三种运行模式

    # 终端本地测试:无需外部服务器,直接验证交互
    python myagent.py console
    
    # 开发模式:连接 LiveKit 云/自托管,支持热重载
    python myagent.py dev
    
    # 生产部署:生产级优化
    python myagent.py start

    开发 / 生产模式需配置环境变量:LIVEKIT_URLLIVEKIT_API_KEYLIVEKIT_API_SECRET(以及对应模型服务商的 Key)。也可用 Agents Playground 快速体验。

    ✨ 核心功能

    • 灵活集成:完整的插件生态,自由混搭最合适的 STT、LLM、TTS 与 Realtime API。
    • 内置任务调度:通过 Dispatch API 自动做任务分配与分发,把终端用户连接到对应智能体。
    • 语义轮流检测(Turn Detection):用 Transformer 模型判断用户是否说完,显著降低误打断。
    • 原生 MCP 支持:一行代码即可把 MCP 服务器提供的工具接入智能体。
    • 内置测试框架:用断言(expect)配合 LLM 评判(judge)编写测试,对抗 LLM 的非确定性。
    • 全平台 WebRTC 客户端 + 电话集成:覆盖浏览器、iOS、Android、Flutter 等,并可拨打 / 接听电话。

    🎯 典型使用场景

    • 语音客服 / 订餐机器人:内置 restaurant_agent 范例,可处理来电订餐与预约,直接对接电话线路。
    • 外呼电话机器人:Outbound Caller 范例可自动批量拨打电话、播报与收集信息。
    • 多智能体接力(Handoff):多个 Agent 按流程交接(如先收集信息、再切换讲故事 Agent),适合工单分流、复杂客服。
    • 视频数字人:通过 Tavus、Bithuman、LemonSlice 等接入 AI 虚拟形象,做出“能说话的脸”。
    • 实时视觉 Agent:结合 Gemini Live 等,做出能“看见”环境并对话的助手(含 iOS 端范例)。

    💡 推荐理由

    我自己折腾过不少语音 Agent 方案,LiveKit Agents 最打动我的是它的“把复杂留给自己、把简单交给开发者”:一个 AgentSession 把你想要的 STT/LLM/TTS 一行声明完,多智能体切换、工具调用、打断检测都有官方最佳实践兜底;更关键的是整套栈可私有化——连媒体服务器都是开源的,数据不出自己的机房,对企业场景非常友好。再加上官方提供的 LiveKit Docs MCPAgent Skill,用 AI 编程助手来搭语音应用也顺手很多。如果你打算认真做一个“能听会说”的产品,它值得作为底座首选。

    🔗 下载地址

    LiveKit Agents 核心亮点

  • AI时代App没死:vibe coding催生独立应用小高潮

    App Store 年度应用精选
    应用商店里的新面孔,远比唱衰者以为的要多。图源:TechCrunch

    大家都在说,等AI智能体真正成熟,人就不再需要一个一个打开App了,跟对话框说句话就能把事办完。这话听起来有道理,可TechCrunch的Sarah Perez最近把App Store翻了一遍,得出的结论刚好相反:应用不但没被冲垮,反而迎来了一波肉眼可见的小高潮。

    有些最近的发布,可能要归功于AI编程的兴起——它让普通人也能更快地把软件做出来,让外行也能挤进应用生态。

    数据先说话

    2026年第一季度,全球新上架的应用同比涨了60%,苹果iOS商店涨得更猛,达到80%。这里头当然有水分,vibe coding确实让不少人随手就甩出一堆质量参差的玩意儿,把商店弄得更拥挤。但Perez的意思很明确:那些真正戳中用户的,自然会浮上来,该担心的不是应用太多,而是好东西被埋了。

    好多App其实偷偷用了AI

    一个容易被忽略的点是,不少新应用底层早就接了AI,只是没把”AI驱动”挂在嘴边当卖点。它们更像一个顺手的小工具,安静地把事办了。

    • Albo:把社交平台的链接丢进去,它自动抓取内容、分类保存,原帖删了也不怕。
    • Coop:邻里集市,从隔壁农场主手里买鸡蛋,把交易留在本地。
    • Lettre:数字时代的笔友,帮你在世界各地交笔友。
    • Pressed Petals:散步时拍朵花,它帮你压成”标本”还认出花名,免费压两朵,之后1.99美元解锁。
    • Moods Faster:两下记录心情进Apple Health,月费1.95美元。

    真正稀缺的从来不是技术

    vibe coding把写代码的门槛削平了,可一个应用值不值得留在主页上,拼的还是设计感和品味。工具越多,好品味越金贵。唱衰App的人或许搞错了一件事:AI没有让软件消失,它只是让更多人有了做软件的机会。

  • AWS 把「氛围编程」搬进企业私有云,和 Superblocks 签下多年合作

    做 vibe coding(氛围编程)的创业公司 Superblocks 这几天和亚马逊云科技(AWS)签了一份多年联合营销协议。重点不在于又多一个合作伙伴,而在于 Superblocks 的工具可以直接嵌进 AWS 客户的私有云里跑。

    这意味着,一家用着 AWS 的企业只要订阅了 Superblocks,就能给自家业务人员提供”用自然语言写应用”的能力,而且这些应用不会把数据往外传——既不会发给模型厂商,也不会甩到外部数据库。应用会在公司自己的私有云里拉起 Amazon Aurora 数据库,而不是像很多 vibe coding 工具那样默认连外部的 Supabase。

    “我们要把能力带到你私有云里的数据旁边,”Superblocks 创始人兼 CEO Brad Menezes 说,”最关键的一点是数据永远不出门……用的是你自己的 AWS 账户,审计、加密、网络管控全都到位。”

    云巨头想当 Agent 时代的”脚手架”供应商

    这些应用还会接上 Amazon Bedrock——亚马逊那套 AI 应用开发、网关和推理平台。说白了,它们会自动归到 IT 部门的管控和安全体系里,而不是变成一堆没人管、随处乱长的”野应用”。AWS 也会像对待其他 Marketplace 伙伴一样,帮着把 Superblocks 推销给大企业。

    Superblocks 创始人 Brad Menezes
    Superblocks 创始人 Brad Menezes(图源:TechCrunch)
    • Superblocks 目前 50 人,截至 2025 年 5 月 A 轮一共融了 6000 万美元,投资方有 Spark Capital、Kleiner Perkins、Meritech Capital 和 Greenoaks。
    • AWS 自己到现在还没有面向业务人员的 vibe coding 智能体;它手里有给开发者用的 Kiro,以及类似 Claude Cowork、Copilot 的 AI 助手 Quick,但都不是”氛围编程”那条路。

    背后是一场”多模型”的撤退

    这件事更大的信号,是超大规模云厂商正忙着劝企业客户:把 AI 模型和跑企业 AI 所需的那些”脚手架”拆开,而且都搁在自己的云上。他们希望企业来买 AI 套壳(也就是智能体应用)、编排、安全工具,而不是去找前沿模型厂。

    过去几周,微软 CEO 萨提亚·纳德拉一直在敲同一个鼓点:多用几个模型来降本、避免被锁死;他还提醒企业别太信任 AI 实验室来做智能体编排,因为对方可能拿你的数据研究你的生意、回头跟你竞争。企业似乎已经听进去了——Menezes 说,六十天前客户还”非 Anthropic 不可”,现在完全翻了过来。上个月,开源模型在 Vercel 的 AI 网关流量里占了 29%。

    “对任何押注单一模型厂商的企业,那个高管迟早会被炒,”Menezes 放话。在他看来,横跨 OpenAI、Anthropic 和开源(眼下以中国开源为主,美国开源也在起来)的多模型策略,已经是 CIO 的必答题。把 vibe coding 送进私有云,只是继开发者 AI 编码智能体之后,云厂商掀起的第二波浪潮。

  • Google砍掉AI Studio独立安卓App,把氛围编程收进Gemini

    Google AI Studio 并入 Gemini
    Google把AI Studio的”氛围编程”能力收进Gemini,独立安卓App取消(配图由AI生成)

    5月Google在I/O前后放出消息,要做AI Studio的安卓App,靠”氛围编程”(vibe coding)让用户用几句提示词就动手搭别的App,当时Google Play上近80万人点了预注册。才两个多月,Google改了主意。

    从独立App到Gemini入口

    Google宣布,AI Studio不再单独出安卓App,而是把这套氛围编程能力直接做进Gemini。背后的逻辑很清楚:让Gemini成为唯一的AI入口,要写要跑应用都在这一个App里解决。对那80万预注册用户来说,以后在Gemini里就能干同样的事,不用再等一个独立安装包。

    与其再装一个App,不如让Gemini自己长成能写应用的入口——这是Google把零散AI能力往一处收的明确信号。

    网页版留着,给认真干活的人

    功能完整的网页版AI Studio不动,继续服务那些想在电脑前认真搓大项目的人。换句话说,手机上的轻量”随手搭个小工具”并进了Gemini,重活儿还是回网页端。Google这步取舍,等于承认独立App的卖点其实没那么硬。

    工具收拢成统一入口

    把散落的AI工具收拢成统一入口,已经是几家大厂的默契。对普通用户,Gemini人人都有,省去多装一个App;对当初冲着独立App去的轻量创作者,少了一个专属入口难免有点失落。真正的变化在后面:Gemini正从聊天框,长成一个能写能跑的应用工作台。


    • 氛围编程(vibe coding):用自然语言提示词驱动AI生成应用,强调”边聊边做”。
    • 独立安卓App原定包名 com.google.android.apps.aistudio,已在Google Play开放预注册。
    • 网页版AI Studio定位不变,仍是功能最完整的开发入口。
  • colibri:用纯 C 把 744B~2.8T MoE 大模型跑到本地

    colibri:用纯 C 把 744B~2.8T MoE 大模型跑到本地

    colibri 是近期 GitHub 上热度最高的本地推理引擎之一:只用纯 C 编写、零运行时依赖,就能把 744B 到 2.8T 参数的 MoE(混合专家)大模型跑在你现有的硬件上。它不是把模型硬塞进显存,而是把 VRAM、RAM 和 NVMe 当作同一层级来管理,按需从磁盘流式加载专家权重。项目上线一个月已收获 21.9K Stars,并支持 GLM-5.2、Inkling、Kimi K3、OLMoE 四大模型家族。

    本期我们就来拆解:colibri 是怎么让“本地运行千亿 MoE”这件事从神话变成可复现实验的。

    项目简介

    colibri 是一个面向前沿 MoE 模型的本地推理引擎。它用“存储即内存层级”的思路替代传统的“模型必须全进显存”假设:密集注意力层常驻 RAM,19456 个路由专家放在磁盘,只有在路由器真正需要时才被预取到 RAM/VRAM。这样一台只有 25 GB 内存的常规电脑也能把 744B 的 GLM-5.2 跑起来,而高端工作站则可以把全部专家驻留 GPU,达到接近数据中心的吞吐。

    配图速览

    colibri 核心速览
    colibri 核心数据一览
    三层存储层级
    colibri 把专家权重分布在 VRAM / RAM / NVMe 三个层级,速度随硬件变化,语义保持不变。

    安装要求和过程

    环境要求

    • 操作系统:Linux、macOS、Windows 11
    • 内存:最低 25 GB RAM(仅 CPU 流式);推荐 128 GB 或更高,配合多 GPU 可获得更好体验
    • 磁盘:GLM-5.2 int4 容器约 372 GB;Kimi K3 原始检查点约 1.6 TB
    • 软件:Python 3(仅用于 launcher 和转换脚本);编译源码需要 gcc/clang + OpenMP
    • GPU(可选):CUDA、Metal(Apple Silicon)、Vulkan 1.2(含 AMD RADV)后端均可选

    快速安装

    1. 下载对应平台的预编译 release 并解压:
    mkdir colibri && tar xzf colibri-v1.1.0-linux-x86_64.tar.gz -C colibri && cd colibri
    python3 coli info
    1. 或从源码构建:
    git clone https://github.com/JustVugg/colibri && cd colibri/c
    ./setup.sh
    1. 下载 GLM-5.2 int4 gs64 容器(推荐带 int8 MTP 头的版本):
    # 推荐从 Hugging Face 拉取 mastouri/GLM-5.2-colibri-int4-g64-with-int8-mtp
    # 约 372 GB,放 NVMe 上最佳
    1. 运行交互式聊天、API 服务或 Web 面板:
    COLI_MODEL=/nvme/glm52_i4 ./coli chat
    COLI_MODEL=/nvme/glm52_i4 ./coli serve    # OpenAI-compatible API
    ./coli web --model /nvme/glm52_i4          # API + 可视化 dashboard

    核心功能

    1. 存储即内存层级
      把 VRAM、RAM、NVMe 统一成专家权重的放置策略。缺显存不会悄悄改模型精度或路由语义,只会影响速度。
    2. 按需流式加载专家
      MoE 每层只激活少量专家。colibri 让 19456 个专家中的绝大部分常驻磁盘,通过 per-layer LRU、学习到的热专家 pinned set 和一层提前预取(PILOT)减少磁盘等待。
    3. 纯 C 零依赖引擎
      每个模型对应一个 C 文件(如 c/glm.c),无 BLAS、无运行时 Python、无 GPU 也能跑。
    4. 多后端异构执行
      支持 CPU、CUDA、Metal、Vulkan 四种后端,可组合使用;双 SSD 镜像可把只读专家读取带宽翻倍。
    5. 学习缓存与压缩状态
      引擎记录你的工作负载路由历史(.coli_usage),越用越快;MLA KV 状态压缩到原来的 1/57,并能持久化对话上下文。

    典型使用场景

    场景一:个人开发者跑前沿模型做实验

    你只有一台 64 GB RAM + 1 TB NVMe 的台式机。传统 vLLM/llama.cpp 会把 744B 模型拒之门外;colibri 让你用 COLI_MODEL=/nvme/glm52_i4 ./coli chat 直接对话,虽然 token/s 不高,但足以做提示工程、长文本探索和小批量评估。

    场景二:工作室搭建本地私有 API

    在多卡工作站(如 6× RTX 5090)上,把专家全部驻留 GPU,colibri 可提供 5.8–6.8 tok/s 的解码速度和 1.6 s 的 TTFT。通过 coli serve 提供 OpenAI-compatible API,内部团队就能在不联网的情况下调用千亿模型。

    场景三:MoE 推理系统研究

    colibri 把放置策略、调度、I/O、CPU/GPU 重叠都做成可测量的实验参数。研究者可以替换缓存策略、测试双 SSD 镜像、评估 int4/int8/MXFP4 格式对质量的影响,并把结果以 issue 形式回馈社区。

    推荐理由

    colibri 最打动我的不是“跑 744B 模型”这个噱头,而是它把“本地推理”重新定义为系统优化问题:不盲目堆硬件,而是认真测量每一个瓶颈——磁盘带宽、专家命中率、KV 压缩、CPU/GPU 重叠、量化质量——并用可复现的 A/B 来做决策。README 里反复出现的不是营销数字,而是“这个功能在哪台机器上、用什么 commit、跑什么 prompt 测出来的”。

    对于国内用户,它还有一个隐性好处:GLM-5.2、Kimi K3、Qwen3 MoE(roadmap)等模型天然和中国模型生态更近,未来可以更低成本地跑开源中文大模型。

    当然,它现在还是研究导向的项目:没有 SLA 保证速度,配置参数很多,对磁盘和内存仍有一定要求。但如果你既想摸到前沿模型,又不想把数据送出去,colibri 是 2026 年最值得关注的本地推理引擎之一。

    下载地址

  • TRELLIS.2:微软开源 4B 参数图像到 3D 生成模型,3 秒生成高保真纹理资产

    TRELLIS.2:微软开源 4B 参数图像到 3D 生成模型,3 秒生成高保真纹理资产

    TRELLIS.2

    项目简介

    TRELLIS.2 是微软研究院开源的 4B 参数大规模 3D 生成模型,专注于图像到 3D(image-to-3D)资产生成。它抛弃了传统等值面场的限制,提出一种名为 O-Voxel 的“无场”稀疏体素结构,能够原生重建和生成具有复杂拓扑、锐利细节以及完整 PBR 材质的 3D 模型。

    安装要求和过程

    目前官方仅验证过 Linux 环境,GPU 显存至少 24GB(推荐 A100 / H100),需要 CUDA 12.4 和 Conda。

    1. 克隆仓库:
      git clone -b main https://github.com/microsoft/TRELLIS.2.git --recursive
      cd TRELLIS.2
    2. 创建 conda 环境并安装依赖:
      . ./setup.sh --new-env --basic --flash-attn --nvdiffrast --nvdiffrec --cumesh --o-voxel --flexgemm
    3. 从 Hugging Face 下载 4B 预训练权重:
      https://huggingface.co/microsoft/TRELLIS.2-4B

    核心功能

    • 高保真生成:40 亿参数 DiT 模型 + 16× 下采样稀疏 3D VAE,可直接生成 512³ 到 1536³ 分辨率的带纹理 3D 资产。
    • O-Voxel 拓扑自由:原生支持开放曲面、非流形几何和内部封闭结构,无需像传统 NeRF/SDF 那样进行有损转换。
    • PBR 材质建模:不仅生成基础色,还输出 Roughness、Metallic、Opacity 等属性,支持透明与真实感渲染。
    • 极简后处理:纹理网格转 O-Voxel 单 CPU <10 秒,O-Voxel 转纹理网格在 CUDA 上 <100 毫秒。
    • 完整训练代码:开源 SC-VAE、形状/纹理 Flow Model 训练脚本,可用 Objaverse-XL 等数据从头训练或微调。

    TRELLIS.2 核心特性

    典型使用场景

    • 游戏/影视资产快速出稿:原画师只需提供一张概念图,即可在数秒内获得带 PBR 材质的可用 3D 模型,大幅缩短原型迭代周期。
    • 电商/虚拟展示:把产品照片自动转换为可旋转的 GLB 3D 资产,用于网页 AR、虚拟展厅和商品详情页。
    • 3D 内容创作者工具链:结合 ComfyUI、Blender 等工具,将 TRELLIS.2 作为 AI 建模节点,批量生成风格化道具和场景元素。

    推荐理由

    TRELLIS.2 给我的最大惊喜是“快”和“全”:快在 H100 上 3 秒就能跑出 512³ 的高质量模型;全在从模型权重到训练代码全部开源,还配有 Hugging Face Demo。相比之前很多只能生成封闭几何体的方案,它对开放曲面、衣物、叶片等复杂拓扑的处理明显更稳。对于想要在本地做 3D AIGC 的同学来说,这是目前最值得入手的工程基座之一。

    下载地址