标签: 多模态

  • LiveKit Agents:用 Python 构建实时语音 AI 智能体的开源框架

    LiveKit Agents:用 Python 构建实时语音 AI 智能体的开源框架

    在语音助手、AI 客服、实时翻译早已不是新鲜事的今天,真正难的是:如何用一个干净、可编排、可私有部署的框架,把 STT、LLM、TTS 串成一次低延迟、不打断、能“看见”的实时对话。LiveKit Agents 正是为这件事而生。

    📌 项目简介

    LiveKit Agents 是一个用于构建实时、可编程的多模态语音 AI 智能体的开源框架,运行在服务器端,让智能体具备“看、听、理解”的能力。它把语音识别(STT)、大模型(LLM)、语音合成(TTS)以及实时模型(Realtime API)抽象成可自由替换的组件,并提供任务调度、工具调用、测试框架等一整套生产级能力。

    💻 安装要求与过程

    环境要求

    • Python 3.9+
    • 一个 LiveKit 服务器:可用 LiveKit Cloud,也可用开源的 livekit 自托管
    • 至少一家模型服务商的密钥:如 Deepgram(STT)、OpenAI / Google(LLM)、Cartesia(TTS)等
    • 如需电话接入,可启用 LiveKit 的 SIP / 电话栈

    快速安装

    pip install "livekit-agents[openai,deepgram,cartesia]"

    三种运行模式

    # 终端本地测试:无需外部服务器,直接验证交互
    python myagent.py console
    
    # 开发模式:连接 LiveKit 云/自托管,支持热重载
    python myagent.py dev
    
    # 生产部署:生产级优化
    python myagent.py start

    开发 / 生产模式需配置环境变量:LIVEKIT_URLLIVEKIT_API_KEYLIVEKIT_API_SECRET(以及对应模型服务商的 Key)。也可用 Agents Playground 快速体验。

    ✨ 核心功能

    • 灵活集成:完整的插件生态,自由混搭最合适的 STT、LLM、TTS 与 Realtime API。
    • 内置任务调度:通过 Dispatch API 自动做任务分配与分发,把终端用户连接到对应智能体。
    • 语义轮流检测(Turn Detection):用 Transformer 模型判断用户是否说完,显著降低误打断。
    • 原生 MCP 支持:一行代码即可把 MCP 服务器提供的工具接入智能体。
    • 内置测试框架:用断言(expect)配合 LLM 评判(judge)编写测试,对抗 LLM 的非确定性。
    • 全平台 WebRTC 客户端 + 电话集成:覆盖浏览器、iOS、Android、Flutter 等,并可拨打 / 接听电话。

    🎯 典型使用场景

    • 语音客服 / 订餐机器人:内置 restaurant_agent 范例,可处理来电订餐与预约,直接对接电话线路。
    • 外呼电话机器人:Outbound Caller 范例可自动批量拨打电话、播报与收集信息。
    • 多智能体接力(Handoff):多个 Agent 按流程交接(如先收集信息、再切换讲故事 Agent),适合工单分流、复杂客服。
    • 视频数字人:通过 Tavus、Bithuman、LemonSlice 等接入 AI 虚拟形象,做出“能说话的脸”。
    • 实时视觉 Agent:结合 Gemini Live 等,做出能“看见”环境并对话的助手(含 iOS 端范例)。

    💡 推荐理由

    我自己折腾过不少语音 Agent 方案,LiveKit Agents 最打动我的是它的“把复杂留给自己、把简单交给开发者”:一个 AgentSession 把你想要的 STT/LLM/TTS 一行声明完,多智能体切换、工具调用、打断检测都有官方最佳实践兜底;更关键的是整套栈可私有化——连媒体服务器都是开源的,数据不出自己的机房,对企业场景非常友好。再加上官方提供的 LiveKit Docs MCPAgent Skill,用 AI 编程助手来搭语音应用也顺手很多。如果你打算认真做一个“能听会说”的产品,它值得作为底座首选。

    🔗 下载地址

    LiveKit Agents 核心亮点

  • TRELLIS.2:微软开源 4B 参数图像到 3D 生成模型,3 秒生成高保真纹理资产

    TRELLIS.2:微软开源 4B 参数图像到 3D 生成模型,3 秒生成高保真纹理资产

    TRELLIS.2

    项目简介

    TRELLIS.2 是微软研究院开源的 4B 参数大规模 3D 生成模型,专注于图像到 3D(image-to-3D)资产生成。它抛弃了传统等值面场的限制,提出一种名为 O-Voxel 的“无场”稀疏体素结构,能够原生重建和生成具有复杂拓扑、锐利细节以及完整 PBR 材质的 3D 模型。

    安装要求和过程

    目前官方仅验证过 Linux 环境,GPU 显存至少 24GB(推荐 A100 / H100),需要 CUDA 12.4 和 Conda。

    1. 克隆仓库:
      git clone -b main https://github.com/microsoft/TRELLIS.2.git --recursive
      cd TRELLIS.2
    2. 创建 conda 环境并安装依赖:
      . ./setup.sh --new-env --basic --flash-attn --nvdiffrast --nvdiffrec --cumesh --o-voxel --flexgemm
    3. 从 Hugging Face 下载 4B 预训练权重:
      https://huggingface.co/microsoft/TRELLIS.2-4B

    核心功能

    • 高保真生成:40 亿参数 DiT 模型 + 16× 下采样稀疏 3D VAE,可直接生成 512³ 到 1536³ 分辨率的带纹理 3D 资产。
    • O-Voxel 拓扑自由:原生支持开放曲面、非流形几何和内部封闭结构,无需像传统 NeRF/SDF 那样进行有损转换。
    • PBR 材质建模:不仅生成基础色,还输出 Roughness、Metallic、Opacity 等属性,支持透明与真实感渲染。
    • 极简后处理:纹理网格转 O-Voxel 单 CPU <10 秒,O-Voxel 转纹理网格在 CUDA 上 <100 毫秒。
    • 完整训练代码:开源 SC-VAE、形状/纹理 Flow Model 训练脚本,可用 Objaverse-XL 等数据从头训练或微调。

    TRELLIS.2 核心特性

    典型使用场景

    • 游戏/影视资产快速出稿:原画师只需提供一张概念图,即可在数秒内获得带 PBR 材质的可用 3D 模型,大幅缩短原型迭代周期。
    • 电商/虚拟展示:把产品照片自动转换为可旋转的 GLB 3D 资产,用于网页 AR、虚拟展厅和商品详情页。
    • 3D 内容创作者工具链:结合 ComfyUI、Blender 等工具,将 TRELLIS.2 作为 AI 建模节点,批量生成风格化道具和场景元素。

    推荐理由

    TRELLIS.2 给我的最大惊喜是“快”和“全”:快在 H100 上 3 秒就能跑出 512³ 的高质量模型;全在从模型权重到训练代码全部开源,还配有 Hugging Face Demo。相比之前很多只能生成封闭几何体的方案,它对开放曲面、衣物、叶片等复杂拓扑的处理明显更稳。对于想要在本地做 3D AIGC 的同学来说,这是目前最值得入手的工程基座之一。

    下载地址

  • PixelRAG:用网页截图做检索增强,让模型“看图说话”

    PixelRAG:用网页截图做检索增强,让模型“看图说话”

    PixelRAG 配图

    项目简介

    PixelRAG 是伯克利 SkyLab / BAIR 团队开源的视觉检索增强生成框架。它把网页、PDF、图片渲染成截图块,再用视觉语言模型直接在“像素”上检索,从而绕过传统文本 RAG 的 HTML 解析问题,把表格、图表、版式、信息图原样保留给读者模型。仓库还附带一个已建好的 828 万维基百科页面视觉索引,以及免费的在线 API,真正做到了开箱即用。

    安装要求和过程

    环境要求

    • Python 3.10+
    • Linux(CUDA)或 macOS(Apple Silicon / MPS),CPU 亦可作为 fallback
    • 可选:Playwright / CDP 用于网页渲染
    • 可选:用于本地索引构建的 GPU,或直接使用 api.pixelrag.ai 线上服务

    快速安装

    # 1. 基础包:像素化截图工具 pixelshot
    pip install pixelrag
    
    # 2. 带向量化:用于本地构建 FAISS 索引
    pip install 'pixelrag'
    
    # 3. 完整流水线:source → ingest → embed → index
    pip install 'pixelrag[index]'
    
    # 4. 本地搜索 API 服务
    pip install 'pixelrag[serve]'
    

    如果想让 pixelshot 始终处在 PATH 里供 Claude 调用,官方推荐用 uv toolpipx

    uv tool install pixelrag   # pipx install pixelrag
    

    核心功能

    1. 像素级文档渲染: 通过 pixelshot 把网页、PDF 转成截图块,保留文本 RAG 会丢失的视觉结构与版式。
    2. 视觉语义检索: 基于 Qwen3-VL-Embedding-2B 微调后的嵌入模型,将页面图片映射到可检索向量空间。
    3. 828 万维基百科预建索引: 官方已建好并托管了 api.pixelrag.ai,无需任何配置即可搜索,还支持“以图搜图”。
    4. 本地自建索引: 通过 pixelrag index build 处理本地文档(网页 / PDF / 图片),再 pixelrag serve 启动 FastAPI 搜索服务。
    5. Claude Code 插件: pixelbrowse skill 让 Claude 直接截图并阅读页面,告别原始 HTML。

    传统文本RAG vs PixelRAG

    传统文本RAG会丢失表格等视觉结构,PixelRAG通过截图块保留完整版式。

    PixelRAG 关键速览

    典型使用场景

    场景 1:财报 / 论文中的表格问答

    传统文本 RAG 把 PDF 表格拆成凌乱文字后,模型经常找不到数字。PixelRAG 直接截取表格区域截图,检索相关页并交给 VLM 读取,数字、单位、行列关系一目了然。

    场景 2:Claude 浏览复杂网页

    安装 pixelbrowse skill 后,Claude 能够对任意页面执行 /screenshot https://example.com,然后“看图”总结新闻、解读产品页或提取图表结论,而不再受限于 HTML 标签提取不全的问题。

    场景 3:内部知识库可视化搜索

    把企业内的产品手册、设计稿、UI 截图、架构图做成 PixelRAG 索引。用户上传一张截图或输入图片描述,即可召回相关视觉文档,适用于设计系统、运维监控面板、竞品分析资料库。

    推荐理由

    PixelRAG 给我最大的启发是:当大家都在卷“更好的 HTML 解析器”时,它直接换了一条赛道——让模型像人一样“看”网页。这不是炫技,而是切中了 RAG 的实际痛点:大量网页的表格、图表、公式和交互组件一旦转成纯文本就面目全非。配合已经训练好的视觉嵌入模型和 828 万维基百科索引,从实验到落地只需要几条命令。

    对于 Claude / Cursor / Codex 等 Coding Agent 用户来说,pixelbrowse skill 是一个润物细无声的能力升级:它不需要 MCP server,也不依赖后端服务,只是让 Agent 多了一双“眼睛”。如果你正在做多模态知识库、网页问答或文档理解,PixelRAG 值得放进候选清单。

    下载地址

    —— 本文由 WorkBuddy 整理发布。

  • Unlimited OCR:百度开源的「一次前向通读整本 PDF」的 OCR 大模型

    Unlimited OCR:百度开源的「一次前向通读整本 PDF」的 OCR 大模型

    项目简介

    Unlimited OCR 是百度开源的一款端到端 OCR 大模型,主打「One-shot Long-horizon Parsing」——在单次前向传播中,直接解析长达 32K token 的整份 PDF 或连续多页图像,而不是把文档切碎后一页页跑。

    它以 DeepSeek-OCR 的编码器为基础,但把解码器的所有注意力层替换为自研的 Reference Sliding Window Attention(R-SWA),让 KV Cache 在解码过程中保持恒定。换句话说:输出越长,显存和速度越稳定,不会出现传统 LLM 解码器「越写越慢」的窘境。

    核心亮点

    • 恒定 KV Cache:R-SWA 替换标准自注意力,长文档生成时显存占用平稳、解码速度不衰减。
    • 一次前向通读多页:标准 32K 上下文内,可一次完成数十页文档解析,保留跨页上下文。
    • 三种部署形态:提供 Hugging Face transformers、vLLM Docker 镜像、SGLang OpenAI 兼容服务三种开箱方案。
    • 通用解析机制:R-SWA 不局限于 OCR,论文指出同样适用于 ASR、翻译等需要长序列输出的任务。
    • 全链路开放:代码与模型权重均托管在 GitHub 与 Hugging Face,MIT 协议可商用。

    安装与快速上手

    项目环境要求:Python 3.12.3 + CUDA 12.9 通过验证;单张 NVIDIA GPU 即可体验。

    1. Transformers 快速体验

    # 依赖
    pip install torch==2.10.0 torchvision==0.25.0 transformers==4.57.1 Pillow==12.1.1
    pip install matplotlib==3.10.8 einops==0.8.2 addict==2.4.0 easydict==1.13 pymupdf==1.27.2.2 psutil==7.2.2
    
    # 加载模型
    from transformers import AutoModel, AutoTokenizer
    model_name = 'baidu/Unlimited-OCR'
    tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True)
    model = AutoModel.from_pretrained(model_name, trust_remote_code=True,
                                      use_safetensors=True, torch_dtype=torch.bfloat16).eval().cuda()
    
    # 单图解析(gundam 配置:base_size=1024, image_size=640, crop_mode=True)
    model.infer(tokenizer, prompt='<image>document parsing.',
                image_file='your_image.jpg', output_path='./outputs',
                base_size=1024, image_size=640, crop_mode=True,
                max_length=32768, save_results=True)
    
    # 多页 / PDF
    model.infer_multi(tokenizer, prompt='<image>Multi page parsing.',
                      image_files=['page1.png', 'page2.png'], output_path='./outputs',
                      image_size=1024, max_length=32768, save_results=True)
    

    2. vLLM 生产部署

    # CUDA 13.0
    docker pull vllm/vllm-openai:unlimited-ocr
    # Hopper GPU 使用 cu129 镜像
    docker pull vllm/vllm-openai:unlimited-ocr-cu129
    # 官方 recipe: https://recipes.vllm.ai/baidu/Unlimited-OCR
    

    3. SGLang 批处理服务

    uv venv --python 3.12
    source .venv/bin/activate
    uv pip install wheel/sglang-*.whl kernels==0.11.7 pymupdf==1.27.2.2
    
    python -m sglang.launch_server --model baidu/Unlimited-OCR --served-model-name Unlimited-OCR \
      --attention-backend fa3 --page-size 1 --context-length 32768 \
      --enable-custom-logit-processor --disable-overlap-schedule \
      --skip-server-warmup --host 0.0.0.0 --port 10000
    
    # 并发批跑目录或 PDF
    python infer.py --pdf ./examples/document.pdf --output_dir ./outputs --concurrency 8 --image_mode gundam
    

    典型使用场景

    1. 学术论文整本转 Markdown:把 30 页 PDF 直接丢给模型,一次前向输出带标题层级、公式占位、表格结构的 Markdown,省去分块合并。
    2. RAG 知识库文档预处理:批量解析合同、手册、财报,保留原文版面和段落结构,作为高质量向量库原始文本。
    3. 票据与表格版面结构化:针对扫描发票、银行流水、Excel 截图等,输出键值对或 JSON 结构化结果。

    推荐理由

    最近大家注意力都在 Coding Agent 上,OCR 赛道反而被低估。Unlimited-OCR 真正的价值在于把「长序列输出」这件事做扎实了——R-SWA 让 KV Cache 不再线性膨胀,这是端到端文档理解从 demo 走向生产的关键。

    另外百度这次放出了完整的训练、推理、部署、微调(ms-swift)链路,并且兼容 vLLM / SGLang 两大推理框架,对工程落地非常友好。如果你在做 RAG、知识库、文档数字化,它很可能成为你管道里的默认 OCR 组件。

    资源下载

    • GitHub 仓库:https://github.com/baidu/Unlimited-OCR
    • Hugging Face 模型:https://huggingface.co/baidu/Unlimited-OCR
    • 在线 Demo:https://huggingface.co/spaces/baidu/Unlimited-OCR
    • arXiv 论文:https://arxiv.org/abs/2606.23050
    • ModelScope 模型:https://modelscope.cn/models/PaddlePaddle/Unlimited-OCR
    • 百度智能云:https://cloud.baidu.com/doc/OCR/s/fmr1p39gb
  • Claude Cookbooks:Anthropic 官方维护的 Claude 实战范例集(50K+ Stars)

    Claude Cookbooks:Anthropic 官方维护的 Claude 实战范例集(50K+ Stars)

    Claude Cookbooks

    Claude Cookbooks 是 Anthropic 官方在 GitHub 上开源维护的 Jupyter Notebook 范例集,已收获 50.4K+ Stars5.9K+ Forks,MIT 许可证。它像一本持续更新的”Claude 实战菜谱”,用可以直接复制运行的代码片段,手把手教开发者把 Claude API 用到生产里——覆盖文本分类、RAG、工具调用、Agent SDK、Skills、多模态、扩展思考、第三方集成等几乎所有主流场景。

    无论是刚接触 Claude API 的新手,还是要把 Claude 嵌入自家产品的资深工程师,都能在这里找到即拿即用的最佳实践。所有 Notebook 都用 Python 写成,但概念同样适用于任何支持 Claude API 的语言。

    Claude Cookbooks 内容地图

    为什么需要它?

    很多人第一次调用 Claude API 只能写出”问个问题拿个回答”的脚本——但生产里要面对的是:结构化输出、上下文管理、长文档解析、Agent 工作流、RAG 检索、工具调用循环、子智能体拆分…这些工程化能力的最佳范式,往往不是 API 文档里那几段示例能覆盖的。Cookbooks 正是 Anthropic 工程师团队把生产经验沉淀下来的”答案库”。

    安装要求和过程

    环境要求

    • Python 3.10+(项目用 uv 管理依赖)
    • Jupyter Lab / VS Code Jupyter 扩展
    • 一个 Anthropic API Key(前往 anthropic.com 免费注册)

    快速安装

    # 1. 克隆仓库
    git clone https://github.com/anthropics/claude-cookbooks.git
    cd claude-cookbooks
    
    # 2. 安装依赖(项目使用 uv,也可用 pip)
    pip install -r requirements-dev.txt
    # 或:uv sync
    
    # 3. 配置密钥
    cp .env.example .env
    # 编辑 .env 填入你的 ANTHROPIC_API_KEY
    
    # 4. 启动 Jupyter
    jupyter lab

    三步快速上手

    核心功能

    1. 基础能力 Recipes

    capabilities/ 目录里包含文本分类、RAG 检索增强、长文摘要、结构化 JSON 输出四大基础用法。每个 Recipe 都配了独立 Notebook,从最小调用示例一路演化到生产级实现。

    2. 工具调用与函数集成

    tool_use/ 演示了 Claude 如何调用外部工具——从最简单的计算器、SQL 查询,到完整的多步骤客服智能体。这是把 Claude 从”聊天机器人”升级成”可执行 Agent”的关键能力。

    3. Claude Agent SDK

    claude_agent_sdk/ 是新近加入的官方 Agent SDK 范例,示范如何用 Python SDK 构建可独立运行的智能体应用、调度工具、规划子任务。

    4. Agent Skills 技能系统

    skills/ 目录展示如何为 Claude 编写模块化技能——把专业能力封装成可复用的 Skills,让 Agent 在不同场景下按需调用。

    5. 多模态能力

    multimodal/ 覆盖图像理解、图表解读、表单/PDF 内容提取、视觉最佳实践等,配合 Claude 强大的视觉模型可直接处理扫描件、合同、PPT。

    6. 扩展思考与设计模式

    extended_thinking/patterns/ 深入推理模式、子智能体协作、提示词缓存、评估驱动开发(Eval-Driven Development)等高阶范式。

    7. 第三方集成

    third_party/ 给出Pinecone 向量数据库、Wikipedia、VoyageAI Embeddings等流行服务的对接范例,把 Claude 嵌入现有技术栈成本极低。

    8. 微调与可观测性

    finetuning/observability/ 提供模型微调生产链路观测的端到端代码,是把 Claude 部署到线上服务的最后一块拼图。

    典型使用场景

    场景 1:快速搭建企业知识库 RAG

    复制 capabilities/retrieval_augmented_generationthird_party/Pinecone 两个 Notebook,半天就能搭起一个基于 Pinecone + Claude 的企业知识问答系统。Notebook 里连如何切分文档、嵌入、检索、重排序、生成都一步步跑通。

    场景 2:构建带工具调用的客服 Agent

    参考 tool_use/customer_service_agent.ipynb 的代码结构,把你的订单查询 API、退款流程、商品库存接口注册成 Claude 可调用的工具,立即得到一个能回答”我的订单到哪了”的多轮 Agent。

    场景 3:批量处理 PDF/扫描件

    multimodal/ 里的 PDF 解析与表单提取 Recipe,配合 Claude 视觉模型,搭建合同关键条款抽取、发票识别、报告摘要等自动化工作流。

    场景 4:评估驱动的提示词迭代

    misc/building_evals.ipynb 给出用 Claude 自身来评估另一批 Claude 输出质量的工程范式——适合团队协作打磨生产级 Prompt,让提示词的优化变成可量化、可回归的过程。

    推荐理由

    用 Cookbooks 这半年,最大的感受是:它不是”玩具示例”,而是真正从生产里长出来的代码

    • 覆盖全面:从基础调用到 Agent SDK,从 RAG 到微调,几乎所有 Claude 应用方向都有现成 Recipe,避免重复造轮子。
    • 持续更新:紧跟 Anthropic 的功能发布(比如 Claude 4 系列、扩展思考、Agent SDK、Skills 都是最近几个月加入的新章节)。
    • 可读性极强:每个 Notebook 都是”一段说明 + 一段代码 + 一段输出”的节奏,能当教程读,也能当模板抄。
    • 社区友好:MIT 许可,欢迎提 PR;CLAUDE.md 里甚至写了让 Claude 帮忙做贡献的指南(meta!)
    • 企业可商用:MIT 协议允许商业使用,没有 Apache-2.0 那种专利条款的顾虑。

    对国内开发者来说,唯一需要注意的是 Anthropic API 的访问渠道——可以走官方、AWS Bedrock、Vertex AI 或合规中转服务。模型本身支持中文,是 Claude 进军中文 AI 应用开发的官方”最佳实践手册”。

    下载地址

    用 Cookbook 抄答案,把 Claude 真正用进生产——这可能是 2026 年最值得收藏的 AI 工程仓库之一。

  • 字节跳动放出 Seed Audio 1.0:给视频配音,AI 不再只会「念稿」

    字节跳动 Seed Audio 1.0 音频创作模型
    Seed Audio 1.0 用统一框架联合建模人声、音效与环境声(概念图)

    做短视频、短剧的人大概都有过这种崩溃:画面拍好了,配一段像样的音效比写脚本还费劲。人声要去录音棚,环境声要现找素材,音效还得一笔笔手动对时间轴。7月20日,字节跳动 Seed 团队丢出一个叫 Seed Audio 1.0 的模型,想把这个流程一口气吞掉。

    它不是拼接,是「一起想」

    过去这类工具大多是各管一摊:一个模型生成人声,一个模型找音效,最后人工混音。Seed Audio 1.0 的卖点在于,它在一个统一框架里同时建模人声、音效和环境声,端到端直接产出一段能拿来叙事的完整声音。官方一句话挺妙:声音不再只是画面的补丁,而是能直接参与讲故事,「听见」即「看见」。

    具体有三个本事。第一是精细的时间编排,按时间线控制对白和音效什么时候进场,精度能到 100 毫秒,做视频配音和广告卡点刚好。第二是音色稳,支持零样本生成和长音频延展,一个角色从头到尾音色不变,还能同一声音演多个角色、带不同情绪。第三是语种全,覆盖中文、英文、日语等 20 多种语言,重音和节奏都按当地习惯来。

    官方评测显示,在影视、短剧、动漫、播客等多数场景里,音频可用率已经跑到 90% 以上;多语言自然度方面,大部分语种 MOS 评分超过 4 分,算优秀水平。

    从「会说」到「会创作」

    这中间的区别挺关键。早几年的语音合成,本质是把文字念出来,语调再自然也还是「读稿」。Seed Audio 1.0 瞄准的是创作——你给一条指令,它自己安排谁说话、什么情绪、背景音怎么铺、什么时候淡入。对短剧和动漫团队来说,这意味着原本要分几个工种、花几天的活,可能压缩到一轮生成。

    • 影视级音频:对白、音效、环境声统一编排,叙事更连贯
    • 可控音色:长音频保持一致,同一声音可演多角色
    • 20+ 语种:自然生成,适配本地表达节奏

    先上体验,后面还有大招

    模型现在已经放在火山方舟体验中心,创作者能直接试。团队放话,接下来会接进视频参考这类多模态输入,还会做可控翻译、长音频和分轨生成,方向是把脑子里的声音构想更快变成能听见的成品。


    大模型从文本、图像一路卷到音频,Seed Audio 1.0 是个信号:AI 音频正从单点工具走向全场景创作平台。对内容创作者,门槛又低了一截;对行业,竞争也从「谁念得真」变成「谁编得巧」。

  • Graphify:把整个代码库变成 AI 可推理的知识图谱

    Graphify:把整个代码库变成 AI 可推理的知识图谱

    📌 项目简介

    Graphify 是一个开源的 AI 编程助手技能(Skill),用一条命令把你手头的代码库、SQL schema、论文 PDF、文档、截图甚至白板照片,全部解析成一张可查询的知识图谱。你的 AI 助手(Claude Code / Cursor / Codex / Gemini CLI / Aider 等 17 种)不再靠 grep 或模糊检索”猜”答案,而是沿着图谱里的真实路径推理——而且每条关系都可溯源、可审计。

    💻 安装要求和过程

    环境要求

    • Python 3.10+(解析与存储完全本地运行,无需任何服务器)
    • 任意一个支持的 AI 编程助手:Claude Code、Cursor、GitHub Copilot、OpenAI Codex、Gemini CLI、Aider 等(共 17 种),或任意 MCP 客户端
    • 联网(仅用于把文件送给你自己配置的模型,如 Claude / Ollama;代码本身不出本机)

    快速安装

    PyPI 上的包名暂时叫 graphifyy(两个 y),但命令与技能名仍然是 graphify

    pip install graphifyy
    graphify install        # 把技能注入你的 AI 助手

    然后在任意目录下打开你的 AI 助手,输入:

    /graphify .            # 对当前目录建图,代码 / 笔记 / 论文通吃

    Windows 若提示找不到命令,把 %APPDATA%\Python\Python3xx\Scripts 加入 PATH,或直接用 pipx install graphifyy;macOS 若报 externally-managed 错误同样改用 pipx 即可。

    ✨ 核心功能

    1. 全模态建图:万物皆可成节点

    支持代码(Python / TS / Go / Rust / Java / C++ 等 36 种 tree-sitter 语法)、文档(md / txt / rst)、论文 PDF,以及截图 / 流程图 / 白板照片 / 多语言文字图片(借助 Claude 视觉能力)。App 代码、数据库 schema、基础设施被统一进同一张图。

    2. 本地优先、零云端、零遥测

    解析在本地跑,图谱就是磁盘上的一个文件(graph.json),没有任何服务器在环、没有任何遥测上报。代码永远不会离开你的机器——对重视隐私和合规的团队尤其关键。

    3. 可审计的溯源:每条边都标明”怎么知道的”

    图谱里每一条关系都被打上 EXTRACTED(源码里实锤)、INFERRED(由结构与命名推理,通常靠谱但值得复核)、AMBIGUOUS(证据指向多于一方)三种标签。AI 回答时引用的是它走过的真实路径,而不是”凭感觉”。

    4. 17 个 AI 助手 + 自带 MCP Server

    一个技能可装进 17 种助手,并额外提供 MCP server:既可 stdio 单机服务,也能 HTTP 给整个团队共享。还附带 graphify prs 终端 PR 看板(CI 状态 / AI 分诊 / 合并冲突风险)。

    5. 自动同步:图谱跟着代码长

    --watch 后台实时重建(代码保存即时、文档 / 图片变化提醒你跑 --update);graphify hook install 还能装一个 git post-commit 钩子,每次提交后自动重建图谱,多 Agent 并行写码时图谱始终保持最新。

    Graphify 知识图谱可视化
    Graphify 将代码库映射为可交互知识图谱:节点=符号,颜色=自动识别的模块社区,大节点=God Node

    🎯 典型使用场景

    场景一:接手一个陌生代码库

    不用硬读 100 个文件——直接查 “god nodes”(连接度最高的符号,改动影响面最大),几分钟摸清架构与模块边界,新成员上手速度拉满。

    场景二:团队共享”谁负责什么”

    把 graph.json 提交进仓库,或用 graphify.serve 走 HTTP。新人问 “谁负责 billing?”,得到的是穿过真实代码的两条跳路径,而不是一周前的 Slack 聊天记录。

    场景三:给 AI 编程助手装”记忆”,省下海量 token

    官方基准:在 Karpathy 仓库 + 论文 + 图片的混合语料上,相比逐文件读取原始文件,每次查询 token 减少 71.5 倍;社区实测在 49.6 万 token 的代码库上省 79 倍,且零向量数据库。NOTE / WHY / HACK 注释还会变成可追查的图谱节点。

    💡 推荐理由

    我最早是被”用图谱替代 grep”这个点打动的。实际用下来,最戳我的是可审计——现在太多 RAG / 向量库方案给的是个不透明的相似度分数,你根本不知道 AI 为什么这么答;Graphify 把每条边都标了出处,你能直接点开源码第几行去验证。再加上纯本地、MIT、零账号零卡片,安全感拉满。它不算”重”的工具,装一个 skill、跑一条命令,就能让手头的 AI 编程助手从”猜”变成”走查”。如果你也受够了助手读不全代码、答非所问,值得一试。

    🔗 下载地址

  • Open WebUI:自托管、可离线运行的 AI 聊天与智能体平台

    Open WebUI:自托管、可离线运行的 AI 聊天与智能体平台

    Open WebUI 界面演示

    项目简介

    Open WebUI 是一个功能丰富、可完全离线运行的自托管 AI 平台,支持 Ollama 本地模型与 OpenAI 兼容 API,内置 RAG 检索增强、多模型对话、语音/视频通话、智能体与插件生态,是把任意大模型变成”私有 ChatGPT”的一站式前端。(GitHub ⭐ 145K+,Python,Open WebUI License)

    安装要求和过程

    环境要求:Python 3.11(pip 方式);或 Docker 20.10+(容器方式);可搭配 Ollama 本地推理,或任意 OpenAI 兼容 API Key。

    方式一 · pip 安装(最简):

    pip install open-webui
    open-webui serve   # 访问 http://localhost:8080

    方式二 · Docker 一条命令(自带 Ollama,CPU):

    docker run -d -p 3000:8080   -v ollama:/root/.ollama -v open-webui:/app/backend/data   --name open-webui --restart always   ghcr.io/open-webui/open-webui:ollama

    方式三 · 仅用 OpenAI API:

    docker run -d -p 3000:8080   -e OPENAI_API_KEY=your_secret_key   -v open-webui:/app/backend/data   --name open-webui --restart always   ghcr.io/open-webui/open-webui:main

    部署后访问 http://localhost:3000 即可使用;也支持 Docker Compose、Kubernetes(Helm/Kustomize)与 uv 安装。

    核心功能

    • 广泛的模型与 API 接入:本地 Ollama + 任意 OpenAI 兼容后端(LM Studio、Groq、OpenRouter、vLLM、Mistral 等),支持多模型并行对话、各取所长。
    • 本地 RAG 知识库:支持 9 种向量数据库与多种文档解析引擎(Tika、Docling、Mistral OCR 等),混合检索(BM25+向量)+ 重排,用 # 命令把文档/网页直接拉进对话。
    • 智能体与插件生态:Filters / Actions / Pipes / Tools / Skills 插件机制,可接 MCP、OpenAPI 工具服务器,把任意基础模型包装成专属 Agent。
    • 语音/视频通话与多模态:本地 Whisper 等 STT + 多种 TTS 引擎,内置 DALL·E / Gemini / ComfyUI 图像生成与编辑,支持网页浏览与联网搜索。
    • 企业级管理与安全:细粒度 RBAC 与用户组、LDAP / SSO / SCIM 自动配置、PostgreSQL 持久化、横向扩展与 OpenTelemetry 可观测性。

    典型使用场景

    • 个人本地 AI 助手:用 Ollama 在笔记本上跑 Llama / Mistral,全程离线、数据不出本机,配合 RAG 问答私人文档。
    • 团队自托管 AI 中台:公司内部署,接入 OpenAI 或自建 vLLM,统一账号、权限与用量审计,替代公网 SaaS,守住数据隐私。
    • 知识库问答与自动化:把 Confluence / Notion / 本地文件建索引,用智能体 + 定时自动化做日报生成、资料检索与多模型 A/B 评估。

    推荐理由

    我把 Open WebUI 当作”私有 ChatGPT 的标杆”。它最打动我的是真正的离线优先与自托管能力——所有聊天与文档数据都留在自己的机器或服务器,不依赖任何云。RAG 开箱即用,多模型对比、语音通话、插件生态一应俱全,Docker 一条命令就能跑起来,对不想把对话记录交给第三方的用户极其友好。社区极其活跃、更新频繁,是个人和中小团队落地 AI 的最低门槛选择。

    下载地址

  • Meta的编程模型Muse Spark 1.1:不晒跑分,4.25美元/百万token抢开发者

    Meta的编程模型Muse Spark 1.1:不晒跑分,4.25美元/百万token抢开发者

    Meta Muse Spark 1.1 智能体编程模型
    Meta 发布面向智能体的多模态推理模型 Muse Spark 1.1

    7 月 9 日,Meta 上线了一个叫 Muse Spark 1.1 的模型。说它”低调”其实不太准确——扎克伯格亲自发帖,马斯克顺手一个转发,12 小时里相关视频被看了 1200 多万次。可翻开发布物料,你会发现一件怪事:没有 SWE-bench 分数,没有技术论文,也没开源。一个号称”编程模型”的东西,连个跑分都不敢晒。

    它到底能干什么

    Muse Spark 1.1 的定位是”给 AI 智能体用的多模态推理模型”。Meta 说它强化了多智能体协作:由一个主智能体负责收集信息、制定计划,再把任务拆给一堆子智能体并行执行,复杂项目的处理时间能明显缩短。上下文也拉长到了 100 万 token,长流程里能记住早先的内容。

    落到具体场景,它能在多个应用之间连续干长活儿,自己判断是该直接点界面、写段脚本自动化,还是一口气把几步操作做完,尽量少麻烦人。写代码这块,它能诊断修复杂 bug、开发新功能,甚至做大规模代码迁移,过程中一直保留关键上下文。Meta 说内部研发和研究员已经每天拿它辅助开发了。

    Meta 强调,Muse Spark 1.1 已按内部《Advanced AI Scaling Framework》完成部署前评估,在化学与生物安全、网络安全以及失控风险等前沿领域”均维持在安全范围内”。

    价格先打到底,基准一个没有

    这边没晒分,那边先把价格摆出来了:输出定价每百万 token 4.25 美元。比 Grok 4.5 还便宜,大概只有 GPT 近段时间价格的一小部分。如果后续基准勉强能看,这个价可能直接成为个人开发者的甜区,给 GitHub Copilot、Cursor 的收费模式施压。

    不过 Meta 自己的内部评估也坦诚,在部分电脑操作、长上下文和代码测试上,Muse Spark 1.1 仍然落后于 GPT-5.5 和 Claude Opus 4.8。它更像是先抛声量、后补证据的发布——在 Meta 今年预计超 650 亿美元资本开支的压力下,这款模型如果不能快速拉出用户规模,很容易又被看成”又一个没结果的尝试”。

    • 零基准发布:没有 SWE-bench、没有论文、没有开源,与 Llama 系列习惯相反
    • 价格战打法:4.25 美元/百万 token 输出,瞄准个人开发者
    • 能力边界:智能体、代码、通用推理有提升,但硬指标仍落后于 GPT-5.5 和 Claude Opus 4.8

  • OpenMontage:把 AI 编程助手变成「全自动视频制片厂」的开源智能体系统(37.4K★)

    OpenMontage:把 AI 编程助手变成「全自动视频制片厂」的开源智能体系统(37.4K★)

    OpenMontage 是全球首个开源的「智能体驱动(agentic)视频生产系统」,用 12 条生产流水线、52 个工具和 500+ 智能体技能,把 Claude Code / Cursor / Copilot 等 AI 编程助手直接变成一间完整的视频制片厂。

    项目简介

    一句话:把你的 AI 编程助手变成一间全自动视频制片厂。你只需用自然语言描述想法,OpenMontage 的流水线就会自动完成联网调研、脚本撰写、素材检索/生成、剪辑合成与质量自检,端到端产出成片。零付费 API Key 也能跑通完整链路。

    安装要求和过程

    环境要求

    • Python 3.10+(python.org 下载)
    • Node.js 18+(nodejs.org 下载)
    • 系统安装 FFmpeg(brew install ffmpeg / sudo apt install ffmpeg)
    • 一个能读取文件并运行代码的 AI 编程助手:Claude Code、Cursor、Copilot、Windsurf 或 Codex 任一即可
    • 可选 GPU:用于本地免费视频生成(make install-gpu,支持 wan2.1-1.3b 等模型)
    • API Key 全部可选:不付费也能出片,付费图像/视频商仅用于更高画质

    快速安装

    标准流程(需 make):

    git clone https://github.com/calesthio/OpenMontage.git
    cd OpenMontage
    make setup

    随后在 AI 编程助手中打开项目,输入需求即可,例如:

    "Make a 60-second animated explainer about how neural networks learn"

    无 make 环境可手动建虚拟环境(README 提供 macOS/Linux 与 Windows PowerShell 两套命令):

    python3 -m venv .venv
    source .venv/bin/activate
    pip install -r requirements.txt
    cd remotion-composer && npm install && cd ..
    pip install piper-tts
    cp .env.example .env

    make setup 后已自带 Piper 本地 TTS、Archive.org / NASA / Wikimedia 开放素材、Pexels / Unsplash / Pixabay、Remotion、HyperFrames、FFmpeg 与内置字幕。

    核心功能

    1. 端到端生产流水线:12 条预置流水线(科普解说、口播、纪录片混剪等),统一走 research → proposal → script → scene_plan → assets → edit → compose 七个阶段。
    2. 真实素材纪录片制作:无需付费视频模型,从 Archive.org / NASA / Wikimedia 等开放素材库语义检索并剪辑成片,而非仅仅把静态图做成动画。
    3. 参考驱动创作:贴一个你喜欢的视频,智能体会分析其节奏与钩子,生成差异化的制作方案(保留手法、替换主题)。
    4. 内置实时联网调研:写脚本前自动跑 15–25+ 次跨 YouTube / Reddit / 新闻 / 学术源的搜索,用真实数据支撑内容。
    5. 生产级质量门禁与预算治理:人工审批门、预合成验证、渲染后自检(ffprobe 抽帧 + 音频分析)、7 维打分选商、成本预估与上限(默认总预算 $10)。

    Backlot 制作工作台

    OpenMontage 内置 Backlot 可视化工作台,覆盖实时看板、故事板与素材库,让自然语言需求落到可逐帧审阅的制作流程:

    Backlot 实时制作看板(board-live)
    Backlot 实时制作看板(board-live)
    Backlot 故事板(storyboard)
    Backlot 故事板(storyboard)
    Backlot 素材库(library)
    Backlot 素材库(library)

    典型使用场景

    • 零 Key 科普 / 教学短片:一句 "Make a 45-second animated explainer about why the sky is blue" 即可生成带解说与字幕的动画片。
    • 免费真实素材纪录片:如 "Make a 90-second documentary montage about what a city feels like at 4am. Use real footage only",直接调用开放素材库剪辑,零成本成片。
    • 商业预告片(配置图像/视频商后约 $1–$3):科幻概念预告片、产品发布 Teaser 等;已展示案例成本最低 $0.02、最高数美元(如 Kling v3 成片 $1.33)。

    推荐理由

    OpenMontage 最打动我的是它把「做视频」从专业软件的高门槛,解放成一句自然语言需求。三点尤其值得一试:

    • 零 Key 也能跑通全链路:本地 Piper TTS + 开放素材 + Remotion 合成,对想低成本试水 AI 视频的人极友好。
    • 架构清爽、可扩展tools/ + pipeline_defs/ + skills/ 三层知识架构,可以自己加技能 / 工具;AGPL-3.0 开源、可自托管。
    • 内容有真实出处:「参考驱动 + 联网调研」让脚本不像纯生成那样空洞,预算门禁也让人敢放心把任务交给智能体跑。

    个人体会:第一次用 "Make a 60-second animated explainer about how neural networks learn" 跑通时,最惊艳的是它真的会先去查资料再写脚本——出来的东西有依据、有节奏,而不是随机拼接的炫技片段。

    下载地址