标签: 开发者工具

  • TensorRT LLM:NVIDIA 开源的高性能大模型推理引擎,14.2K Star

    TensorRT LLM:NVIDIA 开源的高性能大模型推理引擎,14.2K Star

    项目简介

    TensorRT LLM 是 NVIDIA 开源的高性能大语言模型(LLM)与视觉生成模型推理优化库。它在 NVIDIA GPU 上提供最先进的定制内核、运行时优化和 Python 化高层 API,能把主流开源/自研大模型的推理延迟压到更低、吞吐拉到更高——从单张 RTX 显卡到多机 NVL72 集群都能统一部署。

    TensorRT LLM

    安装要求和过程

    环境要求

    • GPU:NVIDIA GPU(推荐 Ampere / Ada / Hopper / Blackwell 架构)
    • CUDA:CUDA 13.2.1(以 README 当前 badge 为准)
    • Python:3.10 或 3.12
    • PyTorch:2.11.0
    • 系统:Linux(主要支持)、Windows、WSL2

    快速安装

    # 推荐通过 pip 安装最新 release
    pip install tensorrt_llm
    
    # 或使用预编译容器(避免环境踩坑)
    docker pull nvcr.io/nvidia/tritonserver:26.05-trtllm-python-py3
    
    # 验证安装
    trtllm-serve --help

    更复杂的源码编译或多节点部署可参考官方安装指南:Installation Guide

    核心功能

    TensorRT LLM 架构分层

    • PyTorch 原生架构:模型定义直接写 PyTorch,调试、扩展、自定义注意力/量化都更直观。
    • 高层 LLM API:一行代码从 Hugging Face 加载模型,自动编译 TensorRT engine,支持单卡、张量并行、流水线并行、专家并行。
    • State-of-the-Art 内核:针对 Attention、GEMM、MoE 等常见算子手写 CUDA kernel,充分发挥 Tensor Core 算力。
    • 丰富的高级特性:FP8/FP4/INT4 AWQ 量化、KV Cache 复用、投机解码、Prefix Caching、CUDA Graphs、Prefill-Decode 解耦等。
    • 生产级部署生态:原生兼容 NVIDIA Dynamo、Triton Inference Server,也能作为 vLLM、SGLang 等框架的后端。

    典型使用场景

    TensorRT LLM 核心优化技术

    1. 高并发在线服务

    在 H100/H200/B200 集群上部署 Llama、DeepSeek、Qwen 等模型,配合 Tensor Parallelism 和 Disaggregated Serving,把单用户延迟压到百毫秒级,同时保持数千 token/s 的聚合吞吐。

    2. 本地化推理与边缘部署

    通过 INT4/FP4 量化和 Weight-Stripped Engines,在单张 RTX 4090 或 Jetson AGX Orin 上运行 70B 级别模型,满足私有化、低功耗场景需求。

    3. Agent 与长上下文应用

    利用 Prefix Caching 和 chunked context,在多轮工具调用、RAG、代码补全等长上下文场景中显著降低首 token 时延。

    推荐理由

    TensorRT LLM 是 NVIDIA 在大模型推理领域的“官方解法”。它不是简单的封装,而是从 kernel、runtime 到 serving 的垂直优化。2025 年 3 月后项目已完全开源并迁到 GitHub 维护,社区活跃、文档详尽,对追求极致吞吐和成本控制的生产环境尤其友好。虽然硬件门槛是 NVIDIA GPU,但如果你已经在 CUDA 生态里,它基本是目前能把模型跑得最快、最省显存的工具之一。

    下载地址

  • Open Code Review:阿里巴巴开源的 AI 代码评审 CLI,Token 只用 1/9 却更精准

    Open Code Review:阿里巴巴开源的 AI 代码评审 CLI,Token 只用 1/9 却更精准

    如果你用过 Claude Code 之类的通用 Agent 做代码评审,大概率遇到过这些坑:改动一多就”偷工减料”只看部分文件、报出来的问题行号对不上、换个提示词质量就飘。Open Code Review(OCR) 是阿里巴巴刚开源的一款 AI 代码评审命令行工具,它把”确定性工程”和”Agent 动态决策”拧在一起,专门解决这些问题。项目上线不久便冲上 GitHub Trending,目前已收获约 12.2K Stars

    Open Code Review 功能亮点
    Open Code Review 功能亮点(图片来源:项目 README)

    一句话简介

    Open Code Review 是阿里巴巴开源的 AI 代码评审 CLI 工具——读取 Git diff,交给可配置的大模型 Agent 进行带工具调用的深度评审,产出行级精准的结构化评审意见。它源自阿里内部使用两年、服务数万开发者、累计发现数百万代码缺陷的官方评审助手,经大规模验证后开源。

    安装要求与快速上手

    环境要求

    • Git ≥ 2.41:OCR 依赖 Git 生成 diff、检索代码与仓库操作。
    • 支持 Windows / macOS / Linux 三大平台;需要配置一个大模型接口(OpenAI / Anthropic 兼容即可),或使用”委托模式”无需配模型。

    安装(npm 全局安装)

    npm install -g @alibaba-group/open-code-review

    安装完成后,全局即可使用 ocr 命令。也支持安装脚本、GitHub Release 二进制、源码编译等方式。

    配置模型

    # 选择内置服务商或添加自定义服务商
    ocr config provider
    # 为当前服务商选择模型
    ocr config model

    交互式界面会引导你完成服务商选择、API Key 填写与模型配置,并自动测试连通性。

    模型配置界面
    交互式模型配置界面(图片来源:项目 README)

    开始评审

    cd your-project
    
    # 工作区模式:评审所有暂存/未暂存/未跟踪的改动
    ocr review
    
    # 分支范围:对比两个 ref
    ocr review --from main --to feature-branch
    
    # 单个 commit
    ocr review --commit abc123
    
    # 整文件扫描:不看 diff,直接审阅整个仓库或指定目录
    ocr scan
    ocr scan --path internal/agent

    核心功能

    • 确定性工程 × Agent 混合架构:对”绝不能出错”的评审步骤(选文件、匹配规则、定位行号)用工程逻辑硬约束保证正确,把动态决策与上下文检索交给 Agent,各司其职。
    • 精准选文件 + 智能打包:明确判定哪些文件需评审、哪些应过滤;把关联文件(如中英两份 message 属性文件)打包为一个评审单元,每包作为隔离上下文的子 Agent 并发运行,在超大改动集上依然稳定。
    • 行级精准定位 + 反思模块:独立的评论定位与评论反思模块,系统性提升 AI 反馈的位置准确度与内容准确度,避免”行号漂移”。
    • diff 评审 + 整文件扫描ocr review 审阅改动,ocr scan 审阅整份文件——适合审计陌生代码库或没有有意义 diff 的目录。
    • 丰富集成能力:内置 MCP Server 扩展工具、CI/CD 集成(GitHub Actions / GitLab CI / Gerrit 等),并可作为 Skill 或插件接入 Claude Code、Codex、Cursor;浏览器端 Session Viewer 可回放评审过程。

    性能基准

    官方基于 50 个热门开源仓库、200 个真实 PR、10 种编程语言构建了真实世界评审基准,由 80+ 资深工程师交叉标注出 1505 个基准问题。结果显示:在同一底座模型下,OCR 的 准确率(Precision)与 F1 显著更高,而 Token 消耗仅约通用 Agent 的 1/9、评审更快;召回率略低,是”以精度换噪声”的有意取舍。

    性能基准对比
    在同一底座模型下的基准表现概览

    典型使用场景

    • 提交前自检:在本地 ocr review 一把,把行级问题在推送前就修掉,减少来回改 PR 的成本。
    • CI 流水线自动评审:接入 GitHub Actions / GitLab CI,对每个 PR 自动评审并留下行级评论,低 Token 成本让团队大规模跑得起。
    • 审计陌生代码库:接手老项目或第三方代码时用 ocr scan 整文件扫描,快速摸清 NPE、线程安全、XSS、SQL 注入等隐患。

    推荐理由

    市面上”给 Agent 套个 Skill 就当代码评审”的方案不少,但真正在工程上把稳定性做扎实的不多。OCR 最打动我的一点,是它没有一味迷信大模型,而是把”该确定的地方交给工程、该灵活的地方交给 Agent”这条边界划得很清楚——这正是它能在阿里内部大规模跑两年、且在基准上只花约 1/9 Token 就拿到更高精度的原因。对追求 CI 成本可控、又不想被误报刷屏的团队来说,这是个值得一试的选择。它还内置了针对 NPE、线程安全、XSS、SQL 注入等常见缺陷的微调规则集,开箱即用。

    下载地址

  • Buzz:Block 开源的”人机同室”协作平台,让 AI 智能体成为团队正式成员 | GitHub 今日 Trending 榜首

    Buzz:Block 开源的”人机同室”协作平台,让 AI 智能体成为团队正式成员 | GitHub 今日 Trending 榜首

    Buzz 项目频道:人与智能体在同一房间协调发布计划
    Buzz 项目频道:人与智能体在同一房间协调发布计划

    项目简介

    Buzz 是 Block, Inc.(Square/Cash App 母公司,也是知名开源智能体 goose 的东家)开源的一款「人类与 AI 智能体共处一室」的自托管协作工作空间——用一条 Nostr 签名事件日志,把聊天、代码评审、CI、工作流、审批和项目记忆统一到同一个 Relay 上,智能体和人拥有完全相同的操作界面与审计轨迹。今日登顶 GitHub Trending 榜首(单日 +2,100 星),目前已收获 7,600+ Stars,Rust 编写,Apache-2.0 许可。

    一句话概括:Slack + GitHub + CI 面板 + 自动化胶水代码,被压缩成一个你自己掌控的事件日志;智能体不再是”闹鬼的定时任务”,而是房间里的正式成员。

    一条签名事件日志,统一七种工具
    一条签名事件日志,统一七种工具

    安装要求和过程

    环境要求

    • 只想试用桌面应用:直接下载打包版,macOS(.dmg)/ Linux(.AppImage / .deb)/ Windows(.exe),无需任何依赖
    • 自托管 / 源码运行:Docker + Hermit(或 Rust 1.88+、Node 24+、pnpm 10+、just)
    • Windows 额外要求:安装 Git for Windows(智能体 Shell 工具依赖 Git Bash,可用 BUZZ_SHELL 指向其他 bash 兼容 Shell)

    快速安装

    方式一:下载安装包(最简单)

    GitHub Releases 下载对应平台安装包,像普通应用一样安装。默认连接 ws://localhost:3000,可通过 BUZZ_RELAY_URL 环境变量或应用内切换 Relay。

    方式二:源码构建 + 自托管(开发者路径)

    # 克隆并激活固定工具链(工具首次使用自动下载)
    git clone https://github.com/block/buzz.git && cd buzz
    . ./bin/activate-hermit
    
    # 一次性初始化:复制 .env、启动 Docker 服务 + 数据库迁移
    just setup && just build
    
    # 日常开发:同时启动 Relay + 桌面应用
    just dev
    

    Relay 跑在 ws://localhost:3000,桌面应用自动弹出。智能体侧设置 BUZZ_PRIVATE_KEY 后即可使用 buzz-cli(JSON 进 / JSON 出,为 LLM 工具调用而设计)。

    核心功能

    智能体是成员,不是机器人——像添加同事一样把智能体拉进频道
    智能体是成员,不是机器人——像添加同事一样把智能体拉进频道
    1. 智能体是”正式成员”而非外挂机器人——每个智能体持有自己的密钥、自己的频道成员身份、自己的审计轨迹,能开仓库、发补丁、评审代码、跑工作流、编辑画布、进语音房间,操作面与人类teammate完全一致,权限按身份而非标志位划分。
    2. 一条事件日志统一一切——消息、表情回应、工作流步骤、评审批准、Git 事件(NIP-34 补丁/仓库公告/状态)全部是同一形状的 Nostr 签名事件,同一身份模型、同一搜索索引、同一审计链。
    3. 分支即房间——开一个 feature 分支就自动生成一个频道,补丁、CI 结果、智能体首轮评审、同事表情反馈和最终合并决定都留在同一个房间里,”这段代码为什么存在”从此有据可查。
    4. YAML 工作流自动化——支持消息 / 表情回应 / 定时 / Webhook 四种触发器;一个 👍 表情就能作为审批门放行一次发布,且每一步都被签名、可搜索。
    5. ACP 智能体接入 + 完整的 Rust Crate 生态——buzz-acp 桥接 ACP↔MCP,官方已适配 goose、Codex、Claude Code;buzz-persona 提供智能体人格包;git-sign-nostr 实现 Nostr 签名的 Git 操作。桌面端 Tauri + React,后端 Postgres + Redis + S3/MinIO。
    Buzz 架构:Relay 是唯一事实来源
    Buzz 架构:Relay 是唯一事实来源

    典型使用场景

    1. 凌晨两点的事故记忆:线上报错,你在频道里问一句”这个错误以前见过吗?”,值守频道的智能体翻出六个月的历史,贴出相关线程、根因和修复记录,并主动提出呼叫上次修复的人——问、答、证据全部留在频道里。
    2. 会自己写发布说明的 Release:打 tag 触发工作流,智能体读取项目频道里合并的 PR,起草 Release Notes 发给人类审阅,收到 👍 表情后自动发布——每一步签名、每一步可搜索。
    3. 不交出”王国钥匙”的 Bug 分诊:让智能体在限定频道内分诊 Bug,它的密钥、成员身份和审计轨迹与人类隔离,像管理一个新同事一样管理它的可见范围,而不是给它一把全局 API Key。
    可讨论的媒体:评论钉在视频的具体帧上
    可讨论的媒体:评论钉在视频的具体帧上

    推荐理由

    我把 Buzz 跑起来体验后的最大感受是:它认真回答了”智能体在团队里应该以什么身份存在”这个问题。市面上的方案大多把 AI 塞进聊天工具当 bot,或者塞进 CI 当脚本,权限靠一堆 API Key 拼凑,出了事没法追溯。Buzz 的答案干脆利落——给智能体一把自己的密钥,让它跟人用同一套协议、进同一个房间、留同一种审计记录。

    值得注意的三点:一是出身硬,Block 是 goose 的东家,这套 ACP harness 直接兼容 goose/Codex/Claude Code,不是玩具;二是技术选型有味道,Nostr 协议的签名事件模型天然适合”人机同权”的审计需求,且不含任何区块链代币成分(README 原话:不用买纪念币);三是坦诚,README 明确列出”今天能用 / 正在接线 / 只有想法”三栏,移动端和推送还在路上。如果你的团队正被 Slack + GitHub + CI 面板 + 各种 bot 胶水折磨,这个”一个基底替代七个标签页”的赌注非常值得关注。

    下载地址


    项目数据(截至 2026-07-24):7,648 Stars · 608 Forks · 语言 Rust · 许可 Apache-2.0 · 创建于 2026-03 · 今日 GitHub Trending 榜首(单日 +2,100 星)

  • 模型卷不动了就卖调度:Runway发布首个生成式媒体模型路由器

    Runway 不想再只当一家”卖模型的公司”了。周四,这家 AI 视频起家的明星创业公司通过本月刚上线的开发者平台 Runway Dev,发布了一个叫 Media Router 的新工具——号称是第一个专为生成式媒体打造的模型路由器。它的野心写在明面上:做整个生成式媒体行业的基础设施层。

    Runway Media Router 模型路由
    Runway Media Router 会按质量、速度或成本自动挑选最合适的生成模型(图源:Runway)

    模型太多挑花眼?那我来替你挑

    Media Router 干的事说来简单:开发者发一个图像、视频或音频的生成请求,它根据你更看重质量、速度还是成本,自动把请求分给最合适的模型——既包括 Runway 自家的,也包括接入平台的一堆第三方模型。模型路由在大语言模型圈早就是常规操作,但在生成式媒体这边,Runway 说自己是头一家。

    Runway 首席产品官 Anthony Maggio:大多数开发者根本没时间搞清楚每个模型在视频、图像、音频上各自强在哪。我们带来的独特价值,就是把这套”哪个模型最适合哪种场景”的判断力打包给你。

    这套判断力不是拍脑袋来的。Runway 内部创意团队常年评测各类模型——视频模型的运动表现、图像模型的构图水平、语音模型的口型同步,积累成了路由器背后的智能层。这层能力原本是为 5 月发布的 Runway Agent(对话式创意智能体)搭建的,现在直接打包卖给外部开发者。目前 Adobe、Cloudflare、ElevenLabs、Expedia、Shutterstock、Quora 都已经在通过 Runway Dev 的 API 把媒体生成能力嵌进自家产品。

    Token 账单疼了一年,路由就是止疼药

    Maggio 透露,客户最关心的路由维度就是 token 价格和质量。2026 年企业圈被智能体的天价 token 账单结结实实上了一课,按价格路由早成了大模型领域的显学,生成式媒体跟进只是时间问题。有意思的是,Runway 自己几周前刚把无限量订阅改成按 token 计费,还挨了不少用户的骂——一边挨骂一边顺势把”帮你省 token”做成新生意,这算盘打得不可谓不精。


    模型不再领跑,那就去做发牌的人

    转型背后有现实压力。Runway 上一款旗舰视频模型 Gen 4.5 还是去年 12 月发的,当时确实登顶过榜单,压过谷歌一头。但如今按 Artificial Analysis 的排名,它的文生视频和图生视频模型已经掉出领先位置,前 20 名里挤满了谷歌和中国大厂的模型,Gen 5 至今没有音讯。

    • Media Router 的底层假设很清醒:”最好的模型”会不断易主,与其赌自己永远领先,不如做那个替所有人分发请求的枢纽;
    • 联合创始人兼联合 CEO Anastasis Germanidis 直言,公司必须建起完整技术栈——开发者平台、创意工具套件、底层推理层缺一不可;
    • 在他看来,当客户开始用模型生产整套营销活动和多场景成片时,编排层的价值只会越来越大。

    当不成最强的模型,就去当最好的调度台——这条路 OpenRouter 们在大语言模型市场已经验证过一遍。生成式媒体这边格局更碎、模型更迭更快,路由生意理论上更有得做。剩下的悬念是:等谷歌、字节这些既有顶级模型又有平台野心的巨头也想通了这一层,Runway 的先发优势还能守多久。

  • Outlines:15K Star 的 LLM 结构化输出库,让大模型 100% 生成合法 JSON

    Outlines:15K Star 的 LLM 结构化输出库,让大模型 100% 生成合法 JSON

    Outlines - LLM 结构化输出库

    项目简介

    Outlines 是由 .txt(dottxt)团队开源的 LLM 结构化输出(Structured Outputs)库——它在生成阶段就保证大模型输出严格符合你指定的类型或结构(枚举、整数、Pydantic 模型、JSON Schema、正则、上下文无关文法),从根源上消灭”解析失败、JSON 残缺”问题。项目在 GitHub 上已收获 15,200+ Stars,被 NVIDIA、Cohere、HuggingFace、vLLM 等信任并采用,vLLM 的 Structured Output 后端正是基于它的 outlines-core。

    一句话:别再用正则和 try/except 去”修补”模型输出了——Outlines 让模型从一开始就只能生成合法结构:model(prompt, output_type)

    安装要求和过程

    环境要求

    • Python 3.9+(建议 3.10 以上)
    • 按需选择后端:本地推理需 transformers / llama.cpp(配相应硬件),或走 vLLM / Ollama 服务端,或直接用 OpenAI / Gemini API(无本地算力要求)
    • 操作系统不限,CPU 也能跑(配合 API 或 Ollama)

    快速安装

    pip install outlines

    # 基础安装
    pip install outlines
    
    # 按后端安装可选依赖(示例)
    pip install outlines[transformers]   # 本地 transformers 模型
    pip install outlines[vllm]           # vLLM 服务
    pip install outlines[openai]         # OpenAI API

    30 秒上手

    import outlines
    from typing import Literal
    from transformers import AutoTokenizer, AutoModelForCausalLM
    
    MODEL = "microsoft/Phi-3-mini-4k-instruct"
    model = outlines.from_transformers(
        AutoModelForCausalLM.from_pretrained(MODEL, device_map="auto"),
        AutoTokenizer.from_pretrained(MODEL),
    )
    
    # 情感分类:输出只可能是这三个值之一
    sentiment = model(
        "Analyze: 'This product completely changed my life!'",
        Literal["Positive", "Negative", "Neutral"],
    )
    print(sentiment)  # "Positive"
    
    # 提取数值:保证返回合法 int
    temperature = model("What's the boiling point of water in Celsius?", int)
    print(temperature)  # 100

    核心功能

    Outlines 使用哲学:指定类型即可

    1. 类型即约束,贴合 Python 类型系统Literal 做多选一、int/float 做数值、Pydantic 模型/JSON Schema 做复杂对象、正则约束字符串格式、CFG 文法约束复杂语法——一行 model(prompt, type) 全部搞定。
    2. 生成期保证合法,而非事后修补:基于约束解码(constrained decoding),在每个 token 采样时就屏蔽非法选项,输出 100% 可被 model_validate_json 解析,不存在破损 JSON。
    3. 一套代码横跨所有模型:统一接口支持 transformers、llama.cpp(本地),vLLM、Ollama(服务端),OpenAI、Gemini(API),换模型/换供应商不改业务代码。
    4. 函数签名即 Schema 的 Function Calling:把 Python 函数直接当输出类型传入,Outlines 自动从签名推断结构,返回可直接 **kwargs 调用的参数字典。
    5. Jinja 提示词模板与可复用应用outlines.Template 把复杂 Prompt 从代码中分离,支持 few-shot 模板文件复用,方便工程化管理。

    典型使用场景

    1. 客服工单自动分诊

    把自由格式的用户来信一步解析为结构化工单(优先级枚举 / 类别 / 是否需主管介入 / 行动项列表),直接驱动自动路由与升级告警——priority 字段只可能是 low/medium/high/urgent 四个合法值,下游逻辑零防御代码。

    2. 电商商品自动归类与信息抽取

    批量把商品描述转成 主类目/子类目/属性列表/品牌 结构化数据,喂给库存和搜索系统;同理可做文档分类(财报/合同/技术文档)、事件信息抽取,甚至用 Union 类型优雅处理”信息不足则返回 I don’t know”的兜底。

    3. 生产级 Agent / RAG 管道的可靠胶水层

    Agent 的工具调用参数、RAG 的引用格式、多步工作流的中间态,全部用 Pydantic 模型锁死结构。vLLM 等推理引擎已内置其核心库,本地部署大模型时开启结构化输出几乎零成本。

    推荐理由

    使用 Outlines 的公司

    • 解决的是 LLM 工程化第一痛点:任何把 LLM 输出接入程序的人都被破损 JSON 折磨过。Outlines 的思路是”让非法输出根本不可能被生成”,比重试+修复的方案优雅一个量级。
    • 学习成本极低:会写 Python 类型注解就会用,10 分钟能跑通第一个例子;README 附 6 个可直接抄的生产级示例。
    • 学术与工业双背书:源自论文《Efficient Guided Generation for Large Language Models》,NVIDIA、HuggingFace、vLLM、Cohere 都在用,不是玩具项目。
    • Apache-2.0 宽松许可:商用无忧;核心 outlines-core 用 Rust 重写,约束编译速度快,生产可用。
    • 实测感受:约束解码对本地小模型提升尤其明显——Phi-3 这类 3B 级模型配合 Outlines 做分类/抽取,可靠性直逼裸用大一个数量级的模型,非常适合降本场景。

    下载地址


    项目信息(截至 2026-07-23):15,256 Stars · 809 Forks · Python · Apache-2.0 许可 · 由 .txt(dottxt-ai)团队维护

  • Microsoft AutoGen – 微软开源多智能体AI编程框架 [59.9K+ Stars]

    Microsoft AutoGen – 微软开源多智能体AI编程框架 [59.9K+ Stars]

    📝 项目简介

    Microsoft AutoGen 是微软研究院出品的开源多智能体 AI 编程框架,官方定位为 “A programming framework for agentic AI”。它把”多个会自主对话的 Agent 协同工作”这件事,抽象成一套事件驱动的运行时 + 消息协议,让 LLM、工具、人类三方可以在同一套代码里自由组合,既能 自主行动,也能 和人并肩工作,被广泛视为现代 Multi-Agent 协作范式的奠基性项目之一。

    59.9K+
    GitHub Stars

    9.0K+
    Forks

    Python / .NET
    双语言支持

    MIT
    代码许可

    数据来源:GitHub REST API(仓库 microsoft/autogen,截至 2026-07-23)。

    ⚙️ 安装要求和过程

    环境要求

    • Python:3.10 及以上(v0.4+ 推荐 3.11)
    • 操作系统:Linux / macOS / Windows 均支持
    • LLM 凭据:OpenAI 兼容 API Key(Azure OpenAI / OpenAI / Ollama / 本地 vLLM 等均可)
    • 可选依赖:Docker(隔离代码执行)、Node.js(Studio 浏览器依赖)
    • .NET 用户:.NET 8 SDK,dotnet add package Microsoft.AutoGen

    快速安装(Python,v0.4+ 推荐)

    # 1) 创建并激活虚拟环境
    python3 -m venv .venv && source .venv/bin/activate
    
    # 2) 安装 AgentChat 核心 + OpenAI 扩展
    pip install -U "autogen-agentchat" "autogen-ext[openai]"
    
    # 3) (可选) 安装无代码可视化工作台
    pip install -U "autogenstudio"
    
    # 4) 验证
    python -c "import autogen_agentchat; print(autogen_agentchat.__version__)"

    从源码安装(v0.4)

    git clone https://github.com/microsoft/autogen.git
    cd autogen
    pip install -e ./python/packages/autogen-agentchat
    pip install -e ./python/packages/autogen-ext[openai]
    # 启动 Studio
    autogenstudio ui --port 8080

    配置 LLM(OpenAI 兼容)

    把 API Key 放进环境变量(推荐),或写入 OAI_CONFIG_LIST

    # .env
    OPENAI_API_KEY=sk-...
    # 可选:Azure / 自定义网关
    AZURE_OPENAI_API_KEY=...
    AZURE_OPENAI_ENDPOINT=https://your-resource.openai.azure.com/
    OPENAI_API_BASE=https://your-gateway.example.com/v1
    ⚠️ 版本提示:自 v0.4 起,包名由 pyautogen 改为 autogen-agentchat / autogen-ext。v0.2 用户可参考 官方迁移指南

    🏗️ 架构总览

    AutoGen 把”造一个能自主干活的 AI”这件事切成三层 API,开发者可以按需选择从底层到高层:

    AutoGen 三层架构:Extensions / AgentChat / Core

    • Core API(底层):消息传递、事件驱动、分布式 Runtime,同时支持 Python 与 .NET,是整条链路的”内核”。
    • AgentChat API(高阶):双智能体对话、群聊、AgentTool 多专家路由——大多数应用只需要这一层。
    • Extensions API(扩展):LLM 客户端、工具注册、MCP 协议适配、模型上下文协议桥接。

    再上面还有三个开箱即用的”上层建筑”:AutoGen Studio(无代码 GUI)、AutoGen Bench(基准评测)、Magentic-One(微软开源的通用多智能体团队基线)。

    ✨ 核心功能

    🤖 1. 多智能体对话与编排

    把每个 Agent 看作一个会发消息的对象,通过 initiate_chat / a_initiate 一行就能拉起对话;支持两人私聊、群聊(SelectorGroupChat / Swarm / RoundRobin)与按需动态编排(AgentTool 把”专家 Agent”当工具调)。

    🧠 2. 可插拔模型与工具

    原生支持 OpenAI / Azure OpenAI / Anthropic / Ollama / vLLM / Gemini 等模型;工具侧通过 FunctionTool + MCP 一键接入浏览器、数据库、Shell、文件系统、Playwright 等上百种能力。

    🧑‍💻 3. 人机协同(Human-in-the-Loop)

    通过 UserProxyAgent / input_func 任意把人类拉进对话:审批、纠正、补充上下文,AI 不会”擅自做主”——这是 AutoGen 最早让业界眼前一亮的杀手锏。

    🖥️ 4. AutoGen Studio:无代码工作台

    可视化拖拽搭建 Agent 团队、连接工具、调试消息流、上传数据集。零代码也能跑通一个 Magentic-One 风格的”会自己上网 + 写代码 + 操作文件”的 AI 助手。

    🔁 5. Magentic-One 通用团队基线

    微软在 AutoGen 上开源的”通用多智能体”参考实现:Orchestrator 动态规划 → 调用 Coder / Computer-Use / Web-Surfer / File-Surfer 四个专家完成任务,对标 OpenAI Operator 与 Anthropic Computer Use。

    Magentic-One 风格的多智能体协作流程:Orchestrator + 4 个专家 Agent

    🎯 典型使用场景

    场景一:自动数据分析 + 报告生成

    做法Planner Agent 拆解任务 → Coder Agent 写 pandas / matplotlib 代码 → Executor 在 Docker 里跑 → Writer Agent 把结果整理成 Markdown 报告。人类只在最后审阅。

    收益:原本 2 小时的手工分析压缩到 10 分钟以内;每一步可追溯、可重放。

    场景二:多角色代码评审 / PR 自动化

    做法Author Agent 改代码 → Reviewer Agent 提风格 / 性能意见 → Tester Agent 自动跑单测 + 覆盖率 → Approver 收口。整套流程在一个 SelectorGroupChat 里循环。

    收益:把”人盯 PR”变成”AI 盯 PR”,工程师只看最后结论。

    场景三:Magentic-One 通用办公助手

    做法:把 Coder / Computer-Use / Web / Files 四个 Agent 配成团队,Orchestrator 自动调度。让它”打开 Chrome 去 LinkedIn 搜索 Python 后端岗位、截图、写到 jobs.md“——这是 OpenAI Operator 还没发布时,AutoGen 社区最早跑通的范式。

    收益:任何能拆成”打开应用 → 抓信息 → 写文件”的流程都能交给它。

    💡 推荐理由(也聊聊它的现状)

    作为多智能体框架的”鼻祖级”项目,AutoGen 给整个行业留下了三份被广泛借鉴的遗产:把”对话”当作 Agent 协作的一等公民把”人”显式拉进循环把”工具调用”做成可插拔。从 2023 年发布至今,AutoGen 一直是 Multi-Agent 论文与开源项目的引用常客,60K Star 是其行业地位的最好注解。

    实际用下来,AutoGen 最打动我的有三点:

    1. 上手曲线友好:AgentChat API 让你 5 行代码就能跑起一个”用户 ↔ 助手”对话;想加工具,FunctionTool(...) 一包就完事;想加人类审核,UserProxyAgent 直接接管输入。
    2. 生态厚、可借鉴多:官方 + 社区沉淀了 Magentic-One、AutoGen Bench、AG2(前 AutoGen 延续)等一大批可直接 fork 的参考实现,几乎所有”AI 办公助手”类产品都能在 AutoGen 里找到原型。
    3. 底层够”工程”:Core API 的事件驱动 + 分布式 Runtime 设计,让它既能跑 Jupyter 玩具,也能跑生产级服务;而且 Python 与 .NET 双实现,给企业 .NET 栈留了通路。

    ⚠️ 也要如实告诉你:维护模式与迁移

    自 2025 年起,AutoGen 仓库进入 社区维护模式(community-maintained):bug fix 与小幅改进由社区接管,重大新特性已并入微软官方的 Microsoft Agent Framework

    对新项目而言:如果只是做多智能体原型 / 内部工具,现在的 AutoGen 仍然完全够用、生态最厚;如果是从 0 起步并预计要跑 2-3 年的产品,建议同步评估 Microsoft Agent FrameworkAG2(原 AutoGen 核心贡献者 fork 的延续版本)。

    📥 下载地址

    🌐

    官方网站

    microsoft.github.io/autogen

    🐙

    GitHub 仓库

    github.com/microsoft/autogen

    📚

    文档中心

    stable 文档

    🐍

    PyPI 安装

    pip install autogen-agentchat


    #Microsoft #AutoGen #多智能体 #AgenticAI #开源项目

  • llmfit:一条命令,算出哪些大模型能在你的电脑上跑起来

    llmfit:一条命令,算出哪些大模型能在你的电脑上跑起来

    llmfit TUI 演示

    想在本地跑大模型,却总被「这张显卡能不能带得动?」「选哪个量化档位?」劝退?llmfit 把这道难题变成了一条命令:它自动检测你的内存、CPU、GPU,再为目录里数百个模型和提供商打分,直接告诉你哪些模型能在你的机器上流畅跑起来。下方动图就是它的交互式 TUI——硬件规格在顶部,下面是所有模型按「适配度」实时排名。

    📌 项目简介

    llmfit 是一款用 Rust 编写的终端工具,能根据系统的 RAM、CPU 与 GPU 自动「量体裁衣」地为 LLM 模型选型;它会检测硬件、对每一个模型从内存适配、速度估算、模型质量、上下文长度四个维度打分,并输出真正能在你机器上跑得动的推荐清单。默认提供交互式 TUI,也支持经典 CLI 模式,兼容多 GPU、MoE 架构、动态量化,以及 Ollama / llama.cpp / MLX / Docker Model Runner / LM Studio 等本地运行时。

    🛠 安装要求和过程

    环境要求:

    • 预编译二进制,无需安装 Node.js / Python 运行时,开箱即用;
    • 支持 Windows / macOS / Linux,跨平台一致;
    • 可选:本地运行时(Ollama、llama.cpp、MLX、Docker Model Runner、LM Studio)用于实测与部署;
    • 从源码构建需要 Rust 工具链(cargo)。

    快速安装(任选其一):

    # macOS / Linux(Homebrew 预编译二进制,推荐)
    brew install AlexsJones/llmfit/llmfit
    
    # Windows(Scoop)
    scoop install llmfit
    
    # 一行脚本安装(无 sudo 时落到 ~/.local/bin)
    curl -fsSL https://llmfit.axjns.dev/install.sh | sh
    
    # Python 生态(uv / pip)
    uv tool install -U llmfit      # 或 pip install llmfit
    
    # Docker / Podman(直接出 JSON 推荐)
    docker run ghcr.io/alexsjones/llmfit
    
    # 从源码构建
    git clone https://github.com/AlexsJones/llmfit.git && cd llmfit && cargo build --release
    

    跑起来:

    llmfit            # 进入交互式 TUI,看硬件 + 全模型排名
    llmfit fit        # 命令行表格:所有模型按适配度排名
    llmfit recommend --json   # 以 JSON 输出 Top 推荐(供脚本 / Agent 消费)
    llmfit info "qwen2.5:7b"  # 单个模型的适配分析与估算依据
    llmfit bench      # 对你的运行时实测 tok/s 与首字延迟
    llmfit doctor     # 输出硬件检测报告(用于反馈问题)
    

    ✨ 核心功能

    llmfit 工作流程

    1. 硬件自动检测 + 四维评分:读取 RAM / CPU / GPU·VRAM 与本地后端,对目录里数百个模型按「内存适配、速度估算、模型质量、上下文长度」四维打分,并公开每个分数的输入依据,llmfit info 可逐项核查。
    2. TUI 交互 + CLI 脚本化:默认 TUI 实时排名、规划、模拟下载并接入社区榜单;同时提供 fit / recommend --json / info 等子命令,方便被脚本、CI 与 AI Agent 调用。
    3. 多 GPU、MoE 与动态量化:支持多卡配置与 MoE 架构(按激活参数而非总量估算显存),并会根据你的硬件动态选择最优量化档位(如 Q4 / Q8)。
    4. 本地运行时全覆盖:原生对接 Ollama、llama.cpp、MLX、Docker Model Runner、LM Studio,推荐结果可直接落地运行。
    5. 实测众包(benchmark & share):在你机器上实测 tok/s,结果先存本地、再一键以 PR 贡献回社区,让同型号硬件的人拿到「已验证 ✓」的真实数字。

    🎯 典型使用场景

    llmfit 四大评分维度

    • 本地部署前选型:拿到一台新笔记本 / 显卡,先跑 llmfit 看 7B / 14B / 32B 甚至 70B 谁能在你的显存和内存里跑、大概多快,避免「下了 3 小时发现跑不起来」的尴尬。
    • 自动化流水线 / AI Agent:在部署脚本或 Coding Agent 里调用 llmfit recommend --json --use-case coding,根据当前主机规格自动挑选可运行的编码模型,做到「按机器适配」而非写死模型名。
    • 硬件升级决策:想加内存还是换显卡?用 llmfit info 对比不同配置下目标模型的适配与速度估算,量化升级带来的收益再下单。

    💡 推荐理由

    本地跑大模型最让人头大的就是「选型玄学」——参数规模、量化、上下文、显存、内存交织在一起,靠经验猜十次翻车八次。llmfit 把这件事变成了可解释、可验证的工程问题:它不只给结论,还把每个估算的输入摊开给你看,并鼓励你用真实 benchmark 反哺社区。Rust 编写的单文件二进制启动极快、零运行时依赖,TUI 好看、CLI 好接,是个人本地 AI 实验室和企业内网「该跑哪个模型」决策的贴心小助手。30K+ Star、MIT 协议、隐私默认(不联网不上传),值得收藏。

    🔗 下载地址

  • Cline:跑在 VS Code、JetBrains 和终端里的开源 AI 编程 Agent(6.3万+ Star)

    Cline:跑在 VS Code、JetBrains 和终端里的开源 AI 编程 Agent(6.3万+ Star)

    Cline

    项目简介

    Cline 是完全开源、支持自带模型的 AI 编程智能体:它能在 VS Code、JetBrains 乃至命令行里帮你读写代码、运行终端、连接 MCP,并且每一步改动都以可审阅的 diff 呈现,让你随时把关。截至 2026 年中,项目已突破 6.3 万 Star、VS Code 安装量超 150 万,是开源 AI 编程赛道增长最快的扩展之一。

    安装要求和过程

    环境要求

    • Node.js 18+(CLI / SDK 形态需要)
    • VS Code 1.84+ 或任意 JetBrains IDE(2023.3+)
    • 一个 LLM API Key(Anthropic / OpenAI / Gemini / Bedrock / Groq / Ollama 本地模型等任意 OpenAI 兼容端点)
    • 可选:Docker(用于浏览器自动化沙箱)

    快速安装

    # 方式一:VS Code 扩展市场搜索 "Cline"(扩展 ID:saoudrizwan.claude-dev)一键安装
    # 方式二:JetBrains 插件市场安装 Cline 插件(IntelliJ / PyCharm / WebStorm / GoLand ...)
    
    # 方式三:命令行(交互式或 CI 无头模式)
    npm i -g cline
    
    # 方式四:嵌入自己的程序 / 集成
    npm install @cline/sdk

    所有形态都跑在同一个 Agent 内核(@cline/sdk)之上,在编辑器里搭好的工作流可无缝迁移到 CLI 与 SDK。

    核心功能

    1. Plan / Act 双模式:先用 Plan 模式探索代码库、提出方案并经你确认,再切到 Act 执行。这是 Cline 对”自动 Agent 自信地做错二十个文件”这一经典失败模式的答案——先规划、再行动,给你一个可在破坏发生前喊停的检查点。
    2. 全程可审阅的 Diff 与检查点:每一次文件改动都落成可审查的 diff;每个步骤都有检查点,可一键回滚到任意历史节点,远比”只能靠 git 历史兜底”的终端工具更可靠。
    3. 自带模型、零加价:填入自己的 API Key(Anthropic / OpenAI / Gemini / Bedrock / Groq / Ollama / LM Studio 或任意 OpenAI 兼容端点),直接付费给模型方,无中间商加价,模型随意切换。
    4. 浏览器自动化 + 终端执行:能导航 URL、截图、验证 UI 改动;在终端运行命令并实时响应输出,边干边盯 linter 与编译器报错。
    5. 完整 MCP 支持与 .clinerules:可接入数据库、API、设计工具等 100+ 现成 MCP server 扩展能力;并通过 .clinerules 文件让 Agent 遵守你的项目约定,而不是自创规范。

    典型使用场景

    • 想用 Cursor 级 Agent 能力却不想被订阅锁死:Cline 扩展本身免费,只为 LLM token 付费,模型可在 Anthropic / OpenAI / 本地 Ollama 之间自由切换。
    • 隐私要求严格的团队:直接接入本地 Ollama 模型,代码与上下文不出内网,满足合规需求。
    • 全栈开发验证 UI 改动:让 Cline 改完前端代码后自动开浏览器、截图、核对界面效果,把”改完—运行—看结果”的循环自动化。

    推荐理由

    我把 Cline 当作“带审批闸门的结对工程师”来用。和纯自动 Agent 相比,它每一步都先让你看 diff、看终端命令,再决定是否放行——这种”人在回路(human-in-the-loop)”的设计,把 AI 幻觉的破坏面压到了最低。再叠加自带模型、成本完全透明,以及 MCP 生态带来的近乎无限的扩展能力,Cline 几乎是 VS Code 生态里最值得长期持有的开源编程 Agent。如果你想在零订阅成本下获得接近 Cursor 的 Agentic 体验,它是不二之选。

    下载地址

  • AstrBot:打通 15+ 聊天平台的开源全能 AI Agent 机器人框架

    AstrBot:打通 15+ 聊天平台的开源全能 AI Agent 机器人框架

    项目简介

    AstrBot 是一个开源的「全合一 AI Agent 聊天机器人平台」,把主流即时通讯(IM)应用、大语言模型(LLM)、插件与 Agent 能力打通,让你在自己常用的聊天软件里快速搭建可投产的 AI 应用——个人 AI 陪聊、智能客服、自动化助手、企业知识库都不在话下。它甚至被官方定位为 OpenClaw 的开源替代品。项目采用 Python 开发,基于 AGPL-3.0 协议完全开源,目前已收获 37.5K+ Stars

    安装要求和过程

    环境要求:Python 3.12+(推荐用 uv 管理环境)、Docker(可选,用于生产部署)、以及一台能联网的服务器或本机。AstrBot 本身跨平台,支持 macOS / Windows / Linux。

    快速安装(三种主流方式):

    • 一键部署(uv,最推荐):
      uv tool install astrbot --python 3.12
      astrbot init   # 首次运行初始化环境
      astrbot run
    • Docker 部署(生产推荐):官方提供 Docker / Docker Compose 方案,镜像为 soulter/astrbot,按文档挂载配置目录即可稳定运行。
    • 桌面端 / 面板部署:可使用 AstrBot App、AstrBot Launcher,或在宝塔 / 1Panel / CasaOS 等面板一键安装;Arch 用户还能通过 AUR:yay -S astrbot-git

    启动后打开 WebUI,绑定你的 LLM API Key(OpenAI / DeepSeek / Gemini / 通义 / 智谱等均可),并接入想用的 IM 平台适配器,即可开始对话。

    AstrBot 运行截图

    核心功能

    • 全平台 IM 接入:原生支持 QQ、企业微信、飞书、钉钉、微信公众号、Telegram、Slack、Discord、LINE 等 15+ 平台,官方与社区适配器持续扩展,几乎覆盖所有常用聊天场景。

      角色扮演与情感陪伴

    • 完整 Agent 能力栈:内置 LLM 对话、多模态、Agent、MCP、Skills、知识库、人设设置与自动上下文压缩,并可直接对接 Dify、阿里云百炼、Coze 等 Agent 平台。

      通用 Agent 能力

    • 主动 Agent(Proactive Agent):支持定时任务、订阅推送、事件触发的”主动出击”式智能体,而不只是被动应答。

      主动 Agent

    • 1000+ 社区插件:插件市场提供一键安装的上千款插件,从实用工具到娱乐玩法即装即用,轻松扩展机器人能力边界。

      1000+ 社区插件

    • 安全沙箱与 Web ChatUI:内置 Agent Sandbox 隔离执行代码与 Shell 调用,配合 Web ChatUI 与 Web 搜索,开箱即用地提供安全可控的对话体验;同时提供国际化(i18n)支持。

    典型使用场景

    1. 个人 AI 陪聊 / 情感陪伴:把 AstrBot 接入自己的 QQ 或 Telegram,设定专属人设与记忆,打造一个懂你、能长期陪伴的”数字伙伴”。
    2. 社群 / 社群运营智能助手:在 Discord、Slack 或 QQ 群里部署机器人,承担自动问答、公告推送、定时提醒,并借助 1000+ 插件实现抽奖、签到、信息查询等玩法。
    3. 企业知识库 / 智能客服:接入飞书、企业微信或钉钉,挂载内部知识库,让 AI 在员工聊天窗口里直接回答制度、流程、产品问题,降低人工客服压力。

    推荐理由

    我在几个社群里都用过 AstrBot,最直观的感受是“省心”:一个平台同时管着 QQ、Telegram、Discord,不用为每个渠道各写一套机器人;WebUI 配置直观,插件市场点一下就能装,非重度开发者也能在半小时内跑起来。它对国内生态(QQ、微信系、飞书、钉钉)的支持尤其到位,这是很多国外同类项目做不到的。Agent Sandbox 让”让 AI 跑代码”这件事变得可控,而不是裸奔执行命令。如果你正想给自己的社群或团队加一个 AI 入口,又不想被某个闭源 SaaS 绑定,AstrBot 是目前最成熟、社区最活跃的开源方案之一。

    下载地址

    * 本文数据基于 2026-07-22 抓取:Stars 37,590 / Forks 2,623 / 协议 AGPL-3.0 / 语言 Python / 最近更新当日。

  • Archon:把 AI 编码变成确定性工作流的开源 harness 构建器

    Archon:把 AI 编码变成确定性工作流的开源 harness 构建器

    Archon 封面

    Archon logo

    项目简介

    Archon 是首个开源的 AI 编码 harness(流程编排)构建器——用 YAML 把“规划→实现→校验→审查→提 PR”等开发流程固化下来,让 AI 编码智能体每次都按同一套确定性步骤执行,把“看模型心情”变成“可重复、可提交”的工程实践。

    如果说 Dockerfile 之于基础设施、GitHub Actions 之于 CI/CD,那么 Archon 之于 AI 编码工作流。可以把它理解为“面向软件开发的 n8n”。

    安装要求和过程

    环境要求

    • 运行时Bun(macOS/Linux/Windows 均支持)
    • AI 编码助手:Claude Code(默认),或 Codex、Pi
    • GitHub CLIgh):用于自动建分支、提 PR
    • 系统:macOS / Linux / WSL / Windows(PowerShell);数据库默认 SQLite,可切 PostgreSQL

    快速安装(30 秒,已有 Claude Code)

    # macOS / Linux
    curl -fsSL https://archon.diy/install | bash
    
    # Windows (PowerShell)
    irm https://archon.diy/install.ps1 | iex
    
    # 或 Homebrew
    brew install coleam00/archon/archon

    ⚠️ 编译版二进制不含 Claude Code,需单独安装并指定 CLAUDE_BIN_PATH;Docker 镜像则已自带。

    完整初始化(5 分钟,推荐)

    git clone https://github.com/coleam00/Archon
    cd Archon
    bun install
    claude          # 在 Claude Code 里说:“Set up Archon”

    引导向导会配置凭证、选择接入平台,并把 Archon skill 复制到你的目标仓库。之后在你的项目里直接对编码智能体说 “Use archon to fix issue #42” 即可。

    核心功能

    • 确定性、可重复:开发流程写成 YAML 工作流,固定阶段与校验门(validation gate),每次运行同一套顺序——计划、实现、校验、审查、PR,结果一致。
    • 隔离并行:每个工作流运行都在独立的 git worktree 中,可同时修 5 个 Bug 而互不冲突。
    • 发射后不管(Fire & forget):启动一个工作流就去忙别的,回来已经是一个带审查意见的成品 PR。
    • 确定性节点 + AI 节点可组合:bash 脚本、测试、git 操作等确定性步骤由机器精确执行;规划、代码生成、审查等只在 AI 真正增值的地方运行。
    • 随处可跑、全员共用:工作流定义在 .archon/workflows/,提交进仓库后,从 CLI、Web UI、Slack、Telegram 到 GitHub 表现完全一致;内置 19 个常用工作流,也可自定义。

    为什么需要 Archon

    典型使用场景

    场景一:自动修 GitHub Issue

    对智能体说 “Use archon to fix issue #42”,自动触发 archon-fix-github-issue 工作流:分类 → 调研/规划 → 实现 → 校验 → 提 PR → 智能审查 → 自我修复,全程无需你盯着。

    场景二:从想法到 PR(Idea-to-PR)

    archon-idea-to-pr 把“给设置页加暗黑模式”这类想法,自动走规划 → 循环实现(直到测试通过)→ 审查 → 提 PR → 5 个并行 reviewer → 自我修复,产出完整 Pull Request。

    场景三:团队远程异步协作

    接入 Slack / Telegram / GitHub / Discord 后,在群聊里丢一句话就能触发工作流;所有平台的活动汇聚到同一个 Web 仪表盘(Mission Control),实时查看进度与历史。

    Archon 工作原理

    推荐理由

    我自己最吃这一套的点在于“把流程的所有权拿回自己手里”。平时让 AI 智能体修 Bug,跑十次九个样:有时忘了跑测试、有时 PR 描述敷衍、并行修多个问题时还互相踩。Archon 用一份 YAML 把团队认可的工程纪律写死,AI 只在需要创造力的节点上发挥作用,其余交给确定性执行——稳定、可审计、可复现。它不绑定某家模型,Claude / Codex / Pi 随便换;Web 仪表盘 + 多平台接入也让“远程派活、回来收 PR”变得很顺。对想把 AI 编码真正纳入研发流程的团队,这是目前最像样的开源方案之一。

    下载地址