标签: 开源

  • Open Deep Research:LangChain 官方开源的深度研究智能体,模型与搜索全可替换

    Open Deep Research:LangChain 官方开源的深度研究智能体,模型与搜索全可替换

    Open Deep Research

    Open Deep Research 是 LangChain 官方开源的一个「深度研究智能体(Deep Research Agent)」——简单、可配置、完全开源,能跨多种模型提供商、搜索工具和 MCP 服务器工作,性能可媲美众多主流深度研究产品(在 Deep Research Bench 排行榜上曾进入前列)。

    一句话简介

    一个把「深度研究」这一最热门的 Agent 应用完整开源、可自由替换模型与搜索后端的研究智能体:你提一个复杂问题,它自动规划、并发检索、压缩证据,并产出一份带引用的高质量研究报告。

    安装要求与快速上手

    环境要求:Python 3.11(推荐),使用 uv 管理虚拟环境;需要至少一个 LLM 提供商的 API Key(默认 OpenAI),以及一个搜索 API(默认 Tavily)。

    # 1. 克隆仓库并创建虚拟环境
    git clone https://github.com/langchain-ai/open_deep_research.git
    cd open_deep_research
    uv venv
    source .venv/bin/activate   # Windows: .venv\Scripts\activate
    
    # 2. 安装依赖
    uv sync
    
    # 3. 配置环境变量(模型、搜索工具等)
    cp .env.example .env
    
    # 4. 本地启动 LangGraph 服务,打开 Studio UI
    uvx --refresh --from "langgraph-cli[inmem]" --with-editable . --python 3.11 langgraph dev --allow-blocking
    

    启动后会自动打开 LangGraph Studio UI,在 messages 输入框里提问并点击 Submit 即可,还能在 “Manage Assistants” 里切换不同配置。

    Open Deep Research 架构流程图

    核心功能

    • 全流程自动研究:自动完成”任务规划 → 并发检索 → 结果摘要 → 证据压缩 → 撰写带引用的最终报告”整条链路。
    • 模型自由组合:基于 init_chat_model() 兼容几乎所有主流 LLM,且摘要 / 研究 / 压缩 / 报告撰写四个环节可分别指定不同模型(如 gpt-4.1-mini 摘要、gpt-5 或 Claude Sonnet 4 做研究)。
    • 搜索后端可插拔:默认 Tavily,同时支持 Anthropic / OpenAI 的原生联网搜索,并完整兼容 MCP 服务器,可接入自定义工具。
    • 基准可评测:内置对接 Deep Research Bench(100 道博士级研究任务,覆盖 22 个领域),用 RACE 分数量化研究报告质量。
    • 部署方式多样:支持本地 LangGraph Studio 调试、LangGraph Platform 托管部署,以及面向非技术用户的 Open Agent Platform(OAP)可视化配置。

    Open Deep Research 在 LangGraph Studio 中运行

    典型使用场景

    • 行业 / 竞品调研报告:输入”分析某赛道 2025 年主流玩家与技术路线”,自动检索多来源并输出结构化、带引用的调研报告。
    • 学术与技术综述:面对博士级、跨领域的复杂问题,自动拆解子问题、并发检索文献并汇总成论证严谨的综述。
    • 企业内部知识 Agent:借助 MCP 接入内部数据源与自定义搜索,搭建可私有化部署、可替换模型的企业级深度研究助手。

    推荐理由

    市面上”深度研究”功能大多藏在闭源产品里,而 Open Deep Research 把这套能力彻底开源、模块化,最大的价值在于”每一层都能换”:换模型、换搜索、换部署方式都只是改配置。它由 LangChain 官方维护、有配套免费课程和详尽评测数据,既适合想理解 Deep Research 内部原理的开发者拆解学习,也适合企业作为自研研究 Agent 的高质量起点。如果你正想做一个能自动查资料、写报告的 Agent,这是目前最值得参考的开源实现之一。

    下载地址

    项目数据:约 12.4K Stars · 1.75K Forks · 语言 Python · 许可证 MIT(数据截至 2026 年 7 月)。

  • Outlines:15K Star 的 LLM 结构化输出库,让大模型 100% 生成合法 JSON

    Outlines:15K Star 的 LLM 结构化输出库,让大模型 100% 生成合法 JSON

    Outlines - LLM 结构化输出库

    项目简介

    Outlines 是由 .txt(dottxt)团队开源的 LLM 结构化输出(Structured Outputs)库——它在生成阶段就保证大模型输出严格符合你指定的类型或结构(枚举、整数、Pydantic 模型、JSON Schema、正则、上下文无关文法),从根源上消灭”解析失败、JSON 残缺”问题。项目在 GitHub 上已收获 15,200+ Stars,被 NVIDIA、Cohere、HuggingFace、vLLM 等信任并采用,vLLM 的 Structured Output 后端正是基于它的 outlines-core。

    一句话:别再用正则和 try/except 去”修补”模型输出了——Outlines 让模型从一开始就只能生成合法结构:model(prompt, output_type)

    安装要求和过程

    环境要求

    • Python 3.9+(建议 3.10 以上)
    • 按需选择后端:本地推理需 transformers / llama.cpp(配相应硬件),或走 vLLM / Ollama 服务端,或直接用 OpenAI / Gemini API(无本地算力要求)
    • 操作系统不限,CPU 也能跑(配合 API 或 Ollama)

    快速安装

    pip install outlines

    # 基础安装
    pip install outlines
    
    # 按后端安装可选依赖(示例)
    pip install outlines[transformers]   # 本地 transformers 模型
    pip install outlines[vllm]           # vLLM 服务
    pip install outlines[openai]         # OpenAI API

    30 秒上手

    import outlines
    from typing import Literal
    from transformers import AutoTokenizer, AutoModelForCausalLM
    
    MODEL = "microsoft/Phi-3-mini-4k-instruct"
    model = outlines.from_transformers(
        AutoModelForCausalLM.from_pretrained(MODEL, device_map="auto"),
        AutoTokenizer.from_pretrained(MODEL),
    )
    
    # 情感分类:输出只可能是这三个值之一
    sentiment = model(
        "Analyze: 'This product completely changed my life!'",
        Literal["Positive", "Negative", "Neutral"],
    )
    print(sentiment)  # "Positive"
    
    # 提取数值:保证返回合法 int
    temperature = model("What's the boiling point of water in Celsius?", int)
    print(temperature)  # 100

    核心功能

    Outlines 使用哲学:指定类型即可

    1. 类型即约束,贴合 Python 类型系统Literal 做多选一、int/float 做数值、Pydantic 模型/JSON Schema 做复杂对象、正则约束字符串格式、CFG 文法约束复杂语法——一行 model(prompt, type) 全部搞定。
    2. 生成期保证合法,而非事后修补:基于约束解码(constrained decoding),在每个 token 采样时就屏蔽非法选项,输出 100% 可被 model_validate_json 解析,不存在破损 JSON。
    3. 一套代码横跨所有模型:统一接口支持 transformers、llama.cpp(本地),vLLM、Ollama(服务端),OpenAI、Gemini(API),换模型/换供应商不改业务代码。
    4. 函数签名即 Schema 的 Function Calling:把 Python 函数直接当输出类型传入,Outlines 自动从签名推断结构,返回可直接 **kwargs 调用的参数字典。
    5. Jinja 提示词模板与可复用应用outlines.Template 把复杂 Prompt 从代码中分离,支持 few-shot 模板文件复用,方便工程化管理。

    典型使用场景

    1. 客服工单自动分诊

    把自由格式的用户来信一步解析为结构化工单(优先级枚举 / 类别 / 是否需主管介入 / 行动项列表),直接驱动自动路由与升级告警——priority 字段只可能是 low/medium/high/urgent 四个合法值,下游逻辑零防御代码。

    2. 电商商品自动归类与信息抽取

    批量把商品描述转成 主类目/子类目/属性列表/品牌 结构化数据,喂给库存和搜索系统;同理可做文档分类(财报/合同/技术文档)、事件信息抽取,甚至用 Union 类型优雅处理”信息不足则返回 I don’t know”的兜底。

    3. 生产级 Agent / RAG 管道的可靠胶水层

    Agent 的工具调用参数、RAG 的引用格式、多步工作流的中间态,全部用 Pydantic 模型锁死结构。vLLM 等推理引擎已内置其核心库,本地部署大模型时开启结构化输出几乎零成本。

    推荐理由

    使用 Outlines 的公司

    • 解决的是 LLM 工程化第一痛点:任何把 LLM 输出接入程序的人都被破损 JSON 折磨过。Outlines 的思路是”让非法输出根本不可能被生成”,比重试+修复的方案优雅一个量级。
    • 学习成本极低:会写 Python 类型注解就会用,10 分钟能跑通第一个例子;README 附 6 个可直接抄的生产级示例。
    • 学术与工业双背书:源自论文《Efficient Guided Generation for Large Language Models》,NVIDIA、HuggingFace、vLLM、Cohere 都在用,不是玩具项目。
    • Apache-2.0 宽松许可:商用无忧;核心 outlines-core 用 Rust 重写,约束编译速度快,生产可用。
    • 实测感受:约束解码对本地小模型提升尤其明显——Phi-3 这类 3B 级模型配合 Outlines 做分类/抽取,可靠性直逼裸用大一个数量级的模型,非常适合降本场景。

    下载地址


    项目信息(截至 2026-07-23):15,256 Stars · 809 Forks · Python · Apache-2.0 许可 · 由 .txt(dottxt-ai)团队维护

  • Microsoft AutoGen – 微软开源多智能体AI编程框架 [59.9K+ Stars]

    Microsoft AutoGen – 微软开源多智能体AI编程框架 [59.9K+ Stars]

    📝 项目简介

    Microsoft AutoGen 是微软研究院出品的开源多智能体 AI 编程框架,官方定位为 “A programming framework for agentic AI”。它把”多个会自主对话的 Agent 协同工作”这件事,抽象成一套事件驱动的运行时 + 消息协议,让 LLM、工具、人类三方可以在同一套代码里自由组合,既能 自主行动,也能 和人并肩工作,被广泛视为现代 Multi-Agent 协作范式的奠基性项目之一。

    59.9K+
    GitHub Stars

    9.0K+
    Forks

    Python / .NET
    双语言支持

    MIT
    代码许可

    数据来源:GitHub REST API(仓库 microsoft/autogen,截至 2026-07-23)。

    ⚙️ 安装要求和过程

    环境要求

    • Python:3.10 及以上(v0.4+ 推荐 3.11)
    • 操作系统:Linux / macOS / Windows 均支持
    • LLM 凭据:OpenAI 兼容 API Key(Azure OpenAI / OpenAI / Ollama / 本地 vLLM 等均可)
    • 可选依赖:Docker(隔离代码执行)、Node.js(Studio 浏览器依赖)
    • .NET 用户:.NET 8 SDK,dotnet add package Microsoft.AutoGen

    快速安装(Python,v0.4+ 推荐)

    # 1) 创建并激活虚拟环境
    python3 -m venv .venv && source .venv/bin/activate
    
    # 2) 安装 AgentChat 核心 + OpenAI 扩展
    pip install -U "autogen-agentchat" "autogen-ext[openai]"
    
    # 3) (可选) 安装无代码可视化工作台
    pip install -U "autogenstudio"
    
    # 4) 验证
    python -c "import autogen_agentchat; print(autogen_agentchat.__version__)"

    从源码安装(v0.4)

    git clone https://github.com/microsoft/autogen.git
    cd autogen
    pip install -e ./python/packages/autogen-agentchat
    pip install -e ./python/packages/autogen-ext[openai]
    # 启动 Studio
    autogenstudio ui --port 8080

    配置 LLM(OpenAI 兼容)

    把 API Key 放进环境变量(推荐),或写入 OAI_CONFIG_LIST

    # .env
    OPENAI_API_KEY=sk-...
    # 可选:Azure / 自定义网关
    AZURE_OPENAI_API_KEY=...
    AZURE_OPENAI_ENDPOINT=https://your-resource.openai.azure.com/
    OPENAI_API_BASE=https://your-gateway.example.com/v1
    ⚠️ 版本提示:自 v0.4 起,包名由 pyautogen 改为 autogen-agentchat / autogen-ext。v0.2 用户可参考 官方迁移指南

    🏗️ 架构总览

    AutoGen 把”造一个能自主干活的 AI”这件事切成三层 API,开发者可以按需选择从底层到高层:

    AutoGen 三层架构:Extensions / AgentChat / Core

    • Core API(底层):消息传递、事件驱动、分布式 Runtime,同时支持 Python 与 .NET,是整条链路的”内核”。
    • AgentChat API(高阶):双智能体对话、群聊、AgentTool 多专家路由——大多数应用只需要这一层。
    • Extensions API(扩展):LLM 客户端、工具注册、MCP 协议适配、模型上下文协议桥接。

    再上面还有三个开箱即用的”上层建筑”:AutoGen Studio(无代码 GUI)、AutoGen Bench(基准评测)、Magentic-One(微软开源的通用多智能体团队基线)。

    ✨ 核心功能

    🤖 1. 多智能体对话与编排

    把每个 Agent 看作一个会发消息的对象,通过 initiate_chat / a_initiate 一行就能拉起对话;支持两人私聊、群聊(SelectorGroupChat / Swarm / RoundRobin)与按需动态编排(AgentTool 把”专家 Agent”当工具调)。

    🧠 2. 可插拔模型与工具

    原生支持 OpenAI / Azure OpenAI / Anthropic / Ollama / vLLM / Gemini 等模型;工具侧通过 FunctionTool + MCP 一键接入浏览器、数据库、Shell、文件系统、Playwright 等上百种能力。

    🧑‍💻 3. 人机协同(Human-in-the-Loop)

    通过 UserProxyAgent / input_func 任意把人类拉进对话:审批、纠正、补充上下文,AI 不会”擅自做主”——这是 AutoGen 最早让业界眼前一亮的杀手锏。

    🖥️ 4. AutoGen Studio:无代码工作台

    可视化拖拽搭建 Agent 团队、连接工具、调试消息流、上传数据集。零代码也能跑通一个 Magentic-One 风格的”会自己上网 + 写代码 + 操作文件”的 AI 助手。

    🔁 5. Magentic-One 通用团队基线

    微软在 AutoGen 上开源的”通用多智能体”参考实现:Orchestrator 动态规划 → 调用 Coder / Computer-Use / Web-Surfer / File-Surfer 四个专家完成任务,对标 OpenAI Operator 与 Anthropic Computer Use。

    Magentic-One 风格的多智能体协作流程:Orchestrator + 4 个专家 Agent

    🎯 典型使用场景

    场景一:自动数据分析 + 报告生成

    做法Planner Agent 拆解任务 → Coder Agent 写 pandas / matplotlib 代码 → Executor 在 Docker 里跑 → Writer Agent 把结果整理成 Markdown 报告。人类只在最后审阅。

    收益:原本 2 小时的手工分析压缩到 10 分钟以内;每一步可追溯、可重放。

    场景二:多角色代码评审 / PR 自动化

    做法Author Agent 改代码 → Reviewer Agent 提风格 / 性能意见 → Tester Agent 自动跑单测 + 覆盖率 → Approver 收口。整套流程在一个 SelectorGroupChat 里循环。

    收益:把”人盯 PR”变成”AI 盯 PR”,工程师只看最后结论。

    场景三:Magentic-One 通用办公助手

    做法:把 Coder / Computer-Use / Web / Files 四个 Agent 配成团队,Orchestrator 自动调度。让它”打开 Chrome 去 LinkedIn 搜索 Python 后端岗位、截图、写到 jobs.md“——这是 OpenAI Operator 还没发布时,AutoGen 社区最早跑通的范式。

    收益:任何能拆成”打开应用 → 抓信息 → 写文件”的流程都能交给它。

    💡 推荐理由(也聊聊它的现状)

    作为多智能体框架的”鼻祖级”项目,AutoGen 给整个行业留下了三份被广泛借鉴的遗产:把”对话”当作 Agent 协作的一等公民把”人”显式拉进循环把”工具调用”做成可插拔。从 2023 年发布至今,AutoGen 一直是 Multi-Agent 论文与开源项目的引用常客,60K Star 是其行业地位的最好注解。

    实际用下来,AutoGen 最打动我的有三点:

    1. 上手曲线友好:AgentChat API 让你 5 行代码就能跑起一个”用户 ↔ 助手”对话;想加工具,FunctionTool(...) 一包就完事;想加人类审核,UserProxyAgent 直接接管输入。
    2. 生态厚、可借鉴多:官方 + 社区沉淀了 Magentic-One、AutoGen Bench、AG2(前 AutoGen 延续)等一大批可直接 fork 的参考实现,几乎所有”AI 办公助手”类产品都能在 AutoGen 里找到原型。
    3. 底层够”工程”:Core API 的事件驱动 + 分布式 Runtime 设计,让它既能跑 Jupyter 玩具,也能跑生产级服务;而且 Python 与 .NET 双实现,给企业 .NET 栈留了通路。

    ⚠️ 也要如实告诉你:维护模式与迁移

    自 2025 年起,AutoGen 仓库进入 社区维护模式(community-maintained):bug fix 与小幅改进由社区接管,重大新特性已并入微软官方的 Microsoft Agent Framework

    对新项目而言:如果只是做多智能体原型 / 内部工具,现在的 AutoGen 仍然完全够用、生态最厚;如果是从 0 起步并预计要跑 2-3 年的产品,建议同步评估 Microsoft Agent FrameworkAG2(原 AutoGen 核心贡献者 fork 的延续版本)。

    📥 下载地址

    🌐

    官方网站

    microsoft.github.io/autogen

    🐙

    GitHub 仓库

    github.com/microsoft/autogen

    📚

    文档中心

    stable 文档

    🐍

    PyPI 安装

    pip install autogen-agentchat


    #Microsoft #AutoGen #多智能体 #AgenticAI #开源项目

  • llmfit:一条命令,算出哪些大模型能在你的电脑上跑起来

    llmfit:一条命令,算出哪些大模型能在你的电脑上跑起来

    llmfit TUI 演示

    想在本地跑大模型,却总被「这张显卡能不能带得动?」「选哪个量化档位?」劝退?llmfit 把这道难题变成了一条命令:它自动检测你的内存、CPU、GPU,再为目录里数百个模型和提供商打分,直接告诉你哪些模型能在你的机器上流畅跑起来。下方动图就是它的交互式 TUI——硬件规格在顶部,下面是所有模型按「适配度」实时排名。

    📌 项目简介

    llmfit 是一款用 Rust 编写的终端工具,能根据系统的 RAM、CPU 与 GPU 自动「量体裁衣」地为 LLM 模型选型;它会检测硬件、对每一个模型从内存适配、速度估算、模型质量、上下文长度四个维度打分,并输出真正能在你机器上跑得动的推荐清单。默认提供交互式 TUI,也支持经典 CLI 模式,兼容多 GPU、MoE 架构、动态量化,以及 Ollama / llama.cpp / MLX / Docker Model Runner / LM Studio 等本地运行时。

    🛠 安装要求和过程

    环境要求:

    • 预编译二进制,无需安装 Node.js / Python 运行时,开箱即用;
    • 支持 Windows / macOS / Linux,跨平台一致;
    • 可选:本地运行时(Ollama、llama.cpp、MLX、Docker Model Runner、LM Studio)用于实测与部署;
    • 从源码构建需要 Rust 工具链(cargo)。

    快速安装(任选其一):

    # macOS / Linux(Homebrew 预编译二进制,推荐)
    brew install AlexsJones/llmfit/llmfit
    
    # Windows(Scoop)
    scoop install llmfit
    
    # 一行脚本安装(无 sudo 时落到 ~/.local/bin)
    curl -fsSL https://llmfit.axjns.dev/install.sh | sh
    
    # Python 生态(uv / pip)
    uv tool install -U llmfit      # 或 pip install llmfit
    
    # Docker / Podman(直接出 JSON 推荐)
    docker run ghcr.io/alexsjones/llmfit
    
    # 从源码构建
    git clone https://github.com/AlexsJones/llmfit.git && cd llmfit && cargo build --release
    

    跑起来:

    llmfit            # 进入交互式 TUI,看硬件 + 全模型排名
    llmfit fit        # 命令行表格:所有模型按适配度排名
    llmfit recommend --json   # 以 JSON 输出 Top 推荐(供脚本 / Agent 消费)
    llmfit info "qwen2.5:7b"  # 单个模型的适配分析与估算依据
    llmfit bench      # 对你的运行时实测 tok/s 与首字延迟
    llmfit doctor     # 输出硬件检测报告(用于反馈问题)
    

    ✨ 核心功能

    llmfit 工作流程

    1. 硬件自动检测 + 四维评分:读取 RAM / CPU / GPU·VRAM 与本地后端,对目录里数百个模型按「内存适配、速度估算、模型质量、上下文长度」四维打分,并公开每个分数的输入依据,llmfit info 可逐项核查。
    2. TUI 交互 + CLI 脚本化:默认 TUI 实时排名、规划、模拟下载并接入社区榜单;同时提供 fit / recommend --json / info 等子命令,方便被脚本、CI 与 AI Agent 调用。
    3. 多 GPU、MoE 与动态量化:支持多卡配置与 MoE 架构(按激活参数而非总量估算显存),并会根据你的硬件动态选择最优量化档位(如 Q4 / Q8)。
    4. 本地运行时全覆盖:原生对接 Ollama、llama.cpp、MLX、Docker Model Runner、LM Studio,推荐结果可直接落地运行。
    5. 实测众包(benchmark & share):在你机器上实测 tok/s,结果先存本地、再一键以 PR 贡献回社区,让同型号硬件的人拿到「已验证 ✓」的真实数字。

    🎯 典型使用场景

    llmfit 四大评分维度

    • 本地部署前选型:拿到一台新笔记本 / 显卡,先跑 llmfit 看 7B / 14B / 32B 甚至 70B 谁能在你的显存和内存里跑、大概多快,避免「下了 3 小时发现跑不起来」的尴尬。
    • 自动化流水线 / AI Agent:在部署脚本或 Coding Agent 里调用 llmfit recommend --json --use-case coding,根据当前主机规格自动挑选可运行的编码模型,做到「按机器适配」而非写死模型名。
    • 硬件升级决策:想加内存还是换显卡?用 llmfit info 对比不同配置下目标模型的适配与速度估算,量化升级带来的收益再下单。

    💡 推荐理由

    本地跑大模型最让人头大的就是「选型玄学」——参数规模、量化、上下文、显存、内存交织在一起,靠经验猜十次翻车八次。llmfit 把这件事变成了可解释、可验证的工程问题:它不只给结论,还把每个估算的输入摊开给你看,并鼓励你用真实 benchmark 反哺社区。Rust 编写的单文件二进制启动极快、零运行时依赖,TUI 好看、CLI 好接,是个人本地 AI 实验室和企业内网「该跑哪个模型」决策的贴心小助手。30K+ Star、MIT 协议、隐私默认(不联网不上传),值得收藏。

    🔗 下载地址

  • Cline:跑在 VS Code、JetBrains 和终端里的开源 AI 编程 Agent(6.3万+ Star)

    Cline:跑在 VS Code、JetBrains 和终端里的开源 AI 编程 Agent(6.3万+ Star)

    Cline

    项目简介

    Cline 是完全开源、支持自带模型的 AI 编程智能体:它能在 VS Code、JetBrains 乃至命令行里帮你读写代码、运行终端、连接 MCP,并且每一步改动都以可审阅的 diff 呈现,让你随时把关。截至 2026 年中,项目已突破 6.3 万 Star、VS Code 安装量超 150 万,是开源 AI 编程赛道增长最快的扩展之一。

    安装要求和过程

    环境要求

    • Node.js 18+(CLI / SDK 形态需要)
    • VS Code 1.84+ 或任意 JetBrains IDE(2023.3+)
    • 一个 LLM API Key(Anthropic / OpenAI / Gemini / Bedrock / Groq / Ollama 本地模型等任意 OpenAI 兼容端点)
    • 可选:Docker(用于浏览器自动化沙箱)

    快速安装

    # 方式一:VS Code 扩展市场搜索 "Cline"(扩展 ID:saoudrizwan.claude-dev)一键安装
    # 方式二:JetBrains 插件市场安装 Cline 插件(IntelliJ / PyCharm / WebStorm / GoLand ...)
    
    # 方式三:命令行(交互式或 CI 无头模式)
    npm i -g cline
    
    # 方式四:嵌入自己的程序 / 集成
    npm install @cline/sdk

    所有形态都跑在同一个 Agent 内核(@cline/sdk)之上,在编辑器里搭好的工作流可无缝迁移到 CLI 与 SDK。

    核心功能

    1. Plan / Act 双模式:先用 Plan 模式探索代码库、提出方案并经你确认,再切到 Act 执行。这是 Cline 对”自动 Agent 自信地做错二十个文件”这一经典失败模式的答案——先规划、再行动,给你一个可在破坏发生前喊停的检查点。
    2. 全程可审阅的 Diff 与检查点:每一次文件改动都落成可审查的 diff;每个步骤都有检查点,可一键回滚到任意历史节点,远比”只能靠 git 历史兜底”的终端工具更可靠。
    3. 自带模型、零加价:填入自己的 API Key(Anthropic / OpenAI / Gemini / Bedrock / Groq / Ollama / LM Studio 或任意 OpenAI 兼容端点),直接付费给模型方,无中间商加价,模型随意切换。
    4. 浏览器自动化 + 终端执行:能导航 URL、截图、验证 UI 改动;在终端运行命令并实时响应输出,边干边盯 linter 与编译器报错。
    5. 完整 MCP 支持与 .clinerules:可接入数据库、API、设计工具等 100+ 现成 MCP server 扩展能力;并通过 .clinerules 文件让 Agent 遵守你的项目约定,而不是自创规范。

    典型使用场景

    • 想用 Cursor 级 Agent 能力却不想被订阅锁死:Cline 扩展本身免费,只为 LLM token 付费,模型可在 Anthropic / OpenAI / 本地 Ollama 之间自由切换。
    • 隐私要求严格的团队:直接接入本地 Ollama 模型,代码与上下文不出内网,满足合规需求。
    • 全栈开发验证 UI 改动:让 Cline 改完前端代码后自动开浏览器、截图、核对界面效果,把”改完—运行—看结果”的循环自动化。

    推荐理由

    我把 Cline 当作“带审批闸门的结对工程师”来用。和纯自动 Agent 相比,它每一步都先让你看 diff、看终端命令,再决定是否放行——这种”人在回路(human-in-the-loop)”的设计,把 AI 幻觉的破坏面压到了最低。再叠加自带模型、成本完全透明,以及 MCP 生态带来的近乎无限的扩展能力,Cline 几乎是 VS Code 生态里最值得长期持有的开源编程 Agent。如果你想在零订阅成本下获得接近 Cursor 的 Agentic 体验,它是不二之选。

    下载地址

  • AstrBot:打通 15+ 聊天平台的开源全能 AI Agent 机器人框架

    AstrBot:打通 15+ 聊天平台的开源全能 AI Agent 机器人框架

    项目简介

    AstrBot 是一个开源的「全合一 AI Agent 聊天机器人平台」,把主流即时通讯(IM)应用、大语言模型(LLM)、插件与 Agent 能力打通,让你在自己常用的聊天软件里快速搭建可投产的 AI 应用——个人 AI 陪聊、智能客服、自动化助手、企业知识库都不在话下。它甚至被官方定位为 OpenClaw 的开源替代品。项目采用 Python 开发,基于 AGPL-3.0 协议完全开源,目前已收获 37.5K+ Stars

    安装要求和过程

    环境要求:Python 3.12+(推荐用 uv 管理环境)、Docker(可选,用于生产部署)、以及一台能联网的服务器或本机。AstrBot 本身跨平台,支持 macOS / Windows / Linux。

    快速安装(三种主流方式):

    • 一键部署(uv,最推荐):
      uv tool install astrbot --python 3.12
      astrbot init   # 首次运行初始化环境
      astrbot run
    • Docker 部署(生产推荐):官方提供 Docker / Docker Compose 方案,镜像为 soulter/astrbot,按文档挂载配置目录即可稳定运行。
    • 桌面端 / 面板部署:可使用 AstrBot App、AstrBot Launcher,或在宝塔 / 1Panel / CasaOS 等面板一键安装;Arch 用户还能通过 AUR:yay -S astrbot-git

    启动后打开 WebUI,绑定你的 LLM API Key(OpenAI / DeepSeek / Gemini / 通义 / 智谱等均可),并接入想用的 IM 平台适配器,即可开始对话。

    AstrBot 运行截图

    核心功能

    • 全平台 IM 接入:原生支持 QQ、企业微信、飞书、钉钉、微信公众号、Telegram、Slack、Discord、LINE 等 15+ 平台,官方与社区适配器持续扩展,几乎覆盖所有常用聊天场景。

      角色扮演与情感陪伴

    • 完整 Agent 能力栈:内置 LLM 对话、多模态、Agent、MCP、Skills、知识库、人设设置与自动上下文压缩,并可直接对接 Dify、阿里云百炼、Coze 等 Agent 平台。

      通用 Agent 能力

    • 主动 Agent(Proactive Agent):支持定时任务、订阅推送、事件触发的”主动出击”式智能体,而不只是被动应答。

      主动 Agent

    • 1000+ 社区插件:插件市场提供一键安装的上千款插件,从实用工具到娱乐玩法即装即用,轻松扩展机器人能力边界。

      1000+ 社区插件

    • 安全沙箱与 Web ChatUI:内置 Agent Sandbox 隔离执行代码与 Shell 调用,配合 Web ChatUI 与 Web 搜索,开箱即用地提供安全可控的对话体验;同时提供国际化(i18n)支持。

    典型使用场景

    1. 个人 AI 陪聊 / 情感陪伴:把 AstrBot 接入自己的 QQ 或 Telegram,设定专属人设与记忆,打造一个懂你、能长期陪伴的”数字伙伴”。
    2. 社群 / 社群运营智能助手:在 Discord、Slack 或 QQ 群里部署机器人,承担自动问答、公告推送、定时提醒,并借助 1000+ 插件实现抽奖、签到、信息查询等玩法。
    3. 企业知识库 / 智能客服:接入飞书、企业微信或钉钉,挂载内部知识库,让 AI 在员工聊天窗口里直接回答制度、流程、产品问题,降低人工客服压力。

    推荐理由

    我在几个社群里都用过 AstrBot,最直观的感受是“省心”:一个平台同时管着 QQ、Telegram、Discord,不用为每个渠道各写一套机器人;WebUI 配置直观,插件市场点一下就能装,非重度开发者也能在半小时内跑起来。它对国内生态(QQ、微信系、飞书、钉钉)的支持尤其到位,这是很多国外同类项目做不到的。Agent Sandbox 让”让 AI 跑代码”这件事变得可控,而不是裸奔执行命令。如果你正想给自己的社群或团队加一个 AI 入口,又不想被某个闭源 SaaS 绑定,AstrBot 是目前最成熟、社区最活跃的开源方案之一。

    下载地址

    * 本文数据基于 2026-07-22 抓取:Stars 37,590 / Forks 2,623 / 协议 AGPL-3.0 / 语言 Python / 最近更新当日。

  • Poolside 把 Laguna S 2.1 甩了出来:西方现在最能打的开放权重编程模型

    一家叫 Poolside 的旧金山小实验室,周二把新模型 Laguna S 2.1 端上了台面。这事有意思的地方不在于它有多大,而在于它小到能塞进一台桌面级机器,却把好几款数倍于己的闭源模型比了下去。

    九周造出来的小钢炮

    Laguna S 2.1 总参数 1180 亿,但每次推理只激活 80 亿,上下文窗口拉到了 100 万 token。Poolside 说它从 5 月 22 日才开始预训练,用 4096 张 H200,不到九周就发布了。在长周期编程基准 Terminal-Bench 2.1 上拿到 70.2%,比 1.6 万亿参数的 DeepSeek-V4-Pro-Max(64.0%)和 5500 亿参数的英伟达 Nemotron 3 Ultra(56.4%)都高;SWE-Bench Multilingual 上它拿到 78.5%,SWE-Bench Pro 公开集 59.4%。不到三个月,Poolside 从 M.1 一路连发三款模型,节奏快得不像一家小实验室。

    我们在这版模型上做的,不是堆更多智能,而是改进那些通向更强模型的行为:更多验证、更少想当然、不早早宣告胜利,也更持久。 —— Poolside 应用研究联合负责人 Pengming Wang

    把权重敞开给人看

    最关键的一点是,它是开放权重的,发布当天就挂在 Hugging Face 上,采用 OpenMDW-1.1 许可,连 BF16、FP8、INT4 各种量化版本都给了。模型小到能跑在单台英伟达 DGX Spark 上,也就是说企业可以把高频的编程智能体任务从按量计费的 API 搬到自己掌控的硬件里。

    • 1180 亿总参数、每次只激活 80 亿,上下文窗口 100 万 token
    • 开放权重,发布即上 Hugging Face,可本地跑在单台 DGX Spark
    • 西方近一年来首个有竞争力的开放权重编程模型

    西方的开源空窗

    Poolside 把这个发布摆进了一个更大的叙事里:过去一年,开发者明显转向能下载、能审查、能在自家基础设施上跑的开放权重系统,而这一类里能打的几乎都来自中国实验室——DeepSeek、通义千问、Kimi、智谱、MiniMax、腾讯混元。西方上一次放出开放权重,还是去年 8 月 OpenAI 的 gpt-oss-120b。联合 CEO Jason Warner 的话很直白:西方需要能信任、能运行、能在其上构建的开放权重模型。

    顺带一提,Poolside 把评测的完整轨迹也公开了,算是给开放二字加了点诚意。对政府、国防这类高度监管的客户来说,能自托管意味着敏感代码和数据不出自己的环境,这正是 Poolside 这门生意的根基。

    Poolside Laguna S 2.1 模型发布
    Poolside 发布的 Laguna S 2.1 开放权重编程模型

    📎 原文来源:Poolside 发布 Laguna S 2.1
  • Archon:把 AI 编码变成确定性工作流的开源 harness 构建器

    Archon:把 AI 编码变成确定性工作流的开源 harness 构建器

    Archon 封面

    Archon logo

    项目简介

    Archon 是首个开源的 AI 编码 harness(流程编排)构建器——用 YAML 把“规划→实现→校验→审查→提 PR”等开发流程固化下来,让 AI 编码智能体每次都按同一套确定性步骤执行,把“看模型心情”变成“可重复、可提交”的工程实践。

    如果说 Dockerfile 之于基础设施、GitHub Actions 之于 CI/CD,那么 Archon 之于 AI 编码工作流。可以把它理解为“面向软件开发的 n8n”。

    安装要求和过程

    环境要求

    • 运行时Bun(macOS/Linux/Windows 均支持)
    • AI 编码助手:Claude Code(默认),或 Codex、Pi
    • GitHub CLIgh):用于自动建分支、提 PR
    • 系统:macOS / Linux / WSL / Windows(PowerShell);数据库默认 SQLite,可切 PostgreSQL

    快速安装(30 秒,已有 Claude Code)

    # macOS / Linux
    curl -fsSL https://archon.diy/install | bash
    
    # Windows (PowerShell)
    irm https://archon.diy/install.ps1 | iex
    
    # 或 Homebrew
    brew install coleam00/archon/archon

    ⚠️ 编译版二进制不含 Claude Code,需单独安装并指定 CLAUDE_BIN_PATH;Docker 镜像则已自带。

    完整初始化(5 分钟,推荐)

    git clone https://github.com/coleam00/Archon
    cd Archon
    bun install
    claude          # 在 Claude Code 里说:“Set up Archon”

    引导向导会配置凭证、选择接入平台,并把 Archon skill 复制到你的目标仓库。之后在你的项目里直接对编码智能体说 “Use archon to fix issue #42” 即可。

    核心功能

    • 确定性、可重复:开发流程写成 YAML 工作流,固定阶段与校验门(validation gate),每次运行同一套顺序——计划、实现、校验、审查、PR,结果一致。
    • 隔离并行:每个工作流运行都在独立的 git worktree 中,可同时修 5 个 Bug 而互不冲突。
    • 发射后不管(Fire & forget):启动一个工作流就去忙别的,回来已经是一个带审查意见的成品 PR。
    • 确定性节点 + AI 节点可组合:bash 脚本、测试、git 操作等确定性步骤由机器精确执行;规划、代码生成、审查等只在 AI 真正增值的地方运行。
    • 随处可跑、全员共用:工作流定义在 .archon/workflows/,提交进仓库后,从 CLI、Web UI、Slack、Telegram 到 GitHub 表现完全一致;内置 19 个常用工作流,也可自定义。

    为什么需要 Archon

    典型使用场景

    场景一:自动修 GitHub Issue

    对智能体说 “Use archon to fix issue #42”,自动触发 archon-fix-github-issue 工作流:分类 → 调研/规划 → 实现 → 校验 → 提 PR → 智能审查 → 自我修复,全程无需你盯着。

    场景二:从想法到 PR(Idea-to-PR)

    archon-idea-to-pr 把“给设置页加暗黑模式”这类想法,自动走规划 → 循环实现(直到测试通过)→ 审查 → 提 PR → 5 个并行 reviewer → 自我修复,产出完整 Pull Request。

    场景三:团队远程异步协作

    接入 Slack / Telegram / GitHub / Discord 后,在群聊里丢一句话就能触发工作流;所有平台的活动汇聚到同一个 Web 仪表盘(Mission Control),实时查看进度与历史。

    Archon 工作原理

    推荐理由

    我自己最吃这一套的点在于“把流程的所有权拿回自己手里”。平时让 AI 智能体修 Bug,跑十次九个样:有时忘了跑测试、有时 PR 描述敷衍、并行修多个问题时还互相踩。Archon 用一份 YAML 把团队认可的工程纪律写死,AI 只在需要创造力的节点上发挥作用,其余交给确定性执行——稳定、可审计、可复现。它不绑定某家模型,Claude / Codex / Pi 随便换;Web 仪表盘 + 多平台接入也让“远程派活、回来收 PR”变得很顺。对想把 AI 编码真正纳入研发流程的团队,这是目前最像样的开源方案之一。

    下载地址

  • Wigolo:给 AI 编程智能体装上本地优先的「上网」引擎(开源 MCP)

    Wigolo:给 AI 编程智能体装上本地优先的「上网」引擎(开源 MCP)

    Wigolo 演示

    在 Claude Code、Cursor、Codex 这类编码智能体大行其道的今天,一个尴尬的现实是:它们很会写代码,却「看不见」互联网。想查一份报错、一份 API 文档、一个竞品定价,往往得开发者自己复制粘贴喂给模型。Wigolo 要做的,就是给 AI 智能体装上一双「眼睛和手」——一个本地优先、无需 API Key、按查询 0 计费的统一「上网」引擎。

    🦉 项目简介

    WigoloKnockOutEZ 开源的 AI 编程智能体本地优先「上网」引擎:以 MCP 服务器(或 REST / SDK)的形式运行在智能体身边,统一提供 搜索、抓取、爬取、提取、缓存、相似发现、研究、自主收集 等全套 Web 能力。核心理念是 no keys, no cloud, no metered bill——核心工具无需任何 API Key,所有数据留在本地 ~/.wigolo/,用得越多账单也不会涨。

    💻 安装要求与过程

    环境要求:Node.js ≥ 20,约 1.5 GB 空闲磁盘(首次运行会下载浏览器引擎等本地组件)。核心搜索 / 抓取 / 爬取无需任何外部 Key 即可使用;如需 researchagent 等高级研究能力,可选择性配置一个 LLM Provider(如 Gemini)。

    快速安装:

    # 初始化本地引擎(任意系统)
    npx wigolo init
    
    # 初始化并一键接入日常 agent(如 Claude Code + Cursor)
    npx wigolo init --agents=claude-code,cursor
    
    # 以 Docker 方式作为 stdio MCP 服务运行
    docker run -i --rm -v wigolo-data:/data ghcr.io/knockoutez/wigolo
    
    # 在自托管 box 上暴露 HTTP 服务(默认 127.0.0.1:3333)
    wigolo serve
    
    # 在你的应用里用 SDK 嵌入
    npm install wigolo-sdk     # TypeScript
    pip install wigolo         # Python

    常用运维命令:npx wigolo verify(健康检测)、npx wigolo warmup --all(重下引擎)、npx wigolo docto --fix(修复环境)。

    ⚙️ 核心功能

    Wigolo 核心工具全景

    1. 🔍 多引擎搜索 search:内置 18 个直连适配器,ML 重排 + 可解释评分,让智能体拿到「为什么是这条结果」。
    2. 🔗 抓取 & 爬取 fetch / crawl:分层路由获取单页并清洗为 markdown(含 PDF / 鉴权页处理);BFS / DFS / sitemap 多页爬取并自带限流保护。
    3. 🧩 提取 & 缓存 & 相似 extract / cache / find_similar:从页面抽取表格 / JSON-LD / Schema 等结构化数据;本地缓存已见内容,二次查询毫秒即回;关键词 + 语义 + 实时发现相似页面。
    4. 🤖 自主研究 research / agent:把一个问题自动分解成子查询、扇出检索、综合成报告;agent 工具则跑 search→fetch→extract→synthesize 的自主收集循环。
    5. 🔔 变更追踪 diff / watch:检测页面变化并推送 webhook,把「定时盯网页」变成可编排的事件。

    🚀 典型使用场景

    • 场景一 · 编码时实时联网:在 Claude Code / Cursor 里改代码时,智能体直接调用 search / fetch 查文档、查报错、查第三方 API,开发者不再手动复制粘贴;所有命中缓存在 ~/.wigolo/,隐私不出本机。
    • 场景二 · 自托管 Agent 的「联网大脑」:在自托管服务器上 wigolo serve 暴露 REST / MCP 端点,LangChain、CrewAI、n8n 等编排框架或任意 MCP client 统一调用,把分散在各处的抓取逻辑收敛成一个服务。
    • 场景三 · 持续竞品 / 文档监控:用 watch 盯住竞品定价页或文档页,diff 出变化并推 webhook 到飞书 / Slack / 自有系统,第一时间感知变更。

    💡 推荐理由

    我特别看好 Wigolo 的一点,是它真正把「本地优先」做到了极致:零 API Key、零按量账单,直接戳中「想让 agent 上网,却要为每家搜索引擎单独接 key、还要担心账单爆掉」的痛点。统一的 MCP 接口对 Claude Code / Cursor / Codex / Gemini CLI / VS Code / Zed 通吃,接入几乎零心智负担;数据默认留在本地,对重视隐私的开发者很友好;AGPL-3.0 开源、可完全自托管。如果你正想给自己的 coding agent 装上一双「眼睛和手」,Wigolo 是目前最省心的一站式方案。

    Wigolo 四种接入方式与差异化

    🔗 下载地址

  • Kimi Code CLI:终端里的下一代 AI 编程智能体(4.3K★,月之暗面开源)

    Kimi Code CLI:终端里的下一代 AI 编程智能体(4.3K★,月之暗面开源)

    Kimi Code CLI 封面

    Kimi Code CLI 是月之暗面(MoonshotAI)开源的终端 AI 编程智能体——它能在命令行里读改代码、执行 shell 命令、搜索文件、抓取网页,并依据反馈自主决定下一步;开箱即用 Kimi 大模型,也可配置接入其它兼容模型。

    一、项目简介

    一个跑在终端里的”AI 同事”。Kimi Code CLI 把代码读写、命令执行、文件检索、网页抓取与多步自主规划统一进一个轻量 TUI,口号是 “The Starting Point for Next-Gen Agents”(下一代智能体的起点)。它脱胎于此前广受关注的 Kimi CLI,把运行时收敛为单文件二进制,启动几乎无感,对 Kimi 大模型用户尤其友好。

    二、安装要求和过程

    环境要求

    • 普通用户无需 Node.js:官方脚本一条命令装好单文件二进制,无 PATH 烦恼、无全局模块冲突;
    • Windows 需先装 Git for Windows:Kimi Code CLI 用内置 Git Bash 作为 shell 环境;若 Git 装在自定义路径,设置环境变量 KIMI_SHELL_PATH 指向 bash.exe 绝对路径;
    • 账号:首次使用需 Kimi 账号(OAuth)或 Moonshot AI 开放平台 API Key;
    • 从源码开发需 Node.js ≥ 24.15.0 + pnpm 10.33.0。

    快速安装

    macOS / Linux:

    curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash

    Windows(PowerShell):

    irm https://code.kimi.com/kimi-code/install.ps1 | iex

    快速开始

    cd your-project
    kimi            # 启动交互式 TUI
    kimi --version  # 验证安装

    首次在会话里执行 /login,选择 Kimi Code OAuth 或 API Key 登录,然后试着让它”看看这个项目,解释下主要目录“。

    三、核心功能

    Kimi Code CLI 核心能力

    1. 单文件分发:一条命令安装,无 Node.js、无 PATH 困扰、无全局模块冲突。
    2. 毫秒级启动:TUI 毫秒就绪,开启会话毫无负担,长时间 Agent 会话也不卡。
    3. 视频输入:把录屏 / 演示片段直接丢进聊天,Agent 逐帧”看懂”画面——把参考片转成 LUT、长视频剪成短片、屏幕录屏变成可运行代码。
    4. AI 原生 MCP:用 /mcp-config 对话式增删与鉴权 Model Context Protocol 服务器,免手改 JSON。
    5. 子智能体并行:内置 coder / explore / plan 子智能体在隔离上下文并行干活,主线对话保持清爽。
    6. ACP 编辑器集成kimi acp 接入 Zed、JetBrains 等任意 Agent Client Protocol 客户端,IDE 里直接驱动。

    四、典型使用场景

    Kimi Code CLI 工作流

    • 日常终端编程搭子:在任意项目目录敲 kimi,让它读代码、跑命令、搜文件、抓网页并自规划下一步,省去来回切窗口。
    • IDE 里的 Agent:在 Zed / JetBrains 配置 kimi acp,用熟悉的编辑器驱动 Agent,一次登录处处可用,开发流不断档。
    • 视频驱动开发:把产品录屏或参考片段丢给 Agent,让它”看懂”后落地为可运行代码或素材(例如把一段参考片转成调色 LUT)。

    五、推荐理由

    Kimi Code CLI 给我最大的惊喜是”“。作为 Kimi CLI 的演进版,它把运行时收敛成单文件二进制,启动几乎无感,TUI 也比不少同类更耐看;视频输入/mcp-config 对话式配置是真正能提升日常效率的巧思,而不是噱头。如果你已经在用 Kimi 大模型、又想要一个不折腾环境、能直接塞进终端和 IDE 的编码 Agent,它非常值得一试。MIT 协议、社区活跃(4.3K+ Stars、当日仍在高频更新),长期主义玩家可以放心上车。

    六、下载地址