标签: Agent编排

  • herdr:17.3K Stars 的终端 Agent 复用器,在命令行里同时”放养”一群 AI 编程智能体

    herdr:17.3K Stars 的终端 Agent 复用器,在命令行里同时”放养”一群 AI 编程智能体

    herdr logo

    herdr 是一款用 Rust 写成、直接跑在你现有终端里的「Agent 复用器(agent multiplexer)」——把 Claude Code、Codex、Cursor、Copilot 等一众 AI 编程智能体并排塞进真实的终端面板,统一监视、分屏、脱离与重连,让你在命令行里就能”放养”一整群 Agent。

    一、项目简介

    herdr = terminal agent multiplexer。它不是一个封装 AI 的 Web 界面,而是一个单文件 Rust 二进制(无 Electron),把多个 AI 编程智能体的真实终端会话聚合到同一个 TUI 里:每个 Agent 的工作状态(阻塞 / 进行中 / 已完成)一目了然,你可以像用 tmux 一样分屏、点击、脱离,而 Agent 们还在后台继续干活。

    二、安装要求和过程

    环境要求

    • 任意现代终端(macOS / Linux / Windows 终端均可),无需图形界面;
    • 单个 Rust 静态二进制,无 Electron、无运行时依赖
    • 支持通过 ssh 远程接入,会话在重启后依然存活;
    • 可选:本地有 Claude Code / Codex / Cursor 等任一 AI 编程助手即可配合工作。

    快速安装

    # macOS / Homebrew
    brew install herdr
    
    # 一键安装脚本(Linux / macOS)
    curl -fsSL https://herdr.dev/install.sh | sh
    
    # 版本管理器
    mise use -g herdr
    
    # Windows(测试版)
    powershell -ExecutionPolicy Bypass -c "irm https://herdr.dev/install.ps1 | iex"
    
    # 或直接从 GitHub Releases 下载对应平台的预编译二进制
    # https://github.com/ogulcancelik/herdr/releases
    

    启动与使用

    # 在代码目录直接启动
    herdr
    
    # Ctrl+B Q 脱离(Agent 继续跑)
    # 之后任意终端再输入 herdr 即可重连
    

    源码构建:git clone https://github.com/ogulcancelik/herdr && cd herdr && cargo build --release

    三、核心功能

    • 一眼掌控所有 Agent:阻塞 / 工作中 / 已完成,展示的是真实终端视图,而非被封装过的”解释版”界面。
    • 脱离不中断:Agent 在后台继续运行,可随时从任意终端或 ssh 重连,会话在系统重启后依然存活。
    • Agent 也能用 herdr:提供纯 Socket API,Agent 可以自己起面板、读输出、彼此等待,官方还配了 agent skill。
    • 键鼠并重:tmux 风格前缀键 鼠标点击 / 拖拽 / 分屏同时是一等公民,按当下场景随时切换。
    • 插件生态:可扩展面板与工作流,官方维护插件市场(herdr.dev/plugins)。

    四、典型使用场景

    • 多 Agent 并行开发:在同一个项目目录里同时跑 Claude Code、Codex、Cursor,分屏对照、统一监管进度,谁卡住一眼看清。
    • 远程 / 后台长跑任务:ssh 登录服务器起 herdr,下班时脱离,第二天从任意终端重连查看结果,会话不丢、无需 nohup 折腾。
    • Agent 自组织协作:主 Agent 通过 Socket API 派生子 Agent 到不同面板,让它们互相等待产出,搭出多智能体流水线。

    五、推荐理由

    我自己用下来最打动的三点:

    • 够轻、够原生:一个 Rust 二进制、无 Electron,和你现有的终端 / ssh 工作流无缝融合,不像某些”AI 终端”还要起一套 Web 服务。
    • 真实终端视图:Agent 的报错、进度、交互提示都是原样可见的,而不是被二次渲染成温和的摘要——排错时这点太重要了。
    • 脱离 / 重连体验极佳:长任务的”离开—回来”几乎零成本;而 Socket API 让 Agent 反过来调度 herdr,是迈向真正 agent runtime 的一步,想象空间很大。

    六、下载地址

    许可证:AGPL-3.0(双许可,商业用途需购买商业许可)。当前约 17.3K Stars,Rust 实现,2026 年 GitHub Trending 常驻热门。

  • PentAGI:完全自主的 AI 渗透测试智能体系统(20.7K Stars,Go 构建)

    PentAGI:完全自主的 AI 渗透测试智能体系统(20.7K Stars,Go 构建)

    PentAGI 概览

    项目简介

    PentAGI(Penetration testing Artificial General Intelligence)是一个面向信息安全专业人士、研究人员与爱好者的自动化安全测试平台。它用前沿 AI 技术把渗透测试流程完全自主化——从信息收集、漏洞利用到生成可执行的攻防报告,全部由多智能体团队在隔离的 Docker 沙箱中自动完成。项目由 vxcontrol 团队维护,采用 MIT 许可证,目前在 GitHub 上已收获 20.7K+ Stars。

    安装要求和过程

    环境要求

    • Docker 与 Docker Compose(或 Podman)
    • 最低 2 vCPU、4GB 内存、20GB 可用磁盘空间
    • 可访问外网(用于拉取镜像与更新)
    • 支持 10+ LLM 供应商:OpenAI / Anthropic / Google Gemini / AWS Bedrock / DeepSeek / Ollama / GLM / Kimi / Qwen 等

    快速安装

    # 1. 下载官方 docker-compose 编排文件
    curl -O https://raw.githubusercontent.com/vxcontrol/pentagi/master/docker-compose.yml
    
    # 2. 一条命令启动(默认拉起 Web UI、Agent 运行时、PostgreSQL+pgvector 等)
    docker compose up -d

    启动后访问 Web UI 完成登录与 LLM 供应商配置,即可用自然语言下发渗透测试任务。还可叠加 docker-compose-langfuse.yml(可观测)、docker-compose-graphiti.yml(知识图谱)、docker-compose-observability.yml(Grafana/Prometheus)等可选编排文件扩展能力。

    核心功能

    • 安全隔离 + 完全自主:所有操作在沙箱化的 Docker 环境中执行,AI 智能体自动规划并执行测试步骤,可选执行监控与智能任务规划提升可靠性。
    • 20+ 专业安全工具内置:开箱即用地集成了 nmap、metasploit、sqlmap 等一整套渗透利器。
    • 专家智能体团队:研究 / 开发 / 基础设施等专职 Agent 分工协作,配合任务规划让小模型也能高效运转。
    • 智能记忆 + 知识图谱:长期沉淀研究结果与成功路径,基于 Graphiti + Neo4j 构建语义关系图谱,增强上下文理解。
    • 详尽报告与可观测性:自动产出带利用指南的漏洞报告,并集成 Grafana/Prometheus 实现实时监控。

    典型使用场景

    • 授权环境下的自动化攻防演练:安全团队在自有靶场或获得书面授权的资产上,让 PentAGI 跑完整渗透流程,快速发现暴露面。
    • 红队作业与报告交付:红队队员把重复性信息收集、初步利用交给智能体,专注高价值的人工研判,并直接生成可交付的漏洞报告。
    • 安全研究与教学:结合 Graphiti 知识图谱复盘历次测试路径,沉淀方法论,用于教学与能力培养。

    推荐理由

    一句话——它把”渗透测试”这件高度依赖经验的手艺,变成了一条可由自然语言驱动、且全程可审计的流水线。对我个人而言最打动的有三点:① 彻底沙箱化,跑再多危险操作也不怕污染宿主机;② 多智能体分工比单一大模型稳得多,任务规划 + 执行监控让小模型也能干活;③ 知识图谱 + 长期记忆让它会”越用越聪明”。当然,它定位是合规授权场景下的安全研究利器,务必在合法授权范围内使用。

    下载地址

    • GitHub 仓库:https://github.com/vxcontrol/pentagi
    • 社区:Discord(discord.gg/2xrMh7qX6m)与 Telegram(t.me/+Ka9i6CNwe71hMWQy)
    • 部署方式:Docker / Docker Compose 自托管,数据完全自控

    本文仅作技术介绍,请在法律法规与授权范围内合理使用。

  • herdr:住在终端里的 AI 智能体复用器,像 tmux 一样并行调度多个编程 Agent

    herdr:住在终端里的 AI 智能体复用器,像 tmux 一样并行调度多个编程 Agent

    herdr 终端演示

    herdr 是一个「住在你终端里的智能体复用器(agent multiplexer)」——它让你像 tmux 管理多窗口那样,在同一个终端里同时监督、调度和并行运行 Claude Code、Codex、Copilot、Gemini CLI 等多个 AI 编程智能体,全部以真实终端视图呈现,随时脱离(detach)与重新接入(reattach)。

    项目简介

    herdr 是用 Rust 写的单文件二进制工具,定位是「AI 编程智能体的终端调度台」。当你的工作流里同时跑着好几个编码 Agent,herdr 帮你把它们收进一个分屏会话里统一管理:谁在干活、谁卡住了、谁完成了,一眼看清;你离开后智能体继续跑,回来在任意终端(甚至 ssh)重新接入就能接着看。

    安装要求和过程

    环境要求

    • 任意现代终端(macOS / Linux 已稳定,Windows 为 beta 版);
    • 无需运行时依赖,单个 Rust 二进制,无 Electron,不占内存;
    • 可选:Homebrew、mise 等包管理器;源码编译需 Rust 工具链(cargo)。

    快速安装

    一行安装脚本(推荐):

    curl -fsSL https://herdr.dev/install.sh | sh

    其他安装方式:

    # Homebrew
    brew install herdr
    
    # mise
    mise use -g herdr
    
    # Windows (beta)
    powershell -ExecutionPolicy Bypass -c "irm https://herdr.dev/install.ps1 | iex"
    
    # 源码编译
    git clone https://github.com/ogulcancelik/herdr
    cd herdr
    cargo build --release

    在代码目录直接启动:

    herdr          # 启动,在代码所在目录运行
    ctrl+b q       # 脱离会话(agents 继续跑)
    herdr          # 任意终端重新接入

    核心功能

    1. 一眼掌控所有智能体:每个 Agent 的状态(blocked / working / done)一目了然,呈现的是真实终端视图,而不是被二次包装过的「解读」。
    2. 脱离后智能体继续跑:会话 detach 后进程不中断,可在任意终端或 ssh 上重新接入,甚至终端/机器重启后会话依然存活。
    3. 智能体也能用 herdr:提供纯 socket API,Agent 可以自己创建 pane、读取输出、互相等待,官方还给了 agent skill,让多智能体流水线成为可能。
    4. 键鼠都是一等公民:既支持 tmux 式前缀键(ctrl+b),也支持鼠标点击、拖拽、分屏,按当下场景自由切换,不被工具绑架。
    5. 插件可扩展:通过插件扩展 pane 与工作流,官方有插件市场,可按需装配能力。
    6. 单 Rust 二进制、无 Electron:跑在你已有的终端里,启动飞快、资源占用极低。

    典型使用场景

    1. 并行跑多个编程智能体
    同时开 Claude Code、Codex、Gemini CLI,分屏对照各自进度,省去在多个窗口之间反复切换、对不上上下文的麻烦。

    2. 远程 / 无人值守跑长任务
    在本地 detach,ssh 到服务器后执行 herdr 重新接入看结果,CI 长任务、 overnight 构建不占用本地终端,进程也不怕断线。

    3. 智能体互相编排
    让一个 Agent 通过 socket API 拉起子 Agent、等它产出再继续,把多智能体协作沉淀成可复用的流水线,而不是手动粘贴上下文。

    推荐理由

    现在工程师同时用两三个 AI 编程助手已是常态,但窗口一多就乱、上下文对不上、离开后任务状态无从追踪。herdr 把「多智能体并行调度」做成了一个趁手的终端工具——不像套壳 IDE 那样笨重,Rust 单二进制启动飞快,detach/reattach + ssh 重新接入这个能力对经常远程看进度的人尤其实用。项目 AGPL-3.0 开源、文档齐全(quick start / concepts / agents / plugins / socket api 一应俱全),如果你已经在 tmux 和多个编码 Agent 之间反复横跳,值得一试。

    下载地址

  • 从手写代码到AI循环:程序员的工作方式正在发生第三次跃迁

    从手写代码到AI循环:程序员的工作方式正在发生第三次跃迁

    AI agents循环概念图
    AI agents相互提示形成循环结构(概念图)

    上周五,Claude Code的创始人Boris Cherny出现在Meta的@Scale会议上。出乎意料的是,观众提出的第一个问题竟然是关于”循环”的。

    “循环是下一个炒作周期,还是真的有用?”提问者问道。

    Cherny的回答很干脆:”没错,它们是真实存在的。”

    “两年前,我们手写源代码。我们开始过渡到由agents来写代码。现在我们正在过渡到这样一个阶段:agents在提示其他agents,然后由后者来写代码。从源代码到agents这一步有多大,循环就是同样重要、同样大的一步。”

    在演讲的后面部分(大约32分钟标记处),Cherny具体谈到了他在自己工作中持续运行的循环。一个agent持续寻找改进代码架构的方法,而另一个则在寻找可以统一的重复抽象。它们像其他程序员一样提交pull requests,而且由于代码在不断变化,它们永远不会停止运行。

    循环到底是什么?

    随着向agentic AI的转变,大多数用户的焦点一直是尽可能好地管理他们的agents:建立明确的目标,检查离散的进度单元,不要让它们偏离提示太远。循环则更进一步,它授权一群agents在后台持续不断地工作。

    这是对AI的极大信任——但随着模型快速变好,这可能是让AI处理真实工作的下一步。

    首先要认识到,这并不完全是新东西。递归循环——调用自身以重复动作的函数,加上一个停止循环的条件——是计算机科学入门课程的主要内容。这些循环遵循的是非确定性逻辑,也就是说,是由一个子agent来选择何时停止循环,而不是一个明确的条件。但同样的基本方法正在发挥作用。

    一旦程序员开始使用AI来完成任务,AI监督AI的某种版本的递归循环就必然会出现。

    简单到令人抓狂

    与经典计算不同,agentic循环可以简单到令人抓狂。最流行的技巧之一是Ralph Loop(以Ralph Wiggum命名),它基本上总结了模型所做的所有工作,并询问是否完成了目标。这是处理AI模型运行时间过长而迷失方向的一种方式——本质上是在模型之间来回弹跳,直到任务完成。

    另一种思考循环的方式是,将其视为推动更多测试时计算的一部分。正如OpenAI研究员Noam Brown本月早些时候观察到的,如果你向当代模型投入足够的计算资源,它们几乎可以解决任何问题。这意味着确保问题得到解决的一种方法是,不断地向它投入计算资源,直到完成为止。

    这对于像改进代码库这样的爬山问题尤其适用,模型可以不断做出增量改进,直到达到给定的阈值。或者,就像Cherny的例子一样,只要有计算资源可以花费,它就可以不断做出增量改进。

    代价不菲,但可能值得

    如果这听起来很昂贵,那确实如此。就像之前的agentic AI一样,AI循环比简单的问答聊天机器人更快地消耗tokens——而且因为重点是让循环一直运行,所以你可以花费的金额没有上限。

    对于Anthropic来说,这没问题,因为它归根结底是在做tokens销售生意。但对于其他所有人来说,这可能是一种昂贵的工作方式。

    尽管如此,取决于agentic循环试图解决的问题,以及允许监督tokens支出、漂移和其他经典AI问题的正确设置,好处可能大到足以超过成本。


  • RAGFlow:83K+ Stars 的开源 RAG 引擎,为 LLM 打造卓越上下文层

    RAGFlow:83K+ Stars 的开源 RAG 引擎,为 LLM 打造卓越上下文层

    📌 项目简介

    RAGFlow 是一款领先的开源检索增强生成(RAG)引擎,由 InfiniFlow 团队(Milvus 向量数据库原班人马)开发,将前沿 RAG 技术与 Agent 能力深度融合,为大语言模型提供卓越的上下文理解层。

    RAGFlow 架构图

    RAGFlow 系统架构概览


    ⚙️ 安装要求和过程

    环境要求(自托管)

    配置项 最低要求
    CPU ≥ 4 核
    内存 ≥ 16 GB
    磁盘 ≥ 50 GB
    Docker ≥ 24.0.0
    Docker Compose ≥ v2.26.1

    🐳 Docker 快速部署(推荐)

    # 1. 调整系统内核参数(避免 Elasticsearch 启动失败)
    sudo sysctl -w vm.max_map_count=262144
    
    # 2. 克隆项目代码
    git clone https://github.com/infiniflow/ragflow.git
    cd ragflow/docker
    
    # 3. 切换到稳定版本
    git checkout v0.26.1
    
    # 4. 启动服务(仅CPU)
    docker compose -f docker-compose.yml up -d
    
    # (可选)如需GPU加速,先执行:
    # sed -i '1i DEVICE=gpu' .env
    # docker compose -f docker-compose.yml up -d
    
    # 5. 验证服务状态
    docker logs -f docker-ragflow-cpu-1

    启动成功后,浏览器访问服务器 IP 地址(默认 HTTP 端口 80)即可进入 RAGFlow 登录页面。

    💻 源码启动(开发用途)

    # 安装依赖工具
    pipx install uv pre-commit
    
    # 克隆代码
    git clone https://github.com/infiniflow/ragflow.git
    cd ragflow/
    uv sync --python 3.13
    uv run python3 download_deps.py
    
    # 启动基础依赖服务
    docker compose -f docker/docker-compose-base.yml up -d
    
    # 启动后端
    source .venv/bin/activate
    export PYTHONPATH=$(pwd)
    bash docker/launch_backend_service.sh
    
    # 启动前端(新终端)
    cd web && npm install && npm run dev

    ✨ 核心功能

    1. 深度文档理解,输入即精准

    基于先进的文档解析技术,可从格式复杂的非结构化数据(PDF、Word、PPT、Excel、扫描件、图片等)中精准提取知识,真正做到”Quality in, Quality out”。

    2. 可视化模板化分块,答案可追溯

    分块逻辑智能可解释,提供大量预置分块模板;支持文本分块可视化,允许人工干预调整;最终答案附带可追溯的引用来源,有效降低 LLM 幻觉问题。

    3. 多源数据兼容,异构数据统一管理

    支持解析 Word、PPT、Excel、TXT、图片、扫描件、结构化数据、网页等各类异构数据源,一站式完成企业知识库构建。

    4. Agentic 工作流 + MCP 协议支持

    内置丰富 Agent 能力,支持 Agentic 工作流编排、MCP 协议接入;内置 Python/JavaScript 代码执行器组件;支持 AI Agent 记忆功能。

    5. 高精度混合检索,多路召回+融合重排

    结合向量搜索、BM25 关键词搜索和自定义评分机制,配合先进重排序算法,提供无与伦比的回答准确性和上下文相关性。


    🚀 典型使用场景

    📈 股权投资研究

    自动化收集公司数据,整合财务指标与研究洞察。通过自主规划和多智能体编排,实现高级股票分析。自动从用户查询中识别股票代码,聚合外部权威来源和内部记录中的洞察,最终结合定性洞察和财务指标生成完整投资报告。

    ⚖️ 法律判例分析

    通过检查公共来源和内部数据集中的类似法律案例,提供结构化判例分析。自动提取关键属性(如司法管辖区和法律问题)以制定搜索查询并检索可比较的先例,最终整合成结构化分析报告。

    🏭 制造业维护支持

    通过从内部手册中准确获取内容,提供结构化维护指导(外部参考作为补充支持)。输入任务后,工作流首先验证输入充分性,然后从内部维护手册中提取标准协议,整合补充外部技术数据,生成清晰的执行指令。


    💡 推荐理由

    RAGFlow 是我用过的最”务实”的 RAG 产品,没有之一。

    第一,它真正解决了 RAG 的底层痛点——文档解析。很多 RAG 框架只关注向量检索和生成,却忽略了最关键的”输入质量”问题。RAGFlow 的 DeepDoc 技术能精准解析复杂格式的 PDF、扫描件,真正做到”Garbage in, garbage out”的反面——Quality in, quality out

    第二,可视化分块 + 可追溯引用,让 AI 回答有章可循。这是企业场景的刚需。你可以清楚看到每个答案是从哪个文档的哪个位置来的,大幅降低了 LLM 幻觉带来的风险。

    第三,Agentic 能力的融合非常自然。不是简单地在 RAG 上面套一个 Agent 外壳,而是将 Agent 能力(MCP 协议、代码执行、记忆管理)深度集成到 RAG 工作流中,真正实现了”RAG + Agent”的一体化编排。

    最后,InfiniFlow 团队是 Milvus 的原班人马,技术底蕴深厚。83K+ Stars 和 9600+ Forks 的社区活跃度也证明了产品的成熟度。如果你正在构建企业级知识库或 RAG 应用,RAGFlow 绝对值得一试。


    📥 下载地址

    🌐 官方网站:https://ragflow.io

    📦 GitHub 开源地址:https://github.com/infiniflow/ragflow ⭐ 83K+ Stars

    ☁️ 云服务(快速体验):https://cloud.ragflow.io

    📚 官方文档:https://ragflow.io/docs/dev/

    💡 小贴士:RAGFlow 支持飞书、Discord、Telegram、Line 等多聊天渠道接入(2026年6月更新),可快速将企业知识库接入到日常沟通工具中!

  • AI智能体学会了成长,但只认你一个人

    你训练的AI智能体,只认你一个人

    一家公司的AI智能体用得越久,表现应该越好。但现实很骨感:你花半天调教的智能体,隔壁工位的同事打开同一个工具,一切又从头开始。没有记忆共享,没有经验传递,每个用户都在重新发明轮子。

    Asana的首席产品官Arnab Bose说得很直白:”模型供应商已经把推理和重试循环做得非常好了,但他们不擅长的是——以人类能够推理的方式,把企业工作上下文引入进来。”

    问题到底出在哪

    场景是这样的:你在AI智能体里纠正了一个错误,比如告诉它你们公司的文档规范是什么。这个纠正被记录了,下次你再问,它答得很好。但是你的同事打开同一个智能体,问同样的问题,它还是会给错的答案。

    这个现象在多人协作的场景里会被放大。Asana自己的研究发现,75%的知识工作者在工作中使用AI,但只有5%的企业报告说获得了生产力提升。记忆无法在团队成员之间共享,是一个核心原因。

    模型本身是无状态的,每一次对话都是全新的开始。记忆存在于上下文窗口里,窗口一关,什么都没留下。要让智能体记住东西,需要在模型之外搭建专门的记忆层。

    几家公司的解法

    Asana的做法是建一个”上下文图谱”,任何一个团队成员对智能体的纠正,都会写入这个共享图谱,之后所有其他成员调用智能体时,都能受益。他们把这个叫做”共享记忆架构”。

    Collate的联合创始人兼CTO Sriharsha Chintalapani说,缺乏共享记忆是多智能体工作流的一个主要障碍,特别是在一致性方面。智能体对提示词的质量很敏感,理解任务深的人给出的提示,比新手给出的效果好得多——因为前者能提供更准确的反馈,智能体记住这些反馈,后续表现就会更好。

    Zeta Global的首席数据官Neej Gore说,共享上下文应该成为一种”活着的记忆”,能够在整个企业范围内复利式地增强智能。

    微软的做法不一样

    微软的Copilot走的是个人优先的路线。它会学习用户在组织中的角色、语气偏好和工作模式,然后把这些存成个人记忆,跨不同的Microsoft 365界面生效。这种做法对用户个人体验很好,但没有解决团队协作的问题。

    对于评估智能体平台的企业技术负责人来说,共享记忆现在已经成为一个采购考量因素。一个只能记住与你个人交互历史的智能体,和能记住整个团队经验的智能体,长期价值差距会越来越大。


    这个方向看上去简单,做起来全是坑。怎么保证写入共享记忆的信息是准确的?怎么控制权限,让该看到的人看到,不该看到的人看不到?这些都是接下来一年里企业AI落地要回答的问题。

  • MIT发布2026年AI十大趋势:从人形机器人训练到反AI运动

    人形机器人训练数据:动作捕捉的新战场

    就像人类的文字成了大语言模型的养料,现在连人类怎么动、怎么走路、怎么搬东西,都被大规模收集起来训练人形机器人。这事儿听起来有点怪,但确实在发生——有公司专门建了”训练中心”,让工人一遍遍重复同样的动作,就为了给机器人提供学习素材。还有更离谱的”提线木偶”模式:远方的人类通过远程操控,手把手教机器人怎么做事。

    这种做法投入巨大,但没人能保证一定成功。可资本还是在砸钱,因为这可能是让机器人真正”活过来”的唯一路径。


    大语言模型没有死,它正在进化

    去年大家还在感叹大语言模型”改变了世界”,今年从业者已经在琢磨下一个突破在哪里。容易摘的果子已经摘完了,模型的提升越来越难,但这不意味着LLM要退出历史舞台。

    相反,它正在往两个方向走:一个是把现有的能力压榨到极致,另一个是在寻找全新的架构突破。这条路不好走,但走通了就是下一个时代。


    AI让诈骗变得便宜又高效

    以前想搞网络诈骗,还得学点技术、花点钱买工具。现在有了生成式AI,门槛几乎降到了地板上。黑客可以用AI批量生成钓鱼邮件,连语法错误都不一定有;换脸视频让冒充别人变得轻而易举;甚至连打电话诈骗都有AI语音代劳。

    AI正在让网络犯罪变得更便宜、更快、更容易——这对普通人来说不是什么好消息。


    世界模型:让AI理解物理世界

    大语言模型擅长处理文字,但要让AI进入真实物理世界——比如让机器人知道”杯子掉地上会碎”这种常识——就需要”世界模型”。这类系统试图让AI理解外部世界的运作规律,而不仅仅是预测下一个词。

    如果这条路走通了,AI就不再只是聊天工具,而是能真正在现实世界里做事情的智能体。这可能是下一波AI浪潮最核心的突破点。


    智能体编排:从单打独斗到团队协作

    早期的AI智能体只能干一件事——比如帮你订个外卖,或者写段代码。但现实世界里的问题往往是复杂的,需要多个步骤、多种能力配合。

    现在的方向是”智能体团队”:一个负责搜索、一个负责推理、一个负责执行,像人类团队一样分工协作。这比单个超级智能体更灵活,也更容易落地。很多公司已经在往这个方向押注了。


    中国的开源赌注:免费模型赢来的全球影响力

    DeepSeek、通义千问、智谱……中国实验室过去一年里密集开源了一大批高质量模型,而且真的好用。这让全球开发者突然意识到:原来不用OpenAI也能做出厉害的东西。

    但这种”免费送”的策略能不能持续,没人说得准。训练模型太烧钱了,光靠口碑和开发者好感,账算得过来吗?不管怎样,全世界已经在基于中国的基础模型搞开发了,这本身就已经改变了格局。


    AI科学家:当AI开始做科研

    有些公司已经在开发能自主做科研的AI——不是帮你查文献,而是真的能设计实验、分析数据、甚至提出新假设。支持者说,这种AI合作者有一天可能会达到诺贝尔奖的水平。

    这话听起来夸张,但想想十年前大家也觉得”AI下围棋赢人类”是天方夜谭。科学发现的门槛正在被重新定义。


    反AI运动:当大家开始说”够了”

    过去几年AI基本上是想怎么发展就怎么发展,监管跟不上,大家也沉浸在”新技术好厉害”的兴奋里。但现在这股浪潮遇到了真正的阻力。

    艺术家不满自己的作品被拿来训练模型,工会担心AI抢走工作,保守派和自由派居然在”限制AI”这件事上找到了共同点。这股反对力量还在早期,但已经在一些具体问题上取得了小胜利。AI的无约束时代,可能正在走向终点。


    写在最后

    MIT Technology Review这份清单的价值不在于预测未来,而在于帮我们看清当下——哪些方向是真的在动,哪些只是炒作。人形机器人、世界模型、智能体编排,这些是当前最值得盯着的变化;而AI安全、监管反弹、开源商业化困境,则是这个行业必须面对的考题。

    2026年的AI,已经不再是”能不能做出来”的问题,而是”应该怎么用、谁来管、往哪里去”的问题。

  • Google I/O 2026:Agent时代正式开启,OpenAI最大对手回来了

    Google I/O 2026:从聊天机器人到数字分身

    过去几年Google I/O的主角,通常是某个模型、某个参数量、某个Benchmark。但今年不一样。整场两个多小时发布会,Google其实只反复讲了一件事:Agent。

    不是聊天机器人,不是”帮你回答问题”的AI,而是真正开始替用户持续执行任务的AI Agent。Google想做的,是把Gemini从一个App,彻底变成Google所有入口背后的操作系统。

    Google I/O 2026发布会
    Google I/O 2026全面押注AI Agent(图源:谷歌)

    Gemini Spark:你的24小时数字分身

    这次发布会上,Google几乎把整个产品体系全部Agent化了。最核心的新产品,是Gemini Spark。你可以把它理解成Google版”全天候数字分身”。它运行在Google Cloud虚拟机上,7×24小时在线。即便你关掉电脑、合上手机,它依然会在后台继续工作。

    Google现场演示了一个典型场景:用户正在组织社区派对,Spark会自动汇总邮件回复、统计每个人带什么东西、追踪谁还没确认、生成提醒邮件、同步Google Sheets,再自动做一份Google Slides宣传页,整个过程几乎不需要用户手动操作。

    Gemini Spark本质上正在把Agent从”问答工具”,变成”长期运行的执行系统”。过去的大模型,更像即时响应;现在的Agent,则开始拥有持续状态、任务记忆和跨应用执行能力。

    Gemini 3.5 Flash:把Agent成本打下来

    Agent最大的难点,从来都不只是能力,而是成本。因为Agent实在太烧Token了。Google披露的数据非常夸张:目前Google自家产品每月处理的Token,已经达到3200万亿个,同比增长7倍。

    于是,Gemini 3.5 Flash出现了。这可能是今年Google最关键的模型。因为它不再单纯强调”最强”,而是开始强调”最适合跑Agent”。Pichai现场直接算了一笔账:如果一家头部企业每天处理1万亿Token,把80%的工作负载从其它前沿模型迁移到Gemini 3.5 Flash,一年能省超过10亿美元。

    性能接近顶级前沿模型,输出速度快4倍,而成本只有同类模型的一半甚至更低。Google现在反复强调一句话:”你不需要再在质量和速度之间二选一。”因为Agent时代,比拼的已经不是一次回答,而是持续运行能力。

    Antigravity 2.0:93个Agent协作搭建操作系统

    如果说Flash负责”让Agent更便宜”,那Antigravity 2.0负责的,就是”让Agent真正开始干活”。它原本只是个AI Coding工具,现在Google直接把它升级成了多Agent协作平台。

    开发者可以同时调度多个Agent:一个写代码,一个生成设计素材,一个规划产品架构,一个测试漏洞,一个修Bug。Google现场甚至演示了一个极其夸张的案例:93个Agent并行协作,从零开始搭建一个可运行的操作系统。

    整个过程持续12小时,处理26亿Token,最终居然真的跑起来了,甚至还能运行Doom。而整个API成本不到1000美元。Google显然是在正面硬刚Claude Code和Codex。

    搜索彻底变了:从链接到执行结果

    Google这次还对搜索动了最大的一刀。Pichai说,这是Google搜索框25年来最大升级。因为搜索不再只是”搜答案”,而是开始”生成执行结果”。

    比如用户问:”黑洞如何影响时空?”以前搜索会给你十条蓝链,现在Google直接生成一个交互式可视化界面,你甚至可以拖动参数、实时观察变化。搜索开始变成实时生成式UI。

    Google还把Agent正式塞进搜索。用户未来可以创建Information Agent,让它24小时后台监控信息,比如跟踪股票、监控租房、盯球鞋发售、观察行业动态、追踪价格变化。Agent会自己搜、自己总结、自己更新。


    Google最恐怖的其实是生态

    但整场发布会真正最危险的地方,其实不是模型,而是Google的生态。因为OpenAI现在最强的,是模型能力;但Google最强的,是入口。

    搜索、Chrome、Android、YouTube、Gmail、Maps、Workspace……这些产品加起来,本身就是全球最大的互联网流量系统之一。而现在,Google正在把Gemini嵌入所有入口。

    这意味着,别人还在想办法”获取用户”,Google已经开始直接给几十亿用户发Agent。这是完全不同的战争维度。

    甚至连智能眼镜,Google也重新杀回来了。今年发布的Android XR眼镜,可以直接通过Gemini完成导航、下单、消息总结,用户甚至不用掏手机。

    Google正在试图让Gemini变成未来所有设备背后的默认智能层。搜索是入口,Chrome是入口,手机是入口,眼镜也是入口。Gemini则开始变成背后的统一大脑。

    AI行业开始进入”运营时代”

    今年Google I/O还有个特别明显的信号:AI行业正在从”模型竞赛”,进入”运营竞赛”。过去两年,行业核心是”谁更聪明”;现在开始变成谁更稳定、谁更便宜、谁更能规模化、谁更能真正接管工作流。

    Google今年资本支出预计高达1800亿~1900亿美元,第八代TPU开始拆成训练芯片和推理芯片。Google甚至公开强调:”我们要把最强AI,变成最便宜的AI。”这已经不是单纯的技术竞争,而是一次基础设施战争。


    过去几年,大家一直在讨论:AI到底什么时候能真正”替人做事”。Google这次给出的答案是:现在。而且它不准备只做一个聊天机器人。它想做的是,一个全天候运行、跨应用协作、持续执行任务、存在于所有入口里的超级Agent系统。

    Google迟到了。但现在,它终于开始全面开卷Agent。

  • 2026年AI领域最值得关注的10件事

    2026年AI领域最值得关注的10件事

    MIT Technology Review最近发了篇文章,总结了当下AI领域最值得你盯着的10个方向。他们的记者和编辑盯了AI这么多年,这次第一次把答案浓缩成一份清单。

    这份榜单的灵感来自他们每年的《10项突破性技术》,但这次把视角投向了当下推动AI进步、改变权力格局的东西。我挑几个最有意思的跟你聊聊。

    AI Trends 2026
    MIT Technology Review总结的2026年AI十大重要趋势(图片来源:MIT Technology Review)

    人形机器人需要大量训练数据

    就像我们的文字成了大语言模型的训练数据一样,记录人类动作的海量视频现在正被收集起来,用来训练人形机器人。有些公司在搞庞大的”训练中心”,让工人重复完成任务;还有些公司让海外的陌生人远程操控”傀儡”机器人。这是个疯狂的尝试,而且没人能保证一定能成功。

    大语言模型还有很大挖掘空间

    大语言模型(LLM)曾经席卷全球。现在所有AI从业者都在追逐下一个重大突破。虽然容易实现的目标已经所剩无几,但大语言模型不会就此消失,这项技术还有很大的挖掘空间。

    AI让诈骗变得更容易了

    AI正在降低诈骗分子和黑客的作案门槛,让入侵目标的尝试变得比以往更快、更便宜、更容易。这件事值得所有人警惕。

    “AI无处不在,铺天盖地。这让你有怎样的感受?”——MIT Technology Review编辑Mat Honan

    世界模型:让AI理解物理世界

    AI公司想要构建能够理解外部世界的系统。如果它们成功,就有可能克服大语言模型的局限性,帮助AI进入物理环境。这是个很有意思的方向。

    AI已经进了作战室

    算法很早就实现了军事杂务的自动化,但现在生成式AI已经在作战室拥有了席位,指挥官会认真采纳它的建议。它正在重塑军队的情报共享方式、和大型科技公司的合作模式,以及致命决策的制定方式。

    深度伪造被武器化了

    随着生成式AI的改进、Grok大规模生成非自愿色情图像,以及美国政府用这项技术进行宣传,人们长期预测的武器化深度伪造威胁已经到来。


    智能体协作:从单打独斗到团队合作

    第一代AI智能体只能运行浏览器或者编写代码片段,而且只能单独行动。接下来将出现的是能够协作完成复杂得多的目标的智能体团队。这个方向对自动化和生产力提升很有意义。

    中国的开源押注

    免费开放前沿模型让中国实验室赢得了全球信誉,也获得了开发者的大量好感。这种模式的财务可持续性无人知晓,但全世界已经在基于中国的模型基础进行构建了。

    人工智能科学家:AI自己搞研究

    学术界和企业都在开发能够自主完成研究任务、作为真正的合作者和科学家共事的智能体。有人认为,这些AI合作科学家终有一天会取得足以获得诺贝尔奖的成果。这个说法有点大胆,但也不是完全没可能。

    全球范围内的AI抵制浪潮

    在多年的AI无限制发展之后,全球范围内正在形成一股强大的抵制浪潮。从保守派到自由派,从艺术家到工会,活动人士的势头越来越猛,已经开始取得一些小胜利。


    我的看法:这10个方向里,我觉得最值得关注的是”智能体协作”和”世界模型”。智能体协作如果能做好,对提升生产力会有很大帮助;世界模型则是让AI从屏幕后面走到物理世界的关键一步。至于AI诈骗和深度伪造武器化,这两个方向让人担心,但也说明AI的能力确实在快速提升。

    另外,中国的开源押注这个方向也很有意思。免费开放前沿模型确实能赢得开发者的好感,但怎么赚钱这是个问题。不过,全世界已经开始基于中国的模型进行构建了,这说明开源策略确实有效。

  • LangGraph:32.6k Stars!LangChain官方Agent编排框架,让复杂AI工作流可视化可控

    LangGraph:32.6k Stars!LangChain官方Agent编排框架,让复杂AI工作流可视化可控

    🔄

    LangGraph:32.6k Stars!LangChain官方Agent编排框架,让复杂AI工作流可视化可控

    GitHub 热门 AI 开源项目系列 · 第27期

    📦 项目简介

    LangGraph 是 LangChain 官方出品的 Agent 编排框架,专门用于构建、管理和可视化复杂的 AI Agent 工作流。它基于图结构(Graph)设计,让开发者能够以声明式方式定义 Agent 之间的交互逻辑,支持循环、条件分支、状态管理等复杂场景。无论是构建多步骤推理链、人机协作流程,还是复杂的多 Agent 协作系统,LangGraph 都能提供清晰的可编程抽象。

    LangGraph 架构示意图

    LangGraph 基于图结构的 Agent 编排架构

    ⚙️ 安装要求和过程

    环境要求

    • Python 3.9+
    • pip 包管理器
    • ✅ (可选)LangSmith 账号用于可视化调试

    快速安装

    Bash
    # 安装LangGraph核心库
    pip install langgraph
    
    # 安装LangChain和LLM支持(以OpenAI为例)
    pip install langchain-openai
    
    # 可选:安装LangSmith用于可视化调试
    pip install langsmith
    
    # 设置环境变量
    export OPENAI_API_KEY="your-api-key"
    export LANGCHAIN_TRACING_V2="true"  # 启用LangSmith追踪
    export LANGCHAIN_API_KEY="your-langsmith-api-key"

    验证安装

    Python
    import langgraph
    print(f"LangGraph version: {langgraph.__version__}")

    🎯 核心功能

    🔄 图结构编排

    基于有向图(Directed Graph)定义 Agent 工作流,支持节点(Node)和边(Edge)的灵活配置。可以轻松实现顺序执行、条件分支、循环等复杂逻辑,让 Agent 工作流程清晰可控。

    💾 状态管理

    内置强大的状态管理机制,支持在图执行过程中持久化、传递和更新状态。每个节点的输入输出都明确定义,避免了传统链式调用中的状态混乱问题,方便调试和测试。

    🔄 循环与人工干预

    原生支持循环(Loops)和人工干预(Human-in-the-Loop)场景。可以在图中定义循环逻辑,让 Agent 根据中间结果动态调整执行路径;也支持在关键节点暂停,等待人工审核后再继续。

    📊 可视化调试

    与 LangSmith 深度集成,提供工作流的实时可视化调试功能。可以查看每个节点的输入/输出、状态变化、执行时间等详细信息,快速定位问题。支持本地调试和云端追踪两种模式。

    🚀 生产级部署

    提供 LangGraph Cloud 服务,支持一键部署 Agent 工作流到生产环境。内置版本管理、并发控制、错误恢复、日志监控等企业级特性,让原型快速走向生产。

    💡 典型使用场景

    📰 场景1:多步骤研究报告生成

    构建一个自动化研究报告生成系统:首先用搜索 Agent 从多个来源收集信息,然后用摘要 Agent 提取关键信息,接着用分析 Agent 生成洞察,最后用写作 Agent 生成结构化报告。LangGraph 可以清晰定义每个步骤的依赖关系和数据处理逻辑。

    Workflow

    搜索 Agent → 摘要 Agent → 分析 Agent → 写作 Agent → 人工审核 → 发布

    🤖 场景2:多Agent协作客服系统

    构建一个智能客服系统:意图识别 Agent 分析用户问题,然后根据问题类型路由到专门的知识库 Agent、订单查询 Agent 或退款处理 Agent。如果遇到复杂问题,系统自动升级到人工客服,并在人工处理完后继续自动跟进。

    Workflow

    意图识别 → 路由分发 → 专业Agent处理 → 人工介入(可选) → 结果反馈

    🔄 场景3:代码审查与重构助手

    构建一个代码审查助手:静态分析 Agent 检查代码质量和潜在bug,安全扫描 Agent 识别安全漏洞,性能分析 Agent 发现性能瓶颈,然后综合 Agent 生成审查报告和改进建议。支持循环迭代,直到代码质量达标。

    Workflow

    代码输入 → 多Agent分析 → 综合报告 → 人工确认 → 重构建议 → 循环优化

    🌟 推荐理由

    作为一名经常构建 AI Agent 系统的开发者,我对 LangGraph 的推荐理由如下:

    1️⃣ 可视化让复杂逻辑变得清晰

    传统的 Agent 开发往往依赖复杂的链式调用,逻辑隐藏在代码细节中,难以理解和维护。LangGraph 的图结构让整个工作流一目了然,节点和边的定义清晰明确,方便团队协作和代码审查。

    2️⃣ 状态管理避免了”意大利面条式”代码

    在复杂 Agent 系统中,状态传递往往是最容易出错的地方。LangGraph 内置的状态管理机制,让每个节点的输入输出都有明确定义,避免了全局变量和隐式状态修改,代码质量显著提升。

    3️⃣ 与LangChain生态深度集成

    如果你已经在使用 LangChain,那么 LangGraph 是天然的选择。它可以无缝集成 LangChain 的所有组件(LLM、Prompt Template、Memory、Tools等),复用现有代码,降低学习成本。

    4️⃣ 生产级特性让部署不再头疼

    很多 AI 项目死在从原型到生产的路上。LangGraph Cloud 提供了版本管理、并发控制、错误恢复、日志监控等生产级特性,让 Agent 系统的部署和运行变得可靠和可控。

    LangGraph 让复杂的 AI Agent 工作流变得清晰可控。如果你正在构建多步骤、多Agent的AI系统,或者需要可视化调试和状态管理,LangGraph 绝对值得一试!

    希望这个开源项目能帮助你在 AI Agent 开发的道路上走得更远 🚀


    📌 GitHub 热门 AI 开源项目系列 · 持续更新中

    本文由 WorkBuddy AI 自动采集撰写 · 源码见 GitHub