标签: Apache-2.0

  • agents-cli:Google 官方 AI Agent 构建 CLI,让编程助手变身 Google Cloud 专家(4,723 Stars)

    agents-cli:Google 官方 AI Agent 构建 CLI,让编程助手变身 Google Cloud 专家(4,723 Stars)

    G

    agents-cli:Google 官方 AI Agent 构建 CLI

    让任何编程助手都成为 Google Cloud AI Agent 专家

    📌 项目简介

    agents-cli 是 Google 官方出品的 CLI 工具与技能包,将任意编程助手(Claude Code、Codex、Antigravity CLI 等)转化为 Google Cloud 上构建、评估、部署企业级 AI Agent 的专家。2026年4月刚发布,已在 AI 开发者社区引起广泛关注。

    4,723
    GitHub Stars

    506
    Forks

    Python
    主要语言

    Apache 2.0
    开源许可

    ⚙️ 安装要求与过程

    环境要求

    • Python 3.11+ (推荐 3.11 或 3.12)
    • uv (Python 包管理器,类似 pip 但更快)
    • Node.js (用于 npx skills add 方式安装)
    • Google Cloud 账号(如需部署到 Google Cloud)

    快速安装(推荐方式)

    # 一键安装 CLI + 技能包到编程助手
    uvx google-agents-cli setup
    
    # 或者只安装技能包(让编程助手自己处理)
    npx skills add google/agents-cli

    验证安装

    # 查看已安装的技能
    agents-cli --help
    
    # 创建新 Agent 项目
    agents-cli scaffold my-agent

    🚀 核心功能

    ① 全栈 Agent 开发工作流

    从项目脚手架创建、代码编写、评估测试到云端部署,agents-cli 提供完整的 Agent 开发生命周期支持。无需手动学习每款 CLI 和云服务,编程助手通过技能包自动掌握最佳实践。

    ② 七大专业技能包

    内置 7 个精心设计的技能包,覆盖 Agent 开发全流程:

    • google-agents-cli-workflow:开发周期、代码保留规则、模型选择
    • google-agents-cli-adk-code:ADK Python API(Agent、Tools、编排、回调、状态)
    • google-agents-cli-scaffold:项目脚手架(create、enhance、upgrade)
    • google-agents-cli-eval:评估方法论(指标、数据集、LLM-as-judge、自适应评分)
    • google-agents-cli-deploy:部署(Agent Runtime、Cloud Run、GKE、CI/CD、密钥管理)
    • google-agents-cli-publish:Gemini Enterprise 注册
    • google-agents-cli-observability:可观测性(Cloud Trace、日志、第三方集成)

    ③ 多编程助手无缝集成

    原生支持 Antigravity CLI、Claude Code、Codex 以及其他遵循 MCP 协议的编程助手。安装后,编程助手自动获得 Google Cloud AI Agent 开发能力,无需额外配置。

    ④ 企业级部署与治理

    支持部署到 Google Cloud 多种运行环境:Agent Runtime(专用 Agent 托管平台)、Cloud Run(无服务器容器)、GKE(Kubernetes)。内置 CI/CD 集成、密钥管理和版本控制,满足企业级安全要求。

    ⑤ 内置评估与可观测性

    提供完整的 Agent 评估框架(数据集管理、自动评分、LLM-as-judge)和开箱即用的可观测性工具(Cloud Trace 分布式追踪、结构化日志、第三方 APM 集成),让 Agent 质量可度量、问题可定位。

    💡 典型使用场景

    场景一:快速构建客服 Agent 并部署到云端

    开发者在 Claude Code 中安装 agents-cli 技能包后,直接描述需求:”构建一个客服 Agent,接入公司知识库,支持订单查询和退换货处理,然后部署到 Cloud Run”。Claude Code 自动调用 agents-cli 技能,完成项目创建、代码生成、测试评估和云端部署全流程,全程无需手动操作 gcloud CLI。

    场景二:企业 Agent 性能评估与持续优化

    使用 agents-cli eval 生成评估数据集,对 Agent 进行自动化测试。通过 LLM-as-judge 自适应评分机制,全面评估 Agent 的回答质量、工具调用准确性、多轮对话连贯性。测试结果自动生成报告,指导后续优化方向。

    场景三:将开源 Agent 发布到 Gemini Enterprise 平台

    完成 Agent 开发后,使用 agents-cli publish gemini-enterprise 命令,一键将 Agent 注册到 Gemini Enterprise Agent Platform,让企业内其他团队可以发现、调用和组合你的 Agent,实现 Agent 能力的内部共享与治理。

    🌟 推荐理由

    agents-cli 的最大价值在于“技能转移”——它将 Google Cloud AI Agent 开发的最佳实践封装成技能包,让任何编程助手都能立即获得专家级 Agent 构建能力。对于已经在使用 Claude Code 或 Codex 的开发者,安装 agents-cli 相当于免费聘请了一位精通 Google Cloud 的 Agent 架构师。

    项目虽然刚发布不久(2026年4月),但作为 Google 官方出品,其架构设计和工程质量有充分保障。七大技能包覆盖了从开发到部署的完整生命周期,特别是评估(eval)和部署(deploy)技能,解决了 AI Agent 工程化落地的最大痛点。

    如果你正在使用 Google Cloud 或考虑将 Agent 部署到云端,agents-cli 是目前最完整、最官方的一站式解决方案。即使暂时不用 Google Cloud,其技能包中蕴含的 Agent 工程最佳实践也值得深入学习。

    📥 下载地址

    快速安装:uvx google-agents-cli setup
     | 
    仅安装技能:npx skills add google/agents-cli

    数据来源:GitHub API | 更新时间:2026-07-05 | 由 AI 自动整理

  • LMCache:为LLM推理打造最快的KV Cache层,降低TTFT 13倍、提升吞吐量4倍,已被NVIDIA官方集成

    LMCache:为LLM推理打造最快的KV Cache层,降低TTFT 13倍、提升吞吐量4倍,已被NVIDIA官方集成

    LMCache Logo

    LMCache:为 LLM 推理打造最快的 KV Cache 层

    ⭐ 10,054 Stars

    🏷️ GitHubLMCache/LMCache

    🌐 官网lmcache.ai

    📄 许可:Apache-2.0

    🔥 集成:NVIDIA、PyTorch 基金会官方集成

    📌 项目简介

    LMCache 是一个面向 LLM 推理的 KV Cache 管理层,将 KV 缓存从临时 GPU 显存状态转化为可持久化、跨服务引擎复用、可观测、可改造的 AI 原生知识层,从根本上降低首 Token 延迟(TTFT)、提升推理吞吐量。

    在长上下文智能体、多轮对话、RAG 等场景中,重复的 Prompt 前缀计算是性能瓶颈。LMCache 通过模块化 KV Cache 层,让跨请求、跨会话、跨引擎实例的 KV Cache 复用变得简单高效,已被 NVIDIAPyTorch 基金会等顶级机构官方集成。

    ⚙️ 安装要求与过程

    环境要求

    • 🐍 Python:3.9 及以上版本
    • 💾 推理引擎:支持 vLLM、SGLang、PyTorch 等主流推理框架
    • 🖥️ 硬件:支持 NVIDIA CUDA / AMD ROCm / CPU 多平台
    • 📦 依赖:PyTorch 2.0+ 推荐
    # 一键安装(PyPI 最新版)
    pip install lmcache
    
    # 从源码安装(开发版)
    git clone https://github.com/LMCache/LMCache.git
    cd LMCache
    pip install -e .
    
    # 与 vLLM 集成安装
    pip install lmcache[vllm]
    

    📚 完整安装指南官方文档

    ✨ 核心功能

    🔥 1. 引擎独立守护进程部署

    LMCache 作为独立守护进程运行,KV Cache 管理与推理引擎进程完全解耦。即使推理引擎崩溃重启,KV Cache 依然完好保存,彻底解决了传统 KV Cache 方案与推理引擎”命运绑定”的问题。

    📦 2. 分级持久化 KV Cache 卸载与复用

    支持将 KV Cache 从昂贵的 GPU 显存逐层卸载到 CPU RAM → 本地 SSD → 远程对象存储(S3 兼容)→ 专用 KV 存储(Redis/Valkey/Mooncake),并在不同请求、会话、引擎实例间透明复用,减少重复 prefill 计算,TTFT 最高降低 13 倍

    📊 3. 生产级 KV Cache 可观测性

    提供丰富的 Prometheus 可观测指标:Kubernetes 常规健康监控、KV Cache 专属指标(请求级/Token 级前缀缓存命中率、生命周期、性能指标)、用户级用量统计,让每一次 KV Cache 命中都有据可查。

    🔌 4. 可插拔存储与传输后端

    统一接口支持对接 CPU RAM、本地磁盘(SSD)、Redis/Valkey、Mooncake、InfiniStore、S3 兼容存储、NIXL、GDS 等多种存储后端;传输层支持 NVLink、RDMA、TCP,适配从单机到数据中心的各类部署场景。

    🔁 5. 非前缀 KV 复用 + PD 解耦

    突破传统前缀缓存限制,支持复用 Prompt 任意位置的已缓存 KV 块(结合 CacheBlend 技术);同时支持 Prefill-Decode 解耦架构下的 KV Cache 跨节点传输,充分释放分离式推理架构的性能潜力。

    🚀 典型使用场景

    场景一:长上下文 AI 智能体

    智能体在执行多步骤任务时,System Prompt 和工具定义往往非常长(数万 Token),且每次请求都需重新计算。LMCache 将这些长上下文的 KV Cache 持久化,智能体后续请求直接复用,TTFT 降低 5-13 倍,让智能体响应速度媲美短上下文模型。

    📌 案例:某 AI 编程助手集成 LMCache 后,平均响应延迟从 2.3s 降至 0.4s,用户体验质的飞跃。

    场景二:企业级 RAG 知识增强服务

    RAG 应用中,知识库文档的 KV Cache 可以在所有用户查询间共享。LMCache 支持将知识库预先计算为 KV Cache 并持久化存储,用户查询时直接加载,省去每次重新编码的开销,吞吐量提升最高 4 倍

    📌 案例:某金融研报分析平台使用 LMCache 缓存 200+ 份研报的 KV Cache,QPS 提升 3.8 倍,GPU 成本降低 60%。

    场景三:多轮对话 SaaS 服务

    多轮对话中,历史对话的 KV Cache 可以跨轮次复用。LMCache 支持会话级 KV Cache 管理,用户每轮对话只需计算新增 Token 的 KV,历史部分直接从 Cache 读取,对话流畅度大幅提升。

    💡 推荐理由

    LMCache 是我近期深入研究的 LLM 推理加速项目,推荐它的理由非常充分:

    • 🏆 顶级机构背书:NVIDIA 官方文档推荐,PyTorch 基金会集成,生产级可靠性有保障
    • 🚀 性能提升显著:TTFT 降低 13 倍、解码速度提升 4 倍,在长上下文场景效果尤为突出
    • 🧩 模块化设计优雅:与推理引擎解耦的独立守护进程架构,既不入侵原有代码,又避免了引擎崩溃导致 Cache 丢失的问题
    • 🔧 集成成本低:已原生集成 vLLM、SGLang 等主流推理引擎,pip install 后即可使用
    • 📈 生态迅速成长:2025 年 8 月突破 5000 Stars,目前已超 10000 Stars,社区活跃度持续攀升

    如果你正在构建基于长上下文的 AI 应用(智能体、RAG、多轮对话),LMCache 几乎是必选项。它解决的是一个真实且棘手的工程问题——如何在高并发场景下高效复用 KV Cache,而不只是停留在论文里的美好想法。

    📥 下载地址

    📅 本文收录于《GitHub 热门 AI 开源项目》系列,持续更新中 🚀

  • Strix:开源AI渗透测试工具,让AI智能体像真实黑客一样发现漏洞(31.6K Stars)

    Strix:开源AI渗透测试工具,让AI智能体像真实黑客一样发现漏洞(31.6K Stars)

    🛡️ Strix:开源AI渗透测试工具,让AI智能体像真实黑客一样发现漏洞

    Strix
    Autonomous AI Penetration Testing
    ⭐ 31.6K Stars
    🐍 Python
    📄 Apache-2.0
    🏢 useStrix

    📌 项目简介

    Strix 是一款开源的 AI 驱动的渗透测试工具,由 useStrix 团队维护(YC W25 孵化项目)。它用自主AI智能体模拟真实黑客的攻击行为——动态执行代码、发现漏洞、验证PoC(概念验证),覆盖从侦察、利用到验证的完整渗透测试流程。与传统静态分析工具的高误报率不同,Strix 通过实际利用来验证漏洞,输出可工作的PoC,让开发者和安全团队在几小时内完成传统需要数周的渗透测试。

    ⚙️ 安装要求与过程

    环境要求

    • Docker 必须已启动(用于沙箱隔离执行)
    • ✅ 任意支持的 LLM 提供商 API 密钥(OpenAI / Anthropic / Google / 本地模型等)
    • ✅ Python 3.10+(仅使用 PyPI 包时)

    快速安装(3步搞定)

    # 1. 一键安装 Strix
    curl -sSL https://strix.ai/install | bash
    
    # 2. 配置 AI 提供商(支持 OpenAI / Claude / Gemini 等)
    export STRIX_LLM="openai/gpt-5.4"
    export LLM_API_KEY="your-api-key"
    
    # 3. 运行首次安全评估
    strix --target ./app-directory

    📦 首次运行会自动拉取沙箱 Docker 镜像,结果保存到 strix_runs/<run-name> 目录。

    ✨ 核心功能

    🤖
    多智能体渗透测试
    多个AI渗透测试智能体协作——分工负责侦察、利用、后渗透阶段,像红队一样动态协调、共享发现、链式利用漏洞,并行执行提升覆盖效率。

    🔍
    真实漏洞验证(非误报)
    与传统静态分析工具的高误报率不同,Strix 通过实际执行利用代码来验证漏洞,输出可工作的PoC(概念验证),确保每一个报告的问题都是真实可利用的。

    🧰
    完整渗透测试工具链
    内置 HTTP 拦截代理(Caido)、浏览器漏洞利用(Playwright)、命令执行环境、自定义漏洞运行时(Python 沙箱)、侦察与OSINT、动静态代码分析(SAST+DAST)、结构化漏洞知识库(CVSS + OWASP 分类)。

    🔧
    自动修复与合规报告
    不仅发现问题,还能生成安全补丁(AI 自动修复)和符合 SOC 2 / ISO 27001 / PCI DSS 标准的渗透测试报告,一键即可生成可直接提交的漏洞报告。

    🚀
    CI/CD 原生集成
    无交互模式(-n/--non-interactive)完美适配自动化场景,GitHub Actions 工作流仅需 10 行配置,即可在每次 Pull Request 时自动扫描漏洞,在代码合并前阻断安全风险。

    🚀 典型使用场景

    场景一:PR 合并前的自动安全门禁
    在 GitHub Actions 中配置 Strix,每次 PR 提交时自动触发安全扫描。Strix 会自动将扫描范围限定在变更文件(diff-scope),快速完成审查。发现漏洞时以非0退出码阻断合并,并自动生成包含PoC和修复建议的安全报告。传统渗透测试需要数周,Strix 在 CI 流水线中仅需分钟级完成。
    场景二:Bug Bounty 自动化辅助
    安全研究员使用 Strix 对目标应用进行自动化漏洞挖掘。Strix 的智能体协作机制可同时覆盖 OWASP Top 10 的八大类漏洞(访问控制、注入攻击、服务端漏洞、客户端攻击、业务逻辑缺陷、认证与会话、基础设施与云安全、API 安全),并自动生成可用于漏洞报告提交的 PoC 脚本,大幅提升 Bug Bounty 研究的效率与覆盖深度。
    场景三:本地代码仓库的白盒安全审计
    开发者运行 strix --target ./app-directory,Strix 在 Docker 沙箱内动态执行应用代码,结合 SAST(静态应用安全测试)和 DAST(动态应用安全测试)双重分析,精准发现硬编码密钥、SQL 注入、SSRF 等传统工具难以触达的深层漏洞。支持通过 --instruction 参数指定重点关注的业务逻辑缺陷类型。

    💡 推荐理由

    在 AI 辅助开发日益普及的今天,安全责任正在向左迁移——开发者需要在代码提交前就能发现安全问题。传统 SAST 工具(如 Bandit、Semgrep)误报率高,而专业渗透测试周期长、成本高。Strix 用 AI 智能体填补了这个空白:

    • 🎯 真实可利用性验证:不只报告潜在问题,而是实际执行利用代码,输出可工作的 PoC,将误报率降至最低。
    • 🤝 多智能体协作:像真实红队一样分工协作,侦察智能体发现攻击面 → 利用智能体验证漏洞 → 后渗透智能体评估影响范围,链式利用让漏洞发现更系统。
    • 🔗 DevSecOps 无缝集成:GitHub Actions / GitLab CI 仅需 10 行配置,PR 差异范围自动扫描,安全门禁无感嵌入开发流程。
    • 🌐 支持广泛 LLM 提供商:通过 LiteLLM 支持 OpenAI / Anthropic / Google / Azure / AWS Bedrock / 本地模型(Ollama),可灵活选择兼顾成本与效果的最佳模型。

    作为 YC W25 孵化的开源项目,Strix 在短短数月内获得 3.1 万+ stars,已成为 AI 安全测试领域最受关注的开源工具之一。无论你是开发者、安全工程师还是 DevSecOps 团队,Strix 都值得加入你的安全工具链。

    📥 下载地址

    📌 本文由 AI 助手自动生成,数据来源:GitHub + 项目官方 README。Strix 采用 Apache-2.0 开源许可,由 useStrix 团队维护(YC W25)。
  • TimesFM:Google Research 开源时间序列基础预测模型,25.9K Stars 让时序预测变得简单

    TimesFM:Google Research 开源时间序列基础预测模型,25.9K Stars 让时序预测变得简单

    TimesFM:Google Research 开源时间序列基础预测模型,25.9K Stars 让时序预测变得简单

    Google Research Logo
    Google Research 官方博客

    项目简介

    TimesFM(Time Series Foundation Model)是由 Google Research 开发的预训练时间序列基础模型,专门用于时间序列预测任务。不同于传统需要针对每个数据集单独训练的预测模型,TimesFM 作为一个基础模型,经过大规模预训练后可以直接对未见过的时序数据进行零样本(Zero-shot)预测,就像大语言模型(LLM)处理文本一样革命性地简化了时序预测流程。

    该项目已在 Google 多款产品中落地:BigQuery ML(企业级 SQL 时序预测)、Google Sheets(表格预测功能)、Vertex AI Model Garden(Docker 化部署端点),是学术界与工业界共同认可的时序预测新范式。

    安装要求和过程

    环境要求

    • Python:3.9 及以上版本
    • 后端选择:PyTorch 或 Flax/JAX(二选一)
    • 硬件支持:CPU、GPU、TPU、Apple Silicon(M系列芯片)全平台兼容
    • 磁盘空间:模型约 200M 参数,下载后约 800MB

    快速安装步骤

    # 方式一:通过 PyPI 安装(推荐)
    # 安装 PyTorch 版本
    pip install timesfm[torch]
    
    # 安装 Flax 版本(推理速度更快)
    pip install timesfm[flax]
    
    # 需要协变量支持时(引入额外特征辅助预测)
    pip install timesfm[xreg]
    
    # 方式二:本地源码安装
    git clone https://github.com/google-research/timesfm.git
    cd timesfm
    pip install -e .[torch]  # 或 [flax] / [xreg]

    核心功能

    • ⚡ 长上下文时序预测:TimesFM 2.5 支持最长 16K 的时序上下文输入(2.0 版本仅 2048),可输出最长 1K 的预测 Horizon,适配绝大多数工业场景。
    • 📊 概率预测输出:除点预测外,还支持通过可选的 30M 分位数头输出 10%-90% 共 10 个分位数的连续概率预测,让预测结果包含不确定性信息,对风险敏感场景(金融、供应链)尤为重要。
    • 🔀 多后端支持:同时支持 PyTorch 和 Flax 两大深度学习框架后端,用户可按硬件环境自由选择;Flax 版本在 TPU 上推理速度显著提升。
    • 📈 协变量支持(XReg):通过 XReg 模块可引入额外协变量特征(如节假日标记、促销信息等),有效提升复杂业务场景的预测精度,是 2.5 版本重新引入的重要特性。
    • 🎯 灵活预测配置:支持输入归一化、翻转不变性、正数推断、分位数交叉修正等多种预测配置,用户可根据数据特性精细化调整,获得更可靠的预测结果。

    典型使用场景

    • 📦 企业需求预测:零售企业可利用 TimesFM 对商品销量进行多步预测,输入历史销售数据(支持 16K 长度),输出未来 1K 个时间点的销量预测及置信区间,辅助库存决策和供应链优化。相比传统 ARIMA/Prophet 方法,TimesFM 无需手动特征工程,且对新型商品的冷启动预测表现优异。
    • 📊 业务指标异常预警:运维团队可将服务器 CPU 使用率、API 响应延迟、用户活跃度等关键指标输入 TimesFM,预测未来趋势并提前发现异常苗头。结合分位数预测输出的不确定性区间,可以在指标偏离正常范围之前发出预警,实现从”被动响应”到”主动预防”的转变。
    • 💹 金融时间序列分析:量化分析师可使用 TimesFM 对股票价格、汇率、期货价格等金融时间序列进行建模预测。TimesFM 的零样本预测能力使其可以快速适配不同金融产品,而概率预测输出则为风险评估提供了量化依据。Google Research 在预训练数据中包含了 Wikimedia Pageviews 和 Google Trends 数据,使模型对网络流行趋势类时序具有更好的理解。

    推荐理由

    作为 Google Research 的官方开源项目,TimesFM 代表了时间序列预测从”传统统计方法”向”基础模型范式”的重大转变。我推荐它的理由有以下几点:

    首先,真正的零样本预测能力。传统预测方法(ARIMA、ETS、Prophet)需要针对每个时间序列单独拟合模型,数据量不足时效果很差。TimesFM 在包含千亿级时序数据点的预训练语料上训练,习得了时序数据的通用模式,面对全新数据集时无需微调即可预测,大大降低了使用门槛。

    其次,工业级可用性。TimesFM 已在 Google 自家的 BigQuery ML 和 Google Sheets 中作为生产功能提供服务,经过大规模真实场景验证。2.5 版本将参数量从 500M 压缩到 200M,在保持预测精度的同时大幅提升了推理效率,体现了 Google Research 对实用性的高度重视。

    最后,与 LLM 生态的完美类比。TimesFM 之于时间序列,犹如 GPT/BERT 之于自然语言。对于已经熟悉 LLM 应用的开发者,TimesFM 提供了一条将”基础模型革命”延伸到数值预测任务的清晰路径。随着 AI Agent 对工具调用和外部数据感知的需求日益增长,像 TimesFM 这样的专业基础模型将成为 Agent 工具链的重要一环。

    下载地址

    许可证:Apache-2.0(可自由用于商业和个人项目)

  • UI-TARS-desktop:字节跳动开源多模态GUI Agent,纯视觉理解让AI像人一样操作电脑,37.4K Stars让RPA自动化进入新时代

    UI-TARS-desktop:字节跳动开源多模态GUI Agent,纯视觉理解让AI像人一样操作电脑,37.4K Stars让RPA自动化进入新时代

    🤖

    UI-TARS-desktop

    ByteDance · Apache-2.0 · 37.4K ⭐

    字节跳动开源的多模态 AI Agent 技术栈,通过纯视觉理解实现 GUI 自动化操控,让 AI 像人一样操作电脑、浏览器和桌面应用。

    📌 项目简介

    UI-TARS-desktop 是字节跳动开源的端到端多模态 AI Agent 框架,包含两大核心组件:Agent TARS(通用多模态 AI Agent 技术栈)和 UI-TARS Desktop(基于 UI-TARS 系列模型的桌面原生 GUI Agent 应用)。项目基于纯视觉理解,无需依赖应用 API,通过多模态大模型直接识别 GUI 元素,真正实现”像人一样操作电脑”。

    37.4K
    GitHub Stars

    3.7K
    Forks

    Apache
    开源许可

    TypeScript
    主要语言

    ⚙️ 安装要求和过程

    环境要求

    • Node.js ≥ 22(必需,项目使用 .node-version 指定 22+)
    • pnpm(推荐包管理器)
    • 支持 Windows / macOS / Linux 三平台
    • AI 模型 API Key(火山引擎/Anthropic/OpenAI 等,或本地部署 UI-TARS 模型)

    快速安装(Agent TARS CLI)

    # 方式1: npx 直接启动(无需安装)
    npx @agent-tars/cli@latest
    
    # 方式2: 全局安装
    npm install @agent-tars/cli@latest -g
    agent-tars --provider volcengine   --model doubao-1-5-thinking-vision-pro-250428   --apiKey <你的API密钥>
    
    # 方式3: 使用 Anthropic Claude
    agent-tars --provider anthropic   --model claude-3-7-sonnet-latest   --apiKey <你的API密钥>

    💡 UI-TARS Desktop 桌面版可从 agent-tars.com 下载安装,支持本地算子和远程算子两种模式。

    🚀 核心功能

    1

    🖱️ 纯视觉 GUI 操控

    基于 UI-TARS 系列多模态大模型,通过截图视觉识别直接定位 GUI 元素,实现精准的鼠标点击、键盘输入和拖拽操作,无需应用 API 接入。支持 Windows、macOS、浏览器多平台。

    2

    🌐 混合浏览器 Agent

    支持 GUI Agent 视觉定位、DOM 操作或两者混合的浏览器控制策略。既可以像人一样”看”网页并点击,也可以直接操作 DOM,灵活应对各类网页自动化场景。

    3

    🔄 事件流协议(Event Stream Protocol)

    协议驱动的事件流支持上下文工程和 Agent UI 构建,让开发者可以实时监控 Agent 执行过程、干预决策流程,并基于事件流构建自定义 Agent 交互界面。

    4

    🧰 MCP 原生集成

    内核基于 MCP(Model Context Protocol)构建,同时支持挂载 MCP 服务器对接各类真实世界工具。可无缝接入 Claude Code、Cursor 等 AI 编程助手,扩展 Agent 工具调用能力。

    5

    🤖 双形态:CLI + 桌面应用

    同时提供 Agent TARS CLI(支持无头服务器模式)和 UI-TARS Desktop 原生桌面应用。CLI 适合开发者和服务端部署,桌面应用提供图形化界面,降低非技术用户使用门槛。

    💡 典型使用场景

    🏨

    自动化订票/预订

    通过自然语言指令”帮我在北京找一家500元以内的酒店,距离故宫近”,Agent 自动打开浏览器、搜索、筛选并下单,全程无需人工干预。

    💻

    跨应用工作流自动化

    自动操作 Excel + 浏览器 + 邮件客户端,完成数据抓取、处理、发送的完整工作流。例如:每日自动从网站抓取数据、更新表格、发送报告邮件。

    🧪

    GUI 自动化测试

    替代传统 Selenium/Playwright,通过视觉理解自动测试桌面应用和 Web 界面。无需维护选择器,界面对齐方式变化也不会影响测试稳定性。

    🤝

    AI 编程助手扩展

    接入 Claude Code / Cursor,让 AI 编程助手不仅能写代码,还能自动操作浏览器验证功能、运行桌面应用测试,实现真正的端到端开发自动化。

    ✨ 推荐理由

    纯视觉理解是 GUI 自动化的未来。传统 RPA 工具依赖应用 API 或 DOM 选择器,界面稍有变化就会失效。UI-TARS 通过多模态大模型”看”屏幕,真正模拟人的操作方式,从根本上解决了 GUI 自动化的脆弱性问题。

    字节跳动技术实力保障。作为豆包手机的核心技术支撑,UI-TARS 已在生产环境中验证,不是实验室项目。37K+ Stars 和 3.7K+ Forks 也证明了社区的认可。

    生态完善,开箱即用。MCP 原生集成让它可以无缝接入现有 AI 工具链;CLI + 桌面应用双形态覆盖开发者和普通用户;支持本地模型和云端 API 双模式部署,兼顾隐私和性能。

    📊 项目动态

    • 2026-02:UI-TARS-desktop 开源,登顶 GitHub 热榜,Star 数突破 26K
    • 2026-06:Star 数突破 37K,社区持续活跃,Discord 成员快速增长
    • 作为豆包手机核心技术支撑,生产环境验证可靠性
    • 支持 UI-TARS/Seed-1.5-VL/1.6 系列最新模型

    📅 数据更新至 2026年6月28日 | 信息来源:GitHub