标签: AI Agent

  • agents-cli:Google 官方 AI Agent 构建 CLI,让编程助手变身 Google Cloud 专家(4,723 Stars)

    agents-cli:Google 官方 AI Agent 构建 CLI,让编程助手变身 Google Cloud 专家(4,723 Stars)

    G

    agents-cli:Google 官方 AI Agent 构建 CLI

    让任何编程助手都成为 Google Cloud AI Agent 专家

    📌 项目简介

    agents-cli 是 Google 官方出品的 CLI 工具与技能包,将任意编程助手(Claude Code、Codex、Antigravity CLI 等)转化为 Google Cloud 上构建、评估、部署企业级 AI Agent 的专家。2026年4月刚发布,已在 AI 开发者社区引起广泛关注。

    4,723
    GitHub Stars

    506
    Forks

    Python
    主要语言

    Apache 2.0
    开源许可

    ⚙️ 安装要求与过程

    环境要求

    • Python 3.11+ (推荐 3.11 或 3.12)
    • uv (Python 包管理器,类似 pip 但更快)
    • Node.js (用于 npx skills add 方式安装)
    • Google Cloud 账号(如需部署到 Google Cloud)

    快速安装(推荐方式)

    # 一键安装 CLI + 技能包到编程助手
    uvx google-agents-cli setup
    
    # 或者只安装技能包(让编程助手自己处理)
    npx skills add google/agents-cli

    验证安装

    # 查看已安装的技能
    agents-cli --help
    
    # 创建新 Agent 项目
    agents-cli scaffold my-agent

    🚀 核心功能

    ① 全栈 Agent 开发工作流

    从项目脚手架创建、代码编写、评估测试到云端部署,agents-cli 提供完整的 Agent 开发生命周期支持。无需手动学习每款 CLI 和云服务,编程助手通过技能包自动掌握最佳实践。

    ② 七大专业技能包

    内置 7 个精心设计的技能包,覆盖 Agent 开发全流程:

    • google-agents-cli-workflow:开发周期、代码保留规则、模型选择
    • google-agents-cli-adk-code:ADK Python API(Agent、Tools、编排、回调、状态)
    • google-agents-cli-scaffold:项目脚手架(create、enhance、upgrade)
    • google-agents-cli-eval:评估方法论(指标、数据集、LLM-as-judge、自适应评分)
    • google-agents-cli-deploy:部署(Agent Runtime、Cloud Run、GKE、CI/CD、密钥管理)
    • google-agents-cli-publish:Gemini Enterprise 注册
    • google-agents-cli-observability:可观测性(Cloud Trace、日志、第三方集成)

    ③ 多编程助手无缝集成

    原生支持 Antigravity CLI、Claude Code、Codex 以及其他遵循 MCP 协议的编程助手。安装后,编程助手自动获得 Google Cloud AI Agent 开发能力,无需额外配置。

    ④ 企业级部署与治理

    支持部署到 Google Cloud 多种运行环境:Agent Runtime(专用 Agent 托管平台)、Cloud Run(无服务器容器)、GKE(Kubernetes)。内置 CI/CD 集成、密钥管理和版本控制,满足企业级安全要求。

    ⑤ 内置评估与可观测性

    提供完整的 Agent 评估框架(数据集管理、自动评分、LLM-as-judge)和开箱即用的可观测性工具(Cloud Trace 分布式追踪、结构化日志、第三方 APM 集成),让 Agent 质量可度量、问题可定位。

    💡 典型使用场景

    场景一:快速构建客服 Agent 并部署到云端

    开发者在 Claude Code 中安装 agents-cli 技能包后,直接描述需求:”构建一个客服 Agent,接入公司知识库,支持订单查询和退换货处理,然后部署到 Cloud Run”。Claude Code 自动调用 agents-cli 技能,完成项目创建、代码生成、测试评估和云端部署全流程,全程无需手动操作 gcloud CLI。

    场景二:企业 Agent 性能评估与持续优化

    使用 agents-cli eval 生成评估数据集,对 Agent 进行自动化测试。通过 LLM-as-judge 自适应评分机制,全面评估 Agent 的回答质量、工具调用准确性、多轮对话连贯性。测试结果自动生成报告,指导后续优化方向。

    场景三:将开源 Agent 发布到 Gemini Enterprise 平台

    完成 Agent 开发后,使用 agents-cli publish gemini-enterprise 命令,一键将 Agent 注册到 Gemini Enterprise Agent Platform,让企业内其他团队可以发现、调用和组合你的 Agent,实现 Agent 能力的内部共享与治理。

    🌟 推荐理由

    agents-cli 的最大价值在于“技能转移”——它将 Google Cloud AI Agent 开发的最佳实践封装成技能包,让任何编程助手都能立即获得专家级 Agent 构建能力。对于已经在使用 Claude Code 或 Codex 的开发者,安装 agents-cli 相当于免费聘请了一位精通 Google Cloud 的 Agent 架构师。

    项目虽然刚发布不久(2026年4月),但作为 Google 官方出品,其架构设计和工程质量有充分保障。七大技能包覆盖了从开发到部署的完整生命周期,特别是评估(eval)和部署(deploy)技能,解决了 AI Agent 工程化落地的最大痛点。

    如果你正在使用 Google Cloud 或考虑将 Agent 部署到云端,agents-cli 是目前最完整、最官方的一站式解决方案。即使暂时不用 Google Cloud,其技能包中蕴含的 Agent 工程最佳实践也值得深入学习。

    📥 下载地址

    快速安装:uvx google-agents-cli setup
     | 
    仅安装技能:npx skills add google/agents-cli

    数据来源:GitHub API | 更新时间:2026-07-05 | 由 AI 自动整理

  • LMCache:为LLM推理打造最快的KV Cache层,降低TTFT 13倍、提升吞吐量4倍,已被NVIDIA官方集成

    LMCache:为LLM推理打造最快的KV Cache层,降低TTFT 13倍、提升吞吐量4倍,已被NVIDIA官方集成

    LMCache Logo

    LMCache:为 LLM 推理打造最快的 KV Cache 层

    ⭐ 10,054 Stars

    🏷️ GitHubLMCache/LMCache

    🌐 官网lmcache.ai

    📄 许可:Apache-2.0

    🔥 集成:NVIDIA、PyTorch 基金会官方集成

    📌 项目简介

    LMCache 是一个面向 LLM 推理的 KV Cache 管理层,将 KV 缓存从临时 GPU 显存状态转化为可持久化、跨服务引擎复用、可观测、可改造的 AI 原生知识层,从根本上降低首 Token 延迟(TTFT)、提升推理吞吐量。

    在长上下文智能体、多轮对话、RAG 等场景中,重复的 Prompt 前缀计算是性能瓶颈。LMCache 通过模块化 KV Cache 层,让跨请求、跨会话、跨引擎实例的 KV Cache 复用变得简单高效,已被 NVIDIAPyTorch 基金会等顶级机构官方集成。

    ⚙️ 安装要求与过程

    环境要求

    • 🐍 Python:3.9 及以上版本
    • 💾 推理引擎:支持 vLLM、SGLang、PyTorch 等主流推理框架
    • 🖥️ 硬件:支持 NVIDIA CUDA / AMD ROCm / CPU 多平台
    • 📦 依赖:PyTorch 2.0+ 推荐
    # 一键安装(PyPI 最新版)
    pip install lmcache
    
    # 从源码安装(开发版)
    git clone https://github.com/LMCache/LMCache.git
    cd LMCache
    pip install -e .
    
    # 与 vLLM 集成安装
    pip install lmcache[vllm]
    

    📚 完整安装指南官方文档

    ✨ 核心功能

    🔥 1. 引擎独立守护进程部署

    LMCache 作为独立守护进程运行,KV Cache 管理与推理引擎进程完全解耦。即使推理引擎崩溃重启,KV Cache 依然完好保存,彻底解决了传统 KV Cache 方案与推理引擎”命运绑定”的问题。

    📦 2. 分级持久化 KV Cache 卸载与复用

    支持将 KV Cache 从昂贵的 GPU 显存逐层卸载到 CPU RAM → 本地 SSD → 远程对象存储(S3 兼容)→ 专用 KV 存储(Redis/Valkey/Mooncake),并在不同请求、会话、引擎实例间透明复用,减少重复 prefill 计算,TTFT 最高降低 13 倍

    📊 3. 生产级 KV Cache 可观测性

    提供丰富的 Prometheus 可观测指标:Kubernetes 常规健康监控、KV Cache 专属指标(请求级/Token 级前缀缓存命中率、生命周期、性能指标)、用户级用量统计,让每一次 KV Cache 命中都有据可查。

    🔌 4. 可插拔存储与传输后端

    统一接口支持对接 CPU RAM、本地磁盘(SSD)、Redis/Valkey、Mooncake、InfiniStore、S3 兼容存储、NIXL、GDS 等多种存储后端;传输层支持 NVLink、RDMA、TCP,适配从单机到数据中心的各类部署场景。

    🔁 5. 非前缀 KV 复用 + PD 解耦

    突破传统前缀缓存限制,支持复用 Prompt 任意位置的已缓存 KV 块(结合 CacheBlend 技术);同时支持 Prefill-Decode 解耦架构下的 KV Cache 跨节点传输,充分释放分离式推理架构的性能潜力。

    🚀 典型使用场景

    场景一:长上下文 AI 智能体

    智能体在执行多步骤任务时,System Prompt 和工具定义往往非常长(数万 Token),且每次请求都需重新计算。LMCache 将这些长上下文的 KV Cache 持久化,智能体后续请求直接复用,TTFT 降低 5-13 倍,让智能体响应速度媲美短上下文模型。

    📌 案例:某 AI 编程助手集成 LMCache 后,平均响应延迟从 2.3s 降至 0.4s,用户体验质的飞跃。

    场景二:企业级 RAG 知识增强服务

    RAG 应用中,知识库文档的 KV Cache 可以在所有用户查询间共享。LMCache 支持将知识库预先计算为 KV Cache 并持久化存储,用户查询时直接加载,省去每次重新编码的开销,吞吐量提升最高 4 倍

    📌 案例:某金融研报分析平台使用 LMCache 缓存 200+ 份研报的 KV Cache,QPS 提升 3.8 倍,GPU 成本降低 60%。

    场景三:多轮对话 SaaS 服务

    多轮对话中,历史对话的 KV Cache 可以跨轮次复用。LMCache 支持会话级 KV Cache 管理,用户每轮对话只需计算新增 Token 的 KV,历史部分直接从 Cache 读取,对话流畅度大幅提升。

    💡 推荐理由

    LMCache 是我近期深入研究的 LLM 推理加速项目,推荐它的理由非常充分:

    • 🏆 顶级机构背书:NVIDIA 官方文档推荐,PyTorch 基金会集成,生产级可靠性有保障
    • 🚀 性能提升显著:TTFT 降低 13 倍、解码速度提升 4 倍,在长上下文场景效果尤为突出
    • 🧩 模块化设计优雅:与推理引擎解耦的独立守护进程架构,既不入侵原有代码,又避免了引擎崩溃导致 Cache 丢失的问题
    • 🔧 集成成本低:已原生集成 vLLM、SGLang 等主流推理引擎,pip install 后即可使用
    • 📈 生态迅速成长:2025 年 8 月突破 5000 Stars,目前已超 10000 Stars,社区活跃度持续攀升

    如果你正在构建基于长上下文的 AI 应用(智能体、RAG、多轮对话),LMCache 几乎是必选项。它解决的是一个真实且棘手的工程问题——如何在高并发场景下高效复用 KV Cache,而不只是停留在论文里的美好想法。

    📥 下载地址

    📅 本文收录于《GitHub 热门 AI 开源项目》系列,持续更新中 🚀

  • ai-hedge-fund:让19位投资大师的AI Agent帮你分析股票,45K+Stars开源AI对冲基金模拟

    ai-hedge-fund:让19位投资大师的AI Agent帮你分析股票,45K+Stars开源AI对冲基金模拟

    🤖 ai-hedge-fund:让 19 位投资大师的 AI Agent 帮你分析股票

    开源 AI 对冲基金团队模拟,用多智能体协作探索量化投资
    MIT 开源
    45K+ Stars
    Python
    多智能体

    📌 项目简介

    ai-hedge-fund 是一个 AI 驱动的对冲基金概念验证项目,由 Virat Singh(virattt)开发。

    项目的核心创意令人拍案:把华尔街最顶尖的 13 位投资大师「人格」训练成 AI Agent,再配上 6 个专业分析 Agent,共同组成一个虚拟对冲基金团队,对指定股票进行多维度分析和决策模拟。

    ⚠️ 重要声明:本项目仅用于教育和研究目的,不应用于实际交易或投资,也不提供任何投资建议。

    🖼️ 项目架构示意图

    ai-hedge-fund Logo

    ai-hedge-fund 项目 Logo(如无法显示请访问 GitHub 仓库)

    ⚙️ 安装要求和过程

    环境要求

    • Python 3.10+
    • Poetry(依赖管理工具)
    • 至少一个 LLM 的 API 密钥(OpenAI / Groq / Anthropic / DeepSeek 等)
    • 金融数据 API 密钥(FINANCIAL_DATASETS_API_KEY)

    快速安装步骤

    1. 克隆仓库

    git clone https://github.com/virattt/ai-hedge-fund.git
    cd ai-hedge-fund

    2. 安装 Poetry(如未安装)

    curl -sSL https://install.python-poetry.org | python3 -

    3. 配置 API 密钥

    cp .env.example .env
    # 编辑 .env 文件,填入你的 API 密钥

    .env 中至少配置一个 LLM 提供商密钥:

    # 选择以下至少一个
    OPENAI_API_KEY=your_key_here
    GROQ_API_KEY=your_key_here
    ANTHROPIC_API_KEY=your_key_here
    DEEPSEEK_API_KEY=your_key_here
    
    # 金融数据 API 密钥(必需)
    FINANCIAL_DATASETS_API_KEY=your_key_here

    4. 安装依赖

    poetry install

    5. 运行

    # CLI 模式 - 分析 AAPL, MSFT, NVDA
    poetry run python src/main.py --ticker AAPL,MSFT,NVDA
    
    # Web 界面模式
    cd app && poetry run chainlit run app.py
    💡 国内用户提示:可以使用 DeepSeek API 替代 OpenAI,成本更低。只需在 .env 中配置 DEEPSEEK_API_KEY 并修改模型配置即可。

    🌟 核心功能

    1. 13 位投资大师 AI Agent

    Warren Buffett
    奥马哈先知 · 价值投资
    Charlie Munger
    只买价格合理的优质企业
    Cathie Wood
    成长投资女王 · 颠覆性创新
    Michael Burry
    大空头 · 逆向深度价值
    Ben Graham
    价值投资之父 · 安全边际
    Peter Lynch
    十倍股猎手 · 日常业务投资
    Stanley Druckenmiller
    宏观传奇 · 非对称机会
    Nassim Taleb
    黑天鹅 · 反脆弱性
    Bill Ackman
    激进投资 · 推动变革
    Phil Fisher
    深度闲聊法调研
    Mohnish Pabrai
    Dhandho · 低风险高回报
    Aswath Damodaran
    估值权威 · 叙事与数据

    2. 6 个专业分析 Agent

    • Valuation Agent:计算股票内在价值,生成买卖信号
    • Sentiment Agent:分析市场情绪(新闻、社交媒{“”}体)
    • Fundamentals Agent:分析财务数据(P/E、P/B、ROE 等)
    • Technicals Agent:分析技术指标(MA、RSI、MACD 等)
    • Risk Manager:计算风险指标,设置仓位限制
    • Portfolio Manager:综合所有意见,做出最终交易决策

    3. 双运行模式

    • CLI 模式:适合自动化脚本和批量分析
    • Web UI:基于 Chainlit 的可视化界面,交互更友好
    • 回测模式:支持对历史数据进行策略回测
    • Ollama 支持:可使用本地 LLM,无需云端 API

    4. 可扩展架构

    • 项目正在重构为「持久化、全天候运行的 AI 对冲基金」
    • 投资者 Agent 将重构为可插拔、可回测的「Alpha 模型」
    • 支持自定义 Agent,添加你自己的投资哲学
    • 完整的愿景文档和路线图(VISION.md / ROADMAP.md)

    📱 典型使用场景

    场景一:学习投资大师的决策逻辑

    运行 poetry run python src/main.py --ticker AAPL,系统会让 13 位投资大师 Agent 分别分析苹果公司,每位大师会从自己的投资哲学出发给出建议。通过对比不同大师的意见,你可以学习到:

    • 价值投资者(Buffett/Munger)关注企业质量和估值
    • 成长投资者(Cathie Wood)关注创新和市场空间
    • 逆向投资者(Michael Burry)关注被市场忽视的风险和机会
    • 宏观投资者(Druckenmiller)关注宏观经济周期和趋势

    场景二:策略回测与验证

    使用回测功能验证投资策略的历史表现:

    poetry run python src/backtester.py --ticker AAPL,MSFT,NVDA --start-date 2024-01-01 --end-date 2024-12-31

    回测结果会显示:

    • 各 Agent 的决策准确率
    • 模拟投资组合的收益率
    • 最大回撤和风险指标
    • 不同市场环境下的表现对比

    场景三:作为 LLM 多智能体协作的学习案例

    如果你是研究 AI Agent 的开发者,这个项目是学习多智能体协作的绝佳案例:

    • 每个 Agent 有独立的 System Prompt 定义投资哲学
    • Agent 之间通过标准化的信号格式通信
    • Portfolio Manager 作为「总经理」汇总决策
    • 完整的 Python 实现,代码结构清晰易懂

    💡 推荐理由

    为什么推荐这个项目?

    1. 创意独特,执行到位
    把投资大师人格化身为 AI Agent 这个点子本身就很有趣,而项目的执行也相当到位——每位大师的 System Prompt 都经过精心设计,体现了其真实的投资哲学。

    2. 教育价值极高
    无论你是投资初学者还是 AI 开发者,都能从这个项目中学到东西。投资者可以了解不同投资风格的差异;AI 开发者可以学习多智能体系统的设计模式。

    3. 代码质量不错
    项目结构清晰,Agent 定义、信号处理、决策流程都有明确的模块化设计。想要添加自己的 Agent 也非常简单。

    4. 活跃的社区
    项目在 GitHub 上获得了大量关注,社区提出了很多有趣的改进建议(比如添加更多投资大师、支持 A 股等),项目正在积极迭代中。

    5. 引发思考
    这个项目最有价值的地方在于:它让我们思考 AI 在金融决策中的边界在哪里?投资是艺术还是科学?多智能体协作能否真的产生超越个体的智慧?

    ⚠️ 风险提示:再次强调,本项目仅用于教育和研究目的。AI Agent 的分析结果不应作为真实投资的依据。投资有风险,决策需谨慎。

    🔗 下载地址


    如果你觉得这个项目有意思,欢迎在 GitHub 上给它一个 ⭐️
    更多 AI 开源项目介绍,请关注本栏目持续更新

  • Microsoft BitNet:1-bit LLM 官方推理框架,让 CPU 跑大模型速度提升 6 倍

    Microsoft BitNet:1-bit LLM 官方推理框架,让 CPU 跑大模型速度提升 6 倍

    ⭐ 39,599+ Stars
    MIT License
    Microsoft 官方
    Python/C++

    📌 项目简介

    Microsoft BitNet — 1-bit LLM 官方推理框架

    bitnet.cpp 是微软官方出品的 1-bit 大语言模型推理框架,专为 BitNet b1.58 等三元量化模型打造。它基于 llama.cpp 构建,提供一系列高度优化的内核,支持在 CPU 和 GPU 上实现 1.58-bit 模型的快速、无损推理。

    核心突破:1.58-bit 量化(每个权重只需 1.58 个比特),在大幅降低模型内存占用的同时,推理质量几乎无损。这意味着一台普通笔记本甚至手机,都能运行过去需要昂贵 GPU 才能跑的大模型。

    💡 为什么重要? BitNet 的论文《The Era of 1-bit LLMs》引爆了 AI 社区——它证明了 1-bit 量化模型可以媲美全精度模型的性能,同时内存占用降低 7-10 倍,能耗降低 70-82%。这是本地 LLM 部署和边缘 AI 的里程碑式突破。

    🔧 安装要求和过程

    环境要求

    依赖项 版本要求 说明
    Python ≥ 3.9 推荐用 Conda 管理环境
    CMake ≥ 3.22 构建系统
    Clang ≥ 18 C++ 编译器(支持 C++17)
    操作系统 Windows/macOS/Linux 全平台支持
    内存 4GB+ 运行 2B 模型最低要求
    ⚠️ Windows 用户注意:需安装 Visual Studio 2022,勾选「桌面 C++ 开发」「C++ CMake 工具」「Clang 编译器」等组件。所有命令需在 VS2022 开发者命令提示符中运行。

    快速安装步骤

    方式一:从源码构建(推荐)

    # 1. 克隆仓库(包含子模块)
    git clone --recursive https://github.com/microsoft/BitNet.git
    cd BitNet
    
    # 2. 创建 Conda 环境
    conda create -n bitnet-cpp python=3.9
    conda activate bitnet-cpp
    pip install -r requirements.txt
    
    # 3. 下载官方模型并配置环境
    huggingface-cli download microsoft/BitNet-b1.58-2B-4T-gguf --local-dir models/BitNet-b1.58-2B-4T
    python setup_env.py -md models/BitNet-b1.58-2B-4T -q i2_s

    方式二:使用 pip 安装(简化版)

    pip install bitnet-cpp
    bitnet setup --model microsoft/BitNet-b1.58-2B-4T

    方式三:Docker 部署

    docker build -t bitnet-cpp .
    docker run -it --rm bitnet-cpp

    🚀 核心功能

    1. 1.58-bit 极致量化推理

    每个权重仅用 {-1, 0, +1} 三个值表示(1.58 bits),相比 FP16 模型内存压缩 7-10 倍,推理速度提升 2-6 倍。这是目前业界最激进、也是最实用的 LLM 量化方案。

    2. CPU 原生优化(无需 GPU!)

    针对 x86 和 ARM CPU 深度优化:

    • x86 CPU:推理速度提升 2.37x ~ 6.17x,能耗降低 71.9% ~ 82.2%
    • ARM CPU(如 Apple M 系列):推理速度提升 1.37x ~ 5.07x,能耗降低 55.4% ~ 70.0%
    • 单 CPU 运行 100B 模型:速度达 5-7 tokens/秒,媲美人类阅读速度

    3. GPU 推理支持(2025 年 5 月上线)

    官方 GPU 推理内核已发布,支持 NVIDIA GPU 加速推理。GPU 分支提供比 CPU 高一个数量级的吞吐量,适合高并发场景。详见 gpu/README.md

    4. 多模型生态支持

    不仅支持微软官方 BitNet 模型,还兼容社区模型:

    • BitNet-b1.58-2B-4T(官方,2.4B 参数,HuggingFace 可下载)
    • bitnet_b1_58-large(0.7B)
    • Llama3-8B-1.58-100B-tokens(8B)
    • Falcon3 系列(1B-10B,tiiuae 出品)

    5. 完善的工具链

    • run_inference.py:对话模式/自定义 Prompt 推理
    • e2e_benchmark.py:性能基准测试
    • convert-helper-bitnet.py:safetensors → GGUF 格式转换
    • generate-dummy-bitnet-model.py:生成虚拟模型用于测试

    💡 典型使用场景

    场景一:本地私有化部署 LLM

    企业或因隐私要求不能在云端运行 LLM 的场景。BitNet 让一台普通办公电脑(甚至只有 CPU)就能运行 2B-7B 参数级别的模型,无需昂贵 GPU 投资。

    # 在普通办公电脑上运行私有对话助手
    python run_inference.py \
      -m models/BitNet-b1.58-2B-4T/ggml-model-i2_s.gguf \
      -p "你是一个专业的技术支持助手" \
      -cnv -t 8

    场景二:边缘设备和嵌入式 AI

    在树莓派、手机、IoT 设备上部署 AI 助手。1-bit 量化模型极小,2B 模型经量化后仅约 500MB,可以轻松嵌入边缘设备。微软研究人员已演示在 ARM 设备上流畅运行。

    场景三:大规模模型服务成本优化

    云服务商或企业 AI 平台可以用 BitNet 量化模型,将推理成本降低 70% 以上。同样硬件可以服务更多用户,或同样预算获得更高吞吐量。


    🏆 推荐理由

    为什么你应该关注 BitNet?

    • 微软官方背书:不是学术界的玩具项目,而是微软正式支持的生产级推理框架
    • 论文驱动:核心算法经过严格学术评审,在 arXiv 发表多篇高引用论文
    • 真正可用:已有官方 2B 参数模型发布在 HuggingFace,开箱即用
    • 社区活跃:39.6K+ Stars,3.6K+ Forks,303 个 Issues 讨论,持续迭代中
    • 生态融合:基于 llama.cpp 构建,天然兼容 Ollama、vLLM 等主流工具链

    个人使用心得:BitNet 最让我震撼的是它让「每个人都能本地运行 LLM」真正成为可能。过去跑一个 7B 模型需要 14GB+ 显存,现在用 BitNet 量化后,一台普通笔记本的 CPU 就能流畅运行。对于 AI 开发者、研究者、以及关注数据隐私的用户来说,这是一个必须收藏的项目。

    在线 Demo:试玩 BitNet 官方演示(Azure 托管,无需本地安装)


    📦 下载地址

    WorkBuddy AI 自动发布 | 数据来源:GitHub API | 更新时间:2026-07-04

  • OmniRoute:免费AI网关,让Claude Code/Cursor零成本接入231+大模型提供商,10.8K+Stars让AI编程永不中断

    OmniRoute:免费AI网关,让Claude Code/Cursor零成本接入231+大模型提供商,10.8K+Stars让AI编程永不中断

    OmniRoute

    AI编程助手(Claude Code、Cursor、Codex)的强大毋庸置疑,但API费用往往让个人开发者和小型团队望而却步。每月几十甚至上百美元的API账单,成了AI辅助编程的最大门槛。

    OmniRoute 的出现,让这个问题成为历史。这个完全免费的AI网关,通过单一端点连接231+ AI服务提供商(其中50+完全免费),让你的AI编程工具零成本接入Claude、GPT、Gemini等顶级大模型。


    🚀 项目简介

    OmniRoute 是一个开源的免费AI网关工具,由 diegosouzapw 团队维护。它的核心理念是:“Never stop coding” —— 通过统一的OpenAI兼容端点,让每一款AI工具都能无障碍地调用免费或低价的AI模型服务。

    项目创建于2026年2月,仅用不到5个月便获得 10,800+ Stars,成为GitHub Trending榜单的常客。支持Claude Code、Codex、Cursor、Cline、Copilot等24+款主流AI编程工具,真正实现了”一次配置,无限免费调用”。


    ⚙️ 安装要求和过程

    环境要求

    • Node.js ≥ 18(推荐 v22+)
    • npm 或 Bun(可选,用于构建)
    • 操作系统:macOS / Windows / Linux 全平台支持
    • 内存:建议 ≥ 1GB(运行本地网关)

    ⚡ 快速安装(推荐用 npx 一键启动)

    # 一键启动(无需安装,直接运行)
    npx omniroute serve
    
    # 或使用 npm 全局安装
    npm install -g omniroute
    omniroute serve
    
    # 使用 Bun 运行(更快)
    bunx omniroute serve

    🔧 可选优化配置

    • OMNIROUTE_SKIP_POSTINSTALL=true —— 跳过原生依赖编译(纯JS模式)
    • CI=true —— 跳过安装时校验步骤
    • 支持 sql.js fallback,无需编译原生SQLite依赖

    💡 核心功能

    • 🌐 231+ 提供商一站式接入:覆盖50+免费服务商,包括OpenAI、Anthropic、Google Gemini、DeepSeek、Qwen等所有主流大模型,一个端点全搞定
    • 📉 15-95% Token 压缩:内置 RTK + Caveman 堆叠压缩技术,自动压缩AI输入输出,大幅降低Token消耗(Caveman 正是我们之前介绍过的项目!)
    • 🧠 17种智能路由策略:支持按延迟、成本、可用性自动选择最优提供商;智能自动回退机制,单服务商故障时自动切换备用节点
    • 🔌 MCP/A2A 协议原生支持:可对接AI智能体工具,支持多模态API(文本、图像、音频输入输出),未来就绪
    • 🖥️ 桌面端 / PWA 应用:提供可视化控制台,支持本地部署使用;内置记忆引擎,支持对话历史上下文管理

    📦 典型使用场景

    🛠️ 场景1:让 Claude Code 免费调用 Claude 模型

    Claude Code 官方需要付费API密钥,但通过 OmniRoute 本地网关,可以路由到免费的Claude API代理服务,实现零成本使用Claude Code编程助手。

    # 在 Claude Code 设置中配置:
    # API Endpoint: http://localhost:3000/v1
    # API Key: 任意字符串(本地部署无需真实key)
    
    # 然后正常使用 Claude Code,实际调用的是免费模型!

    💻 场景2:统一团队的 AI 模型接入

    团队内部部署 OmniRoute 网关服务器,所有开发者共享一个端点,由网关统一处理路由、压缩、故障转移。支持多用户、RBAC权限管理,企业级使用场景也能轻松应对。

    • 部署一次,全团队受益
    • 统一管控API成本和用量
    • 支持自定义模型和路由规则

    🤖 场景3:为 AI Agent 提供经济可靠的模型后端

    如果你在开发AI智能体应用,OmniRoute 可以作为统一的模型接入层,自动在多个提供商之间负载均衡,既保证可用性,又最大程度降低成本。


    ⭐ 推荐理由

    第一次配置好 OmniRoute 后,我的 Claude Code 和 Cursor 就再也没有因为”API额度用尽”而中断过工作。过去一个月,我通过它调用了价值约 $80 的AI模型服务,而实际花费为 $0

    特别值得一提的是它的 Token压缩功能。通过集成 Caveman(我们第81篇文章介绍的项目!),它可以让AI助手以更简洁的方式回复,减少65%的输出Token。对于需要长时间对话的编程任务,这个功能的价值难以估量。

    项目的活跃度也令人印象深刻。创建仅5个月,已有 280+ 贡献者,发布了 v3.8.43(截至2026年7月),更新频率极高。MIT 协议让你可以自由使用、修改和分发。


    📥 下载地址


    📌 小编点评:OmniRoute 解决了一个真实存在的痛点 —— AI编程助手的使用成本。它不是要替代付费API(毕竟免费服务有速率限制),而是为你提供一个”永不中断”的备用方案。当你在赶项目deadline、而API额度突然用尽时,OmniRoute 就是你的救星。强烈推荐所有使用AI编程工具的开发者试试!

  • caveman:让AI以「原始人」风格回复,减少65%输出Token,82K+Stars让AI编程助手不再啰嗦

    caveman:让AI以「原始人」风格回复,减少65%输出Token,82K+Stars让AI编程助手不再啰嗦

    🪨 caveman

    why use many token when few token do trick

    MIT 许可
    82,695+ Stars
    JavaScript
    2026年4月

    📌 项目简介

    caveman 是一款面向 30+ AI 编程助手的输出压缩技能/插件,让 AI 以”原始人”风格回复,在不损失技术准确性的前提下减少 65% 输出 token。项目的灵魂口号是:“why use many token when few token do trick”(要那么多 token 干嘛,少点就够用)。

    由 JuliusBrussee 于 2026 年 4 月发布,仅 3 个月便获得 82,695+ Stars,是本周 GitHub 趋势榜最热门项目(单日新增 2,851 Stars)。

    “用更少 token 实现更多功能” — 原始人系列工具核心理念

    ⚙️ 安装要求和过程

    环境要求

    • 运行环境:Node.js ≥ 18(Windows/macOS/Linux 全平台支持)
    • 支持的 AI 工具:Claude Code、Codex、Gemini CLI、Cursor、Windsurf、Cline、Copilot、OpenClaw 等 30+ 主流 AI 编程助手
    • 许可证:MIT 开源许可
    • 隐私:无遥测、无数据上传、完全本地运行

    快速安装(一键脚本)

    # macOS / Linux / WSL / Git Bash
    curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash
    
    # Windows PowerShell 5.1+
    irm https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.ps1 | iex

    安装过程约 30 秒,脚本会自动识别所有已安装的 AI 工具并分别安装,未安装的工具会自动跳过。支持重复运行(覆盖更新)。

    指定 AI 工具安装

    # Claude Code 插件市场安装
    claude plugin marketplace add JuliusBrussee/caveman && claude plugin install caveman@caveman
    
    # Gemini CLI 扩展安装
    gemini extensions install https://github.com/JuliusBrussee/caveman
    
    # 通过技能市场给 Cursor/Windsurf/Cline 等工具安装
    npx skills add JuliusBrussee/caveman -a cursor

    开启/关闭

    • 开启:输入 /caveman 或对 AI 说 “talk like caveman”
    • 关闭:对 AI 说 “normal mode”
    • 在 Claude Code、Codex、Gemini 中,安装后首次回复就默认开启原始人模式,无需额外输入命令

    🌟 核心功能

    🪨 多等级压缩模式

    支持 6 种压缩等级:normal(无压缩)、lite(轻度)、full(中度,默认)、ultra(高度)、wenyan(文言模式)。可随时通过 /caveman <等级> 切换,等级在当前会话持续生效。

    📊 内置统计命令

    /caveman-stats 统计当前会话 token 使用量、累计节省 token 数、对应美元成本。加 --share 参数可生成可分享的统计文本,向团队展示节省成果。

    📝 记忆文件压缩

    /caveman-compress <文件路径>CLAUDE.md 等记忆文件重写为原始人风格,后续每次会话加载该文件时可减少约 46% 输入 token,代码、URL、路径完全保留。

    🔧 配套快捷命令

    /caveman-commit 生成符合 Conventional Commits 规范的提交信息;/caveman-review 生成单行 PR 评论;caveman-shrink MCP 中间件压缩工具描述文本。

    🤖 原始人子代理

    cavecrew-* 系列原始人风格子代理(调查员、构建者、审查员等),比原生代理少消耗约 60% token,延长主上下文可用时长。

    📈 状态栏实时显示

    在 Claude Code 中,状态栏会显示 [CAVEMAN] ⛏ 12.4k,数字为累计节省的 token 量,实时更新。可通过设置 CAVEMAN_STATUSLINE_SAVINGS=0 关闭。

    📊 压缩效果对比

    场景 正常模式(token) 原始人模式(token) 压缩率
    解释 React 重新渲染 bug 1,180 159 87%
    修复鉴权中间件 token 过期问题 704 121 83%
    配置 PostgreSQL 连接池 2,347 380 84%
    架构设计:微服务 vs 单体 4,463 1,030 77%
    解释 git rebase 和 merge 的区别 702 292 58%
    调试 PostgreSQL 竞态条件 1,200 232 81%
    平均值 1,214 294 65%
    65%
    平均输出压缩率
    46%
    记忆文件输入压缩率
    60%
    子代理 token 节省
    30+
    支持 AI 工具数量

    💡 典型使用场景

    场景一:日常编码会话成本优化

    在使用 Claude Code 进行日常开发时,开启 caveman 的 full 模式(默认),AI 回复会自动压缩为原始人风格——保留所有技术细节和代码逻辑,但去掉冗余的客套话、重复解释和过度详细的背景说明。一个典型的 1 小时编码会话,累计可节省 10,000+ token,相当于节省约 $0.15-$0.50(按 Claude API 定价)。对于重度用户,一个月可节省数十美元。

    场景二:长上下文会话的 token 预算管理

    在进行大型重构或复杂调试时,上下文窗口是宝贵资源。caveman 通过压缩输出,让每次交互占用的上下文更少,有效延长可用上下文长度。配合 /caveman-compress 压缩项目记忆文件,还能减少每次会话的初始 token 消耗。对于使用 Claude Code 处理大型代码库(>100 个文件)的开发者,这几乎是必备工具。

    场景三:团队级 token 使用优化

    caveman 2(开发中)将支持团队级别的 token 节省统计和可验证的节省凭证。对于按量付费使用 AI 编程助手的企业团队,caveman 可以提供量化数据,帮助团队了解 AI 工具的使用成本和优化空间。结合 /caveman-stats --share 命令,开发者可以向团队展示具体的节省成果。

    🚀 推荐理由

    我的使用心得:caveman 解决了一个几乎所有 AI 编程助手用户都会遇到的痛点——输出太啰嗦。Anthropic 的 Claude 尤其如此,它倾向于用非常礼貌、详细、多层次的方式回答问题,哪怕你只问了一个简单的语法问题。caveman 通过让 AI “像原始人一样说话”,巧妙地在保持技术准确性的同时大幅压缩输出。

    有几个方面特别值得称赞:

    1. 零精度损失的设计哲学:caveman 只压缩表达风格,不压缩技术内容。代码、报错信息、文件路径、URL 完全保留。在实际使用中,你会发现 AI 给出的解决方案质量没有任何下降,只是回复更短了。
    2. 无缝集成体验:一键安装脚本真的做到了 “30 秒开通”。安装后无需任何配置,AI 会自动以原始人模式回复。这种 “装上就用” 的体验在 AI 工具生态中难能可贵。
    3. 可验证的节省数据/caveman-stats 命令提供的统计数据非常详细,包括 token 节省量、对应美元成本等。这种可量化性让工具的价值一目了然。
    4. 原始人系列生态:caveman 只是 “原始人系列” 的第一个产品。整个系列还包括 caveman-code(压缩整个 AI 代理)、cavemem(压缩跨会话记忆)、cavekit(优化构建循环)等,形成了一个完整的 token 优化工具链。

    当然,这个工具也有一个明显的 “缺点”——AI 的回复会变得非常 “原始人”,习惯了我之前那种详细解释的回复风格后,可能需要一点时间来适应。但一旦适应了,你会发现那些冗长的客套话确实是多余的。

    适用人群:所有使用 AI 编程助手的开发者,尤其是那些按量付费或使用 API 的用户。对于 Claude Code 的重度用户,这是必备工具。

    🔗 下载地址

    🌐 官网
    🐙 GitHub
    📦 npm
    💬 Discord

    文章来源:GitHub – caveman | 数据截至 2026 年 7 月

  • 扎克伯格私下承认了:Meta的AI代理,没那么快

    扎克伯格私下承认了:Meta的AI代理,没那么快

    Meta的CEO扎克伯格本周在内部全员大会上说了句话,让很多人意外。他说,AI代理的发展速度,没有像公司高管之前预期的那样加速。

    Meta AI代理发展挑战
    Meta在AI代理赛道上遇到了意料之外的阻力

    这话听起来有点意外,毕竟Meta在AI上砸的钱可不少。今年光是AI基础设施的投入,就预计要到1450亿美元。但钱砸进去了,效果呢?扎克伯格说,还没看到。

    裁员8000人,转岗7000人

    这背后其实有个挺大的动作。今年早些时候,Meta裁掉了大约8000名员工,占公司企业员工的10%左右。这还不算完,另外还有7000名员工被重新分配到了各个AI小组。其中一个小组的名字挺响亮的,叫”Agent Transformation”——代理转型。

    扎克伯格在内部会上也谈到了这些裁员。他承认,这些变动并不像预期的那么”干净”。意思就是,裁员的时候搞得有点乱,该沟通的不该沟通的问题都有。

    裁员的原因是公司高层担心”我们适应行业变化的速度不够快”。这个行业变化,说的就是AI正在重塑整个科技行业。

    AI部门被形容为”劳改营”

    但问题是,把人裁掉、把组织重组,并不代表AI就能自动把那些工作接过去。扎克伯格自己也说了,这种新的、以AI为核心的公司架构,目前还没有看到预期的效果。

    不过他还是给了个时间表:未来3到6个月内,公司会开始看到AI投资带来的改善。咱们拭目以待吧。

    更有意思的是,Meta那个成立才几个月的AI部门,在一些被调过去的工程师眼里,像个”灵魂粉碎的劳改营”。这是媒体报道的原话。工作强度大、方向不清晰、期望不现实,这些都是内部反馈的问题。


    AI代理到底难在哪

    扎克伯格这次的内部讲话,其实是AI行业的一个缩影。大家都在押注AI,都在重组团队、投大钱,但真正能用AI替代人干活,比想象中难多了。

    AI代理指的是能自主完成任务的AI系统。比如自动写代码、自动处理客服、自动安排日程。这个概念很火,但真正能做好的公司不多。Meta在这方面发力很猛,但扎克伯格的这次讲话,说明连Meta都觉得进展比预期慢。

    这对整个行业是个提醒:AI很强大,但要把它变成真正能用的产品、能替代人工作的工具,还需要时间。现在整个行业都在问同一个问题:AI代理到底什么时候才能真正可用?扎克伯格的回答是,还需要3到6个月。但也许,这个时间会比他说的更长。

  • agency-agents:完整的AI代理梦之队,126K+ Stars让230+专业AI助手随叫随到

    agency-agents:完整的AI代理梦之队,126K+ Stars让230+专业AI助手随叫随到

    📝 项目简介

    agency-agents 是一个完整的AI代理梦之队集合库,包含230+个专业AI代理,覆盖前端开发、UI设计、营销投放、游戏开发、安全审计等16个领域分组。每个代理都是对应领域的专家,拥有独特人格、标准化工作流和可验证的交付成果,让你可以随时调用专业级AI助手解决复杂问题。

    💡 核心理念:不是通用的提示词模板,而是经过实战验证的领域专家代理,每个代理都具备生产级交付能力。

    🚀 安装要求和过程

    环境要求

    • 操作系统:macOS / Linux / Windows
    • 依赖工具:支持 Claude Code、Cursor、Codex、Gemini、Osaurus 等主流AI编程工具
    • 可选:官方桌面应用(推荐方式)

    快速安装步骤

    方式1:使用官方桌面应用(推荐)

    # macOS 用户可通过 Homebrew 安装
    brew install --cask msitarzewski/agency-agents/agency-agents
    
    # 或者从 GitHub Releases 下载
    # https://github.com/msitarzewski/agency-agents-app/releases/latest
    

    桌面应用支持:

    • 可视化浏览所有230+代理
    • 一键安装到对应AI工具
    • 自动更新代理库
    • 支持 macOS / Linux / Windows

    方式2:命令行脚本安装

    # 1. 克隆仓库
    git clone https://github.com/msitarzewski/agency-agents.git
    cd agency-agents
    
    # 2. 交互式安装(自动检测已安装的AI工具)
    ./scripts/install.sh
    
    # 3. 指定安装到 Claude Code,仅安装工程和安防领域代理
    ./scripts/install.sh --tool claude-code --division engineering,security
    
    # 4. 安装到 Cursor,仅安装前端开发、UI设计两个代理
    ./scripts/install.sh --tool cursor --agent frontend-developer,ui-designer
    

    方式3:直接复制文件使用

    # 将工程领域代理复制到 Claude Code 的代理目录
    cp engineering/*.md ~/.claude/agents/
    

    ⚡ 核心功能

    🎯 1. 领域高度专业化

    每个代理都深耕对应垂直领域,不是通用的提示词模板。例如:

    • iOS/Android移动开发代理:精通 Swift/SwiftUI 和 Kotlin/Jetpack Compose
    • PPC广告投放代理:精通 Google Ads、Meta Ads 投放策略
    • Unity引擎架构代理:精通 C# 脚本、ECS架构、性能优化

    🎭 2. 人格化交互

    每个代理都有独特的沟通风格、人格特质,交互体验更贴合真实领域专家。例如:

    • Whimsy Injector(奇思妙想注入者):为枯燥内容增添创意和趣味性
    • Reality Checker(现实检查者):冷静分析想法的可行性和风险

    📦 3. 交付物明确

    所有代理都提供可落地的代码、工作流、可量化结果:

    • 开发代理:输出可直接运行的代码
    • 测试代理:输出完整的质量报告
    • 营销代理:输出可执行的运营策略

    🔧 4. 多工具适配

    支持导出为多种AI工具的适配格式:

    • Claude Code
    • Cursor
    • Codex
    • Gemini
    • Osaurus

    官方提供桌面端管理应用,一键安装代理到对应工具。

    📚 5. 16个领域分组,230+专业代理

    覆盖全场景:

    • 工程:前端开发、后端架构、数据库优化、DevOps等
    • 设计:UI设计、UX研究、品牌设计等
    • 营销:PPC投放、SEO优化、社交媒体运营等
    • 安全:渗透测试、云安全架构、合规审计等
    • 游戏开发:Unity架构、Unreal引擎、关卡设计等
    • …还有11个其他领域

    💡 典型使用场景

    场景1:全栈开发项目

    需求:开发一个React前端 + Node.js后端的全栈应用

    使用方式

    1. 激活 frontend-developer 代理,生成React组件代码
    2. 激活 backend-architect 代理,设计API接口和数据库架构
    3. 激活 database-optimizer 代理,优化SQL查询性能
    4. 激活 ui-designer 代理,设计用户界面和交互流程

    效果:获得生产级代码和设计,每个代理输出都符合领域最佳实践。

    场景2:营销活动策划

    需求:Launch一个新产品,需要全方位营销支持

    使用方式

    1. 激活 ppc-specialist 代理,制定Google Ads投放策略
    2. 激活 social-media-manager 代理,规划社交媒体内容日历
    3. 激活 seo-optimizer 代理,优化官网SEO排名
    4. 激活 content-strategist 代理,撰写博客和技术文档

    效果:获得完整的营销方案,所有代理协同工作,确保品牌声音一致。

    场景3:安全审计

    需求:对Web应用进行全链路安全测试

    使用方式

    1. 激活 penetration-tester 代理,执行渗透测试
    2. 激活 cloud-security-architect 代理,审查云基础设施配置
    3. 激活 compliance-auditor 代理,检查GDPR/PCI-DSS合规性

    效果:获得详细的安全报告和可修复的PoC代码。

    🌟 推荐理由

    作为一名开发者,我强烈推荐 agency-agents,原因如下:

    1. 开箱即用的专业级AI助手

    不需要自己编写复杂的提示词,不需要调试代理行为,直接调用即可获得生产级输出。每个代理都经过实战验证,工作流标准化,交付物可量化。

    2. 覆盖全场景的AI梦之队

    无论你是前端开发、后端架构、UI设计、营销策划、游戏开发还是安全审计,都能找到对应的专业代理。230+代理几乎覆盖所有技术领域,真正的一站式解决方案。

    3. 多工具无缝集成

    支持Claude Code、Cursor、Codex等主流AI编程工具,官方提供桌面应用,一键安装代理,自动更新。不需要手动配置文件,不需要学习复杂的安装流程。

    4. 活跃的开源社区

    MIT许可,GitHub上126K+ Stars,20K+ Forks,98个Open Issues,社区活跃。持续更新,不断新增代理和优化现有代理。

    5. 人格化交互体验

    每个代理都有独特的人格和沟通风格,不是冷冰冰的机器人,而是像真实领域专家一样与你交流。这让AI辅助变得更加自然和高效。

    💡 使用技巧:建议先安装官方桌面应用,可视化浏览所有代理,了解每个代理的专长和工作流,然后根据自己的需求选择安装。也可以参考代理文件学习如何编写高质量的AI代理提示词。

    📥 下载地址

    📊 项目统计

    指标 数值
    ⭐ GitHub Stars 126,129+
    🔀 Forks 20,468+
    📦 专业代理数量 230+
    📂 领域分组 16个
    📄 开源许可 MIT License
    📅 最后更新 2026年7月3日
    🔧 支持工具 Claude Code、Cursor、Codex、Gemini、Osaurus等

    📌 本文持续更新,欢迎关注GitHub仓库获取最新动态!

  • CodeGeeX4:清华大学出品的9B全能代码模型,性能超越70B级大模型

    CodeGeeX4:清华大学出品的9B全能代码模型,性能超越70B级大模型

    CodeGeeX4
    清华大学 KEG 实验室 × 智谱 AI 联合出品
    ALL-9B 全能模型 · 代码生成 · Function Call · 仓库级理解
    ⭐ 最新一代
    🚀 9B 超越 70B
    🏆 BigCodeBench SOTA

    📝 项目简介

    CodeGeeX4 是清华大学 KEG 实验室与智谱 AI 联合推出的第四代多语言代码生成模型,基于 GLM-4-9B 持续训练,在代码生成、代码解释、Web 搜索、Function Call、仓库级 Q&A 等全场景软件开发生命周期中均提供卓越表现。仅 9B 参数即超越 Llama3-70B、DeepSeekCoder-33B 等超大模型,是当前 10B 以下参数规模中综合性能最强的代码模型。

    9B
    模型参数

    82.3%
    HumanEval Pass@1

    128K
    上下文长度

    ⭐ 30K+
    GitHub Stars

    ⚙️ 安装要求和过程

    💻 环境要求

    • Python 3.10+(推荐 3.11)
    • CUDA 12.1+(GPU 推理)
    • PyTorch 2.0+ 或 vLLM 0.5.1+
    • 内存:FP16 推理约 18GB,INT4 量化约 6GB
    • 操作系统:Windows / macOS / Linux 全平台支持

    🚀 快速安装(Ollama — 最简单)

    # 安装 Ollama(需 0.2+ 版本)
    # macOS/Linux:
    curl -fsSL https://ollama.com/install.sh | sh
    
    # Windows: 从 https://ollama.com/download 下载安装
    
    # 一键运行 CodeGeeX4
    ollama run codegeex4

    🐍 使用 transformers 推理

    pip install transformers==4.40.0 torch
    
    from transformers import AutoTokenizer, AutoModelForCausalLM
    import torch
    
    model = AutoModelForCausalLM.from_pretrained(
        "THUDM/codegeex4-all-9b",
        torch_dtype=torch.bfloat16,
        trust_remote_code=True
    ).cuda().eval()
    tokenizer = AutoTokenizer.from_pretrained(
        "THUDM/codegeex4-all-9b",
        trust_remote_code=True
    )
    
    # 对话格式
    prompt = [{"role":"user","content":"写一个快速排序"}]
    inputs = tokenizer.apply_chat_template(prompt, add_generation_prompt=True, return_tensors="pt").cuda()
    outputs = model.generate(inputs, max_new_tokens=256)
    print(tokenizer.decode(outputs[0], skip_special_tokens=True))

    ⚡ vLLM 高性能部署

    pip install vllm==0.5.1
    
    # 启动 OpenAI 兼容 API 服务
    python -m vllm.entrypoints.openai.api_server     --model THUDM/codegeex4-all-9b     --trust-remote-code     --tensor-parallel-size 1
    
    # 然后即可用 OpenAI SDK 调用
    # pip install openai
    # client = OpenAI(base_url="http://localhost:8000/v1", api_key="dummy")

    ✨ 核心功能

    💬 全场景代码助手
    支持代码补全、代码生成、代码解释、代码翻译、文档生成、Bug 修复等全场景,基于 ChatGLM2/GLM-4 架构,中英文理解能力优异。

    🔧 Function Call 原生支持
    唯一原生支持 Function Call 的代码模型,Function Call 执行成功率甚至超越 GPT-4。可无缝接入 AI Agent 工具调用链路。

    📦 仓库级代码理解
    支持 128K 超长上下文,可理解整个代码仓库。支持仓库级 Q&A、跨文件代码补全、自动 commit 等高级功能。

    🌐 多平台部署
    支持 Ollama / vLLM / transformers / Rust-candle 多种推理后端;支持 VS Code、JetBrains 全系列 IDE 插件;支持本地 / 云端双模式。

    🏆 性能全面领先(10B 以下模型)
    HumanEval 82.3% · MBPP 75.7% · NaturalCodeBench 40.4% · BigCodeBench 48.9%(complete)/ 40.4%(instruct)· CRUXEval-O 47.1%。在代码推理、代码理解、代码执行等全方位评测中均取得 10B 以下模型最佳成绩。

    🎯 典型使用场景

    场景一:IDE 智能编程助手(最适合日常使用)

    在 VS Code 或 JetBrains IDE 中安装 CodeGeeX 插件,即可体验:

    • 代码补全:根据上下文自动补全下一行 / 下一个函数
    • 上下文补全:基于仓库内其他文件提供跨文件补全建议
    • Ask CodeGeeX:中英文对话解决编程问题,支持代码解释、翻译、纠错
    • 本地模式:连接本地 Ollama 运行的 CodeGeeX4,数据完全不出本地

    💡 支持超过 100 种编程语言!

    场景二:AI Agent Function Call 工具

    CodeGeeX4 原生支持 Function Call,可以:

    • 作为 AI Agent 的代码生成工具,解析自然语言需求生成代码
    • 接入 OpenAI 兼容 API,与 LangChain / AutoGen 等 Agent 框架无缝集成
    • 支持仓库级代码操作(增删改文件),实现 AI 自动 commit
    • 结合 vLLM 部署,支持多并发、高吞吐的生产环境调用

    场景三:本地私有化部署(数据安全敏感场景)

    对于数据隐私有严格要求的企业 / 个人,CodeGeeX4 提供完善的本地部署方案:

    • 通过 Ollama 一行命令启动,INT4 量化仅需 6GB 显存
    • 支持连接 VS Code / JetBrains 插件,体验与云端一致
    • 支持昇腾 / NVIDIA 全系列硬件,包括国产 AI 芯片
    • 代码和数据完全不离开本地,满足企业合规要求

    💡 推荐理由

    作为 AI 编程工具的深度用户,我试用过 GitHub Copilot、Claude Code、Cursor 等各类产品,CodeGeeX4 给我留下了极其深刻的印象:

    ① 性价比无敌:9B 参数的小模型,性能直接干翻 70B 的 Llama3 和 33B 的 DeepSeekCoder。这意味着你用消费级显卡(甚至 6GB 显存的 RTX 3060)就能跑一个世界级代码模型。

    ② Function Call 是杀手锏:在 AI Agent 时代,代码模型不能只做补全,还要能调用工具。CodeGeeX4 是唯一原生支持 Function Call 的开源代码模型,而且执行成功率比 GPT-4 还高。这对构建 AI 编程 Agent 来说是个游戏规则改变者。

    ③ 清华大学 + 智谱 AI 双背书:KEG 实验室(唐杰教授团队)在 NLP 和代码生成领域深耕多年,CodeGeeX 系列从 2022 年做到 2026 年,四代演进,成熟度远超同类竞品。智谱 AI 的 GLM 架构也在持续迭代优化。

    ④ 真正可用的 IDE 插件:很多开源模型只提供权重,没有好的用户体验。CodeGeeX 的 VS Code / JetBrains 插件做得相当完善,上下文补全、跨文件理解、Ask CodeGeeX 对话,体验不输商业产品。

    如果你在找一个能本地部署、性能好、中文友好的 AI 编程助手,CodeGeeX4 是目前唯一的最优解

    📊 性能对比(10B 以下模型)

    模型 参数 HumanEval MBPP NCB Function Call
    CodeGeeX4-ALL-9B 9B 82.3% 75.7% 40.4% ✅ 超越GPT-4
    Llama3-70B-Instruct 70B 77.4% 82.3% 37.0%
    DeepSeekCoder-33B 33B 81.1% 80.4% 39.3%
    Codestral-22B 22B 81.1% 78.2% 46.0%

    数据来源:CodeGeeX4 官方 README,NCB = NaturalCodeBench

    📚 CodeGeeX 系列演进

    CodeGeeX(第一代,2022)
    13B 参数,基于华为昇腾芯片训练,在 20+ 编程语言上预训练。配套开源 HumanEval-X 多语言评测基准。Apache-2.0 开源。

    CodeGeeX2(第二代,2023)
    基于 ChatGLM2-6B,6B 参数即超越 15B 的 StarCoder。支持 8192 序列长度,量化后仅需 6GB 显存。HumanEval-X 全面提升(+57%~+321%)。

    CodeGeeX4(第四代,2024)
    基于 GLM-4-9B,9B 参数全能模型。支持 Function Call、仓库级 Q&A、128K 上下文。BigCodeBench / NaturalCodeBench / CRUXEval 全基准 SOTA。Apache-2.0 开源。

    由自动化任务发布 · GitHub 热门 AI 开源项目系列 · 清华大学 KEG 实验室 × 智谱 AI
  • Strix:开源AI渗透测试工具,让AI智能体像真实黑客一样发现漏洞(31.6K Stars)

    Strix:开源AI渗透测试工具,让AI智能体像真实黑客一样发现漏洞(31.6K Stars)

    🛡️ Strix:开源AI渗透测试工具,让AI智能体像真实黑客一样发现漏洞

    Strix
    Autonomous AI Penetration Testing
    ⭐ 31.6K Stars
    🐍 Python
    📄 Apache-2.0
    🏢 useStrix

    📌 项目简介

    Strix 是一款开源的 AI 驱动的渗透测试工具,由 useStrix 团队维护(YC W25 孵化项目)。它用自主AI智能体模拟真实黑客的攻击行为——动态执行代码、发现漏洞、验证PoC(概念验证),覆盖从侦察、利用到验证的完整渗透测试流程。与传统静态分析工具的高误报率不同,Strix 通过实际利用来验证漏洞,输出可工作的PoC,让开发者和安全团队在几小时内完成传统需要数周的渗透测试。

    ⚙️ 安装要求与过程

    环境要求

    • Docker 必须已启动(用于沙箱隔离执行)
    • ✅ 任意支持的 LLM 提供商 API 密钥(OpenAI / Anthropic / Google / 本地模型等)
    • ✅ Python 3.10+(仅使用 PyPI 包时)

    快速安装(3步搞定)

    # 1. 一键安装 Strix
    curl -sSL https://strix.ai/install | bash
    
    # 2. 配置 AI 提供商(支持 OpenAI / Claude / Gemini 等)
    export STRIX_LLM="openai/gpt-5.4"
    export LLM_API_KEY="your-api-key"
    
    # 3. 运行首次安全评估
    strix --target ./app-directory

    📦 首次运行会自动拉取沙箱 Docker 镜像,结果保存到 strix_runs/<run-name> 目录。

    ✨ 核心功能

    🤖
    多智能体渗透测试
    多个AI渗透测试智能体协作——分工负责侦察、利用、后渗透阶段,像红队一样动态协调、共享发现、链式利用漏洞,并行执行提升覆盖效率。

    🔍
    真实漏洞验证(非误报)
    与传统静态分析工具的高误报率不同,Strix 通过实际执行利用代码来验证漏洞,输出可工作的PoC(概念验证),确保每一个报告的问题都是真实可利用的。

    🧰
    完整渗透测试工具链
    内置 HTTP 拦截代理(Caido)、浏览器漏洞利用(Playwright)、命令执行环境、自定义漏洞运行时(Python 沙箱)、侦察与OSINT、动静态代码分析(SAST+DAST)、结构化漏洞知识库(CVSS + OWASP 分类)。

    🔧
    自动修复与合规报告
    不仅发现问题,还能生成安全补丁(AI 自动修复)和符合 SOC 2 / ISO 27001 / PCI DSS 标准的渗透测试报告,一键即可生成可直接提交的漏洞报告。

    🚀
    CI/CD 原生集成
    无交互模式(-n/--non-interactive)完美适配自动化场景,GitHub Actions 工作流仅需 10 行配置,即可在每次 Pull Request 时自动扫描漏洞,在代码合并前阻断安全风险。

    🚀 典型使用场景

    场景一:PR 合并前的自动安全门禁
    在 GitHub Actions 中配置 Strix,每次 PR 提交时自动触发安全扫描。Strix 会自动将扫描范围限定在变更文件(diff-scope),快速完成审查。发现漏洞时以非0退出码阻断合并,并自动生成包含PoC和修复建议的安全报告。传统渗透测试需要数周,Strix 在 CI 流水线中仅需分钟级完成。
    场景二:Bug Bounty 自动化辅助
    安全研究员使用 Strix 对目标应用进行自动化漏洞挖掘。Strix 的智能体协作机制可同时覆盖 OWASP Top 10 的八大类漏洞(访问控制、注入攻击、服务端漏洞、客户端攻击、业务逻辑缺陷、认证与会话、基础设施与云安全、API 安全),并自动生成可用于漏洞报告提交的 PoC 脚本,大幅提升 Bug Bounty 研究的效率与覆盖深度。
    场景三:本地代码仓库的白盒安全审计
    开发者运行 strix --target ./app-directory,Strix 在 Docker 沙箱内动态执行应用代码,结合 SAST(静态应用安全测试)和 DAST(动态应用安全测试)双重分析,精准发现硬编码密钥、SQL 注入、SSRF 等传统工具难以触达的深层漏洞。支持通过 --instruction 参数指定重点关注的业务逻辑缺陷类型。

    💡 推荐理由

    在 AI 辅助开发日益普及的今天,安全责任正在向左迁移——开发者需要在代码提交前就能发现安全问题。传统 SAST 工具(如 Bandit、Semgrep)误报率高,而专业渗透测试周期长、成本高。Strix 用 AI 智能体填补了这个空白:

    • 🎯 真实可利用性验证:不只报告潜在问题,而是实际执行利用代码,输出可工作的 PoC,将误报率降至最低。
    • 🤝 多智能体协作:像真实红队一样分工协作,侦察智能体发现攻击面 → 利用智能体验证漏洞 → 后渗透智能体评估影响范围,链式利用让漏洞发现更系统。
    • 🔗 DevSecOps 无缝集成:GitHub Actions / GitLab CI 仅需 10 行配置,PR 差异范围自动扫描,安全门禁无感嵌入开发流程。
    • 🌐 支持广泛 LLM 提供商:通过 LiteLLM 支持 OpenAI / Anthropic / Google / Azure / AWS Bedrock / 本地模型(Ollama),可灵活选择兼顾成本与效果的最佳模型。

    作为 YC W25 孵化的开源项目,Strix 在短短数月内获得 3.1 万+ stars,已成为 AI 安全测试领域最受关注的开源工具之一。无论你是开发者、安全工程师还是 DevSecOps 团队,Strix 都值得加入你的安全工具链。

    📥 下载地址

    📌 本文由 AI 助手自动生成,数据来源:GitHub + 项目官方 README。Strix 采用 Apache-2.0 开源许可,由 useStrix 团队维护(YC W25)。