标签: 模型部署

  • 贝尼奥夫领投2000万美元:用AI抹平企业AI落地的烂摊子

    June 公司创始人团队
    June 的创始团队,大多来自 Salesforce 的 AI 业务。图源:TechCrunch

    大模型不难买,难的是让它真正跑进一家公司的日常运转里。这个问题坑了无数CTO,也养出了一批叫FDE(前置部署工程师)的新贵。现在,一支前Salesforce班底想用AI把这道最难的交付环节也自动化掉。

    AI悖论性地增加了对专业服务的需求。行业应对AI落地的办法,是”再雇更多的人”。——June创始人Efrat Rapoport

    2000万美元的pre-seed,连BP都没写

    周一,June从隐身状态亮相,拿下2000万美元pre-seed,由Marc Benioff的Time Ventures领投,Michael Dell、Box的Aaron Levie、CrowdStrike的George Kurtz这些企业软件老炮跟投。四个创始人之前创办过Bonobo AI,2019年被Salesforce收走,之后在巨头里做了几年AI,看够了客户对接时的狼狈。Rapoport说,这轮融资他们连一份正式BP都没准备。

    模板好写,底下的乱麻难解

    模型进了企业,绕不开Salesforce、ServiceNow、Databricks、Workday这一长串老平台。Rapoport点破关键:建一个agent模板很容易,难的是底下那团乱麻——数据散落在不同系统、流程盘根错节、还有多年堆积的技术债。”当数据库里有10个意思相同的重复字段、不同团队各用各的,agent怎么知道该听谁的?”

    June怎么干

    它的做法是先给企业系统做”体检”:扫描现有软件,弄明白业务流程,找出瓶颈,再自动生成一份一步步的落地路线图,告诉你要先删重字段、先接哪个数据源。你点一下”build”,它就在你的环境里动手搭。

    客户为什么买账

    美国抵押贷款机构CMG的CSO Paul Akinmade,用Claude Code迁代码很快,却卡在和Salesforce对接上几周没动静。June让他提前看清该往哪部署,还能在双方正式开会前就安全上线了一部分。他一开始的硬性条件是:”如果你的产品还要靠FDE,我不要。”June恰恰踩中了这个痛点——它把自己说成FDE和咨询公司的补充,可客户可能正是冲着”能甩开FDE”才来的。


    📎 原文来源:A Marc Benioff-backed startup thinks AI can solve the AI deployment problem(TechCrunch / Tim Fernholz)
  • TensorRT LLM:NVIDIA 开源的高性能大模型推理引擎,14.2K Star

    TensorRT LLM:NVIDIA 开源的高性能大模型推理引擎,14.2K Star

    项目简介

    TensorRT LLM 是 NVIDIA 开源的高性能大语言模型(LLM)与视觉生成模型推理优化库。它在 NVIDIA GPU 上提供最先进的定制内核、运行时优化和 Python 化高层 API,能把主流开源/自研大模型的推理延迟压到更低、吞吐拉到更高——从单张 RTX 显卡到多机 NVL72 集群都能统一部署。

    TensorRT LLM

    安装要求和过程

    环境要求

    • GPU:NVIDIA GPU(推荐 Ampere / Ada / Hopper / Blackwell 架构)
    • CUDA:CUDA 13.2.1(以 README 当前 badge 为准)
    • Python:3.10 或 3.12
    • PyTorch:2.11.0
    • 系统:Linux(主要支持)、Windows、WSL2

    快速安装

    # 推荐通过 pip 安装最新 release
    pip install tensorrt_llm
    
    # 或使用预编译容器(避免环境踩坑)
    docker pull nvcr.io/nvidia/tritonserver:26.05-trtllm-python-py3
    
    # 验证安装
    trtllm-serve --help

    更复杂的源码编译或多节点部署可参考官方安装指南:Installation Guide

    核心功能

    TensorRT LLM 架构分层

    • PyTorch 原生架构:模型定义直接写 PyTorch,调试、扩展、自定义注意力/量化都更直观。
    • 高层 LLM API:一行代码从 Hugging Face 加载模型,自动编译 TensorRT engine,支持单卡、张量并行、流水线并行、专家并行。
    • State-of-the-Art 内核:针对 Attention、GEMM、MoE 等常见算子手写 CUDA kernel,充分发挥 Tensor Core 算力。
    • 丰富的高级特性:FP8/FP4/INT4 AWQ 量化、KV Cache 复用、投机解码、Prefix Caching、CUDA Graphs、Prefill-Decode 解耦等。
    • 生产级部署生态:原生兼容 NVIDIA Dynamo、Triton Inference Server,也能作为 vLLM、SGLang 等框架的后端。

    典型使用场景

    TensorRT LLM 核心优化技术

    1. 高并发在线服务

    在 H100/H200/B200 集群上部署 Llama、DeepSeek、Qwen 等模型,配合 Tensor Parallelism 和 Disaggregated Serving,把单用户延迟压到百毫秒级,同时保持数千 token/s 的聚合吞吐。

    2. 本地化推理与边缘部署

    通过 INT4/FP4 量化和 Weight-Stripped Engines,在单张 RTX 4090 或 Jetson AGX Orin 上运行 70B 级别模型,满足私有化、低功耗场景需求。

    3. Agent 与长上下文应用

    利用 Prefix Caching 和 chunked context,在多轮工具调用、RAG、代码补全等长上下文场景中显著降低首 token 时延。

    推荐理由

    TensorRT LLM 是 NVIDIA 在大模型推理领域的“官方解法”。它不是简单的封装,而是从 kernel、runtime 到 serving 的垂直优化。2025 年 3 月后项目已完全开源并迁到 GitHub 维护,社区活跃、文档详尽,对追求极致吞吐和成本控制的生产环境尤其友好。虽然硬件门槛是 NVIDIA GPU,但如果你已经在 CUDA 生态里,它基本是目前能把模型跑得最快、最省显存的工具之一。

    下载地址