TensorRT-LLM

NVIDIA GPU 上跑大模型,编译优化后推理又快又省显存

TensorRT-LLM 是 NVIDIA 推出的开源大语言模型推理加速库,提供易用的 Python API 来定义 LLM,并在 NVIDIA GPU 上实现高效推理。它内置了量化、内核融合、张量并行、流水线并行、KV 缓存优化、投机采样等前沿优化技术,还包含用于编排推理执行的 Python 和 C++ 运行时组件。该项目解决的核心问题是:通用深度学习框架在 GPU 上运行大模型时推理延迟高、吞吐低、显存占用大,难以满足生产级部署需求。通过将模型编译为高度优化的 TensorRT 引擎,它能显著提升推理性能,支持 MoE 架构、Blackwell 等新硬件,并与 Triton 推理服务器等生态集成,适合对延迟和吞吐有严苛要求的在线服务场景。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 14638
维护状态 活跃
是否开源
定价模式 free

项目数据

分类基础设施
开发团队NVIDIA
所属国家
定价模式free
价格说明开源免费,遵循Apache 2.0许可证
访问状态
是否开源
开源协议NOASSERTION
主要语言Python
技术栈/模型blackwell,cuda,llm-serving,moe,pytorch
GitHub 星标★ 14638
30天Star增速
HF 下载量
上线时间2023-08-16 00:00:00
最近更新2026-09-17 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-15
浏览次数0

使用教程

难度:进阶 约 20 分钟 部署方式:本地安装 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • NVIDIA GPU(具体型号需对照官方 Support Matrix)
  • 已安装 CUDA 等 GPU 软件栈
  • Python 环境(项目主要开发语言为 Python)
  • 能访问 nvidia.github.io 官方文档站点

安装与启动步骤

  1. 1打开官方文档

    README 未直接给出安装命令,安装与使用说明全部集中在官方文档站点,先从这里进入。

  2. 2阅读快速开始

    按 Quick Start Guide 走一遍最小可运行示例,确认后续步骤所需的版本与依赖。

  3. 3阅读安装指南

    Installation Guide 是唯一的官方安装入口,按其章节选择容器或源码安装方式。

  4. 4核对支持矩阵

    先比对 Support Matrix,确认自己的 GPU、模型和软件版本在支持范围内,避免白折腾。

  5. 5获取源码

    克隆仓库以便使用 examples 目录下的模型示例(如 DeepSeek)。

    git clone https://github.com/NVIDIA/TensorRT-LLM.git

如何确认成功

文档站点可正常打开,仓库克隆完成后本地出现 TensorRT-LLM 目录及其 examples 子目录。

常见问题

Q:README 里有安装命令吗?

A:没有。README 只提供了 Quick Start Guide 和 Installation Guide 的链接,所有安装命令都需在官方文档中查看,请勿照搬第三方教程。

Q:怎么确认我的显卡能用?

A:查阅官方 Support Matrix 页面,逐项核对 GPU 型号、支持的模型以及依赖软件版本。

Q:如何在 TensorRT-LLM 上跑 DeepSeek?

A:README 指向仓库 examples/models/core/deepseek_v3 目录,进入该目录按其中的说明操作。

Q:安装方式选容器还是源码?

A:README 未做推荐,Installation Guide 中列出了可选路径,按自身环境(Docker 可用性、编译需求)选择。

Q:性能怎么测?

A:参考文档中的 Benchmarking Performance 章节,使用 trtllm-bench 进行基准测试。

注意事项

  • README 本身不含任何安装命令,全部安装细节以 nvidia.github.io 官方文档为准
  • 安装前务必先确认硬件与软件版本在 Support Matrix 支持范围内
  • 本项目面向 LLM 与视觉生成模型的 GPU 推理,无 NVIDIA GPU 的环境无法使用

核心亮点

  • 深度绑定 NVIDIA 硬件,利用 TensorRT 内核融合、量化(FP8/INT4)和并行策略,推理性能通常显著优于通用框架
  • 提供 Python API 和 C++ 运行时,支持从模型定义到生产部署的完整链路,并集成 Triton 推理服务器
  • 紧跟最新硬件与模型架构,已支持 Blackwell、MoE、投机采样等前沿特性,社区活跃且由 NVIDIA 官方维护

不足之处

  • 强依赖 NVIDIA GPU 和 CUDA 生态,无法在 AMD、Intel 等非 NVIDIA 硬件上运行,硬件绑定性强
  • 模型需要经过编译转换流程,调试和迭代不如 PyTorch 原生推理灵活,对新模型的支持存在滞后

适用场景

  • 在线大模型 API 服务,需要低延迟高吞吐地响应大量并发请求
  • 企业私有化部署 LLM,在有限 GPU 资源下追求最大推理吞吐和显存效率
  • 需要将大模型推理集成到 C++ 生产系统中,要求高性能运行时和稳定部署

替代项目

vLLM、SGLang

项目介绍

TensorRT-LLM 是一个基础设施领域的开源项目,官方简介:TensorRT LLM provides users with an easy-to-use Python API to define Large Language Models (LLMs) and supports state-of-the-art optimizations to perform inference efficiently on NVIDIA GPUs. TensorRT LLM also contains components to create Python and C++ runtimes that orchestrate the inference execution in a performant way.。项目使用 Python 开发,在 GitHub 上获得 14621 星标。

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···

★ 202 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8433 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 435 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181124 2026-08-09