
TensorRT-LLM
NVIDIA GPU 上跑大模型,编译优化后推理又快又省显存
TensorRT-LLM 是 NVIDIA 推出的开源大语言模型推理加速库,提供易用的 Python API 来定义 LLM,并在 NVIDIA GPU 上实现高效推理。它内置了量化、内核融合、张量并行、流水线并行、KV 缓存优化、投机采样等前沿优化技术,还包含用于编排推理执行的 Python 和 C++ 运行时组件。该项目解决的核心问题是:通用深度学习框架在 GPU 上运行大模型时推理延迟高、吞吐低、显存占用大,难以满足生产级部署需求。通过将模型编译为高度优化的 TensorRT 引擎,它能显著提升推理性能,支持 MoE 架构、Blackwell 等新硬件,并与 Triton 推理服务器等生态集成,适合对延迟和吞吐有严苛要求的在线服务场景。
项目数据
使用教程
⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。
环境要求
- NVIDIA GPU(具体型号需对照官方 Support Matrix)
- 已安装 CUDA 等 GPU 软件栈
- Python 环境(项目主要开发语言为 Python)
- 能访问 nvidia.github.io 官方文档站点
安装与启动步骤
-
1打开官方文档
README 未直接给出安装命令,安装与使用说明全部集中在官方文档站点,先从这里进入。
-
2阅读快速开始
按 Quick Start Guide 走一遍最小可运行示例,确认后续步骤所需的版本与依赖。
-
3阅读安装指南
Installation Guide 是唯一的官方安装入口,按其章节选择容器或源码安装方式。
-
4核对支持矩阵
先比对 Support Matrix,确认自己的 GPU、模型和软件版本在支持范围内,避免白折腾。
-
5获取源码
克隆仓库以便使用 examples 目录下的模型示例(如 DeepSeek)。
git clone https://github.com/NVIDIA/TensorRT-LLM.git
如何确认成功
文档站点可正常打开,仓库克隆完成后本地出现 TensorRT-LLM 目录及其 examples 子目录。
常见问题
Q:README 里有安装命令吗?
A:没有。README 只提供了 Quick Start Guide 和 Installation Guide 的链接,所有安装命令都需在官方文档中查看,请勿照搬第三方教程。
Q:怎么确认我的显卡能用?
A:查阅官方 Support Matrix 页面,逐项核对 GPU 型号、支持的模型以及依赖软件版本。
Q:如何在 TensorRT-LLM 上跑 DeepSeek?
A:README 指向仓库 examples/models/core/deepseek_v3 目录,进入该目录按其中的说明操作。
Q:安装方式选容器还是源码?
A:README 未做推荐,Installation Guide 中列出了可选路径,按自身环境(Docker 可用性、编译需求)选择。
Q:性能怎么测?
A:参考文档中的 Benchmarking Performance 章节,使用 trtllm-bench 进行基准测试。
注意事项
- README 本身不含任何安装命令,全部安装细节以 nvidia.github.io 官方文档为准
- 安装前务必先确认硬件与软件版本在 Support Matrix 支持范围内
- 本项目面向 LLM 与视觉生成模型的 GPU 推理,无 NVIDIA GPU 的环境无法使用
核心亮点
- 深度绑定 NVIDIA 硬件,利用 TensorRT 内核融合、量化(FP8/INT4)和并行策略,推理性能通常显著优于通用框架
- 提供 Python API 和 C++ 运行时,支持从模型定义到生产部署的完整链路,并集成 Triton 推理服务器
- 紧跟最新硬件与模型架构,已支持 Blackwell、MoE、投机采样等前沿特性,社区活跃且由 NVIDIA 官方维护
不足之处
- 强依赖 NVIDIA GPU 和 CUDA 生态,无法在 AMD、Intel 等非 NVIDIA 硬件上运行,硬件绑定性强
- 模型需要经过编译转换流程,调试和迭代不如 PyTorch 原生推理灵活,对新模型的支持存在滞后
适用场景
- 在线大模型 API 服务,需要低延迟高吞吐地响应大量并发请求
- 企业私有化部署 LLM,在有限 GPU 资源下追求最大推理吞吐和显存效率
- 需要将大模型推理集成到 C++ 生产系统中,要求高性能运行时和稳定部署
替代项目
vLLM、SGLang
项目介绍
同类项目推荐
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···