rtp-llm

阿里出品的高性能推理引擎,让LLM部署更快更省

RTP-LLM是阿里巴巴开源的高性能大语言模型推理引擎,旨在为多样化的应用场景提供低延迟、高吞吐的推理服务。它解决了LLM在生产环境中部署时面临的性能瓶颈和资源效率问题,通过优化的CUDA内核、高效的KV Cache管理、动态批处理和模型并行等核心技术,显著提升了推理速度和吞吐量。RTP-LLM支持多种主流模型架构(如GPT、LLaMA等),并提供灵活的配置选项,便于集成到现有系统中。其核心能力包括高并发处理、流式输出、量化推理(如FP16/INT8)以及针对长序列的优化,适用于在线服务、离线批处理等不同负载。作为阿里内部大规模验证过的引擎,RTP-LLM在性能上对标vLLM等主流方案,并针对特定硬件(如A100/H800)做了深度调优,是生产级推理的可靠选择。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1349
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类基础设施
开发团队alibaba
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型gpt,inference,llama,llm,llm-serving,llmops,model-serving
GitHub 星标★ 1349
30天Star增速
HF 下载量
上线时间2023-12-27 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 20 分钟 部署方式:本地安装 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 已安装 git,可访问 GitHub 获取源码
  • Python 环境(项目主要开发语言为 Python)
  • 可访问官方文档站 https://rtp-llm.ai/(安装步骤以该站为准)
  • 按需准备硬件后端:GPU,或 AMD ROCm / Intel CPU / ARM CPU(后者仍在开发中)

安装与启动步骤

  1. 1克隆源码仓库

    从 GitHub 拉取 rtp-llm 源码;README 未给出 pip 或 docker 安装命令,需自行编译。

    git clone https://github.com/alibaba/rtp-llm.git
  2. 2查阅安装文档

    README 的 Getting Started 仅提供官方文档链接,安装依赖与编译步骤以该页面为准。

  3. 3跑通快速开始

    按 Quick Start 文档启动服务并发起一次请求,确认推理链路可用。

  4. 4参考后端教程

    按 Backend Tutorial 了解不同模型后端的部署方式(例如 DeepSeek 相关示例)。

如何确认成功

README 未给出启动校验方式,以官方 Quick Start 文档中请求返回正常结果为准。

常见问题

Q:README 里为什么没有安装命令?

A:本仓库的 README 只提供 Documentation、Install、Quick Start 等官方文档链接,具体安装与启动命令需到 https://rtp-llm.ai/ 查看对应版本说明。

Q:支持哪些硬件后端?

A:README 提到已实现完整 GPU 显存管理,并正在开发 AMD ROCm、Intel CPU 与 ARM CPU 支持;其中 Qwen 系列模型与 bert embedding 模型已支持倚天 ARM CPU。

Q:支持什么新特性?

A:README 的 News 显示 0.2.0 版本带来性能增强与新功能,并已支持 Prefill/Decode 分离部署。

Q:想参与开发怎么开始?

A:README 提供了 Contribution Guide 链接,按官方贡献指南提交代码即可。

注意事项

  • 本教程仅依据 README 节选整理,README 未给出任何安装命令、端口、路径或配置项,实际部署请以 https://rtp-llm.ai/ 官方文档为准。
  • rtp-llm 是 havenask 项目的子项目,如遇构建依赖问题可参考该项目的相关说明。
  • 不同版本(如 0.2.0)的能力与安装方式可能不同,请确认文档版本与代码版本一致。

核心亮点

  • 针对NVIDIA GPU深度优化,推理性能在主流模型上优于vLLM
  • 支持动态批处理和连续KV缓存,提升高并发场景吞吐
  • 提供FP16/INT8量化,降低显存占用和推理成本

不足之处

  • 文档和社区生态相比vLLM尚不完善
  • 对非NVIDIA硬件(如AMD)支持有限

适用场景

  • 高并发在线LLM服务(如聊天机器人)
  • 长序列生成任务(如文档摘要)
  • 资源受限环境下的模型部署(量化推理)

替代项目

vLLM、TensorRT-LLM、TGI

项目介绍

rtp-llm 是基础设施领域的开源项目,由 alibaba 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,349)位列前 30%,在基础设施分类中处于中上游。

近 42 天,它的 GitHub 星标从 1,301 增加到 1,349,净增 48。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:高并发在线LLM服务(如聊天机器人)。同类可对比的替代方案包括 vLLM、TensorRT-LLM、TGI。

上一篇:langfuse-js

下一篇:VectorChord

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09