sglang

让大模型服务更快更省,复杂提示词场景吞吐翻倍

SGLang 是一个高性能的大语言模型和多模态模型服务框架,旨在解决 LLM 推理服务中吞吐量低、延迟高、显存利用率不足等问题。它通过 RadixAttention 技术自动复用 KV-Cache,显著提升前缀共享场景(如多轮对话、Few-shot 提示)的推理效率;提供前端语言 SGLang 原生支持结构化输出、并行采样、约束解码等复杂控制流,简化了应用开发。后端则利用连续批处理、PagedAttention 等优化,支持 Llama、Qwen、DeepSeek 等多种主流模型,并兼容 OpenAI API 协议,可无缝替换现有服务。核心能力在于极致的推理性能优化和灵活的编程接口,适合高并发、长上下文的在线服务场景。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 36323
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队sgl-project
所属国家
官网地址https://sglang.io
定价模式free
价格说明开源框架,Apache-2.0 许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型attention,blackwell,cuda,deepseek,diffusion,glm,gpt-oss,inference,llama,llm,minimax,moe,qwen,qwen-image,reinforcement-learning,transformer,vlm,wan
GitHub 星标★ 36323
30天Star增速
HF 下载量
上线时间2024-01-08 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 15 分钟 部署方式:本地安装 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(项目主要开发语言为 Python)
  • 可用的 GPU/CUDA 或 TPU 硬件环境(项目针对 CUDA、Blackwell、TPU 做了优化)
  • 能够访问 docs.sglang.io 官方文档以获取安装细节

安装与启动步骤

  1. 1阅读安装文档

    README 的 Getting Started 只给出链接,请打开 Install SGLang 文档,按官方指引选择并完成安装。

  2. 2跑通快速开始

    按 Quick Start(send_request)文档中的示例发起一次请求,确认服务能正常返回结果。

  3. 3了解 OpenAI 兼容

    阅读 Backend Tutorial 中的 OpenAI API 文档,了解如何用兼容协议调用服务。

  4. 4学习前端语言

    阅读 Frontend Tutorial,掌握结构化输出、并行采样等 SGLang 前端用法。

  5. 5查阅贡献指南

    如需改代码或提 PR,按 Contribution Guide 文档中的流程参与社区贡献。

如何确认成功

按官方 Quick Start 文档中的示例成功发出请求并拿到模型返回结果,即表示环境可用。

常见问题

Q:README 里没有安装命令怎么办?

A:本页 Getting Started 只提供链接,具体安装步骤请以官方 Install SGLang 文档(docs.sglang.io/get_started/install.html)为准。

Q:如何用 OpenAI API 协议调用?

A:参考 Getting Started 中的 Backend Tutorial,对应文档为 docs.sglang.io/basic_usage/openai_api_completions.html。

Q:前端语言怎么上手?

A:查看 Frontend Tutorial,文档地址 docs.sglang.io/references/frontend/frontend_tutorial.html。

Q:支持哪些模型?

A:README News 中列出了 Kimi K3、GLM5.2、Nemotron 3 系列、Higgs Audio 等最新开源模型的 day-0 支持。

注意事项

  • README 节选未包含任何安装命令,本教程步骤仅为官方文档指引,切勿凭猜测执行未验证的命令。
  • 项目官网为 https://sglang.io,文档为 https://docs.sglang.io,Slack 为 https://slack.sglang.io。
  • 遇到问题可加入 Slack 或参加每周开发者会议获取帮助。

核心亮点

  • RadixAttention 自动复用 KV-Cache,多轮对话和共享前缀场景吞吐提升显著
  • 原生支持结构化输出、并行采样等复杂控制流,开发效率高
  • 兼容 OpenAI API,迁移成本低,支持主流开源模型

不足之处

  • 前端语言 SGLang 有学习成本,不如纯 Python 直观
  • 部分高级特性依赖特定后端(如 RadixAttention 需配合其运行时),灵活性受限

适用场景

  • 高并发多轮对话及聊天机器人服务
  • 需要结构化输出(JSON、函数调用)的 LLM 应用
  • 长上下文或大量共享前缀提示词的批处理推理

替代项目

vLLM、TGI (Hugging Face Text Generation Inference)、TensorRT-LLM

项目介绍

sglang 是基础设施领域的开源项目,由 sgl-project 开发,2024 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(36,323)位列前 1%,在基础设施分类的 1,130 个项目里位列前 3%。

近 41 天,它的 GitHub 星标从 31,718 增加到 36,323,净增 4,605。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。Apache-2.0 许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:高并发多轮对话及聊天机器人服务。同类可对比的替代方案包括 vLLM、TGI (Hugging Face Text Generation Inference)、TensorRT-LLM。

上一篇:ray

下一篇:llmfit

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09