sglang-omni

让语音和多模态模型服务快如闪电,吞吐翻倍

SGLang-Omni 是一个基于 SGLang 的高性能多模态推理服务框架,专注于语音相关模型(TTS、ASR)及全模态(omni)模型的部署。它解决了传统语音模型服务中延迟高、吞吐低、多模态协同困难的问题,通过优化的 CUDA 内核、分布式推理和异步流水线,实现了低延迟、高并发的模型服务。核心能力包括:支持 OpenAI 兼容 API,便于集成;提供统一的推理接口,覆盖文本、语音和音频生成;利用 PyTorch 生态,易于扩展新模型。项目处于早期阶段,但已吸引近 800 星标,显示出社区对高性能语音推理服务的强烈需求。

开源 free 基础设施
GitHub 星标 ★ 796
维护状态 活跃
是否开源
定价模式 free

项目数据

分类基础设施
开发团队sgl-project
所属国家
定价模式free
价格说明开源项目,免费使用,定价信息待确认
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型asr,audio-generation,cuda,distributed-inference,inference,model-serving,multimodal,music-generation,openai-api,pytorch,sglang,speech-recognition,streaming,text-to-speech,tts
GitHub 星标★ 796
30天Star增速
HF 下载量
上线时间2026-01-07 00:00:00
最近更新2026-08-14 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-14
浏览次数0

核心亮点

  • 基于 SGLang 成熟框架,推理性能优化到位,延迟低、吞吐高
  • 原生支持 OpenAI API,集成现有应用零成本
  • 统一支持 TTS/ASR/音频生成,多模态场景一站搞定

不足之处

  • 早期项目,文档和示例相对较少,上手门槛偏高
  • 模型兼容性有限,主要适配特定架构,通用性待验证

适用场景

  • 实时语音助手后端服务,需低延迟响应
  • 大规模音频内容生成平台,需高吞吐处理
  • 多模态交互应用,需同时处理语音、文本和音频

替代项目

vLLM、Triton Inference Server、Hugging Face TGI

项目介绍

sglang-omni 是一个基础设施领域的开源项目,官方简介:SGLang-Omni empowers high-performance serving for TTS, ASR, speech and omni models.。项目使用 Python 开发,在 GitHub 上获得 796 星标。

上一篇:vLLM-Hook

下一篇:没有了!

同类项目推荐

ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi-K2.6, GLM-5.2, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma ···

★ 178456 2026-08-09
litellm 开源

一个网关接入所有大模型,告别接口乱、成本散、监控难

The fastest, litest AI Gateway. Rust core with Python SDK. Call 100+ LLM APIs in Ope···

★ 56266 2026-08-09
coze-loop 开源

一站式调试、评估、监控你的 AI Agent,让开发更高效

Next-generation AI Agent Optimization Platform: Cozeloop addresses challenges in AI ···

★ 5695 2026-08-09
OpenMemory 开源

AI 工具共用一份记忆,关掉重开照样记得你

Local persistent memory store for LLM applications including claude desktop, github ···

★ 4431 2026-08-09