sglang

本站收录 18 个带「sglang」标签的 AI 开源项目

inferenceXinference 是一个统一推理引擎,旨在解决多模型部署与调用碎片化问题。它允许开发者通过修改一行代码,将 GPT 替换为任何开源大语言模型、语音模型或多模★ 9,593MooncakeMooncake 是 Moonshot AI 为其 Kimi 大语言模型服务打造的高性能推理平台,核心解决 LLM 服务中的高吞吐、低延迟和成本控制问题。它基于★ 6,689gpustackgpustack 是一个面向高性能 AI 模型服务的 GPU 集群管理器,专注于简化 vLLM、SGLang 等推理引擎的部署与运维。它解决了 GPU 资源利用★ 5,768InferenceXInferenceX 是一个开源的持续推理基准研究平台,专注在大规模 LLM 推理场景下做可复现、可持续的性能评测。它把当下主流大模型(如 Kimi、MiniM★ 1,792kvcachedkvcached 是一个面向大语言模型推理场景的虚拟化弹性 KV 缓存管理框架,核心目标是解决多模型、多租户共享 GPU 时 KV 缓存资源利用率低、隔离性差的★ 1,509MOSS-TTSDMOSS-TTSD 是一个面向表达性多说话人合成的口语对话生成模型。它解决了传统语音合成在长上下文建模、说话人灵活控制和多语言支持方面的不足,能够从短音频参考中★ 1,400zero-to-sglangzero-to-sglang 是 SGLang 官方与 Datawhale 联合推出的 LLM 推理学习课程,面向想深入理解大模型推理引擎的开发者。它解决的是「★ 1,323sglang-omniSGLang-Omni 是一个基于 SGLang 的高性能多模态推理服务框架,专注于语音相关模型(TTS、ASR)及全模态(omni)模型的部署。它解决了传统语★ 1,302SpecForgeSpecForge 是一个面向大模型推理加速的开源训练框架,专门用于训练投机解码(speculative decoding)模型,并支持将训练结果平滑部署到 S★ 1,194MOVAMOVA 是一个统一的多模态基础模型,能够在一个模型中同时生成同步的视频和音频,解决了传统视频生成中音画分离、需要额外配音或后期对齐的痛点。它基于扩散模型架构,★ 1,119UniRL腾讯混元开源的统一多模态强化学习框架,支持在多模态场景下训练与优化模型。它提供统一的 RL 流程抽象,帮助研究者和工程师在文本、图像等多模态任务上高效开展强化学★ 999time-to-first-token这是一个为期10周、每天30分钟的LLM推理服务与优化学习路线图。它面向想要系统掌握大模型推理性能调优的开发者,解决从理论到实践缺乏结构化路径的问题。项目核心能★ 960Spark-X2.5Spark-X2.5 是一个面向端侧设备的开源大模型系列,目标是在手机、笔记本等本地硬件上把智能体(Agent)能力推到极限。它解决的核心问题是:云端大模型调用★ 498llmazllmaz 是一个面向 Kubernetes 的大模型推理平台,目标是把 vLLM、SGLang、TGI、llama.cpp、Ollama 等主流推理引擎统一纳★ 315gpt_servergpt_server 是一个面向生产环境的 AI 服务部署框架,旨在统一集成多种主流模型能力,包括大语言模型(LLM)、Embedding、Reranker、A★ 253One-EvalOne-Eval 是一个面向大语言模型评测的自动化系统,核心思路是用 agent 来驱动整个评测流程。传统 LLM 评测往往需要人工配置数据集、编写推理脚本、跑★ 164vector-inferencevector-inference 是一个面向 Slurm 集群的 LLM 推理服务框架,目标是让团队在已有 HPC 调度系统上高效部署大模型推理,而不必额外搭建★ 107heronHeron 是一个基于 Rust 构建的智能体与 LLM API 性能监控工具,通过网络数据包探测的方式,在服务提供方侧部署,无需修改 SDK 即可测量 Ope★ 104