llm-serving

本站收录 36 个带「llm-serving」标签的 AI 开源项目

vllm面向 LLM 的高吞吐、内存高效的推理与 serving 引擎,支持 PagedAttention 等核心技术,是大规模模型部署与在线服务的事实标准之一。★ 92,945rayRay 是一个面向 AI 计算的分布式引擎,由核心分布式运行时和一组 AI 库组成,用于加速机器学习工作负载。它解决了大规模分布式训练、调参、推理和服务部署中的★ 43,949llm-actionllm-action 是一个面向大模型工程师和开发者的开源知识库与实战指南,系统梳理了大模型从训练、微调到推理部署的全链路技术原理与工程实践。项目以教程和代码示★ 25,121TensorRT-LLMTensorRT-LLM 是 NVIDIA 推出的开源大语言模型推理加速库,提供易用的 Python API 来定义 LLM,并在 NVIDIA GPU 上实现★ 14,723OpenLLM让任意开源 LLM(如 DeepSeek、Llama)一键以 OpenAI 兼容的 API 形式部署到云端的工具。它屏蔽了模型服务化的复杂度,提供标准化的推理接★ 12,548skypilot面向前沿 AI 团队的计算平台,将分散在不同云厂商的 GPU 算力整合成一台“AI 超级计算机”。它支持在多云环境下统一调度资源、自动选型最优实例并显著节省成本★ 10,665BentoML以最简单的方式部署 AI 应用与模型的开源框架,支持构建模型推理 API、任务队列、LLM 应用与多模型流水线。它提供了标准化的服务化流程、容器化打包与云原生扩★ 8,870gpustackgpustack 是一个面向高性能 AI 模型服务的 GPU 集群管理器,专注于简化 vLLM、SGLang 等推理引擎的部署与运维。它解决了 GPU 资源利用★ 5,768superduperSuperduper 是一个端到端的开源框架,用于构建自定义 AI 应用和智能代理。它解决了将 AI 模型(如 LLM、预训练模型)与现有数据基础设施(尤其是 ★ 5,327loraxLorax 是一个专为大规模多 LoRA 推理而设计的高性能服务器,能够同时承载数千个微调后的 LLM。它解决了传统推理服务中每个微调模型需要独立部署、资源消耗★ 3,834FastDeployFastDeploy 是百度飞桨(PaddlePaddle)生态下的高性能推理与部署工具包,专注于大语言模型(LLM)和多模态模型(VLM)的快速部署。它解决了★ 3,718chituchitu 是一个面向大语言模型的高性能推理框架,专注于效率、灵活性和可用性。它旨在解决 LLM 推理过程中的性能瓶颈和部署复杂性问题,通过优化的内核和调度策略★ 3,010vllm-ascendvllm-ascend 是 vLLM 在华为昇腾(Ascend)硬件上的社区维护插件,旨在让 vLLM 这一主流大模型推理框架能够无缝运行在昇腾 NPU 上。它★ 2,911MoBAMoBA 是一种面向长上下文大语言模型的新型注意力机制,核心思想是将输入序列划分为多个块,并采用混合专家(MoE)的思路,让每个查询只关注最相关的少数块,从而将★ 2,191aiciAICI(Artificial Intelligence Controller Interface)是一个开源框架,它提出了一种全新的与大语言模型交互的方式:将★ 2,076InferenceXInferenceX 是一个开源的持续推理基准研究平台,专注在大规模 LLM 推理场景下做可复现、可持续的性能评测。它把当下主流大模型(如 Kimi、MiniM★ 1,792kvcachedkvcached 是一个面向大语言模型推理场景的虚拟化弹性 KV 缓存管理框架,核心目标是解决多模型、多租户共享 GPU 时 KV 缓存资源利用率低、隔离性差的★ 1,509parallaxParallax 是一个分布式模型推理框架,旨在帮助用户在任何地方构建自己的 AI 集群。它通过将多个计算节点(如 GPU 服务器)聚合起来,统一调度和管理大语★ 1,392rtp-llmRTP-LLM是阿里巴巴开源的高性能大语言模型推理引擎,旨在为多样化的应用场景提供低延迟、高吞吐的推理服务。它解决了LLM在生产环境中部署时面临的性能瓶颈和资源★ 1,357mosecmosec 是一个高性能的机器学习模型服务框架,专注于解决模型部署中的吞吐量和资源利用率问题。它通过动态批处理(dynamic batching)和 CPU/G★ 902helixhelix 是一个私有的 AI 代理集群管理工具,采用 Go 语言开发。它允许用户为每个代理分配独立的 GPU 加速桌面环境,并支持运行 Claude、Code★ 814halogen-flash-serverhalogen-flash-server 是一个面向 AMD Strix Halo(gfx1151)平台的本地大模型推理部署脚本,目标是让用户以最快速度在搭载该★ 729pegainferpegainfer 是一个用纯 Rust 编写的 LLM 推理引擎,底层直接调用 CUDA 内核,不依赖 PyTorch 或任何 Python 运行时。它解决的★ 712LLM-FineTuning-Large-Language-Models该项目是一个专注于大语言模型(LLM)微调的教学型开源仓库,主要使用 Jupyter Notebook 编写,旨在帮助开发者系统学习和实践大模型微调技术。它解决★ 578Awesome-KV-Cache-Optimization这是一个面向大模型推理服务的 KV Cache 优化综述仓库,对应 ACL 2026 论文《Towards Efficient Large Language M★ 415swiftLLMswiftLLM 是一个极简但高性能的 LLM 推理系统,专为研究目的设计。它用仅约 2000 行 Python 代码实现了与 vLLM 相当的性能,代码量仅为★ 359flamaflama 是一个面向预测式与生成式 AI 的生产级框架,旨在让开发者以极简方式将任意模型快速部署为 API。它解决了模型服务化过程中配置复杂、接口不统一、缺乏★ 298runbooksRunbooks 是一个基于 Kubernetes 的 LLM 微调工具,旨在通过声明式工作流简化大语言模型的微调过程。它利用 Kubernetes 的弹性资源★ 169model-serving-minefieldmodel-serving-minefield 是一个社区维护的 LLM 推理服务“踩坑登记册”,专门收集那些会让测量结果看似正常、实则自信地给出错误结论的陷阱★ 134sndr_core_engineSNDR Core Engine (Genesis) 是一个针对消费级 NVIDIA GPU(如 RTX 3090、A5000)的 vLLM 运行时补丁覆盖层,★ 132get-beamget-beam 是一个面向 AI 基础设施的早期开源项目,旨在让用户以无服务器(Serverless)方式运行 GPU 推理和训练任务。它解决了传统 GPU ★ 104sample-genai-on-eks-starter-kit这是一个在 Amazon EKS 上快速部署生产级生成式 AI 基础设施的工具包。它解决了企业在 AWS 上搭建 GenAI 平台时面临的组件集成复杂、配置繁琐★ 95llm-inference-solutions这是一个收录大语言模型(LLM)推理解决方案的精选列表,旨在为开发者提供一站式的推理工具参考。项目整理了当前主流的推理框架、服务化方案和优化库,涵盖从本地部署到★ 95ray_vllm_inferenceray_vllm_inference 是一个将 vLLM 与 Ray Serve 集成的轻量级 LLM 推理服务项目,旨在提供快速且可扩展的大模型服务能力。它解★ 79Awesome-LLMs-ICLR-24Awesome-LLMs-ICLR-24 是一个专门整理 ICLR 2024 会议上所有大语言模型(LLM)相关论文的资源合集。它解决了研究者难以系统追踪顶级会★ 72sugarcane-aisugarcane-ai 是一个面向 Prompt 的 npm 风格包生态系统,旨在解决 Prompt 复用、管理和分发难题。它将 Prompt 视为可版本化的★ 52