model-serving

本站收录 42 个带「model-serving」标签的 AI 开源项目

vllm面向 LLM 的高吞吐、内存高效的推理与 serving 引擎,支持 PagedAttention 等核心技术,是大规模模型部署与在线服务的事实标准之一。★ 92,945BentoML以最简单的方式部署 AI 应用与模型的开源框架,支持构建模型推理 API、任务队列、LLM 应用与多模型流水线。它提供了标准化的服务化流程、容器化打包与云原生扩★ 8,870vllm-omni面向全模态模型的统一高效推理框架,支持文本、图像、视频、音频等多种模态的高性能推理,延续 vLLM 的工程优势,为多模态大模型应用提供稳定快速的部署方案。★ 7,135kserveKServe 是一个基于 Kubernetes 的标准化的分布式生成式 AI 和预测式 AI 推理平台,旨在为可扩展、多框架的模型部署提供统一解决方案。它解决了★ 6,046OlaresOlares 是一个开源的个人云操作系统,专为常驻智能体(Always-On Agents)设计。它解决了个人在本地或边缘环境部署、运行和管理 AI 智能体时面★ 5,294AI-Infra-from-Zero-to-Hero这是一个面向机器学习系统领域的精选资源合集,旨在帮助开发者从零开始系统学习AI基础设施。项目汇集了OSDI、NSDI、SIGCOMM、SoCC、MLSys等顶级★ 4,403LightLLMLightLLM 是一个基于 Python 的轻量级大语言模型推理与服务框架,主打轻量设计、易于扩展和高性能。它解决了 LLM 部署中常见的资源占用高、扩展复杂★ 4,304FedMLFedML 是一个统一且可扩展的机器学习库,专注于大规模分布式训练、模型服务和联邦学习。它提供跨云调度器 FedML Launch,支持在任意 GPU 云或本地★ 4,067loraxLorax 是一个专为大规模多 LoRA 推理而设计的高性能服务器,能够同时承载数千个微调后的 LLM。它解决了传统推理服务中每个微调模型需要独立部署、资源消耗★ 3,834chituchitu 是一个面向大语言模型的高性能推理框架,专注于效率、灵活性和可用性。它旨在解决 LLM 推理过程中的性能瓶颈和部署复杂性问题,通过优化的内核和调度策略★ 3,010vllm-ascendvllm-ascend 是 vLLM 在华为昇腾(Ascend)硬件上的社区维护插件,旨在让 vLLM 这一主流大模型推理框架能够无缝运行在昇腾 NPU 上。它★ 2,911openlakeOpenLake 是一个用 Rust 编写的高性能存储引擎,专为大型语言模型(LLM)推理和 GPU 训练而设计。它解决的是传统数据存储系统在 AI 工作负载下★ 2,656envdenvd 是一个面向人类和 AI 代理的可复现开发环境管理工具。它解决了开发环境配置不一致、依赖管理复杂、环境迁移困难等痛点,通过声明式配置文件和容器化技术,让★ 2,236aiciAICI(Artificial Intelligence Controller Interface)是一个开源框架,它提出了一种全新的与大语言模型交互的方式:将★ 2,076mlrunMLRun 是一个开源的 MLOps 平台,旨在帮助团队快速构建和管理持续运行的机器学习应用全生命周期。它解决的核心问题是 ML 项目从开发到生产的工程化难题,★ 1,700kitopskitops 是一个来自 CNCF 的 DevOps 工具,用于将 AI/ML 模型、数据集、代码和配置打包并版本化为 OCI Artifact。它解决了 AI★ 1,423rtp-llmRTP-LLM是阿里巴巴开源的高性能大语言模型推理引擎,旨在为多样化的应用场景提供低延迟、高吞吐的推理服务。它解决了LLM在生产环境中部署时面临的性能瓶颈和资源★ 1,357hopsworksHopsworks 是一个面向数据密集型 AI 的平台,核心是 Feature Store(特征存储),旨在解决机器学习特征管理混乱、训练与推理数据不一致的问题★ 1,306sglang-omniSGLang-Omni 是一个基于 SGLang 的高性能多模态推理服务框架,专注于语音相关模型(TTS、ASR)及全模态(omni)模型的部署。它解决了传统语★ 1,302trussTruss 是一个用于在生产环境中部署 AI/ML 模型的 Python 开源框架,旨在简化模型服务的流程。它解决了从模型训练到实际部署之间的复杂工程问题,让开★ 1,205mosecmosec 是一个高性能的机器学习模型服务框架,专注于解决模型部署中的吞吐量和资源利用率问题。它通过动态批处理(dynamic batching)和 CPU/G★ 902YataiYatai 是一个基于 Kubernetes 的模型部署平台,旨在帮助机器学习团队将训练好的模型规模化地部署到生产环境。它解决了模型从实验到上线过程中面临的部署★ 839ServerlessLLMServerlessLLM 是一个面向大语言模型(LLM)的无服务器推理服务平台,旨在让任何人都能轻松部署和运行 LLM 服务。它解决了传统 LLM 部署中资源★ 715pegainferpegainfer 是一个用纯 Rust 编写的 LLM 推理引擎,底层直接调用 CUDA 内核,不依赖 PyTorch 或任何 Python 运行时。它解决的★ 712timbertimber 是一个面向经典机器学习模型的高性能推理编译器,定位为“Ollama for classical ML models”。它通过 AOT(Ahead-★ 687JetStreamJetStream 是一个面向 XLA 设备(当前以 TPU 为主,未来计划支持 GPU)的 LLM 推理引擎,专注于提升吞吐量和优化内存使用。它解决了在 TP★ 461predikitPredikit 是一个 Python 开发框架,定位为机器学习模型与 AI 智能体之间的桥梁。它解决的核心问题是:传统 ML 模型(如 scikit-lear★ 393stable-diffusion-deploystable-diffusion-deploy 是一个基于 Lightning Apps 框架构建的 Stable Diffusion 模型云服务部署参考项目。★ 391BentoDiffusionBentoDiffusion 是一个基于 BentoML 的扩散模型服务集合,旨在简化 Stable Diffusion 等扩散模型的部署、推理和微调流程。它解★ 389swiftLLMswiftLLM 是一个极简但高性能的 LLM 推理系统,专为研究目的设计。它用仅约 2000 行 Python 代码实现了与 vLLM 相当的性能,代码量仅为★ 359flamaflama 是一个面向预测式与生成式 AI 的生产级框架,旨在让开发者以极简方式将任意模型快速部署为 API。它解决了模型服务化过程中配置复杂、接口不统一、缺乏★ 298chitrachitra 是一个面向全栈深度学习的多功能 Python 库,旨在简化从模型构建到 API 开发再到模型部署的完整流程。它解决了深度学习项目中常见的工程化痛点★ 234clearml-servingClearML Serving 是 ClearML 生态中的模型服务编排与仓库解决方案,用于将训练好的机器学习模型部署为生产级推理服务。它解决的是模型从实验到上★ 170SmarterRouterSmarterRouter 是一个面向本地 AI 实验室的智能 LLM 网关和路由工具,专门服务于 Ollama、llama.cpp 和 OpenAI 等后端。★ 153monai-deploy-app-sdkMONAI Deploy App SDK 是 MONAI 项目的一部分,专注于医疗影像 AI 应用的全生命周期管理。它提供了一套框架和工具,帮助开发者设计、开发★ 138serving-pytorch-modelsserving-pytorch-models 是一个面向 PyTorch 模型生产部署的教程型开源项目,主要展示如何使用 TorchServe 将训练好的 Py★ 102infermuxinfermux 是一个用 Go 编写的开源工具,专注于跨云服务提供商的网络路由推断。它解决了在多云或混合云环境中,难以准确判断数据包从源到目的地所经过的网络路★ 95nboxnbox 是 NimbleBox 平台的官方 Python 包,旨在将平台的所有 API 封装为命令行工具和可复用的 Python 模块,从而简化机器学习工作流★ 87inferencedbinferencedb 是一个实验性的开源基础设施项目,旨在将生产环境中实时机器学习模型的推理结果流式传输到任意数据湖。它解决了模型推理数据难以统一收集、存储和★ 81ray_vllm_inferenceray_vllm_inference 是一个将 vLLM 与 Ray Serve 集成的轻量级 LLM 推理服务项目,旨在提供快速且可扩展的大模型服务能力。它解★ 79CLIP-API-serviceCLIP-API-service 是一个基于 OpenAI CLIP 模型封装的即用型 API 服务,旨在将 CLIP 的图文跨模态能力以简单易用的 HTTP ★ 67dgx-spark-inference-stackdgx-spark-inference-stack 是一个面向 NVIDIA DGX Spark(Grace Blackwell 桌面级 AI 超算)的推理服务★ 52