vllm
本站收录 71 个带「vllm」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
FunASRFunASR 是阿里开源的多语言语音识别工具包,专为中文场景深度优化,同时支持英文、日文等。它解决了从训练到部署的全链路问题,包括语音识别(ASR)、端点检测(★ 20,549
llama-cookbookllama-cookbook 是 Meta 官方推出的 Llama 模型实战指南,以 Jupyter Notebook 形式提供从推理、微调到 RAG 的完整教★ 18,559
Halfrost-FieldHalfrost-Field 是一个以 Go 语言为主的技术博客与知识库,由作者 Halfrost 维护,内容涵盖源码深度解析、系统设计与工程实践。项目以系列文★ 13,238
LMCacheLMCache 是一个专为大型语言模型(LLM)推理场景设计的 KV 缓存加速层,旨在解决长上下文和多轮对话场景下推理速度慢、显存占用高的问题。它通过智能管理 ★ 11,941
OpenRLHFOpenRLHF 是一个基于 Ray 的强化学习框架,专为大规模语言模型(LLM)的智能体训练而设计。它解决了传统 RLHF(人类反馈强化学习)流程中训练效率低★ 10,053
inferenceXinference 是一个统一推理引擎,旨在解决多模型部署与调用碎片化问题。它允许开发者通过修改一行代码,将 GPT 替换为任何开源大语言模型、语音模型或多模★ 9,593
MooncakeMooncake 是 Moonshot AI 为其 Kimi 大语言模型服务打造的高性能推理平台,核心解决 LLM 服务中的高吞吐、低延迟和成本控制问题。它基于★ 6,689
kserveKServe 是一个基于 Kubernetes 的标准化的分布式生成式 AI 和预测式 AI 推理平台,旨在为可扩展、多框架的模型部署提供统一解决方案。它解决了★ 6,046
semantic-routersemantic-router 是一个用 Go 编写的可编程混合模型路由器,专为异构 LLM 推理场景设计。它解决的核心问题是:当企业或开发者需要同时调用多个不★ 5,980
gpustackgpustack 是一个面向高性能 AI 模型服务的 GPU 集群管理器,专注于简化 vLLM、SGLang 等推理引擎的部署与运维。它解决了 GPU 资源利用★ 5,768
UltraRAGUltraRAG 是一个基于 Python 的低代码 MCP(Model Context Protocol)框架,用于构建复杂且创新的 RAG(检索增强生成)流★ 5,711
sparrowsparrow 是一个专注于结构化数据提取、指令调用和智能体工作流的开源框架,结合了传统机器学习、大语言模型和视觉大模型的能力。它解决的核心问题是让开发者能够轻★ 5,226
tiny-llmtiny-llm 是一个面向系统工程师的 LLM 推理服务实战课程,专注于在 Apple Silicon 上构建一个精简版 vLLM + Qwen。项目通过亲手★ 4,735
cascadeflowCascadeFlow 是一个面向 AI 代理(Agent)的级联运行时,旨在解决代理循环中成本、延迟、质量和策略决策的优化问题。它允许开发者将多个模型或处理步★ 3,999
FastDeployFastDeploy 是百度飞桨(PaddlePaddle)生态下的高性能推理与部署工具包,专注于大语言模型(LLM)和多模态模型(VLM)的快速部署。它解决了★ 3,718
ramalamaRamaLama 是一个开源开发者工具,旨在简化 AI 模型的本地部署与推理流程。它通过容器化技术,让开发者能够从任何来源(如 HuggingFace、Olla★ 3,064
vllm-ascendvllm-ascend 是 vLLM 在华为昇腾(Ascend)硬件上的社区维护插件,旨在让 vLLM 这一主流大模型推理框架能够无缝运行在昇腾 NPU 上。它★ 2,911
InferenceXInferenceX 是一个开源的持续推理基准研究平台,专注在大规模 LLM 推理场景下做可复现、可持续的性能评测。它把当下主流大模型(如 Kimi、MiniM★ 1,792
vllm-mlxvllm-mlx 是一个专为 Apple Silicon 芯片设计的开源推理服务器,兼容 OpenAI 和 Anthropic API 协议。它解决了在 Mac★ 1,607
kvcachedkvcached 是一个面向大语言模型推理场景的虚拟化弹性 KV 缓存管理框架,核心目标是解决多模型、多租户共享 GPU 时 KV 缓存资源利用率低、隔离性差的★ 1,509
kubeaiKubeAI 是一个面向 Kubernetes 的 AI 推理 Operator,目标是把大模型、视觉语言模型、Embedding 和语音转文字等模型在生产环境★ 1,267
tiny-vllmtiny-vllm 是一个用 C++ 与 CUDA 从零实现的高性能 LLM 推理引擎教学项目,定位为 vLLM 的精简版。它解决的核心问题是:主流推理框架(如★ 1,135
prometheus-evalPrometheus-Eval 是一个用于评估大语言模型(LLM)回复质量的工具,基于 Prometheus 模型和 GPT-4 作为评判标准。它解决了 LLM★ 1,117
UniRL腾讯混元开源的统一多模态强化学习框架,支持在多模态场景下训练与优化模型。它提供统一的 RL 流程抽象,帮助研究者和工程师在文本、图像等多模态任务上高效开展强化学★ 999
AnyJevAnyJev 是一个把任意大语言模型改造成 Jev 风格决策模型的 Python 框架。它不依赖额外训练,而是通过类型化决策(typed decisions)与★ 985
time-to-first-token这是一个为期10周、每天30分钟的LLM推理服务与优化学习路线图。它面向想要系统掌握大模型推理性能调优的开发者,解决从理论到实践缺乏结构化路径的问题。项目核心能★ 960
llm_notellm_note 是一个面向大语言模型学习者的开源笔记仓库,用 Python 编写,内容覆盖模型推理、Transformer 结构解析以及主流 LLM 框架的源★ 892
llmcordllmcord 是一个将 Discord 变成大语言模型前端的开源项目。它解决了用户在 Discord 中直接调用多种 LLM 服务的问题,无需切换多个应用。核★ 836
haloHalo 是由 White Circle 开源的大语言与多模态模型训练框架,用 Python 编写。它面向从微调到强化学习后训练的完整流程,核心能力包括分布式训★ 798
BambooAIBambooAI 是一个由大语言模型驱动的数据分析智能体,核心特点是让 LLM 在持久化的 Python 内核中执行代码,而不是每次问答都重新启动环境。用户通过★ 790
LightCompressLightCompress 是一个面向大模型压缩的开源工具包,由 EMNLP 2024 和 AAAI 2026 论文支撑,支持对 LLM(大语言模型)、VLM(★ 749
pegainferpegainfer 是一个用纯 Rust 编写的 LLM 推理引擎,底层直接调用 CUDA 内核,不依赖 PyTorch 或任何 Python 运行时。它解决的★ 712
vidurVidur 是微软开源的 LLM 推理系统模拟器,用于在无需真实 GPU 集群的情况下,大规模、精确地评估大模型推理服务的性能表现。它通过建模算子级计算、显存占★ 685
taOStaOS 是一个自托管的 AI 智能体操作系统,旨在让用户的记忆、聊天、智能体和文件全部保存在自有硬件上,默认离线运行,也可选择接入云端。它解决了用户对数据主权★ 553
llmmanllmman 是一个用 Rust 编写的模型与 Agent 运行管理工具,核心思路是把大语言模型当作 OCI 镜像来存储和分发,让模型像 Docker 镜像一样★ 523
Spark-X2.5Spark-X2.5 是一个面向端侧设备的开源大模型系列,目标是在手机、笔记本等本地硬件上把智能体(Agent)能力推到极限。它解决的核心问题是:云端大模型调用★ 498
worker-vllmworker-vllm 是 Runpod 官方提供的 Serverless Worker 模板,用于在 Runpod 平台上部署基于 vLLM 的大语言模型推理★ 467
TinyLLMTinyLLM 是一个面向消费级硬件的本地大语言模型(LLM)与聊天机器人搭建工具。它解决了个人用户在普通电脑上运行大模型时面临的配置复杂、资源占用高、部署门槛★ 350
NeuralDeskAppNeuralDeskApp 是一个跨平台的桌面智能助手应用,旨在提供几乎本地化、最终合理的 AI 辅助体验。它基于 TypeScript 构建,集成多种本地大语★ 331
llmazllmaz 是一个面向 Kubernetes 的大模型推理平台,目标是把 vLLM、SGLang、TGI、llama.cpp、Ollama 等主流推理引擎统一纳★ 315
flamaflama 是一个面向预测式与生成式 AI 的生产级框架,旨在让开发者以极简方式将任意模型快速部署为 API。它解决了模型服务化过程中配置复杂、接口不统一、缺乏★ 298
hass_local_openai_llm这是一个 Home Assistant 的本地 LLM 集成组件,让用户可以直接在 HA 中使用本地运行的 OpenAI 兼容服务(如 llama.cpp、vL★ 289
OmniSpaceOmniSpace 是一个本地优先的全栈 AI 创作工作站,把 AI 对话、AI 漫画、漫剧创作、写作台和知识学习五个模块整合到一个应用里。它主要解决创作者在本★ 270
gpt_servergpt_server 是一个面向生产环境的 AI 服务部署框架,旨在统一集成多种主流模型能力,包括大语言模型(LLM)、Embedding、Reranker、A★ 253
LLMKubeLLMKube 是一个 Kubernetes Operator,用于在异构 GPU 集群上自托管大模型推理。它解决的核心问题是:家里或公司机房里混着 NVIDI★ 220
LMeterXLMeterX 是一个基于 Python 的通用 API 压测平台,专注于大模型推理服务与业务 HTTP 接口的性能测试。它解决传统压测工具难以适配 LLM 流★ 211
GutenOCRGutenOCR 是一个面向 OCR 场景的开源工具集,专注于视觉语言模型(VLM)的训练与评测。它解决的核心问题是:传统 OCR 方案在复杂版式、手写体或低质★ 191
GutenOCRGutenOCR 是一个面向 OCR 场景的开源工具集,专注于视觉语言模型(VLM)的训练与评测。它解决的核心问题是:传统 OCR 方案在复杂版面、手写体、多语★ 191
One-EvalOne-Eval 是一个面向大语言模型评测的自动化系统,核心思路是用 agent 来驱动整个评测流程。传统 LLM 评测往往需要人工配置数据集、编写推理脚本、跑★ 164
vLLM-HookvLLM-Hook 是一个针对 vLLM 推理引擎的插件,允许开发者编程访问和修改模型在推理过程中的内部状态。它解决了 vLLM 默认黑盒推理、难以干预中间层输★ 162