paddler

自托管 LLM 负载均衡,简单部署,CPU/GPU 通吃

paddler 是一个用 Rust 编写的开源 LLM/VLM 负载均衡与服务平台,专为自托管大语言模型和多模态模型的大规模部署而设计。它围绕 ggml 生态构建,支持 CPU 和 GPU 运行,旨在成为 llm-d、Docker Model Runner 等项目的轻量级替代方案。paddler 解决的核心问题是:在自托管多个模型时,如何高效地分配请求、管理模型生命周期,并简化部署流程。它的核心能力包括智能负载均衡、模型动态加载与卸载、统一的 API 接口,以及基于 Rust 的高性能低资源占用。相比同类项目,paddler 组件更少,部署更简单,特别适合希望快速搭建私有模型服务且不想引入复杂编排系统的团队。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1676
维护状态 活跃
是否开源
定价模式 free

项目数据

分类开源模型
开发团队intentee
所属国家
定价模式free
价格说明开源项目,Apache-2.0 许可证,可自由使用和部署,无付费版本。
访问状态
是否开源
开源协议Apache-2.0
主要语言Rust
技术栈/模型ai,llamacpp,llm,llmops,load-balancer
GitHub 星标★ 1676
30天Star增速
HF 下载量
上线时间2024-04-27 00:00:00
最近更新2026-09-21 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:入门 约 10 分钟 部署方式:本地安装 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 能访问 GitHub Releases 页面以下载 paddler 二进制文件
  • 若选择源码构建,需安装 Rust,MSRV(最低支持版本)为 1.88.0
  • 运行推理需要自托管的基础设施(README 说明支持 CPU 与 GPU,基于 ggml/llama.cpp 生态)

安装与启动步骤

  1. 1获取 paddler 二进制

    README 提供选项一:从 GitHub Releases 页面下载最新版本发布的 paddler 二进制文件,README 未给出具体下载命令。

  2. 2让二进制可用

    README 说明 paddler 是单文件自包含程序,只需把 paddler 二进制放到系统 PATH 中即可使用,无需其他依赖。

  3. 3或从源码构建

    README 提供选项二:从源码构建 paddler,最低支持的 Rust 版本为 1.88.0,README 未给出具体构建命令。

  4. 4通过管理面板确认运行

    paddler 内置 Web 管理面板,可用于管理、监控与测试;README 未提供启动命令和访问端口。

如何确认成功

README 未给出启动命令,可通过内置 Web 管理面板与可观测性指标确认服务是否正常运行,具体方式请查阅官网文档。

常见问题

Q:找不到适合我系统的预编译二进制怎么办?

A:使用 README 的选项二,从源码自行构建,注意 Rust 版本至少为 1.88.0。

Q:paddler 支持 GPU 推理吗?

A:支持。README 说明其围绕 llama.cpp/ggml 生态构建,可运行在 CPU 和 GPU 上。

Q:需要额外部署负载均衡组件吗?

A:不需要。paddler 自带 LLM 专用负载均衡,二进制自包含,组件数量少于同类项目。

Q:能否配合自动扩缩容使用?

A:可以。README 提到 agent 可动态添加,并支持请求缓冲,从而实现从零主机开始扩容。

注意事项

  • README 的安装章节只给出两种获取方式(下载 release 或源码构建),未提供启动命令、端口和配置项,请以官方 Release 页面与官网文档为准。
  • 从源码构建时,Rust 最低支持版本(MSRV)为 1.88.0。
  • paddler 支持动态模型切换与可观测性指标,适合自托管 LLM/VLM 的大规模部署场景。

核心亮点

  • 基于 Rust 实现,内存占用低,性能强劲,适合高并发场景
  • 围绕 ggml 生态构建,天然支持 llama.cpp 等模型,CPU 推理优化好
  • 部署极简,组件少,无需 Kubernetes 等重型编排,开箱即用

不足之处

  • 项目较新,生态和文档尚在完善中,社区规模有限
  • 功能聚焦负载均衡,相比 vLLM 等缺少高级推理优化(如 PagedAttention)

适用场景

  • 企业内部自托管多个 LLM 模型,需要统一入口和负载分发
  • 在 CPU 或混合 CPU/GPU 环境下提供轻量级模型推理服务
  • 作为 Docker Model Runner 或 llm-d 的替代,简化模型服务部署

替代项目

llm-d、Docker Model Runner、vLLM

项目介绍

paddler 是基础设施领域的开源项目,由 intentee 开发,2024 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,676)位列前 30%,在基础设施分类中处于中上游。

近 42 天,它的 GitHub 星标从 1,651 增加到 1,676,净增 25。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-21。Apache-2.0 许可证,可自由使用和部署,无付费版本。

它主要面向的使用场景是:企业内部自托管多个LLM模型,需要统一入口和负载分发。同类可对比的替代方案包括 llm-d、Docker Model Runner、vLLM。

上一篇:FastFlowLM

下一篇:gpu-hot

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09