lorax

一个服务跑上千个微调模型,省 GPU 又省心

Lorax 是一个专为大规模多 LoRA 推理而设计的高性能服务器,能够同时承载数千个微调后的 LLM。它解决了传统推理服务中每个微调模型需要独立部署、资源消耗巨大的问题,通过共享基础模型权重,将多个 LoRA 适配器动态加载到 GPU 内存中,实现高吞吐、低延迟的批量推理。核心能力包括:支持 Hugging Face 模型和 LoRA 权重、动态加载/卸载适配器、连续批处理、Paged Attention 优化、与 OpenAI 兼容的 API,以及内置的 Prometheus 监控指标。Lorax 特别适合需要为大量用户或场景提供个性化模型服务的场景,如多租户 AI 平台、A/B 测试、个性化推荐等,显著降低部署成本和运维复杂度。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3835
维护状态 低维护
是否开源
定价模式 free

项目数据

分类开源模型
开发团队predibase
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,可自行部署使用,无收费版本。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型fine-tuning,gpt,llama,llm,llm-inference,llm-serving,llmops,lora,model-serving,pytorch,transformers
GitHub 星标★ 3835
30天Star增速
HF 下载量
上线时间2023-10-20 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 20 分钟 部署方式:Docker 6 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 支持 CUDA 的 NVIDIA GPU(LoRA 适配器需动态加载到 GPU 内存)
  • 已安装 Docker,用于运行官方预构建镜像
  • Python 环境(如需使用 Python 客户端调用)

安装与启动步骤

  1. 1确认运行环境

    准备带 CUDA 的 NVIDIA GPU 与 Docker。README 明确建议从官方预构建 Docker 镜像入手,避免自行编译 CUDA 内核和其他依赖。

  2. 2获取预构建镜像

    按官方文档 Getting Started 的说明拉取 LoRAX 预构建镜像;README 节选未给出具体镜像名,请以官方文档为准。

  3. 3启动 LoRAX 服务

    参考官方文档 Launch LoRAX Server 一节启动服务,模型与端口参数以文档为准,README 节选未列出具体启动命令。

  4. 4REST API 发起推理

    服务启动后,按文档 Prompt via REST API 一节发送请求,即可用指定 LoRA 适配器完成推理。

  5. 5Python 客户端调用

    按文档 Prompt via Python Client 一节,用 Python 客户端提交推理请求,适合集成到脚本或服务中。

  6. 6OpenAI 兼容对话

    按文档 Chat via OpenAI API 一节,使用 OpenAI 兼容接口进行对话调用,可直接复用现有 OpenAI SDK 代码。

如何确认成功

REST API 或 Python 客户端能正常返回推理结果,即表示服务已就绪;README 未给出具体健康检查命令。

常见问题

Q:为什么 README 推荐用 Docker 镜像部署?

A:README 明确说明使用预构建 Docker 镜像可以避免编译自定义 CUDA 内核和其他依赖,省去大量环境配置工作。

Q:如何接入自己的 LoRA 适配器?

A:README 的功能说明指出,可在请求中直接指定来自 HuggingFace、Predibase 或任意本地文件系统的 LoRA 适配器,服务会即时加载而不阻塞并发请求。

Q:是否兼容 OpenAI 接口?

A:兼容。README 目录中提供了 Chat via OpenAI API 一节,可按其示例用 OpenAI 格式的接口进行对话调用。

Q:能不能同时服务多个微调模型?

A:可以。LoRAX 的设计目标就是在单张 GPU 上服务数千个微调模型,通过共享基础模型权重并动态加载 LoRA 适配器来降低部署成本。

注意事项

  • README 节选未给出镜像名、端口和具体启动命令,实际部署请以官方文档 Getting Started 为准。
  • 官方推荐使用预构建 Docker 镜像,自行编译 CUDA 内核容易出错。
  • LoRA 适配器支持 HuggingFace、Predibase 和本地文件系统三种来源,请求时即时加载。

核心亮点

  • 共享基础模型权重,单卡可承载数千 LoRA,显存占用大幅降低
  • 支持动态加载/卸载适配器,无需重启服务即可切换模型
  • 提供 OpenAI 兼容 API,迁移成本低,集成方便

不足之处

  • 仅支持 LoRA 类微调,不适用于全量微调模型
  • 文档/社区待观察

适用场景

  • 多租户 AI 平台,为不同客户提供定制化模型服务
  • 大规模 A/B 测试,快速验证多个微调版本效果
  • 个性化推荐或对话系统,按用户动态切换模型

替代项目

vLLM、Text Generation Inference (TGI)、Punica

项目介绍

lorax 是模型训练领域的开源项目,由 predibase 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(3,835)位列前 30%,在模型训练分类的 518 个项目里位列前 13%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。Apache-2.0许可证,可自行部署使用,无收费版本。

它主要面向的使用场景是:多租户AI平台,为不同客户提供定制化模型服务。同类可对比的替代方案包括 vLLM、Text Generation Inference (TGI)、Punica。

上一篇:higgsfield

下一篇:Torch-Pruning

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13