
llm-engine
自建大模型推理与微调平台,OpenAI 接口一键迁移
llm-engine 是 Scale AI 开源的 LLM 推理与微调引擎,面向企业级大模型部署场景。它把模型服务、批量推理、LoRA/全参微调等能力封装成统一 API,底层基于 vLLM 等高性能推理框架,支持在自有 GPU 集群上托管开源模型(如 Llama、Mistral 系列),并提供 OpenAI 兼容接口,方便现有应用直接迁移。项目还包含微调任务编排、模型版本管理和自动扩缩容等工程化组件,目标是让团队不必从零搭建推理基础设施,就能完成从模型上传、微调到线上服务的完整闭环。对于需要私有化部署、数据不出内网的团队,它提供了一条相对省心的落地路径。
开源
unknown
模型训练
GitHub 星标
★ 839
维护状态
较活跃
是否开源
是
定价模式
unknown
项目数据
分类模型训练
开发团队scaleapi
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型fine-tune,llm,python,scaleai
GitHub 星标★ 839
30天Star增速
HF 下载量
上线时间2023-07-13 00:00:00
最近更新2026-09-16 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0
使用教程
核心亮点
- 提供 OpenAI 兼容 API,现有应用改个 base_url 即可接入
- 集成 vLLM 推理后端,支持高吞吐批量推理与流式输出
- 内置 LoRA 微调与模型版本管理,覆盖从训练到上线的闭环
不足之处
- 项目早期,文档与示例较少,上手需要一定工程能力
- 社区活跃度和生态集成不如 vLLM、TGI 等成熟方案
适用场景
- 企业内网私有化部署开源大模型对外提供 API 服务
- 基于业务数据做 LoRA 微调并快速上线专属模型
- 需要 OpenAI 接口兼容、平滑替换云端 API 的应用迁移
替代项目
vLLM、text-generation-inference、OpenLLM
项目介绍
同类项目推荐
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···