OpenLLM

开源大模型一键变成标准接口,部署上线像点外卖

让任意开源 LLM(如 DeepSeek、Llama)一键以 OpenAI 兼容的 API 形式部署到云端的工具。它屏蔽了模型服务化的复杂度,提供标准化的推理接口,支持在云端弹性扩展,是快速搭建 LLM 服务、接入各类应用的轻量级方案。

开源 unknown 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 12545
维护状态 活跃
是否开源 是
定价模式 unknown

项目数据

分类基础设施
开发团队bentoml
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型bentoml,fine-tuning,llama,llama2,llama3-1,llama3-2,llama3-2-vision,llm,llm-inference,llm-ops,llm-serving,llmops,mistral,mlops,model-inference,open-source-llm,openllm,vicuna
GitHub 星标★ 12545
30天Star增速
HF 下载量
上线时间2023-04-19 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:入门 约 10 分钟 部署方式:本地安装 5 步

环境要求

  • Python 环境(可用 pip 或 pip3 安装包)
  • 按所选模型准备对应显存,例如 gemma2:2b 需 12G GPU,deepseek:r1-671b 需 80Gx16
  • 若部署 gated(受限)模型,需准备 Hugging Face 的 HF_TOKEN
  • 若要部署到 BentoCloud,需先注册并登录 BentoCloud 账号

安装与启动步骤

  1. 1安装 OpenLLM

    用 pip 安装 OpenLLM 包,若系统默认是 python3 可改用 pip3 install openllm。

    pip install openllm
  2. 2交互式体验

    运行内置的 hello 命令,交互式地快速体验 OpenLLM 功能。

    openllm hello
  3. 3启动模型服务

    用 serve 子命令拉起一个模型,模型名与规格用冒号连接;请按显存要求选择模型。

    openllm serve gemma2:2b
  4. 4注册自定义仓库

    按默认模型仓库的格式把自定义模型放进 bentos 目录后,注册自己的模型仓库。

    openllm repo add my-repo https://github.com/bentoml/openllm-repo
  5. 5部署到 BentoCloud

    登录 BentoCloud 后一条命令把模型部署到云端,gated 模型需带上 HF_TOKEN。

    openllm deploy llama3.2:1b --env HF_TOKEN

关键配置

配置项必填说明示例
HF_TOKEN否部署 gated(受限)模型时需要,在环境变量中提供的访问令牌。hf_xxxxxxxxxxxxxxxxxxxx

如何确认成功

openllm serve 启动成功后终端会输出服务信息,打开内置 Chat UI 或调用 OpenAI 兼容接口能正常得到模型回复。

常见问题

Q:显存不够怎么办?

A:参考支持模型表挑选所需 GPU 更小的模型,例如 gemma2:2b 与 gemma3:3b 只需 12G 显存,deepseek:r1-671b 则需 80Gx16。

Q:部署 gated 模型报错怎么处理?

A:确保已在环境变量中设置 HF_TOKEN,部署时带上 --env HF_TOKEN,例如 openllm deploy llama3.2:1b --env HF_TOKEN。

Q:能用自己微调的模型吗?

A:可以。按默认模型仓库的格式,参照 BentoML 构建 Bentos 的方式把自定义模型放入 bentos 目录,再用 openllm repo add 注册仓库。

Q:可以直接部署到云端吗?

A:可以。注册并登录 BentoCloud 后执行 openllm deploy,即可获得带自动扩缩容和可观测性的托管推理服务。

注意事项

  • OpenLLM 目前只支持添加公开(public)的模型仓库。
  • 不同模型对 GPU 显存要求差异极大,启动前请先对照支持模型表确认硬件。
  • 部署到 BentoCloud 需要先注册并登录账号,属于云服务路径,会产生云端费用。

核心亮点

  • 一键将任意开源LLM(如DeepSeek、Llama)部署为OpenAI兼容API,降低接入成本
  • 基于BentoML生态,支持云原生部署、自动扩缩容和模型服务化,运维便捷
  • 活跃社区,12k+星标,持续支持最新模型(如Llama 3.2 Vision)和微调集成

不足之处

  • 文档/社区待观察
  • 依赖BentoML框架,对非该生态用户有学习曲线

适用场景

  • 快速搭建企业内部LLM网关,统一管理多种开源模型
  • 将开源模型无缝替换或补充OpenAI API,实现成本优化和隐私保护
  • 在云端部署多模型推理服务,支持动态切换和负载均衡

替代项目

vLLM、Ollama、LocalAI

项目介绍

OpenLLM 是基础设施领域的开源项目,由 bentoml 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(12,545)位列前 4%,在基础设施分类的 1,130 个项目里位列前 6%。

近 44 天,它的 GitHub 星标从 12,455 增加到 12,545,净增 90。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。从国内网络环境看,可直接访问。

它主要面向的使用场景是:快速搭建企业内部LLM网关,统一管理多种开源模型。同类可对比的替代方案包括 vLLM、Ollama、LocalAI。

上一篇:weaviate

下一篇:tensorzero

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09