BentoML

模型打包一键变线上服务,上线运维全不操心

以最简单的方式部署 AI 应用与模型的开源框架,支持构建模型推理 API、任务队列、LLM 应用与多模型流水线。它提供了标准化的服务化流程、容器化打包与云原生扩展能力,帮助团队把训练好的模型快速、稳定地推向生产环境。

开源 freemium 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 8855
维护状态 较活跃
是否开源 是
定价模式 freemium

项目数据

分类基础设施
开发团队bentoml
所属国家
定价模式freemium
价格说明开源框架免费,BentoCloud 云平台提供免费额度,付费升级获取更多资源与功能。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型ai-inference,deep-learning,generative-ai,inference-platform,llm,llm-inference,llm-serving,llmops,machine-learning,ml-engineering,mlops,model-inference-service,model-serving,multimodal,python
GitHub 星标★ 8855
30天Star增速
HF 下载量
上线时间2019-04-02 00:00:00
最近更新2026-09-22 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:入门 约 15 分钟 部署方式:本地安装 8 步

环境要求

  • Python 虚拟环境(用于安装 BentoML 及相关依赖)
  • 本地运行推理服务需额外安装 torch 与 transformers
  • 打包成容器镜像时本机需已安装并运行 Docker
  • 部署到 BentoCloud 需先注册账号并登录获取 API token

安装与启动步骤

  1. 1安装 BentoML

    README 的安装代码块为空,未给出具体命令,请按官网文档安装 BentoML,安装后确认 bentoml 命令可用。

  2. 2安装本地运行依赖

    在 Python 虚拟环境中额外安装 PyTorch 和 Transformers,否则示例服务无法在本地运行。

    pip install torch transformers
  3. 3本地启动服务

    在项目目录执行,服务默认监听 http://localhost:3000,终端出现 Starting production HTTP BentoServer 即启动成功。

    bentoml serve
  4. 4调用接口验证

    用 Python 脚本通过 SyncHTTPClient 访问本地 3000 端口,确认服务能正常返回推理结果。

    import bentoml
    
    with bentoml.SyncHTTPClient('http://localhost:3000') as client:
        summarized_text: str = client.summarize([bentoml.__doc__])[0]
        print(f"Result: {summarized_text}")
  5. 5构建 Bento 包

    bentoml build 会把代码、模型和依赖配置打包成 Bento,这是 BentoML 的标准可部署产物。

    bentoml build
  6. 6生成容器镜像

    确保本机 Docker 正在运行,再执行 containerize 生成可部署的 Docker 镜像。

    bentoml containerize summarization:latest
  7. 7运行容器

    把容器 3000 端口映射到宿主机 3000,用 --rm 让容器退出后自动清理。

    docker run --rm -p 3000:3000 summarization:latest
  8. 8部署到 BentoCloud

    先登录生成 API token,再在当前目录执行部署命令推送到云上。

    bentoml cloud login
    bentoml deploy

关键配置

配置项必填说明示例
BENTOML_DO_NOT_TRACK否设置为 True 可关闭匿名使用数据上报True
--do-not-track否CLI 选项,附加到任意 bentoml 命令后关闭统计上报bentoml [command] --do-not-track

如何确认成功

终端出现 Starting production HTTP BentoServer ... listening on http://localhost:3000,浏览器打开 http://localhost:3000 可正常推理。

常见问题

Q:本地服务默认端口是多少?

A:README 说明默认监听 http://localhost:3000,启动后直接访问该地址即可推理。

Q:不想上报匿名使用数据怎么办?

A:执行 bentoml [command] --do-not-track,或设置环境变量 export BENTOML_DO_NOT_TRACK=True 即可关闭。

Q:containerize 报 Docker 相关错误?

A:README 强调生成镜像前必须确保 Docker 正在运行,请先启动 Docker 服务再重试。

Q:安装 BentoML 的命令是什么?

A:README 的安装代码块为空,未给出具体命令,请以官方文档为准,不要照抄本文档。

Q:部署到 BentoCloud 需要什么前置条件?

A:需先在 cloud.bentoml.com/signup 注册获取个人访问权限,再执行 bentoml cloud login 创建 API token。

注意事项

  • README 中 “Install BentoML” 下的代码块为空,安装步骤请参照官网文档,切勿照搬本教程。
  • 本地运行示例需要先 pip install torch transformers 补依赖。
  • Docker 打包前必须确认本机 Docker 已启动,否则 containerize 会失败。
  • 示例镜像名为 summarization:latest,实际项目请替换成自己构建的 Bento 名称。

核心亮点

  • 统一了模型推理、任务队列和多模型管线的部署流程,显著降低AI服务上线复杂度
  • 原生支持LLM应用与多模型pipeline,内置性能监控和自动扩缩容,适合生产环境
  • 提供Pythonic的API和丰富的框架适配(如PyTorch、TensorFlow、Transformers),上手门槛低

不足之处

  • 文档/社区待观察
  • 与Kubernetes等云原生生态的集成深度可能不如KServe等专用方案

适用场景

  • 将训练好的模型快速封装为REST/gRPC推理服务
  • 构建包含多个模型或LLM的复杂推理流水线
  • 需要异步任务队列处理批量推理或视频/图像处理

替代项目

Ray Serve、KServe、MLflow

项目介绍

BentoML 是基础设施领域的开源项目,由 bentoml 开发,2019 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(8,855)位列前 6%,在基础设施分类的 1,130 个项目里位列前 8%。

近 44 天,它的 GitHub 星标从 8,772 增加到 8,855,净增 83。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-22。开源框架免费,BentoCloud 云平台提供免费额度,付费升级获取更多资源与功能。从国内网络环境看,可直接访问。

它主要面向的使用场景是:将训练好的模型快速封装为REST/gRPC推理服务。同类可对比的替代方案包括 Ray Serve、KServe、MLflow。

上一篇:deeplake

下一篇:airweave

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09