truss

把模型打包成 API,一行命令部署上线

Truss 是一个用于在生产环境中部署 AI/ML 模型的 Python 开源框架,旨在简化模型服务的流程。它解决了从模型训练到实际部署之间的复杂工程问题,让开发者无需深入理解底层基础设施即可快速上线模型服务。Truss 提供声明式配置,支持自动生成 Docker 镜像、依赖管理、API 端点创建、模型版本管理以及可观测性集成。其核心能力包括:将任何 Python 模型打包为 REST API、自动处理请求批处理与 GPU 资源调度、内置 Falcon 高性能 Web 框架、支持本地与云环境无缝切换。通过简单的目录结构和配置文件,开发者可以快速将 HuggingFace 等预训练模型部署为生产级服务。

开源 unknown 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1204
维护状态 活跃
是否开源 是
定价模式 unknown

项目数据

分类图像生成
开发团队basetenlabs
所属国家
定价模式unknown
价格说明官网为产品页,但未明确展示定价信息,需进一步查看。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型artificial-intelligence,easy-to-use,falcon,inference-api,inference-server,machine-learning,model-serving,open-source,packaging,stable-diffusion,whisper,wizardlm
GitHub 星标★ 1204
30天Star增速
HF 下载量
上线时间2022-07-06 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:入门 约 10 分钟 部署方式:云服务 6 步

环境要求

  • Python 环境(可用 pip 安装包)
  • 已安装 uv 包管理器(提供 uvx 命令)
  • 已注册或登录 Baseten 账号(app.baseten.co)
  • 准备一个 config.yaml,用于声明模型、硬件与推理引擎

安装与启动步骤

  1. 1安装 Truss

    用 pip 安装并升级 Truss CLI,安装完成后即可使用 truss 命令;也可以跳过此步,直接用 uvx 运行。

    pip install --upgrade truss
  2. 2安装 uv 工具

    按 uv 官方文档安装这个快速 Python 包管理器;本指南用 uvx 直接运行 Truss 命令,无需单独安装步骤。

  3. 3注册 Baseten 账号

    前往 app.baseten.co 注册或登录。部署会把模型推到 Baseten 云端,运行在 GPU 上,注意产生用量。

  4. 4编写 config.yaml

    新建 config.yaml,声明要部署的模型、硬件和引擎,例如 Qwen2.5-3B-Instruct 搭配 L4 GPU 与 TRT-LLM。

  5. 5推送到 Baseten

    执行 push 完成部署,默认是正式发布部署;TRT-LLM 不支持 --watch 开发模式(--watch 仅用于自定义 Python 模型)。

    uvx truss push
  6. 6记录部署信息

    从终端输出中保存 Model ID、Deployment ID、Endpoint 与 Logs 链接,其中 Model ID 用于调用模型 API。

如何确认成功

终端出现 “Model Qwen 2.5 3B was successfully pushed” 并打印 Model ID、Deployment ID 与 Endpoint 地址,即部署成功。

常见问题

Q:为什么用 uvx truss 而不是直接 truss?

A:README 推荐用 uvx 直接运行 Truss 命令,无需单独安装,可跳过 pip 安装步骤;两种方式都能执行同一套 Truss 命令。

Q:可以用 --watch 做开发模式部署吗?

A:TRT-LLM 部署不支持 --watch,会提示改用发布的正式部署;开发模式(live reload)仅适用于自定义 Python 模型。

Q:部署后怎么调用模型?

A:使用输出中的 Endpoint(OpenAI 兼容接口)发起请求,调用时需要用到输出里的 Model ID。

Q:config.yaml 里要写哪些字段?

A:README 只说明它指定模型、硬件和引擎,未给出具体字段示例,请参考官方文档 docs.baseten.co 的示例配置。

注意事项

  • 默认 push 是正式发布部署,不是开发模式;开发模式需额外加 --watch 且不适用于 TRT-LLM。
  • 部署过程会下载 Hugging Face 权重并用 TensorRT-LLM 编译,随后部署到 L4 GPU,耗时与云端费用取决于模型大小。
  • README 未提供 config.yaml 的字段示例,本教程未虚构任何配置项,实际字段请以官方文档为准。

核心亮点

  • 声明式配置,几分钟内将模型转为生产级 REST API
  • 自动处理依赖、Docker 镜像和 GPU 调度,省去 DevOps 工作
  • 内置 Falcon 框架,性能高且支持流式响应

不足之处

  • 项目星标较少,社区规模相对有限
  • 文档/社区待观察

适用场景

  • 快速将研究原型模型部署为内部 API 服务
  • 为 HuggingFace 模型提供生产级推理端点
  • 在云环境或本地一键启动模型服务,用于测试或演示

替代项目

BentoML、Ray Serve、MLflow Models

项目介绍

truss 是基础设施领域的开源项目,由 basetenlabs 开发,2022 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,204)位列前 30%,在基础设施分类中处于中上游。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。官网为产品页,但未明确展示定价信息,需进一步查看。从国内网络环境看,可直接访问。

它主要面向的使用场景是:快速将研究原型模型部署为内部API服务。同类可对比的替代方案包括 BentoML、Ray Serve、MLflow Models。

上一篇:modal-examples

下一篇:biniou

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09