trainer

在 Kubernetes 上轻松跑起分布式模型训练和微调

trainer 是一个基于 Kubernetes 的分布式 AI 模型训练与 LLM 微调平台,由开源社区维护。它解决了在 Kubernetes 上运行大规模训练任务时面临的资源调度、分布式通信、生命周期管理复杂等问题。核心能力包括:将训练任务抽象为 Kubernetes 自定义资源(CRD),支持 PyTorch、TensorFlow 等主流框架的分布式训练;内置弹性伸缩、故障恢复、日志监控等机制,简化运维;提供统一的训练作业 API 和 CLI,便于集成到 CI/CD 流水线。项目采用 Go 语言开发,目前处于成长阶段,适合需要灵活、可扩展训练基础设施的团队。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2228
维护状态 活跃
是否开源
定价模式 free

项目数据

分类开源模型
开发团队kubeflow
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和自行部署。
访问状态
是否开源
开源协议Apache-2.0
主要语言Go
技术栈/模型ai,distributed,fine-tuning,gpu,huggingface,jax,kubeflow,kubernetes,llm,machine-learning,mlops,python,pytorch,tensorflow,xgboost
GitHub 星标★ 2228
30天Star增速
HF 下载量
上线时间2017-06-28 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:高级 约 30 分钟 部署方式:本地安装 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 一个可用的 Kubernetes 集群(Trainer 基于 Kubernetes 运行,训练任务以自定义资源形式提交)
  • 可访问 GitHub 与官网文档,用于获取安装说明
  • 如需本地编译或二次开发,需准备 Go 语言环境(项目使用 Go 开发)

安装与启动步骤

  1. 1查看官方文档

    README 明确要求按官方文档安装,先打开 getting-started 页面,确认当前版本与前置组件。

  2. 2准备 K8s 集群

    Trainer 运行在 Kubernetes 之上,需先准备可用集群并具备创建 CRD、Pod 等资源的权限。

  3. 3克隆源码仓库

    可选步骤,仅在需要查看源码或本地开发时使用;README 未提供该命令,此地址来自项目 GitHub 地址。

    git clone https://github.com/kubeflow/trainer.git
  4. 4按文档安装

    按官方 getting-started 页面给出的命令把 Trainer 安装到集群,README 中未给出任何具体安装命令。

如何确认成功

README 未给出验证命令;安装后请按官方文档确认 Trainer 控制平面与相关 CRD 是否就绪。

常见问题

Q:照着 README 能完成安装吗?

A:不能。README 只指向官方文档 https://trainer.kubeflow.org/en/latest/getting-started/index.html,安装命令需以该页面为准。

Q:必须自己准备 Kubernetes 集群吗?

A:是。Kubeflow Trainer 是运行在 Kubernetes 上的训练平台,训练任务会被抽象为自定义资源(CRD)提交到集群。

Q:支持哪些训练框架?

A:支持 PyTorch、TensorFlow 等主流框架,v2.2 起新增 JAX 与 XGBoost 训练运行时,并支持 MPI/Flux 面向 HPC 的场景。

Q:如何确认自己该用哪个版本?

A:可查看 GitHub Releases,最新为 v2.3.0(2026/08 发布),并按官方文档选择匹配版本安装。

注意事项

  • README 未提供安装命令,本教程仅包含可从 README 推断的准备动作,实际部署必须以官方文档为准。
  • 项目为 Go 开发的 Kubernetes 组件,建议具备 Kubernetes 基础后再部署。
  • 涉及 LLM 微调、分布式训练时通常需要 GPU 节点,请按官方文档确认集群资源要求。

核心亮点

  • 深度集成 Kubernetes,原生支持资源调度和弹性伸缩
  • 支持多种分布式训练框架,如 PyTorch、TensorFlow
  • 提供 CRD 和控制器,训练作业可声明式管理,便于 GitOps

不足之处

  • 文档和社区生态尚在早期,中文资料较少
  • 高级功能如超参数调优、模型注册等依赖外部组件

适用场景

  • 在 Kubernetes 集群中运行大规模 LLM 微调任务
  • 需要弹性伸缩和故障恢复的分布式训练生产环境
  • 将训练流程纳入现有 CI/CD 和 GitOps 工作流

替代项目

Kubeflow Training Operator、Ray Train、Volcano

项目介绍

trainer 是模型训练领域的开源项目,由 kubeflow 开发,2017 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(2,228)位列前 30%,在模型训练分类中处于中上游。

近 42 天,它的 GitHub 星标从 2,179 增加到 2,228,净增 49。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。Apache-2.0许可证,可免费使用和自行部署。

它主要面向的使用场景是:在Kubernetes集群中运行大规模LLM微调任务。同类可对比的替代方案包括 Kubeflow Training Operator、Ray Train、Volcano。

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13