determined

一键拉起分布式训练,自动调参省心省力

Determined 是一个开源机器学习平台,旨在简化分布式训练、超参数调优、实验追踪和资源管理。它支持 PyTorch 和 TensorFlow,提供统一的 API 和 CLI,让用户无需深入底层分布式系统细节即可轻松扩展训练任务。平台内置了先进的超参数搜索算法(如贝叶斯优化),自动记录实验元数据和指标,并提供 Web UI 进行可视化对比。同时,它具备集群资源调度能力,可动态分配 GPU 等资源,提高利用率。对于团队协作,Determined 支持实验共享和权限管理,帮助组织更高效地迭代模型。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3239
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类基础设施
开发团队determined-ai
所属国家
定价模式free
价格说明开源平台,Apache-2.0 许可证,可免费自托管使用,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Go
技术栈/模型data-science,deep-learning,distributed-training,hyperparameter-optimization,hyperparameter-search,hyperparameter-tuning,keras,kubernetes,machine-learning,ml-infrastructure,ml-platform,mlops,pytorch,tensorflow
GitHub 星标★ 3239
30天Star增速
HF 下载量
上线时间2020-04-07 00:00:00
最近更新2026-09-18 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:入门 约 10 分钟 部署方式:命令行工具 5 步

环境要求

  • 可运行 pip 的 Python 环境(README 未指定具体版本)
  • 本地部署:一台可运行 Determined 集群的机器(on-prem)
  • 云端部署:AWS 或 GCP 账号(README 提供对应部署指南链接)
  • 其他受支持环境:Kubernetes、Slurm/PBS

安装与启动步骤

  1. 1安装 Determined CLI

    使用 pip 安装 determined 包,安装后即可使用 det 命令行工具,这是本地和云端部署的统一入口。

    pip install determined
  2. 2启动本地集群

    用 det deploy 在本地拉起一个 Determined 集群,之后才能提交实验;集群参数 README 未展开,详见 on-prem 部署指南。

    det deploy local cluster-up
  3. 3改造训练代码

    把已有的 PyTorch/TensorFlow 代码整理成类式 API(如 PyTorchTrial)或只用需要的函数(Core API),使其兼容 Determined。

  4. 4提交训练实验

    用 YAML 文件描述分布式训练、超参数搜索等配置,然后通过 det experiment create 把代码目录和配置一起提交。

    det experiment create gpt.yaml .
  5. 5部署到云端(可选)

    如需使用云端 GPU,可通过 det deploy 在 AWS 或 GCP 上部署集群,具体参数见对应云厂商部署指南。

    det deploy aws up

关键配置

配置项必填说明示例
resources否实验 YAML 中用于配置资源的字段,README 中该示例被截断,完整写法见官方文档resources:

如何确认成功

README 未给出验证命令;本地集群启动后可用 det CLI 继续提交实验来确认集群可用。

常见问题

Q:Determined 支持哪些深度学习框架?

A:兼容 PyTorch 和 TensorFlow,可用 PyTorchTrial 类式 API 或 Core API(det.core.init)接入现有代码。

Q:如何把已有训练代码接入?

A:两种方式:一是整理成 PyTorchTrial 等类式 API;二是只调用需要的函数,通过 Core API 的 det.core.init() 初始化。

Q:只能在本地跑吗?

A:不是。除本地(on-prem)外,还支持 AWS、GCP、Kubernetes 以及 Slurm/PBS,分别有对应的集群部署指南。

Q:超参数调优和分布式训练怎么配置?

A:通过 YAML 文件统一配置,从分布式训练到超参数调优都由该配置文件描述。

注意事项

  • README 未给出 Python 版本、端口号、镜像名等细节,完整安装请查阅对应环境的集群部署指南(Local/AWS/GCP/K8s/Slurm-PBS)。
  • det deploy 除本地外还支持云端,云上部署前需准备好相应云账号与权限。
  • 项目主要组件为 Python 库、命令行工具(CLI)和 Web UI,实验对比与可视化在 Web UI 中完成。

核心亮点

  • 内置贝叶斯等超参搜索算法,自动调参效率高
  • 对 PyTorch/TensorFlow 代码侵入小,迁移成本低
  • 自带资源调度和任务队列,GPU 利用率高

不足之处

  • 文档/社区待观察
  • 生态相对较新,第三方集成不如 Kubeflow 丰富

适用场景

  • 团队需要快速进行大规模分布式训练
  • 超参数调优实验频繁,希望自动化搜索
  • 统一管理多机 GPU 资源,提升利用率

替代项目

Kubeflow、Polyaxon、MLflow

项目介绍

determined 是模型训练领域的开源项目,由 determined-ai 开发,2020 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(3,239)位列前 30%,在模型训练分类的 522 个项目里位列前 14%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-18。开源平台,Apache-2.0 许可证,可免费自托管使用,无付费版本。

它主要面向的使用场景是:团队需要快速进行大规模分布式训练。同类可对比的替代方案包括 Kubeflow、Polyaxon、MLflow。

上一篇:azure-databricks-mlops-mlflow

下一篇:fasttrackml

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13