soperator

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

soperator 是一个 Kubernetes 原生算子,用于在 Kubernetes 集群中运行和管理 Slurm 工作负载。它解决了传统 HPC 环境中 Slurm 集群部署复杂、资源利用率低、难以与云原生生态集成的问题。核心能力包括:通过自定义资源定义(CRD)声明式地创建 Slurm 集群,自动管理 Slurm 控制节点和计算节点,支持弹性扩缩容,集成 Kubernetes 的调度、存储和网络能力,并提供监控和日志集成。用户可以使用熟悉的 kubectl 和 Helm 工具来管理 HPC 工作负载,从而降低运维成本,提高资源利用效率,并加速机器学习模型训练等计算密集型任务。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 439
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类基础设施
开发团队nebius
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Go
技术栈/模型high-performance-computing,hpc,k8s,k8s-operator,kubernetes,machine-learning,ml,model-training,slurm
GitHub 星标★ 439
30天Star增速
HF 下载量
上线时间2024-06-04 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数26

使用教程

核心亮点

  • 声明式管理:通过 CRD 定义 Slurm 集群,支持 GitOps 工作流
  • 弹性伸缩:根据工作负载自动调整计算节点,提高资源利用率
  • 云原生集成:无缝使用 K8s 的存储、网络、监控等生态

不足之处

  • 项目处于早期阶段,文档和社区支持有待完善
  • 对已有 Slurm 集群的迁移支持可能有限

适用场景

  • 在 Kubernetes 上运行大规模机器学习模型训练
  • 需要弹性 HPC 资源的科研机构或企业
  • 统一管理 HPC 和云原生工作负载的混合环境

替代项目

KubeSlurm、Slurm Operator、HPC Operator

项目介绍

soperator 是基础设施领域的开源项目,由 nebius 开发,2024 年首次发布。

它收录于基础设施分类,该分类目前共有 1,133 个项目,GitHub 星标数为 439。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:在Kubernetes上运行大规模机器学习模型训练。同类可对比的替代方案包括 KubeSlurm、Slurm Operator、HPC Operator。

上一篇:curvine

下一篇:esProc

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

[DEPRECATED / UNMAINTAINED] Multi-account gateway. No longer maintained; fork it and···

★ 303 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09