skypilot

各家云比价自动挑最划算的,算力随叫随到

面向前沿 AI 团队的计算平台,将分散在不同云厂商的 GPU 算力整合成一台“AI 超级计算机”。它支持在多云环境下统一调度资源、自动选型最优实例并显著节省成本,让团队把精力聚焦在模型研发本身,是异构算力管理的实用基础设施。

开源 unknown 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 10638
维护状态 活跃
是否开源 是
定价模式 unknown

项目数据

分类基础设施
开发团队skypilot-org
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型cloud-computing,cloud-management,cost-optimization,deep-learning,distributed-training,gpu,hyperparameter-tuning,job-queue,job-scheduler,llm-serving,llm-training,machine-learning,ml-infrastructure,ml-platform,mlops,multicloud,slurm,spot-instances,tpu
GitHub 星标★ 10638
30天Star增速
HF 下载量
上线时间2021-08-11 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:进阶 约 10 分钟 部署方式:命令行工具 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(SkyPilot 为 Python 项目,具体版本以官方安装文档为准)
  • 至少一个云厂商账号及可用的访问凭证(BYOC 模式)
  • 可访问 GitHub 与 SkyPilot 官方文档的网络环境

安装与启动步骤

  1. 1阅读官方安装文档

    README 未直接给出安装命令,只提供了安装入口,请先打开官方 Installation 页面按指引安装 SkyPilot。

  2. 2获取项目与示例代码

    README 提到示例源码位于仓库的 llm/ 与 examples/ 目录,克隆仓库以便查看和运行示例。

    git clone https://github.com/skypilot-org/skypilot.git
  3. 3配置云账号凭证

    SkyPilot 采用 BYOC 模式,所有集群都启动在你自己的云账号、VPC 和集群内,需先在本机配好对应云厂商凭证。

  4. 4按 Quickstart 启动集群

    按官方 Quickstart 文档在约 2 分钟内启动第一个集群,命令与参数均以该文档为准。

  5. 5运行示例任务

    从训练、推理服务、模型等示例中挑选一个,按示例页面说明提交作业;示例 YAML 的 setup 字段会在作业执行前运行准备命令。

关键配置

配置项必填说明示例
setup否任务 YAML 中在作业执行前运行的准备命令,常用于安装依赖或克隆代码cd mnist pip install -r requirements.txt

如何确认成功

按官方 Quickstart 能成功启动集群并看到任务运行日志,即表示部署成功。

常见问题

Q:为什么 README 里没有直接的安装命令?

A:README 仅提供安装入口,实际安装步骤全部放在官方 Installation 文档中,请以该文档为准,不要自行猜测包名与参数。

Q:会把任务跑在 SkyPilot 自己的服务器上吗?

A:不会。SkyPilot 是 BYOC 模式,所有资源都启动在你自己的云账号、VPC 和已有集群中。

Q:安装大概需要多久?

A:README 称安装约 1 分钟,随后可在 2 分钟内启动第一个集群,前提是云凭证已提前配置好。

Q:去哪里找可运行的示例?

A:官方 Examples 页面覆盖训练、推理服务、模型与常见框架,源码文件同时存在于仓库的 llm/ 和 examples/ 目录。

注意事项

  • 所有命令、云凭证配置方式与支持的云厂商列表均以官方文档为准,README 未给出具体参数。
  • 任务会直接消耗你自己云账号的资源,运行前请确认配额与费用。
  • 示例任务 YAML 里的 setup 段是执行前的准备步骤,不要在本地误当作安装 SkyPilot 的命令。

核心亮点

  • 统一抽象多云GPU资源,支持AWS/GCP/Azure等主流云,显著降低分散管理成本
  • 内置成本优化策略,自动竞价实例与按需实例切换,节省训练费用
  • 支持分布式训练与任务队列,简化大规模AI作业调度

不足之处

  • 文档/社区待观察

适用场景

  • 跨云GPU集群管理,适合需要灵活调度多家云资源的AI团队
  • 大规模分布式训练,如大模型预训练或微调
  • 成本敏感型AI任务,利用竞价实例优化预算

替代项目

Ray、Kubernetes + KubeFlow、Slurm

项目介绍

skypilot 是基础设施领域的开源项目,由 skypilot-org 开发,2021 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(10,638)位列前 5%,在基础设施分类的 1,130 个项目里位列前 7%。

近 44 天,它的 GitHub 星标从 10,465 增加到 10,638,净增 173。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。从国内网络环境看,可直接访问。

它主要面向的使用场景是:跨云GPU集群管理,适合需要灵活调度多家云资源的AI团队。同类可对比的替代方案包括 Ray、Kubernetes + KubeFlow、Slurm。

上一篇:kedro

下一篇:metaflow

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09