AzurePublicDataset

用微软真实云数据,做靠谱的调度与容量研究

AzurePublicDataset 是微软公开的 Azure 云平台真实运行轨迹数据集,包含虚拟机 CPU 利用率、部署规模、内存与磁盘指标等多类生产环境数据。它解决云计算与系统研究领域长期缺乏真实、大规模、可复现工作负载数据的问题:学术论文中的仿真实验往往基于合成负载,难以反映真实云环境的动态特征。项目按数据来源分为多个子集,如 Azure Public Dataset V1/V2、VM 轨迹、函数计算轨迹等,提供 Jupyter Notebook 示例代码帮助研究者快速加载、统计与可视化数据。核心能力包括:覆盖数百万虚拟机与函数调用的大规模样本、包含资源请求与实际使用量对比、支持负载预测、调度优化、能耗建模、自动扩缩容等研究场景。数据以 CSV/Parquet 等形式发布,可直接下载使用,是云资源管理领域被广泛引用的基准数据集之一。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1210
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类数据集
开发团队Azure
所属国家
官网地址
定价模式free
价格说明开源数据集,免费使用
访问状态
是否开源是
开源协议CC-BY-4.0
主要语言Jupyter Notebook
技术栈/模型
GitHub 星标★ 1210
30天Star增速
HF 下载量
上线时间2017-08-18 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-04
浏览次数0

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:入门 约 10 分钟 部署方式:本地安装 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 可访问 GitHub 的网络环境
  • 已安装 git 命令行工具
  • 安装 Jupyter Notebook 以便运行仓库内的示例代码(项目以 Jupyter Notebook 编写,README 未明确要求但示例为 Notebo

安装与启动步骤

  1. 1克隆数据集仓库

    将 AzurePublicDataset 仓库克隆到本地,README 中数据以仓库形式公开释放,尚未给出独立下载链接。

    git clone https://github.com/Azure/AzurePublicDataset.git
  2. 2阅读总览说明

    打开根目录 README,了解当前发布的轨迹类别与采集时间范围,先确定自己需要哪一类数据。

    cd AzurePublicDataset
  3. 3浏览子集目录

    查看仓库内各子集目录结构,README 提到 VM 轨迹、Azure Functions 轨迹、LLM 推理轨迹等分类。

    ls
  4. 4查看示例 Notebook

    仓库提供 Jupyter Notebook 示例代码,用于加载、统计与可视化轨迹数据;README 节选未给出运行命令,按仓库内文件的说明操作。

  5. 5邮件咨询问题

    README 表示愿意协助研究者理解与使用数据,遇到问题或有疑问可发邮件到公开邮件列表。

如何确认成功

能成功列出仓库目录,并确认其中包含 README 所列的轨迹类别(如 VM Traces、Azure Functions Traces 等)即为正常。

常见问题

Q:README 里没有安装步骤,怎么使用数据?

A:该项目是数据集仓库,核心内容是轨迹数据与示例 Notebook,README 只描述轨迹类别,未提供安装命令;按仓库内各子集目录的说明读取数据即可。

Q:数据从哪里下载?

A:README 节选未给出独立的下载地址,数据以 GitHub 仓库形式发布,克隆仓库即可获得;如需更多信息可通过邮件列表咨询。

Q:遇到问题如何反馈?

A:README 说明可发送邮件到 azurepublicdataset@service.microsoft.com 联系维护方,反馈使用中的问题或疑问。

Q:这些数据能用于学术研究吗?

A:README 明确表示这些轨迹是面向研究与学术社区公开发布的,具体使用条款请以仓库内许可说明为准。

注意事项

  • 本教程仅依据 README 节选整理,README 未提供安装命令、端口、依赖或配置项,因此未列出任何配置参数。
  • 项目分类为数据集、开发语言为 Jupyter Notebook,主要以数据文件加示例代码的形式提供,而非可部署的服务。
  • README 列举的轨迹类别包含 VM、Azure Functions、LLM 推理、多模态推理、VM 基准噪声与 GitHub Copilot 编码代理轨迹,实际可用子集以仓库当前内容为准。
  • 使用数据前请确认仓库中的许可与引用要求,学术发表时按规范标注数据来源。

核心亮点

  • 数据来自微软 Azure 生产环境,规模达数百万虚拟机与函数调用,真实性和覆盖度远超合成负载
  • 提供 Jupyter Notebook 示例,包含数据加载、统计分析和可视化流程,上手门槛低
  • 按版本和场景拆分子数据集,支持负载预测、调度、能耗、自动扩缩容等多种研究方向

不足之处

  • 数据为静态快照,缺少持续更新机制,难以反映最新云环境特征
  • 文档以英文为主,部分子集字段说明分散,中文用户理解成本较高

适用场景

  • 云资源调度算法研究:用真实 VM 轨迹验证调度策略效果
  • 负载预测与自动扩缩容:基于历史 CPU/内存数据训练预测模型
  • 能耗与成本建模:分析资源请求与实际使用差异,评估资源浪费

替代项目

Google Cluster Data、Alibaba Cluster Trace

项目介绍

AzurePublicDataset 是数据集领域的开源项目,由 Azure 开发,2017 年首次发布。

在全站 13,635 个收录项目中,它的 GitHub 星标数(1,210)位列前 30%,在数据集分类中处于中上游。

项目目前处于活跃维护状态,最近一次代码更新于 2026-10-01。开源数据集,免费使用。

它主要面向的使用场景是:云资源调度算法研究:用真实VM轨迹验证调度策略效果。同类可对比的替代方案包括 Google Cluster Data、Alibaba Cluster Trace。

上一篇:Awesome-Medical-Dataset

下一篇:UrbanNavDataset

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10592 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1647 2026-09-20
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3403 2026-08-10