litData

几行代码优化数据管道,让 GPU 不再等数据

litData 是 Lightning AI 推出的数据加载与预处理加速库,专门解决模型训练中数据管道成为瓶颈的问题。它把原始数据(图片、文本、音频、张量等)转换成高度优化的分块二进制格式,配合内存映射、并行读取和智能缓存,让 GPU 不再因等数据而空转。核心能力包括:一键将现有数据集优化为流式格式、支持多进程并行加载、与 PyTorch DataLoader 无缝兼容、可处理超大规模数据集而不爆内存,并能在本地磁盘、云存储之间灵活切换。项目由 PyTorch Lightning 团队维护,API 简洁,通常只需几行代码即可替换原有 Dataset,训练吞吐量常有数倍提升,适合数据量庞大或 I/O 密集的训练任务。

开源 free 模型训练
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 614
维护状态 活跃
是否开源
定价模式 free

项目数据

分类模型训练
开发团队Lightning-AI
所属国家
官网地址
定价模式free
价格说明开源免费,无在线服务
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型
GitHub 星标★ 614
30天Star增速
HF 下载量
上线时间2024-02-15 00:00:00
最近更新2026-09-16 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-19
浏览次数0

使用教程

核心亮点

  • 与 PyTorch DataLoader 兼容,替换成本低,几行代码即可接入
  • 分块二进制+内存映射,减少随机 I/O,提升吞吐
  • 支持超大规模数据集流式读取,内存占用可控

不足之处

  • 项目尚处早期,API 可能变动,生产稳定性待验证
  • 需要先做一次数据格式转换,增加预处理步骤

适用场景

  • 大规模图像分类训练中 GPU 利用率低、数据加载慢
  • 多机多卡训练时数据读取成为瓶颈
  • 云端存储上的海量数据集需要高效流式加载

替代项目

WebDataset、FFCV、NVIDIA DALI

项目介绍

litData 是一个模型训练领域的开源项目,官方简介:Speed up model training by fixing data loading.。项目使用 Python 开发,在 GitHub 上获得 614 星标。

上一篇:VeOmni

下一篇:ai8x-training

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 61327 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1279 2026-08-13