
litData
几行代码优化数据管道,让 GPU 不再等数据
litData 是 Lightning AI 推出的数据加载与预处理加速库,专门解决模型训练中数据管道成为瓶颈的问题。它把原始数据(图片、文本、音频、张量等)转换成高度优化的分块二进制格式,配合内存映射、并行读取和智能缓存,让 GPU 不再因等数据而空转。核心能力包括:一键将现有数据集优化为流式格式、支持多进程并行加载、与 PyTorch DataLoader 无缝兼容、可处理超大规模数据集而不爆内存,并能在本地磁盘、云存储之间灵活切换。项目由 PyTorch Lightning 团队维护,API 简洁,通常只需几行代码即可替换原有 Dataset,训练吞吐量常有数倍提升,适合数据量庞大或 I/O 密集的训练任务。
开源
free
模型训练
GitHub 星标
★ 614
维护状态
活跃
是否开源
是
定价模式
free
项目数据
分类模型训练
开发团队Lightning-AI
所属国家
定价模式free
价格说明开源免费,无在线服务
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型
GitHub 星标★ 614
30天Star增速
HF 下载量
上线时间2024-02-15 00:00:00
最近更新2026-09-16 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-19
浏览次数0
使用教程
核心亮点
- 与 PyTorch DataLoader 兼容,替换成本低,几行代码即可接入
- 分块二进制+内存映射,减少随机 I/O,提升吞吐
- 支持超大规模数据集流式读取,内存占用可控
不足之处
- 项目尚处早期,API 可能变动,生产稳定性待验证
- 需要先做一次数据格式转换,增加预处理步骤
适用场景
- 大规模图像分类训练中 GPU 利用率低、数据加载慢
- 多机多卡训练时数据读取成为瓶颈
- 云端存储上的海量数据集需要高效流式加载
替代项目
WebDataset、FFCV、NVIDIA DALI
项目介绍
上一篇:VeOmni
下一篇:ai8x-training
同类项目推荐
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···