DataFlex

训练时动态挑数据,让模型学得更快更好

DataFlex 是一个数据为中心的 LLM 训练工具,它嵌入在 LLaMA-Factory 训练流程中,通过动态样本选择、领域混合优化和示例重加权来提升模型训练效果。它解决的核心问题是:在训练数据质量参差不齐、领域分布不均的情况下,如何自动筛选高价值样本并优化数据配比,从而提升模型性能并降低训练成本。DataFlex 提供了一套与训练循环紧密耦合的数据管理机制,让数据选择不再是静态的预处理步骤,而是能够根据模型训练状态动态调整,实现数据与模型的交互优化。其核心能力包括动态样本选择(根据模型反馈挑选最有用的样本)、领域混合优化(自动调整各领域数据比例)、以及示例重加权(为不同样本赋予不同学习权重),这些功能均以轻量级插件形式集成,用户无需大幅改动现有训练代码即可使用。

开源 free 模型训练
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2818
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类模型训练
开发团队OpenDCAI
所属国家
定价模式free
价格说明开源项目,Apache-2.0 许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型data,data-mixture,data-model-interaction,data-reweighting,data-science,data-selection,model-training
GitHub 星标★ 2818
30天Star增速
HF 下载量
上线时间2025-08-09 00:00:00
最近更新2026-09-23 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数7

使用教程

难度:进阶 约 15 分钟 部署方式:本地安装 7 步

环境要求

  • Python 3.11 及以上
  • LlamaFactory 0.9.5 及以上(安装 DataFlex 时自动安装)
  • 显卡环境需支持 CUDA 12.4 的 PyTorch 2.6.0
  • transformers 4.55 ~ 5.6(Qwen3.5、Gemma 4 等新模型需 5.5+;ZeRO-3 下 train_from_scratch 建
  • 使用 examples/deepspeed 下任意配置需额外安装 DeepSpeed

安装与启动步骤

  1. 1安装 PyTorch

    先装 PyTorch,避免 pip 先解析出别的构建版本再回头替换;指定 cu124 源与 2.6.0 版本。

    pip install --index-url https://download.pytorch.org/whl/cu124 
        torch==2.6.0 torchvision==0.21.0 torchaudio==2.6.0
  2. 2验证 PyTorch

    打印 torch 版本并确认 CUDA 是否可用,确保后续训练能用到 GPU。

    python -c "import torch; print(torch.__version__, torch.cuda.is_available())"
  3. 3安装 DataFlex

    直接用 pip 安装发行版,核心依赖(含 LlamaFactory)会自动装好。

    pip install dataflex
  4. 4源码安装(开发用)

    需要改代码时改用可编辑安装:先克隆仓库,再进目录执行 pip install -e .。

    git clone https://github.com/OpenDCAI/DataFlex.git
    cd DataFlex
    pip install -e .
  5. 5安装 DeepSpeed 扩展

    deepspeed 是可选 extra,只有跑 examples/deepspeed 下的配置才需要装。

    pip install "dataflex[deepspeed]"
  6. 6安装 LESS 扩展

    LESS 选择器依赖 TRAK,属于另一个可选 extra,需要时单独安装。

    pip install dataflex[less]
  7. 7启动训练

    启动方式与 LLaMA-Factory 类似,这里用 LESS 选择器示例;yaml 里还要写 DataFlex 专有参数。

    dataflex-cli train examples/train_lora/selectors/less.yaml

如何确认成功

执行 dataflex-cli train 后终端持续输出训练日志、无报错即启动成功。

常见问题

Q:pip install dataflex 时报 torch 版本问题怎么办?

A:README 建议先单独安装指定版本的 PyTorch(cu124 源、2.6.0),再安装 DataFlex,避免 pip 先解析出别的构建版本。

Q:安装 deepspeed 扩展后导入失败?

A:deepspeed extra 被刻意限制在 0.17 以下,因为 0.17+ 在上面固定的 torch 版本上无法导入;若换用更新的 torch 可自行解除该限制。

Q:LESS 选择器报缺少 TRAK?

A:TRAK 属于可选依赖,执行 pip install dataflex[less] 即可补上。

Q:运行报 yaml 缺少参数?

A:与原生 LLaMA-Factory 不同,配置文件必须额外包含 DataFlex 专有参数,具体写法见 DataFlex-Doc 官方文档。

Q:源码方式怎么装 DeepSpeed 扩展?

A:在 DataFlex 目录下执行 pip install -e ".[deepspeed]",而不是直接装 dataflex[deepspeed]。

注意事项

  • 需要 Python 3.11 及以上,LlamaFactory 0.9.5+ 会随核心依赖自动安装。
  • deepspeed extra 版本刻意低于 0.17,0.17+ 在固定 torch 上会导入失败。
  • 如需在 DeepSpeed ZeRO-3 下使用 train_from_scratch,建议 transformers 5.3 及以上。
  • DataFlex 的 yaml 配置需额外补充专有参数,详见官网 DataFlex-Doc。

核心亮点

  • 动态样本选择能根据模型实时状态筛选高价值数据,避免无效训练
  • 深度集成 LLaMA-Factory,无需重构训练流程即可使用
  • 领域混合优化自动调整数据配比,减少人工调参成本

不足之处

  • 依赖 LLaMA-Factory 生态,独立使用场景受限
  • 文档和社区支持尚待完善,上手门槛可能较高

适用场景

  • 大规模预训练数据筛选,提升训练效率
  • 多领域混合训练,自动平衡各领域数据比例
  • 指令微调阶段,动态重加权提升对齐效果

替代项目

DataComp、TinyLlama、LLaMA-Factory

项目介绍

DataFlex 是模型训练领域的开源项目,由 OpenDCAI 开发,2025 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(2,818)位列前 30%,在模型训练分类中处于中上游。

近 42 天,它的 GitHub 星标从 2,035 增加到 2,818,净增 783。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-23。Apache-2.0 许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:大规模预训练数据筛选,提升训练效率。同类可对比的替代方案包括 DataComp、TinyLlama、LLaMA-Factory。

上一篇:transformerlab-app

下一篇:hud-python

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13