DataDesigner

从零或种子数据一键生成高质量合成数据,加速 AI 训练

DataDesigner 是 NVIDIA 开源的合成数据生成工具,基于 NeMo 框架构建。它解决的是高质量训练数据获取难、成本高的问题,允许用户从零开始或基于少量种子数据生成大规模、多样化的合成数据集。核心能力包括:支持多种生成策略(如基于 LLM 的指令生成、对话模拟、代码合成等),提供数据清洗、去重、质量过滤等后处理管道,并可与 NeMo 生态无缝集成,方便用户构建端到端的数据飞轮。项目采用 Python 编写,模块化设计,支持自定义扩展,适合 NLP 和多模态任务的训练数据准备。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2274
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队NVIDIA-NeMo
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型agentic-ai,data-augmentation,data-generation,llm,mcp,multimodal,nemo,nvidia,sdg,synthetic-data,tool-use
GitHub 星标★ 2274
30天Star增速
HF 下载量
上线时间2025-10-16 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数11

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • Python 环境(README 未指定具体版本)
  • 已安装 pip 包管理器
  • 源码安装方式需本地具备 git 与 make
  • 网络可访问 PyPI 与 GitHub

安装与启动步骤

  1. 1准备 Python 环境

    确认本机已安装 Python 与 pip。README 未给出所需 Python 版本,建议参考官网文档确认。

  2. 2pip 直接安装

    最简安装方式,适合快速试用。安装过程会拉取依赖包,建议在虚拟环境中执行。

    pip install data-designer
  3. 3克隆源码仓库

    如需从源码安装,先克隆仓库并进入项目目录。

    git clone https://github.com/NVIDIA-NeMo/DataDesigner.git
    cd DataDesigner
  4. 4源码方式安装

    在项目根目录执行 make install 完成源码安装,需本机已具备 make 工具。

    make install
  5. 5确认安装结果

    README 未给出运行示例,可先用 pip show 检查包是否已成功安装。

    pip show data-designer

如何确认成功

README 未提供启动验证方式;可用 pip show data-designer 确认包已安装。

常见问题

Q:应该用 pip 安装还是源码安装?

A:README 提供两种方式:快速试用直接执行 pip install data-designer;需要查看或修改源码则克隆仓库后执行 make install。

Q:安装需要哪个 Python 版本?

A:README 未标注 Python 版本要求,建议使用较新的 Python 3,并以官网文档 docs.nvidia.com/nemo/datadesigner 为准。

Q:安装时会引入其他软件吗?

A:会。README 明确提示项目会下载并安装额外的第三方开源软件,使用前请先阅读这些项目的许可条款。

Q:安装完成后如何生成第一份数据?

A:README 的 Quick Start 在配置环节被截断,未给出运行示例,请前往官网文档获取后续配置与使用方式。

注意事项

  • README 提示项目会下载并安装第三方开源软件,使用前请审阅其许可条款。
  • README 节选中的 Quick Start 在设置步骤处被截断,缺少配置与运行示例,请以官网文档为准。
  • 源码安装需要本地已安装 git 与 make 工具。

核心亮点

  • 提供从数据生成到清洗、去重的完整流水线,开箱即用
  • 支持多种生成策略(指令、对话、代码等),适配不同场景
  • 背靠 NVIDIA NeMo 生态,与主流训练框架集成顺畅

不足之处

  • 依赖 NVIDIA 生态,对非 NVIDIA 环境支持有限
  • 文档和社区尚在完善,上手门槛较高

适用场景

  • 为 LLM 微调生成指令数据
  • 扩充小样本数据集以提升模型泛化能力
  • 模拟对话或代码数据用于专项训练

替代项目

Argilla、Distilabel、Synthetic Data Vault

项目介绍

DataDesigner 是数据集领域的开源项目,由 NVIDIA-NeMo 开发,2025 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(2,274)位列前 30%,在数据集分类的 279 个项目里位列前 15%。

近 42 天,它的 GitHub 星标从 2,156 增加到 2,274,净增 118。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:为LLM微调生成指令数据。同类可对比的替代方案包括 Argilla、Distilabel、Synthetic Data Vault。

上一篇:autolabel

下一篇:graph-fraud-detection-papers

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09