syncd 是数据集领域的开源项目,由 nupurkmr9 开发,2025 年首次发布。
它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 156。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-04。MIT许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:学术研究:快速生成定制化数据集用于论文实验。同类可对比的替代方案包括 DreamBooth、Textual Inversion、LoRA。

一键生成多图合成数据,搞定个性化图像生成训练
SynCD 是一个用于文本到图像定制化(Text-to-Image Customization)的合成数据生成工具,源自 ICCV 2025 论文。它解决的是个性化图像生成中高质量多图像训练数据稀缺且标注成本高的问题。核心能力是自动化生成包含同一主体在不同场景、姿态、风格下的多张图像及其对应文本描述的数据集,用于训练或微调定制化生成模型(如 DreamBooth、LoRA 等)。项目提供数据生成流程、配置和评估脚本,帮助研究者快速构建定制化训练数据,提升模型对特定主体的还原度和编辑能力。
DreamBooth、Textual Inversion、LoRA
syncd 是数据集领域的开源项目,由 nupurkmr9 开发,2025 年首次发布。
它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 156。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-04。MIT许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:学术研究:快速生成定制化数据集用于论文实验。同类可对比的替代方案包括 DreamBooth、Textual Inversion、LoRA。
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models