easy-dataset

一键生成高质量LLM训练数据集,告别手工整理

easy-dataset 是一个用于创建大语言模型(LLM)微调、RAG 和评估数据集的强大工具。它主要解决 AI 开发者在构建高质量训练数据时面临的痛点,如数据收集、清洗、格式化等繁琐流程。该项目提供了一套简洁的 JavaScript 接口,帮助用户从多种数据源(如文本、网页、PDF 等)提取内容,并进行结构化处理,生成符合主流 LLM 训练框架要求的格式。其核心能力包括数据抓取、预处理、转换和导出,支持自定义规则,可灵活适配不同场景。通过自动化流水线,显著提升数据集构建效率,降低人工成本,使得开发者能更专注于模型优化本身。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 14941
维护状态 低维护
是否开源
定价模式 free

项目数据

分类搜索知识
开发团队ConardLi
所属国家
定价模式free
价格说明开源项目,本地部署,完全免费。
访问状态
是否开源
开源协议NOASSERTION
主要语言JavaScript
技术栈/模型dataset,fine-tuning,javascript,llm,rag
GitHub 星标★ 14941
30天Star增速
HF 下载量
上线时间2025-03-04 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:入门 约 10 分钟 部署方式:Docker 6 步

环境要求

  • 已安装 Node.js 与 npm(选择 NPM 本地运行方式时)
  • 已安装 Docker 与 docker-compose(选择容器方式时)
  • 可访问 GitHub 以克隆仓库
  • 本机 1717 端口可用(浏览器访问地址)

安装与启动步骤

  1. 1克隆项目仓库

    把 easy-dataset 源码克隆到本地并进入项目目录,后续 Docker 和 NPM 两种方式都从这里开始。

    git clone https://github.com/ConardLi/easy-dataset.git
    cd easy-dataset
  2. 2修改 compose 配置

    按 README 示例确认 image、端口映射 1717:1717,并挂载仓库目录下的 local-db 与 prisma。

  3. 3启动 Docker 容器

    在项目目录执行后台启动,首次启动会自动初始化数据库文件,无需手动执行 npm run db:push。

    docker-compose up -d
  4. 4或本地安装依赖

    不使用 Docker 时,先在项目根目录安装 npm 依赖,需保证 Node.js 环境正常。

    npm install
  5. 5构建并启动服务

    本地方式需先执行构建,再启动服务;两条命令依次运行,服务保持前台运行。

    npm run build
    npm run start
  6. 6打开浏览器访问

    访问 http://localhost:1717 打开 Easy Dataset 界面,即可开始构建数据集。

关键配置

配置项必填说明示例
image官方 Docker 镜像地址ghcr.io/conardli/easy-dataset
container_name容器名称,便于识别和管理easy-dataset
ports将容器 1717 端口映射到本机 1717'1717:1717'
volumes - local-db挂载数据库目录,保持数据路径一致./local-db:/app/local-db
volumes - prisma挂载 prisma 目录,保持数据库文件一致./prisma:/app/prisma
restart容器自动重启策略unless-stopped

如何确认成功

浏览器打开 http://localhost:1717 能看到 Easy Dataset 界面即启动成功;也可用 docker-compose ps 查看容器状态。

常见问题

Q:需要手动初始化数据库吗?

A:不需要。README 明确说明数据库文件会在首次启动时自动初始化,无需手动运行 npm run db:push。

Q:为什么建议挂载 local-db 和 prisma 目录?

A:README 建议使用当前代码仓库目录下的 local-db 和 prisma 作为挂载路径,这样与通过 NPM 启动时的数据库路径保持一致。

Q:想自己构建镜像怎么操作?

A:在项目根目录执行 docker build -t easy-dataset .,再用 docker run 挂载 local-db、prisma 并映射 1717 端口启动容器。

Q:不用 Docker 可以运行吗?

A:可以。按 README 的 NPM 方式依次执行 npm install、npm run build、npm run start,然后访问 http://localhost:1717。

注意事项

  • README 给出三种方式:docker-compose 官方镜像、本地 Dockerfile 构建、NPM 本地运行,按需选择其一即可。
  • 首次启动自动初始化数据库,不要重复执行 npm run db:push。
  • 若自行构建镜像,docker run 时同样要挂载 ./local-db 和 ./prisma 目录并映射 1717 端口。
  • 默认访问地址为 http://localhost:1717,请确保该端口未被占用。

核心亮点

  • 支持多种数据源(网页、PDF、文本)自动抓取与解析
  • 内置数据清洗和格式化功能,直接输出标准训练格式
  • 提供可视化界面,操作简单,上手快

不足之处

  • 文档/社区待观察

适用场景

  • LLM微调前的训练数据准备
  • 构建RAG系统的知识库数据
  • 生成模型评估的测试集

替代项目

Datasets (Hugging Face)、Label Studio、Prodigy

项目介绍

easy-dataset 是数据集领域的开源项目,由 ConardLi 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(14,941)位列前 4%,在数据集分类的 279 个项目里位列前 4%。

近 41 天,它的 GitHub 星标从 14,780 增加到 14,941,净增 161。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。本地部署,完全免费。

它主要面向的使用场景是:LLM微调前的训练数据准备。同类可对比的替代方案包括 Datasets (Hugging Face)、Label Studio、Prodigy。

上一篇:opendataloader-pdf

下一篇:pii-masker

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09