Dialog_Corpus 是数据集领域的开源项目,由 candlewill 开发,2017 年首次发布。
在全站 13,014 个收录项目中,它的 GitHub 星标数(2,054)位列前 30%,在数据集分类中处于中上游。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-03。开源语料库,完全免费,可自行下载使用。
它主要面向的使用场景是:学术研究中验证对话模型效果。同类可对比的替代方案包括 ConvAI、PersonaChat、DailyDialog。

拿来即用的中英文对话语料,快速训练你的聊天机器人
Dialog_Corpus 是一个面向中英文对话系统训练的开源语料库项目,旨在解决聊天机器人开发中高质量对话数据稀缺的问题。项目收集并整理了多种来源的对话数据,涵盖日常闲聊、问答、任务型对话等场景,并提供了统一的格式和加载脚本,方便研究者与开发者直接用于训练模型。其核心能力包括:提供结构化的中英文对话数据集、支持多种数据格式转换、附带简单的数据预处理工具,以及清晰的文档说明。项目以 Python 为主,易于集成到现有 NLP 流程中,适合学术研究、产品原型验证以及教学演示等场景。通过降低数据获取与清洗成本,它帮助开发者快速启动对话系统项目,是构建中文聊天机器人的实用资源库。
⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。
1获取项目仓库
README 本身未给出安装命令,仅提供项目地址;可用 git clone 把仓库拉到本地再查看语料清单与备份文件。
git clone https://github.com/candlewill/Dialog_Corpus.git2浏览公开语料清单
打开 README 的“公开语料”章节,逐个查看 8 个数据源说明,按中英文、场景、规模挑选需要的语料。
3下载所需语料
点击 README 中每条语料的原始地址手动下载,例如小黄鸡的分词与未分词两个 zip、白鹭问答语料备份等。
4解压并整理数据
把下载的压缩包解压到同一目录,README 提到项目附带数据预处理工具,可用于统一格式与清洗噪声。
5接入训练流程
按统一格式组织后的语料可直接读入现有 NLP 流程,用于聊天机器人模型训练或原型验证。
README 未提供启动命令,可确认语料压缩包下载完整并能被本地 Python 脚本正常读取。
Q:README 里为什么没有安装命令?
A:该项目主要是语料与数据集的收集整理仓库,README 只列出公开语料来源链接,未提供 pip 安装或运行脚本说明。
Q:有哪些中文语料可用?
A:包括 dgk_shooter 电影对白、ChatterBot 中文语料、小黄鸡语料、白鹭时代中文问答语料和保险行业 QA 语料库等。
Q:哪里能拿到英文对话语料?
A:NUS SMS Corpus 含中英文短信;Datasets for Natural Language Processing 主要包含英文问答与对话系统数据。
Q:README 里的“未公开”部分是什么?
A:README 最后以“### 未公开”结尾但未给出任何内容,因此无法得知其具体语料信息。
Q:中文字幕类语料质量如何?
A:README 明确提示 dgk_shooter 中文电影对白语料噪音较大,许多对白问答关系没有对应好,使用前需清洗。
ConvAI、PersonaChat、DailyDialog
Dialog_Corpus 是数据集领域的开源项目,由 candlewill 开发,2017 年首次发布。
在全站 13,014 个收录项目中,它的 GitHub 星标数(2,054)位列前 30%,在数据集分类中处于中上游。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-03。开源语料库,完全免费,可自行下载使用。
它主要面向的使用场景是:学术研究中验证对话模型效果。同类可对比的替代方案包括 ConvAI、PersonaChat、DailyDialog。
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models