Chatbot-Training-Corpus

拿来即用的中英文聊天语料,快速启动你的对话模型训练

Chatbot-Training-Corpus 是一个用于聊天机器人训练的中英文语料库集合项目。它主要解决对话系统开发中高质量训练数据稀缺的问题,为开发者提供可直接用于训练和测试的文本对话数据。项目核心能力包括:收集并整理了多种场景下的对话语料,涵盖中文和英文两种语言,方便不同语言背景的开发者使用;数据格式相对统一,易于导入常见的聊天机器人框架(如 Rasa、ChatterBot 等)进行模型训练;同时项目结构简单清晰,便于用户按需筛选和扩展语料。作为早期开源项目,它更偏向于数据资源而非完整工具链,适合作为入门级聊天机器人训练的起步数据源。

开源 free 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 118
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类对话助手
开发团队EternalFeather
所属国家
官网地址
定价模式free
价格说明开源数据集,完全免费,可自行下载使用。
访问状态
是否开源是
开源协议
主要语言Python
技术栈/模型chatbot,corpus,dialogue
GitHub 星标★ 118
30天Star增速
HF 下载量
上线时间2017-07-25 00:00:00
最近更新2026-05-02 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

核心亮点

  • 直接提供中英文双语文料,省去自行爬取和清洗数据的麻烦
  • 数据按场景分类,便于针对特定领域(如闲聊、问答)快速筛选
  • 项目结构简单,易于二次扩展和集成到现有训练流程

不足之处

  • 语料规模较小,覆盖场景有限,可能无法满足复杂对话需求
  • 文档和更新维护较少,社区活跃度待观察

适用场景

  • 初学者学习构建聊天机器人时作为初始训练数据
  • 快速原型验证对话模型效果,无需从零收集数据
  • 为特定语言(中/英)的对话系统补充基础语料

替代项目

Cornell Movie Dialogs Corpus、DailyDialog、ParlAI

项目介绍

Chatbot-Training-Corpus 是数据集领域的开源项目,由 EternalFeather 开发,2017 年首次发布。

它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 118。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-05-02。开源数据集,完全免费,可自行下载使用。

它主要面向的使用场景是:初学者学习构建聊天机器人时作为初始训练数据。同类可对比的替代方案包括 Cornell Movie Dialogs Corpus、DailyDialog、ParlAI。

上一篇:Know-Your-Intent

下一篇:fountain

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09