Gossiping-Chinese-Corpus

用PTT八卦版海量问答,训练接地气的中文聊天机器人。

这是一个从台湾PTT八卦版抓取并整理的问答中文语料库,用于训练中文聊天机器人。项目将论坛中的帖子标题作为问题、回帖内容作为回答,构建了大规模的中文对话数据集,解决了中文闲聊语料稀缺的问题。核心能力包括提供清洗后的结构化数据、支持多种数据格式、以及配套的预处理脚本。数据量较大,覆盖社会、娱乐、生活等多元话题,风格口语化且带有网络用语,适合训练风格活泼的对话模型。项目早期由社区维护,数据持续更新,为中文NLP研究者和开发者提供了便捷的语料获取途径。

开源 free 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 245
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类对话助手
开发团队zake7749
所属国家
定价模式free
价格说明开源数据集,Apache-2.0许可,完全免费,可自由下载使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Jupyter Notebook
技术栈/模型chatbot,chatbot-corpus,chinese-chatbot,chinese-corpus,chinese-dataset,chinese-nlp,corpus,dataset,dialog,ptt,question-answering
GitHub 星标★ 245
30天Star增速
HF 下载量
上线时间2017-06-28 00:00:00
最近更新2026-09-18 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

核心亮点

  • 数据源自真实论坛,口语化强,贴近日常聊天场景
  • 数据量充足,话题覆盖广,便于训练多样化的对话模型
  • 提供清洗和预处理流程,降低使用门槛

不足之处

  • 数据包含大量网络俚语和敏感内容,需额外过滤
  • 文档/社区待观察

适用场景

  • 训练中文闲聊型聊天机器人
  • 构建中文对话系统的预训练语料
  • 研究网络语言和社交媒体文本分析

替代项目

DuConv、LCCC、THUCNews

项目介绍

Gossiping-Chinese-Corpus 是数据集领域的开源项目,由 zake7749 开发,2017 年首次发布。

它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 245。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-18。开源数据集,Apache-2.0许可,完全免费,可自由下载使用。

它主要面向的使用场景是:训练中文闲聊型聊天机器人。同类可对比的替代方案包括 DuConv、LCCC、THUCNews。

上一篇:Chatette

下一篇:awesome-NLP-resources

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09