Gossiping-Chinese-Corpus 是数据集领域的开源项目,由 zake7749 开发,2017 年首次发布。
它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 245。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-18。开源数据集,Apache-2.0许可,完全免费,可自由下载使用。
它主要面向的使用场景是:训练中文闲聊型聊天机器人。同类可对比的替代方案包括 DuConv、LCCC、THUCNews。

用PTT八卦版海量问答,训练接地气的中文聊天机器人。
这是一个从台湾PTT八卦版抓取并整理的问答中文语料库,用于训练中文聊天机器人。项目将论坛中的帖子标题作为问题、回帖内容作为回答,构建了大规模的中文对话数据集,解决了中文闲聊语料稀缺的问题。核心能力包括提供清洗后的结构化数据、支持多种数据格式、以及配套的预处理脚本。数据量较大,覆盖社会、娱乐、生活等多元话题,风格口语化且带有网络用语,适合训练风格活泼的对话模型。项目早期由社区维护,数据持续更新,为中文NLP研究者和开发者提供了便捷的语料获取途径。
DuConv、LCCC、THUCNews
Gossiping-Chinese-Corpus 是数据集领域的开源项目,由 zake7749 开发,2017 年首次发布。
它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 245。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-18。开源数据集,Apache-2.0许可,完全免费,可自由下载使用。
它主要面向的使用场景是:训练中文闲聊型聊天机器人。同类可对比的替代方案包括 DuConv、LCCC、THUCNews。
上一篇:Chatette
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models