chatgpt-comparison-detection

一键识别文本是否由ChatGPT生成,基于权威HC3数据集。

这是一个用于检测文本是否由ChatGPT等大型语言模型生成的工具集,核心是发布了Human ChatGPT Comparison Corpus (HC3)数据集,包含人类与ChatGPT对同一问题的回答对。项目提供了基于该数据集的多种检测器实现,包括基于GPT-2、RoBERTa等模型的微调分类器,以及基于统计特征或困惑度的方法。它解决了AI生成内容泛滥带来的溯源和鉴别问题,为研究人员和开发者提供了标准化的基准数据和可复用的检测模型。项目还包含训练、评估和推理的完整代码,支持自定义数据集的扩展,是研究AI文本检测的重要参考资源。

开源 free 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1468
维护状态 低维护
是否开源
定价模式 free

项目数据

分类对话助手
开发团队Hello-SimpleAI
所属国家
官网地址
定价模式free
价格说明开源数据集与检测工具,完全免费,无付费版本。
访问状态
是否开源
开源协议
主要语言Python
技术栈/模型ai,chatbot,chatgpt,dataset,deep-learning,gpt-3,gpt2,gpt3,machine-learning,ml,nlp,openai,python,text-classification
GitHub 星标★ 1468
30天Star增速
HF 下载量
上线时间2023-01-07 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数7

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 可访问 GitHub 的网络环境
  • 已安装 git(用于克隆仓库)
  • 可访问 HuggingFace Datasets 或 ModelScope 的网络环境
  • 用于存放 HC3 数据集的本地磁盘空间

安装与启动步骤

  1. 1克隆项目仓库

    把仓库下载到本地,后续数据集说明和检测器代码都在其中,注意保持目录名不变。

    git clone https://github.com/Hello-SimpleAI/chatgpt-comparison-detection.git
  2. 2进入项目目录

    切换到克隆下来的仓库根目录,后续操作均在此目录下进行。

    cd chatgpt-comparison-detection
  3. 3下载英文 HC3 数据集

    README 给出 HuggingFace 上的 HC3-English 地址,在浏览器打开即可浏览或下载数据。

  4. 4下载中文 HC3 数据集

    中文社区版本托管在 ModelScope,README 给出 HC3-Chinese 地址,按页面提示下载。

  5. 5获取论文划分版本

    README 说明训练/测试划分及过滤版本见 HC3/README.md 中的 Google Drive 链接,按需下载。

如何确认成功

能打开 HC3 数据集页面并成功浏览/下载数据,且本地已保存对应语料文件,即视为准备完成。

常见问题

Q:HC3 数据集在哪里下载?

A:英文版在 HuggingFace Datasets 的 Hello-SimpleAI/HC3,中文版在 HuggingFace 的 Hello-SimpleAI/HC3-Chinese,也可在 ModelScope 上找到同名数据集。

Q:有中文语料吗?

A:有。项目同时发布了 HC3-Chinese,并已在 ModelScope 中文社区提供下载入口。

Q:论文里用的训练/测试划分在哪?

A:README 指出划分与过滤版本不在主页面下载,需参考 HC3/README.md 中给出的 Google Drive 链接获取。

Q:数据集可以商用吗?

A:若所用源数据集许可证比 CC-BY-SA 更严格,则沿用该源许可证;否则遵循 CC-BY-SA,使用前请逐一核对来源许可。

注意事项

  • 本次 README 节选只包含数据集相关说明,未给出检测器的安装或运行命令,因此步骤仅覆盖数据获取准备。
  • 仓库处于持续更新状态,README 建议 star、watch、fork 以获取最新内容。
  • HC3 的许可取决于各子数据源许可,使用前请查看 HC3/README.md 中的来源与许可表。

核心亮点

  • 提供首个大规模人类与ChatGPT对比语料库HC3,数据质量高,覆盖多领域。
  • 内置多种检测模型(如GPT-2、RoBERTa),开箱即用,支持快速评估。
  • 代码结构清晰,含训练和推理脚本,便于二次开发和定制。

不足之处

  • 检测器主要针对特定模型(如ChatGPT),对新型LLM的泛化能力有限。
  • 文档和社区支持相对薄弱,更新频率较低。

适用场景

  • 学术研究:分析AI生成文本的语言特征,训练检测模型。
  • 内容审核:识别社交媒体或新闻平台上的AI生成内容。
  • 教育防作弊:检测学生作业是否由ChatGPT代写。

替代项目

GPTZero、OpenAI AI Text Classifier、DetectGPT

项目介绍

chatgpt-comparison-detection 是数据集领域的开源项目,由 Hello-SimpleAI 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,468)位列前 30%,在数据集分类中处于中上游。

近 45 天,它的 GitHub 星标从 1,425 增加到 1,468,净增 43。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。开源数据集与检测工具,完全免费,无付费版本。

它主要面向的使用场景是:学术研究:分析AI生成文本的语言特征,训练检测模型。同类可对比的替代方案包括 GPTZero、OpenAI AI Text Classifier、DetectGPT。

上一篇:Dialog_Corpus

下一篇:MELD

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09