insuranceqa-corpus-zh

拿保险问答数据,快速训练客服机器人

这是一个面向保险行业的中文语料库,专为训练聊天机器人和自然语言处理模型而设计。它解决了保险领域缺乏高质量、结构化问答数据的问题,提供了大量真实的保险咨询问题和对应答案,覆盖险种、理赔、条款等常见场景。核心能力包括:数据已按问答对整理,可直接用于训练检索式或生成式对话模型;同时提供英文原版对照,方便多语言研究。项目以Python工具和数据集形式发布,适合构建保险客服机器人、智能问答系统等应用。

开源 unknown 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1068
维护状态 低维护
是否开源 是
定价模式 unknown

项目数据

分类对话助手
开发团队chatopera
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型chatbot,corpus,dataset,insurance,insuranceqa-corpus-zh,machine-learning,natural-language-processing,natural-language-understanding,qasystem,question-answering
GitHub 星标★ 1068
30天Star增速
HF 下载量
上线时间2017-07-26 00:00:00
最近更新2026-09-19 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • Python 2.x 或 3.x
  • pip
  • 需要购买证书获取证书标识(INSQA_DL_LICENSE)

安装与启动步骤

  1. 1准备Python环境

    确认本机已安装 Python 2.x 或 3.x,并确保 pip 可用;README 未给出具体版本号或安装命令。

  2. 2安装脚本包

    使用 pip 安装 insuranceqa_data 脚本包,这是后续下载和处理语料的前置依赖。

    pip install -U insuranceqa_data
  3. 3获取证书标识

    进入证书商店购买证书,购买后进入【证书-详情】,点击【复制证书标识】得到 YOUR_LICENSE。

  4. 4设置许可证变量

    将证书标识设置为环境变量 INSQA_DL_LICENSE;Linux/macOS 使用 export,Windows 可用 set 或 PowerShell。

    export INSQA_DL_LICENSE=YOUR_LICENSE
  5. 5下载语料数据

    按 README 的 Python 代码保存为 download.py,并把 YOUR_LICENSE 替换为真实证书标识,然后执行下载。

    python download.py

关键配置

配置项必填说明示例
INSQA_DL_LICENSE是下载语料所需的证书标识,购买证书后复制获得。FOOBAR

如何确认成功

执行 download.py 后无报错,即表示数据下载流程完成。

常见问题

Q:证书标识从哪里获取?

A:进入 https://store.chatopera.com/product/insqa001 购买证书,购买后在【证书-详情】中点击【复制证书标识】。

Q:支持哪些 Python 版本?

A:README 标明依赖 Python 2.x 和 3.x,并需要 pip。

Q:Windows 下如何设置环境变量?

A:Command Prompt 使用 set INSQA_DL_LICENSE=YOUR_LICENSE;PowerShell 使用 $env:INSQA_DL_LICENSE='YOUR_LICENSE'。

Q:问答对语料和问答语料有什么区别?

A:问答语料是从原始英文翻译、未其他处理;问答对语料在问答语料基础上做了分词、去标去停并添加 label,可直接对接机器学习任务。

注意事项

  • 下载语料需要有效的证书标识,未购买证书无法完成语料包下载。
  • 问答对语料可直接用于机器学习任务;若对格式或分词不满意,可基于问答语料自行处理。
  • README 中方式2的下载命令不完整,未在本教程中编造使用。

核心亮点

  • 数据规模超2万对,覆盖保险核心业务场景
  • 中英双语对照,便于迁移学习和跨语言研究
  • 问答对结构化清晰,可直接用于训练和评估

不足之处

  • 数据时效性可能滞后,近年新险种覆盖不足
  • 文档/社区待观察

适用场景

  • 保险客服聊天机器人训练
  • 保险领域智能问答系统开发
  • 中文NLP问答模型基准测试

替代项目

CMRC2018、DuReader、WebQA

项目介绍

insuranceqa-corpus-zh 是数据集领域的开源项目,由 chatopera 开发,2017 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,068)位列前 30%,在数据集分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-19。

它主要面向的使用场景是:保险客服聊天机器人训练。同类可对比的替代方案包括 CMRC2018、DuReader、WebQA。

上一篇:MELD

下一篇:Chatito

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09