sodaverse

用GPT-3蒸馏百万级社交常识对话,让AI聊天更懂人情世故。

SODA是一个用于构建大规模社交常识对话数据集的工具链,源自EMNLP 2023论文。它解决的核心问题是:现有对话数据集缺乏社交常识背景,导致模型生成的回复不够自然、缺乏人情味。项目提供从种子对话出发,利用GPT-3等大模型进行对话蒸馏(dialogue distillation)的完整流程,并公开了百万级规模的SODA数据集。核心能力包括:社交常识的自动上下文化、对话生成与筛选管道、以及配套的模型训练与评测代码。通过该工具,研究者可以低成本地生成高质量、富含社交常识的对话数据,从而提升对话系统的拟人化水平。

开源 free 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 244
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类对话助手
开发团队skywalker023
所属国家
官网地址
定价模式free
价格说明开源项目,代码和数据集免费提供,遵循MIT许可证,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型chatgpt,commonsense,dataset,dataset-creation,dialogue,dialogue-generation,dialogue-system,gpt-3
GitHub 星标★ 244
30天Star增速
HF 下载量
上线时间2022-12-14 00:00:00
最近更新2026-08-17 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

核心亮点

  • 开源了百万级带社交常识标注的对话数据集,规模罕见
  • 提供从数据生成到模型训练的全套可复现代码,门槛低
  • 基于EMNLP论文方法,学术严谨性有保障

不足之处

  • 依赖GPT-3等商业API,数据生成成本高且不可控
  • 文档/社区待观察,项目处于早期,生态不完善

适用场景

  • 学术研究者复现论文实验或扩展对话数据集
  • 对话系统开发者需要带社交常识的训练数据
  • 数据工程团队探索大模型蒸馏数据的自动化流程

替代项目

Blended Skill Talk、Empathetic Dialogues、DailyDialog

项目介绍

sodaverse 是数据集领域的开源项目,由 skywalker023 开发,2022 年首次发布。

它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 244。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-17。代码和数据集免费提供,遵循MIT许可证,无付费版本。

它主要面向的使用场景是:学术研究者复现论文实验或扩展对话数据集。同类可对比的替代方案包括 Blended Skill Talk、Empathetic Dialogues、DailyDialog。

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09