fountain

一句话生成海量对话样本,让 NLU 模型更聪明

fountain 是一个面向对话系统的自然语言数据增强工具。它主要解决构建对话式 AI 时训练数据不足、样本单一的问题,帮助开发者快速生成多样化的自然语言表达,以提升 NLU 模型的泛化能力。其核心能力包括对已有对话样本进行同义改写、句式变换、实体替换等操作,从而扩充数据集。它基于 Python 实现,易于集成到现有的数据流水线中,适合用于聊天机器人、语音助手等场景的训练数据准备。

开源 free 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 115
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类对话助手
开发团队tzano
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型chatbot,conversational-ai,data-generator,natural-language,nlu,training-data
GitHub 星标★ 115
30天Star增速
HF 下载量
上线时间2018-03-19 00:00:00
最近更新2024-12-03 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

核心亮点

  • 支持多种数据增强策略,如同义替换、随机插入删除,能有效增加样本多样性
  • 与主流 NLU 框架兼容,可无缝接入 Rasa 等工具的数据准备流程
  • 提供简单易用的 API,降低使用门槛,快速上手

不足之处

  • 文档/社区待观察
  • 项目处于早期阶段,功能可能不够完善

适用场景

  • 构建聊天机器人时扩充训练语料
  • 提升 NLU 模型在少见表达上的鲁棒性
  • 快速生成测试数据以验证对话系统

替代项目

NLPAug、TextAttack、Parrot

项目介绍

fountain 是数据集领域的开源项目,由 tzano 开发,2018 年首次发布。

它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 115。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2024-12-03。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:构建聊天机器人时扩充训练语料。同类可对比的替代方案包括 NLPAug、TextAttack、Parrot。

上一篇:Chatbot-Training-Corpus

下一篇:sexting-dataset

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09