Chatito

用简单DSL快速生成海量NLP训练数据,告别手工标注。

Chatito 是一个用于生成 AI 聊天机器人、NLP 任务、命名实体识别或文本分类模型训练数据集的开源工具。它通过一种简洁的领域特定语言(DSL)来描述对话样本的生成规则,用户只需定义意图、槽位和实体,即可自动生成大量多样化的标注数据。该项目解决了手工标注训练数据耗时费力的问题,尤其适合在缺乏真实语料时快速构建合成数据集。其核心能力包括:支持嵌套实体、条件生成、权重控制,以及导出为 JSON 或 JSONL 格式,方便直接用于 Rasa、Dialogflow 等主流 NLU 平台。Chatito 采用 TypeScript 编写,提供命令行界面和 Node.js API,易于集成到现有工作流中。

开源 free 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 890
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类对话助手
开发团队rodrigopivi
所属国家
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言TypeScript
技术栈/模型chatbot,chatbots,chatito,dataset,dataset-generation,named-entity-recognition,nlg,nlp,nlu,text-classification
GitHub 星标★ 890
30天Star增速
HF 下载量
上线时间2017-11-22 00:00:00
最近更新2026-09-09 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

核心亮点

  • DSL语法简洁,学习成本低,几分钟即可上手生成数据集
  • 支持嵌套实体和条件逻辑,能模拟复杂对话场景
  • 可导出JSON/JSONL,无缝对接Rasa、Dialogflow等主流NLU平台

不足之处

  • 文档相对简略,高级用法示例不足
  • 社区活跃度一般,更新频率较低

适用场景

  • 为聊天机器人训练NLU模型生成初始训练语料
  • 在缺乏真实用户数据时,快速构造命名实体识别数据集
  • 用于文本分类模型的训练数据增强与平衡

替代项目

Rasa NLU、TinyTroupe、Faker

项目介绍

Chatito 是数据集领域的开源项目,由 rodrigopivi 开发,2017 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(890)位列前 30%,在数据集分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-09。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:为聊天机器人训练NLU模型生成初始训练语料。同类可对比的替代方案包括 Rasa NLU、TinyTroupe、Faker。

上一篇:insuranceqa-corpus-zh

下一篇:MuTual

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09