Chatito 是数据集领域的开源项目,由 rodrigopivi 开发,2017 年首次发布。
在全站 13,090 个收录项目中,它的 GitHub 星标数(890)位列前 30%,在数据集分类中处于中上游。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-09。MIT许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:为聊天机器人训练NLU模型生成初始训练语料。同类可对比的替代方案包括 Rasa NLU、TinyTroupe、Faker。

用简单DSL快速生成海量NLP训练数据,告别手工标注。
Chatito 是一个用于生成 AI 聊天机器人、NLP 任务、命名实体识别或文本分类模型训练数据集的开源工具。它通过一种简洁的领域特定语言(DSL)来描述对话样本的生成规则,用户只需定义意图、槽位和实体,即可自动生成大量多样化的标注数据。该项目解决了手工标注训练数据耗时费力的问题,尤其适合在缺乏真实语料时快速构建合成数据集。其核心能力包括:支持嵌套实体、条件生成、权重控制,以及导出为 JSON 或 JSONL 格式,方便直接用于 Rasa、Dialogflow 等主流 NLU 平台。Chatito 采用 TypeScript 编写,提供命令行界面和 Node.js API,易于集成到现有工作流中。
Rasa NLU、TinyTroupe、Faker
Chatito 是数据集领域的开源项目,由 rodrigopivi 开发,2017 年首次发布。
在全站 13,090 个收录项目中,它的 GitHub 星标数(890)位列前 30%,在数据集分类中处于中上游。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-09。MIT许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:为聊天机器人训练NLU模型生成初始训练语料。同类可对比的替代方案包括 Rasa NLU、TinyTroupe、Faker。
下一篇:MuTual
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models