Rasa_NLU_Chi

让中文对话秒变结构化数据,轻松构建聊天机器人

Rasa_NLU_Chi 是一个面向中文的 NLU(自然语言理解)工具,基于 Rasa NLU 构建,专注于将中文自然语言输入转换为结构化数据。它解决了中文在分词、词性标注和意图识别上的特殊挑战,提供开箱即用的中文支持,包括自定义分词器、意图分类和实体提取功能。核心能力涵盖:中文文本预处理、基于机器学习或深度学习的意图识别、实体抽取(如时间、地点、人名等),以及与 Rasa 对话管理模块的无缝集成。项目旨在降低中文聊天机器人开发者的门槛,使其能快速构建具备语义理解能力的对话系统,而无需从零处理中文 NLP 的复杂性。

开源 free 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1531
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类对话助手
开发团队crownpku
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0 许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型chatbot,chinese,natural-language
GitHub 星标★ 1531
30天Star增速
HF 下载量
上线时间2017-06-21 00:00:00
最近更新2026-09-17 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:进阶 约 20 分钟 部署方式:本地安装 6 步

环境要求

  • 已安装 Python 环境(README 仅给出 python setup.py install)
  • 已 git 可用,能克隆 GitHub 仓库
  • 需准备中文特征模型文件 data/total_word_feature_extractor_zh.dat
  • 需准备训练语料 data/examples/rasa/demo-rasa_zh.json,并尽量多加示例

安装与启动步骤

  1. 1克隆项目

    把 Rasa_NLU_Chi 仓库克隆到本地,后续安装与配置都在该目录内进行。

    git clone https://github.com/crownpku/Rasa_NLU_Chi.git
  2. 2安装项目

    进入项目目录后按 README 执行 setup.py 安装,等待依赖安装完成且无报错。

    cd Rasa_NLU_Chi
    python setup.py install
  3. 3准备中文特征模型

    把训练好的 total_word_feature_extractor_zh.dat 放到 data/ 目录;README 未给下载命令,需自行从中文 Blog 下载。

  4. 4选择并修改配置

    中文提供 MITIE+Jieba 与 MITIE+Jieba+sklearn 两套 pipeline,README 推荐后者,可基于 sample_configs 下的示例文件修改。

  5. 5补充训练语料

    编辑 data/examples/rasa/demo-rasa_zh.json,按实际业务场景尽可能多地添加中文示例。

  6. 6可选自定义词典

    在 tokenizer_jieba 下配置 user_dicts 或 default_dict,值可填文件路径或目录路径,用于自定义或替换 Jieba 词典。

关键配置

配置项必填说明示例
language是指定语种,中文场景必须为 zhzh
pipeline是定义处理流水线,中文可选 MITIE+Jieba 或加 sklearnnlp_mitie, tokenizer_jieba, ner_mitie, ner_synonyms, intent_
pipeline[].model是nlp_mitie 使用的中文词向量特征模型路径data/total_word_feature_extractor_zh.dat
pipeline[].default_dict否tokenizer_jieba 的默认词典路径,用于替换默认词典./default_dict.big
pipeline[].user_dicts否tokenizer_jieba 的用户自定义词典,可填文件或目录路径./jieba_userdict

如何确认成功

安装过程无报错,且 data/total_word_feature_extractor_zh.dat 与配置文件均已就位;README 未提供启动命令。

常见问题

Q:该选哪套 pipeline?

A:README 推荐 MITIE+Jieba+sklearn,即 sample_configs/config_jieba_mitie_sklearn.yml;简单场景也可用 MITIE+Jieba。

Q:没有 total_word_feature_extractor_zh.dat 怎么办?

A:可从中文 Blog 下载基于中文维基与百度百科训练的模型;也可用 MITIE wordrep 工具自行训练,但需 2-3 天。

Q:可以自己训练特征模型吗?

A:可以,需先构建 MITIE Wordrep Tool,中文语料要先分词再喂入训练,且与业务最接近的垂直语料效果最好。

Q:如何让分词更贴合业务?

A:使用 jieba 的用户自定义词典,在 tokenizer_jieba 下配置 user_dicts(文件或目录路径),必要时用 default_dict 替换默认词典。

Q:配置示例在哪里看?

A:sample_configs 目录下有各套 pipeline 示例,如 config_jieba_mitie.yml、config_jieba_mitie_sklearn.yml 及其 plus_dict_path 版本。

注意事项

  • README 未给出训练与启动服务的命令,请参考官方 Rasa NLU 文档 https://nlu.rasa.com/
  • 本项目是 RasaHQ/rasa_nlu 的 fork,仅针对中文场景做适配
  • 训练语料越丰富,意图识别与实体抽取效果越好,建议持续补充 demo-rasa_zh.json

核心亮点

  • 内置中文分词与词性标注,解决中文分词难题
  • 与 Rasa 生态无缝集成,支持完整对话流程
  • 提供多种意图识别和实体提取算法,灵活适配场景

不足之处

  • 文档和社区支持相对有限,新手上手可能遇到障碍
  • 项目维护活跃度一般,可能滞后于上游 Rasa 更新

适用场景

  • 中文客服机器人,自动识别用户意图并提取关键信息
  • 中文语音助手,将语音转文字后的语义解析
  • 中文舆情分析,从评论中抽取实体和情感倾向

替代项目

Rasa Open Source、HanLP、Jieba

项目介绍

Rasa_NLU_Chi 是对话助手领域的开源项目,由 crownpku 开发,2017 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,531)位列前 30%,在对话助手分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-17。Apache-2.0 许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:中文客服机器人,自动识别用户意图并提取关键信息。同类可对比的替代方案包括 Rasa Open Source、HanLP、Jieba。

上一篇:openilink-hub

下一篇:Video-ChatGPT

同类项目推荐

open-webui 开源

给本地模型配个漂亮聊天室,全家都能用

User-friendly AI Interface (Supports Ollama, OpenAI API, ...)

★ 152821 2026-08-09
prompts.chat 开源

海量好提示词,抄了就能让 AI 更听话

f.k.a. Awesome ChatGPT Prompts. Share, discover, and collect prompts from the commun···

★ 170999 2026-08-09
elia 开源

终端里用键盘快速聊 AI,多模型切换不打断思路

A snappy, keyboard-centric terminal user interface for interacting with large langua···

★ 2479 2026-08-09
NextChat 开源

一个界面聊遍所有主流AI模型,支持全平台部署,轻快又私密。

✨ Zero-config AI chat assistant. No API key needed — sign up and instantly chat wi···

★ 88802 2026-08-09