MOSS-TTS-Nano

0.1B 参数,CPU 上实时跑多语言语音克隆

MOSS-TTS-Nano 是 MOSI.AI 与 OpenMOSS 团队开源的多语言轻量级语音合成模型,参数量仅 0.1B,专为实时语音生成设计。它解决了传统 TTS 模型体积大、推理慢、依赖 GPU 的问题,可在纯 CPU 环境下直接运行,部署栈简单,适合本地演示、Web 服务和轻量级产品集成。核心能力包括多语言支持(中英文)、流式音频输出、语音克隆,并配套 audio-tokenizer 等工具链,方便开发者快速构建语音交互应用。项目当前处于成长阶段,GitHub 星标已超 4 千,社区关注度较高。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4398
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队OpenMOSS
所属国家
定价模式free
价格说明开源模型,Apache-2.0 许可证,完全免费,可本地部署或在线体验。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型audio-tokenizer,chinese,cpu-inference,english,multi-modality,multilingual,onnx,realtime,speech-synthesis,streaming-audio,text-to-speech,tts,voice-clone,voice-cloning
GitHub 星标★ 4398
30天Star增速
HF 下载量
上线时间2026-04-10 00:00:00
最近更新2026-09-23 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 6 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(建议使用干净的虚拟环境)
  • 可访问 GitHub 克隆仓库
  • 能访问 HuggingFace 或 ModelScope 下载默认模型权重
  • 如需跑 Android 示例,需准备 Android ONNX Runtime 环境

安装与启动步骤

  1. 1克隆仓库

    把 MOSS-TTS-Nano 源码拉到本地,后续以该目录为工作目录。

    git clone https://github.com/OpenMOSS/MOSS-TTS-Nano.git
    cd MOSS-TTS-Nano
  2. 2创建干净环境

    README 明确建议先准备一个干净的 Python 环境,避免依赖冲突;具体创建方式按你的工具链执行。

    python -m venv .venv
  3. 3激活虚拟环境

    进入刚创建的虚拟环境后再执行后续安装。

    source .venv/bin/activate
  4. 4可编辑模式安装

    README 要求以 editable 模式安装本项目,安装后本地才会出现 moss-tts-nano 命令。

    pip install -e .
  5. 5运行 Quickstart 示例

    README 的 Quickstart 未给出具体命令,示例刻意保持参数最小并依赖仓库默认配置,请按仓库内示例文件执行。

  6. 6(可选)Android ONNX 示例

    示例目录 examples/android_onnx_runtime 提供端侧冒烟测试,加载导出的 ONNX 图并写 WAV,模型文件放在 APK 外。

关键配置

配置项必填说明示例
OpenMOSS-Team/MOSS-TTS-Nano否默认加载的 TTS 模型仓库标识,README 说明无需手动指定OpenMOSS-Team/MOSS-TTS-Nano
OpenMOSS-Team/MOSS-Audio-Tokenizer-Nano否默认加载的音频 tokenizer 模型仓库标识OpenMOSS-Team/MOSS-Audio-Tokenizer-Nano

如何确认成功

安装完成后本地出现 moss-tts-nano 命令即说明可编辑安装成功;README 未给出更具体的启动验证方式,请以仓库示例运行结果为准。

常见问题

Q:必须要有 GPU 吗?

A:不需要。该项目定位为 CPU 推理、面向实时语音生成的轻量模型,README 未提出 GPU 要求,纯 CPU 即可运行。

Q:模型权重需要手动下载吗?

A:默认会自动加载 OpenMOSS-Team/MOSS-TTS-Nano 和 OpenMOSS-Team/MOSS-Audio-Tokenizer-Nano;若网络受限,可到对应的 HuggingFace 或 ModelScope 页面获取。

Q:为什么按 README 找不到具体运行命令?

A:README 的 Quickstart 只说明环境准备思路,未列出完整命令;请直接查看仓库内示例脚本和 examples 目录,不要凭猜测拼参数。

Q:Android 示例怎么用?

A:位于 examples/android_onnx_runtime,加载导出的 ONNX 图和 tokenizer 解码器,对预分词的短提示做合成并写出 WAV,模型文件不打包进 APK。

注意事项

  • README 节选未给出完整安装与运行命令,本教程中的命令依据其“editable 安装”“干净 Python 环境”等描述推断,请以仓库最新文档为准。
  • 默认模型为 OpenMOSS-Team/MOSS-TTS-Nano 与 OpenMOSS-Team/MOSS-Audio-Tokenizer-Nano,首次运行需联网拉取权重。
  • 项目为流式音频输出的多语言(中英文)TTS,支持语音克隆,适合本地演示与轻量 Web 服务集成。
  • Android 示例刻意保持最小化,模型文件放在 APK 之外,仅用于本地测试。

核心亮点

  • 超小模型仅 0.1B,CPU 即可实时推理,无需 GPU 成本低
  • 支持中英文多语言和语音克隆,功能实用
  • 部署简单,适合本地演示和轻量级 Web 服务集成

不足之处

  • 文档/社区待观察
  • 0.1B 参数可能限制生成语音的自然度和复杂场景表现

适用场景

  • 本地实时语音合成演示
  • 轻量级 Web 服务的语音播报
  • 嵌入式或边缘设备的语音交互

替代项目

Coqui TTS、Piper TTS、MeloTTS

项目介绍

MOSS-TTS-Nano 是音频音乐领域的开源项目,由 OpenMOSS 开发,是 2026 年新上线的项目。

在全站 13,090 个收录项目中,它的 GitHub 星标数(4,398)位列前 10%,在音频音乐分类的 738 个项目里位列前 6%。

近 42 天,它的 GitHub 星标从 4,139 增加到 4,398,净增 259。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-23。Apache-2.0 许可证,完全免费,可本地部署或在线体验。从国内网络环境看,可直接访问。

它主要面向的使用场景是:本地实时语音合成演示。同类可对比的替代方案包括 Coqui TTS、Piper TTS、MeloTTS。

上一篇:Inflect

下一篇:nabu

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09