MOSS-TTS

一站式生成高保真语音、对话、音效,支持实时流式输出

MOSS-TTS 是由 MOSI.AI 和 OpenMOSS 团队开发的开源语音与声音生成模型家族,专注于高保真、高表现力及复杂真实场景的语音合成。它解决了传统 TTS 在长文本稳定性、多说话人对话、声音克隆和环境音效生成方面的不足,支持稳定长语音、多说话人对话、声音/角色设计、环境音效以及实时流式 TTS。核心能力包括基于音频 tokenizer 和 LLM 的多模态建模,能够生成自然流畅的语音,并支持声音克隆和个性化定制。项目使用 Python 实现,技术栈涵盖音频处理、大语言模型和多模态学习,适合研究与应用开发。目前项目处于成长阶段,社区活跃,为语音合成领域提供了新的开源选择。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4136
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队OpenMOSS
所属国家
定价模式free
价格说明开源模型,Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型audio,audio-tokenizer,llm,multilingual,multimodal,speech-synthesis,streaming,text-to-audio,text-to-speech,tts,voice-cloning
GitHub 星标★ 4136
30天Star增速
HF 下载量
上线时间2026-02-07 00:00:00
最近更新2026-09-23 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 25 分钟 部署方式:本地安装 7 步

环境要求

  • Python 3.12 环境(README 使用 uv venv --python 3.12)
  • uv 包管理器(需先按官方文档安装 uv)
  • 支持 CUDA 12.8 的 NVIDIA GPU 及驱动(纯 CPU 可用 cpu-only 配置)
  • 建议使用干净隔离环境,并搭配 Transformers 5.0.0 以避免依赖冲突

安装与启动步骤

  1. 1克隆仓库

    把 MOSS-TTS 源码拉取到本地并进入项目目录,后续所有安装命令都在该目录执行。

    git clone https://github.com/OpenMOSS/MOSS-TTS.git
    cd MOSS-TTS
  2. 2创建虚拟环境

    用 uv 创建 Python 3.12 的隔离虚拟环境,目录名为 .venv。

    uv venv --python 3.12 .venv
  3. 3激活虚拟环境

    Linux/macOS 下用 source 激活;激活后终端提示符前会出现 .venv 标识。

    source .venv/bin/activate
  4. 4安装 torch 运行依赖

    按 cu128 后端安装 PyTorch CUDA 轮子及项目依赖,如用其他后端把 cu128 换成 cpu、cu126 等。

    uv pip install --torch-backend cu128 -e ".[torch-runtime]"
  5. 5可选安装 FlashAttention

    硬件支持时可提升速度、降低显存;编译失败可跳过,改用默认 attention 后端,内存小的机器可限制并行度。

    uv pip install --torch-backend cu128 -e ".[torch-runtime,flash-attn]"
  6. 6可选轻量安装

    不想装 torch 时,用 llama-cpp-onnx 配置安装 numpy、onnxruntime-gpu、tokenizers,作为推荐起点。

    pip install -e ".[llama-cpp-onnx]"
  7. 7运行命令行推理

    使用 default.yaml(ONNX 音频 + GGUF 主干)合成语音,输出写入 output.wav。

    python -m moss_tts_delay.llama_cpp 
        --config configs/llama_cpp/default.yaml 
        --text "Hello, world!" --output output.wav

关键配置

配置项必填说明示例
heads_backend是LM heads 计算后端,可选 auto、numpy、torch。auto
audio_backend是音频 tokenizer 后端,可选 onnx、trt、torch。onnx
low_memory否显存有限时分阶段加载/卸载编码器、主干、解码器。true
kv_cache_type_k / kv_cache_type_v否KV cache 量化类型,用于降低显存占用。q8_0
flash_attn否预填充阶段启用 flash attention 以降低峰值显存。auto

如何确认成功

命令执行完成后在当前目录生成 output.wav 音频文件,播放可听到合成的语音即为成功。

常见问题

Q:显存不够怎么办?

A:改用 configs/llama_cpp/trt-8gb.yaml(8GB 显存低内存模式,分阶段加载)或 cpu-only.yaml(完全 CPU,无需 GPU),并在配置中开启 low_memory。

Q:FlashAttention 2 编译失败怎么办?

A:直接跳过安装,使用默认 attention 后端即可;若机器内存有限而 CPU 核数较多,可加 MAX_JOBS=4 限制构建并行度。

Q:没有 GPU 能运行吗?

A:可以,选择 configs/llama_cpp/cpu-only.yaml 完全基于 CPU 运行;也可只安装 llama-cpp-onnx 的 torch-free 版本。

Q:想换 CUDA 版本或纯 CPU 后端?

A:把安装命令中的 --torch-backend cu128 替换成目标后端,例如 cpu 或 cu126。

Q:多语言文本怎么生成?

A:已知语言时请设置 language 参数;MOSS-TTS-v1.5 与 1.0 的 MossTTSDelay-8B 检查点使用相同的生成 API。

注意事项

  • 依赖统一由 pyproject.toml 管理,当前固定 torch==2.9.1+cu128 与 torchaudio==2.9.1+cu128。
  • README 提供四套预置配置:default.yaml、trt.yaml、trt-8gb.yaml、cpu-only.yaml,其中 trt 需要自行构建引擎。
  • TRT 配置可获得最大音频 tokenizer 速度,但需要自行构建 TensorRT 引擎。
  • 各模型的浏览器 Gradio Demo 脚本位于 clis/ 目录(如 moss_tts_app.py、moss_ttsd_app.py 等),MOSS-TTS-Realtime 见 docs/moss_tts_realtime_model_card.md。

核心亮点

  • 支持超长文本稳定合成,避免长句崩坏
  • 多说话人对话生成,角色区分自然
  • 集成环境音效生成,拓展 TTS 应用边界

不足之处

  • 文档/社区待观察
  • 模型体积可能较大,部署成本待评估

适用场景

  • 有声书与播客批量生成
  • 游戏角色配音与动态对话
  • 实时语音助手与直播互动

替代项目

ChatTTS、Bark、VITS

项目介绍

MOSS-TTS 是音频音乐领域的开源项目,由 OpenMOSS 开发,是 2026 年新上线的项目。

在全站 13,090 个收录项目中,它的 GitHub 星标数(4,136)位列前 10%,在音频音乐分类的 738 个项目里位列前 7%。

近 42 天,它的 GitHub 星标从 3,984 增加到 4,136,净增 152。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-23。Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:有声书与播客批量生成。同类可对比的替代方案包括 ChatTTS、Bark、VITS。

上一篇:RealtimeTTS

下一篇:Applio

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09