MOSS-TTSD 是音频音乐领域的开源项目,由 OpenMOSS 开发,2025 年首次发布。
在全站 13,014 个收录项目中,它的 GitHub 星标数(1,400)位列前 30%,在音频音乐分类的 738 个项目里位列前 13%。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-23。Apache-2.0许可,完全免费,可自行部署使用。
它主要面向的使用场景是:语音助手和智能客服的对话生成。同类可对比的替代方案包括 Coqui TTS、XTTS、VITS。

1克隆 SGLang 分支
MOSS-TTSD v1.0 需搭配专用 SGLang 分支,必须带 -b 参数克隆,否则依赖不匹配。
git clone https://github.com/OpenMOSS/sglang -b moss-ttsd-v1.0-with-cat2用 venv 建环境
在 sglang 同级目录创建并激活虚拟环境,README 提供 venv 与 conda 两种方式,任选其一。
python -m venv moss_ttsd_sglang
source moss_ttsd_sglang/bin/activate3安装 SGLang 依赖
在已激活的环境中从本地克隆目录安装 SGLang 全部依赖,注意路径指向刚克隆的 sglang 目录。
pip install ./sglang/python[all]4(备选)用 conda 建环境
若不用 venv,可用 conda 创建 Python 3.12 环境后执行同一条 pip 安装命令。
conda create -n moss_ttsd_sglang python=3.12
conda activate moss_ttsd_sglang
pip install ./sglang/python[all]5加载模型与处理器
用 transformers 的 AutoProcessor 加载模型,需传入音频 tokenizer 的 codec_path 并开启 trust_remote_code。
import torch
from transformers import AutoModel, AutoProcessor
pretrained_model_name_or_path = "OpenMOSS-Team/MOSS-TTSD-v1.0"
audio_tokenizer_name_or_path = "OpenMOSS-Team/MOSS-Audio-Tokenizer"
device = "cuda" if torch.cuda.is_available() else "cpu"
dtype = torch.bfloat16 if device == "cuda" else torch.float32
processor = AutoProcessor.from_pretrained(
pretrained_model_name_or_path,
trust_remote_code=True,
codec_path=audio_tokenizer_name_or_path,
)
processor.audio_tokenizer = processor.audio_tokenizer.to(device)
processor.audio_tokenizer.eval()
attn_implementation = "flash_attention_2" if device == "cuda" else "sdpa"6准备参考音频与文本
MOSS-TTSD 采用续写式工作流:先给每位说话人的参考音频及其转写文本作为前缀,再给待生成的对话文本。
| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
pretrained_model_name_or_path | 是 | 主模型权重路径或 Hugging Face 仓库名。 | OpenMOSS-Team/MOSS-TTSD-v1.0 |
codec_path | 是 | 音频 tokenizer 权重路径,作为 AutoProcessor 参数传入。 | OpenMOSS-Team/MOSS-Audio-Tokenizer |
trust_remote_code | 是 | 允许加载仓库中的自定义远程代码。 | True |
device | 否 | 推理设备,无 GPU 时回退 CPU。 | cuda |
dtype | 否 | 推理精度,GPU 用 bfloat16,CPU 用 float32。 | torch.bfloat16 |
attn_implementation | 否 | 注意力实现,GPU 用 flash_attention_2,CPU 用 sdpa。 | flash_attention_2 |
Python 中执行模型与处理器加载代码不报错,权重能从 Hugging Face 成功下载并完成 audio_tokenizer 的设备迁移。
Q:没有 GPU 能跑吗?
A:可以。把 device 设为 cpu、dtype 用 torch.float32、attn_implementation 用 sdpa,但速度会明显变慢。
Q:为什么不能直接 pip install sglang?
A:README 要求使用 MOSS-TTSD v1.0 专用分支,必须 git clone 带 -b moss-ttsd-v1.0-with-cat 的仓库再本地安装。
Q:怎么实现零样本声音克隆?
A:为每位说话人提供参考音频及其对应转写文本作为前缀,再给出对话文本,模型会以各说话人身份继续生成。
Q:venv 和 conda 选哪个?
A:两者效果一致,README 都给出命令。conda 方式固定 Python 3.12,venv 方式使用本机 Python 版本,任选其一即可。
Q:模型可以商用吗?
A:项目采用 Apache 2.0 许可,但 README 声明仅限学术研究、教育及合法用途,禁止未授权克隆、冒充、诈骗等行为。
Coqui TTS、XTTS、VITS
MOSS-TTSD 是音频音乐领域的开源项目,由 OpenMOSS 开发,2025 年首次发布。
在全站 13,014 个收录项目中,它的 GitHub 星标数(1,400)位列前 30%,在音频音乐分类的 738 个项目里位列前 13%。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-23。Apache-2.0许可,完全免费,可自行部署使用。
它主要面向的使用场景是:语音助手和智能客服的对话生成。同类可对比的替代方案包括 Coqui TTS、XTTS、VITS。
上一篇:MusicGPT
下一篇:MOSS-Speech
tango
开源
输入一句话,自动生成匹配的音频内容
A family of diffusion models for text-to-audio generation.
AuK
开源
一个模型搞定语音生成、编辑与分离
AuK: An Open-Source Foundational Model for Speech Generation and Editing
swift-tts
开源
Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine
A straightforward package containing version for Swift modern concurrency, Point-Fre···
ai-dj
开源
现场演出中实时用 AI 生成音乐,保持人类掌控
AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···