MOSS-TTSD

从短音频克隆声音,生成多说话人 expressive 对话

MOSS-TTSD 是一个面向表达性多说话人合成的口语对话生成模型。它解决了传统语音合成在长上下文建模、说话人灵活控制和多语言支持方面的不足,能够从短音频参考中实现零样本声音克隆。其核心能力包括长上下文建模以捕捉对话中的语义和情感连贯性,灵活的说话人控制以支持多说话人场景,以及多语言支持以覆盖不同语种。该模型基于 Python 实现,适用于生成自然、富有表现力的口语对话,可应用于语音助手、有声书、游戏角色配音等场景。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1400
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类开源模型
开发团队OpenMOSS
所属国家
定价模式free
价格说明开源模型,Apache-2.0许可,完全免费,可自行部署使用。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型finetune,large-language-models,multilingual,podcast,sglang,speech-dialogue-generation,speech-synthesis,streaming,text-to-speech,voice-cloning
GitHub 星标★ 1400
30天Star增速
HF 下载量
上线时间2025-06-17 00:00:00
最近更新2026-09-23 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:进阶 约 30 分钟 部署方式:模型权重 6 步

环境要求

  • Python 3.10+(conda 环境示例用 3.12)
  • PyTorch 2.0+
  • Linux/macOS 终端,可运行 git 与 pip
  • 建议有 NVIDIA GPU(CUDA)以获得 flash_attention_2 加速,也可退回 CPU
  • 可访问 Hugging Face 下载 OpenMOSS-Team/MOSS-TTSD-v1.0 与 MOSS-Audio-Tokenizer 权重

安装与启动步骤

  1. 1克隆 SGLang 分支

    MOSS-TTSD v1.0 需搭配专用 SGLang 分支,必须带 -b 参数克隆,否则依赖不匹配。

    git clone https://github.com/OpenMOSS/sglang -b moss-ttsd-v1.0-with-cat
  2. 2用 venv 建环境

    在 sglang 同级目录创建并激活虚拟环境,README 提供 venv 与 conda 两种方式,任选其一。

    python -m venv moss_ttsd_sglang
    source moss_ttsd_sglang/bin/activate
  3. 3安装 SGLang 依赖

    在已激活的环境中从本地克隆目录安装 SGLang 全部依赖,注意路径指向刚克隆的 sglang 目录。

    pip install ./sglang/python[all]
  4. 4(备选)用 conda 建环境

    若不用 venv,可用 conda 创建 Python 3.12 环境后执行同一条 pip 安装命令。

    conda create -n moss_ttsd_sglang python=3.12
    conda activate moss_ttsd_sglang
    pip install ./sglang/python[all]
  5. 5加载模型与处理器

    用 transformers 的 AutoProcessor 加载模型,需传入音频 tokenizer 的 codec_path 并开启 trust_remote_code。

    import torch
    from transformers import AutoModel, AutoProcessor
    
    pretrained_model_name_or_path = "OpenMOSS-Team/MOSS-TTSD-v1.0"
    audio_tokenizer_name_or_path = "OpenMOSS-Team/MOSS-Audio-Tokenizer"
    device = "cuda" if torch.cuda.is_available() else "cpu"
    dtype = torch.bfloat16 if device == "cuda" else torch.float32
    
    processor = AutoProcessor.from_pretrained(
        pretrained_model_name_or_path,
        trust_remote_code=True,
        codec_path=audio_tokenizer_name_or_path,
    )
    processor.audio_tokenizer = processor.audio_tokenizer.to(device)
    processor.audio_tokenizer.eval()
    
    attn_implementation = "flash_attention_2" if device == "cuda" else "sdpa"
  6. 6准备参考音频与文本

    MOSS-TTSD 采用续写式工作流:先给每位说话人的参考音频及其转写文本作为前缀,再给待生成的对话文本。

关键配置

配置项必填说明示例
pretrained_model_name_or_path主模型权重路径或 Hugging Face 仓库名。OpenMOSS-Team/MOSS-TTSD-v1.0
codec_path音频 tokenizer 权重路径,作为 AutoProcessor 参数传入。OpenMOSS-Team/MOSS-Audio-Tokenizer
trust_remote_code允许加载仓库中的自定义远程代码。True
device推理设备,无 GPU 时回退 CPU。cuda
dtype推理精度,GPU 用 bfloat16,CPU 用 float32。torch.bfloat16
attn_implementation注意力实现,GPU 用 flash_attention_2,CPU 用 sdpa。flash_attention_2

如何确认成功

Python 中执行模型与处理器加载代码不报错,权重能从 Hugging Face 成功下载并完成 audio_tokenizer 的设备迁移。

常见问题

Q:没有 GPU 能跑吗?

A:可以。把 device 设为 cpu、dtype 用 torch.float32、attn_implementation 用 sdpa,但速度会明显变慢。

Q:为什么不能直接 pip install sglang?

A:README 要求使用 MOSS-TTSD v1.0 专用分支,必须 git clone 带 -b moss-ttsd-v1.0-with-cat 的仓库再本地安装。

Q:怎么实现零样本声音克隆?

A:为每位说话人提供参考音频及其对应转写文本作为前缀,再给出对话文本,模型会以各说话人身份继续生成。

Q:venv 和 conda 选哪个?

A:两者效果一致,README 都给出命令。conda 方式固定 Python 3.12,venv 方式使用本机 Python 版本,任选其一即可。

Q:模型可以商用吗?

A:项目采用 Apache 2.0 许可,但 README 声明仅限学术研究、教育及合法用途,禁止未授权克隆、冒充、诈骗等行为。

注意事项

  • README 未给出具体的依赖清单与推理调用示例,本教程仅覆盖其中实际出现的克隆、环境搭建与加载步骤。
  • 模型权重托管在 Hugging Face,国内网络可能下载缓慢,建议提前配置好镜像或代理。
  • README 明确要求不得将模型用于未授权声音克隆、深度伪造或任何违法活动,使用时须遵守当地法律法规。
  • 非 SGLang 路径下的通用 pip 安装说明在 README 中未展开,无法据此写出确切命令。

核心亮点

  • 支持零样本声音克隆,只需短音频参考即可生成目标说话人语音
  • 长上下文建模能力强,能保持对话的语义和情感连贯性
  • 多语言支持,覆盖多种语言场景

不足之处

  • 文档和社区支持尚待完善,项目仍处于成长阶段
  • 模型推理资源消耗可能较高,部署门槛待观察

适用场景

  • 语音助手和智能客服的对话生成
  • 有声书和播客的多角色配音
  • 游戏和动画的角色语音合成

替代项目

Coqui TTS、XTTS、VITS

项目介绍

MOSS-TTSD 是音频音乐领域的开源项目,由 OpenMOSS 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,400)位列前 30%,在音频音乐分类的 738 个项目里位列前 13%。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-23。Apache-2.0许可,完全免费,可自行部署使用。

它主要面向的使用场景是:语音助手和智能客服的对话生成。同类可对比的替代方案包括 Coqui TTS、XTTS、VITS。

上一篇:MusicGPT

下一篇:MOSS-Speech

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 245 2026-08-09