MARS5-TTS

几秒音频克隆音色,生成富有情感的语音

MARS5-TTS 是 CAMB.AI 开源的语音合成模型,专注于高表现力的文本转语音和声音克隆。它解决的核心问题是传统 TTS 合成语音平淡、缺乏韵律和情感的问题,以及声音克隆需要大量样本且效果不佳的痛点。MARS5 采用深度学习方法,能够从极少的参考音频(甚至几秒)中提取说话人特征,并生成具有丰富韵律、语调和情感的自然语音。其核心能力包括:跨语言声音克隆、细粒度韵律控制(如通过输入文本中的标点或特殊标记控制语气)、支持中英文等多种语言,以及提供简单的 Python API 和 Gradio 演示界面,方便开发者快速集成和实验。该模型在保持高自然度的同时,显著降低了声音克隆的使用门槛,适合内容创作、有声书、虚拟助手等场景。

开源 unknown 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2819
维护状态 低维护
是否开源
定价模式 unknown

项目数据

分类音频音乐
开发团队Camb-ai
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源
开源协议AGPL-3.0
主要语言Jupyter Notebook
技术栈/模型prosody,speech,speech-synthesis,text-to-speech,voice-cloneai,voice-cloning
GitHub 星标★ 2819
30天Star增速
HF 下载量
上线时间2024-06-03 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 4 步

环境要求

  • Python >= 3.10
  • Torch >= 2.0
  • 需安装 torchaudio、librosa、vocos、encodec、safetensors、regex
  • 可选:已安装 Docker(使用 Docker 方式时)

安装与启动步骤

  1. 1安装依赖

    用 pip 一次性升级并安装推理所需全部 Python 依赖,建议在虚拟环境中执行以免污染全局环境。

    pip install --upgrade torch torchaudio librosa vocos encodec safetensors regex
  2. 2加载模型

    无需克隆仓库,直接用 torch.hub 从 GitHub 拉取 MARS5 英文 AR 与 NAR 模型,首次运行会自动下载权重。

    import torch, librosa
    
    mars5, config_class = torch.hub.load('Camb-ai/mars5-tts', 'mars5_english', trust_repo=True)
  3. 3拉取官方镜像

    想用容器方式,可直接从 README 给出的 DockerHub 页面拉取镜像,作为基础镜像使用。

    docker pull cambai/mars5ttsimage
  4. 4自建 Docker 镜像

    克隆仓库后进入目录,基于仓库 docker 目录中的 Dockerfile 构建自定义镜像。

    git clone https://github.com/Camb-ai/MARS5-TTS.git
    cd MARS5-TTS
    docker build -t mars5ttsimage ./docker

关键配置

配置项必填说明示例
trust_repotorch.hub.load 参数,设为 True 表示信任该仓库代码以完成加载True

如何确认成功

执行 torch.hub.load 后成功返回 mars5 与 config_class 两个对象、无报错,即表示模型加载成功。

常见问题

Q:必须把仓库 clone 到本地吗?

A:不需要。README 明确使用 torch.hub.load 加载模型,无需克隆仓库即可推理;只有自建 Docker 镜像时才需要 clone。

Q:声音克隆需要多长的参考音频?

A:README 说明仅需约 5 秒音频配合一小段文本,即可生成体育解说、动画等韵律复杂的语音。

Q:Docker 镜像能直接生成语音吗?

A:不能。README 指出该镜像应作为基础镜像,需在其之上自行添加推理脚本;直接产出结果的镜像后续才会发布。

Q:模型支持哪些语言?

A:README 描述的是 MARS5 English 英文语音模型,通过 torch.hub 加载的是 mars5_english。

注意事项

  • 最新 AR checkpoint 于 2024 年 7 月 5 日发布,输出稳定性更高。
  • 首次通过 torch.hub 加载会联网下载模型权重,请保证网络通畅。
  • Docker 方式需自行编写推理脚本,镜像本身不直接产生音频输出。

核心亮点

  • 极少量样本即可克隆声音,几秒音频即可生成相似音色
  • 强调韵律和情感表现,合成语音自然度高,优于多数开源TTS
  • 提供简单API和Gradio界面,易于上手和集成

不足之处

  • 模型较大,推理资源需求高,不适合低端设备
  • 文档和社区支持相对有限,中文资料较少
  • 跨语言克隆效果对某些语言或口音可能不稳定

适用场景

  • 内容创作者快速生成配音或旁白
  • 有声书或播客制作,需要特定音色
  • 虚拟助手或游戏角色语音定制

替代项目

Coqui TTS、XTTS v2、Bark

项目介绍

MARS5-TTS 是音频音乐领域的开源项目,由 Camb-ai 开发,2024 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(2,819)位列前 30%,在音频音乐分类的 738 个项目里位列前 8%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。

它主要面向的使用场景是:内容创作者快速生成配音或旁白。同类可对比的替代方案包括 Coqui TTS、XTTS v2、Bark。

上一篇:vall-e

下一篇:gTTS

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 245 2026-08-09