MARS5-TTS 是音频音乐领域的开源项目,由 Camb-ai 开发,2024 年首次发布。
在全站 13,014 个收录项目中,它的 GitHub 星标数(2,819)位列前 30%,在音频音乐分类的 738 个项目里位列前 8%。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。
它主要面向的使用场景是:内容创作者快速生成配音或旁白。同类可对比的替代方案包括 Coqui TTS、XTTS v2、Bark。

几秒音频克隆音色,生成富有情感的语音
MARS5-TTS 是 CAMB.AI 开源的语音合成模型,专注于高表现力的文本转语音和声音克隆。它解决的核心问题是传统 TTS 合成语音平淡、缺乏韵律和情感的问题,以及声音克隆需要大量样本且效果不佳的痛点。MARS5 采用深度学习方法,能够从极少的参考音频(甚至几秒)中提取说话人特征,并生成具有丰富韵律、语调和情感的自然语音。其核心能力包括:跨语言声音克隆、细粒度韵律控制(如通过输入文本中的标点或特殊标记控制语气)、支持中英文等多种语言,以及提供简单的 Python API 和 Gradio 演示界面,方便开发者快速集成和实验。该模型在保持高自然度的同时,显著降低了声音克隆的使用门槛,适合内容创作、有声书、虚拟助手等场景。
1安装依赖
用 pip 一次性升级并安装推理所需全部 Python 依赖,建议在虚拟环境中执行以免污染全局环境。
pip install --upgrade torch torchaudio librosa vocos encodec safetensors regex2加载模型
无需克隆仓库,直接用 torch.hub 从 GitHub 拉取 MARS5 英文 AR 与 NAR 模型,首次运行会自动下载权重。
import torch, librosa
mars5, config_class = torch.hub.load('Camb-ai/mars5-tts', 'mars5_english', trust_repo=True)3拉取官方镜像
想用容器方式,可直接从 README 给出的 DockerHub 页面拉取镜像,作为基础镜像使用。
docker pull cambai/mars5ttsimage4自建 Docker 镜像
克隆仓库后进入目录,基于仓库 docker 目录中的 Dockerfile 构建自定义镜像。
git clone https://github.com/Camb-ai/MARS5-TTS.git
cd MARS5-TTS
docker build -t mars5ttsimage ./docker| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
trust_repo | 否 | torch.hub.load 参数,设为 True 表示信任该仓库代码以完成加载 | True |
执行 torch.hub.load 后成功返回 mars5 与 config_class 两个对象、无报错,即表示模型加载成功。
Q:必须把仓库 clone 到本地吗?
A:不需要。README 明确使用 torch.hub.load 加载模型,无需克隆仓库即可推理;只有自建 Docker 镜像时才需要 clone。
Q:声音克隆需要多长的参考音频?
A:README 说明仅需约 5 秒音频配合一小段文本,即可生成体育解说、动画等韵律复杂的语音。
Q:Docker 镜像能直接生成语音吗?
A:不能。README 指出该镜像应作为基础镜像,需在其之上自行添加推理脚本;直接产出结果的镜像后续才会发布。
Q:模型支持哪些语言?
A:README 描述的是 MARS5 English 英文语音模型,通过 torch.hub 加载的是 mars5_english。
Coqui TTS、XTTS v2、Bark
MARS5-TTS 是音频音乐领域的开源项目,由 Camb-ai 开发,2024 年首次发布。
在全站 13,014 个收录项目中,它的 GitHub 星标数(2,819)位列前 30%,在音频音乐分类的 738 个项目里位列前 8%。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。
它主要面向的使用场景是:内容创作者快速生成配音或旁白。同类可对比的替代方案包括 Coqui TTS、XTTS v2、Bark。
tango
开源
输入一句话,自动生成匹配的音频内容
A family of diffusion models for text-to-audio generation.
AuK
开源
一个模型搞定语音生成、编辑与分离
AuK: An Open-Source Foundational Model for Speech Generation and Editing
swift-tts
开源
Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine
A straightforward package containing version for Swift modern concurrency, Point-Fre···
ai-dj
开源
现场演出中实时用 AI 生成音乐,保持人类掌控
AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···