merlin

用深度学习快速训练自定义语音合成模型,从文本到语音一键生成。

Merlin 是一个基于深度学习的开源语音合成工具包,专注于文本到语音(TTS)和语音转换任务。它解决了传统语音合成系统依赖复杂信号处理、难以扩展的问题,提供了从声学特征提取到声码器重建的完整训练流程。核心能力包括:支持多种神经网络架构(如前馈神经网络、循环神经网络)、与 Keras 和 Theano 后端集成、提供特征提取和模型训练脚本、支持多说话人建模。用户可以通过配置文件和命令行接口快速训练自定义语音合成模型,适用于研究实验和原型开发。项目代码结构清晰,文档覆盖安装、数据准备和训练步骤,适合有一定深度学习基础的开发者使用。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1321
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队CSTR-Edinburgh
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,完全免费,需自行部署使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型deep-learning,keras,merlin,python,speech-synthesis,tensorflow,text-to-speech,theano,voice-conversion
GitHub 星标★ 1321
30天Star增速
HF 下载量
上线时间2016-08-10 00:00:00
最近更新2026-08-07 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:进阶 约 20 分钟 部署方式:本地安装 5 步

环境要求

  • Python 2.7–3.6(README 明确声明兼容范围)
  • Theano 数值计算库(Merlin 核心依赖)
  • numpy、scipy、matplotlib、bandmat
  • 可选:tensorflow(仅在用 tensorflow 模型时需要)
  • 可选:sklearn、keras、h5py(仅在用 keras 模型时需要)
  • 外部组件:前端文本处理器(如 Festival)与声码器(如 STRAIGHT 或 WORLD)

安装与启动步骤

  1. 1准备 Python 环境

    确认 Python 版本落在 2.7–3.6 区间,并准备好可执行 shell 脚本的编译环境,供后续编译内置工具使用。

  2. 2编译内置工具

    进入 merlin 项目根目录后执行,编译 Merlin 自带的基础工具;脚本依赖 bash 与系统编译工具链。

    bash tools/compile_tools.sh
  3. 3安装 Python 依赖

    仍在项目根目录执行,按 requirements.txt 安装 numpy、scipy、matplotlib、bandmat、theano 等必需依赖。

    pip install -r requirements.txt
  4. 4安装可选依赖

    需要使用 TensorFlow 或 Keras 模型时,另行安装 tensorflow、sklearn、keras、h5py;不用则跳过。

  5. 5准备外部组件

    Merlin 本身只做声学建模,必须额外准备前端文本处理器(如 Festival)和声码器(如 STRAIGHT 或 WORLD)。

如何确认成功

README 未给出专门的验证命令;compile_tools.sh 与 pip 安装均无报错、Theano 可正常导入即视为环境就绪。

常见问题

Q:支持 Python 3.7 及以上版本吗?

A:README 明确写明兼容 Python 2.7–3.6,更高版本未声明支持,建议严格控制解释器版本。

Q:必须安装 TensorFlow 和 Keras 吗?

A:不必。两者属于可选依赖,只有使用 tensorflow 模型或 keras 模型时才需要安装。

Q:只安装 Merlin 就能直接合成语音吗?

A:不能。Merlin 需搭配前端文本处理器(如 Festival)和声码器(如 STRAIGHT 或 WORLD)一起使用。

Q:可以用于商业项目吗?

A:可以。Merlin 采用 Apache License 2.0,允许不受限制地商业和非商业使用。

Q:有现成的训练流程参考吗?

A:有。项目提供 Kaldi 风格的 recipes,展示如何构建当前最优的系统。

注意事项

  • 提供的 README 节选在安装章节被截断,完整安装与数据准备说明见官方文档 cstr-edinburgh.github.io/merlin/
  • 项目依赖的 Python 2.7–3.6 与 Theano 已较老旧,建议用 conda 或虚拟环境隔离,避免污染系统环境
  • Merlin 仅负责声学建模部分,数据准备需自行准备文本前端与声码器输出
  • 本教程只包含 README 中实际出现的命令,未出现的安装步骤未作推测

核心亮点

  • 提供完整的 TTS 训练流水线,从数据预处理到声码器合成,开箱即用
  • 支持多种神经网络架构和 Keras/Theano 后端,灵活适配不同实验需求
  • 社区活跃,持续更新,文档详细,适合学术研究和原型验证

不足之处

  • 依赖较老的深度学习框架(Theano),与现代 PyTorch/TF2 生态兼容性差
  • 合成音质相比现代端到端模型(如 Tacotron)有差距,需额外调参

适用场景

  • 学术研究:对比不同声学模型在语音合成上的效果
  • 语音克隆:基于少量数据训练特定说话人的合成模型
  • 教育演示:教学深度学习在语音领域的应用

替代项目

Tacotron、FastSpeech、Mozilla TTS

项目介绍

merlin 是音频音乐领域的开源项目,由 CSTR-Edinburgh 开发,2016 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,321)位列前 30%,在音频音乐分类的 738 个项目里位列前 14%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-07。Apache-2.0许可证,完全免费,需自行部署使用。

它主要面向的使用场景是:学术研究:对比不同声学模型在语音合成上的效果。同类可对比的替代方案包括 Tacotron、FastSpeech、Mozilla TTS。

上一篇:Matcha-TTS

下一篇:WavTokenizer

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09