magphase

用幅度和相位重建自然语音,让 TTS 发声更真实

MagPhase 是一个基于 Python 的开源声码器,用于语音分析与合成,主要面向文本转语音(TTS)及相关应用。它解决了传统声码器在语音自然度和计算效率之间的平衡问题,通过提取幅度谱和相位信息,并采用相位估计与重建技术,生成高质量的语音波形。核心能力包括:对语音信号进行短时傅里叶变换(STFT)分析,提取幅度和相位特征;利用 MagPhase 算法合成语音,支持与 HTS(HMM-based Speech Synthesis System)等传统 TTS 前端集成;提供命令行工具和 Python API,方便研究人员和开发者进行实验与部署。项目代码结构清晰,依赖较少,适合作为学习声码器原理和二次开发的参考。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 80
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队CSTR-Edinburgh
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0 许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型merlin,phase-spectra,speech-analysis,synthesis,tts,vocoder
GitHub 星标★ 80
30天Star增速
HF 下载量
上线时间2017-08-19 00:00:00
最近更新2025-02-10 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 基于相位重建的声码器,相比传统参数声码器能保留更多语音细节,提升自然度
  • 纯 Python 实现,依赖简单,易于阅读和修改,适合学术研究
  • 提供与 HTS 的接口,可直接用于传统统计参数语音合成流程

不足之处

  • 项目处于早期阶段,文档较少,社区活跃度低
  • 合成速度可能较慢,未针对实时应用优化
  • 仅支持 Python 2,缺乏对现代 Python 3 的官方支持

适用场景

  • 学术研究:用于探索新的声码器算法和相位重建技术
  • 语音合成教学:作为理解 TTS 前端和声码器原理的示例
  • 与 HTS 等传统 TTS 系统集成,构建完整的语音合成链路

替代项目

WORLD、STRAIGHT、WaveNet Vocoder

项目介绍

magphase 是音频音乐领域的开源项目,由 CSTR-Edinburgh 开发,2017 年首次发布。

它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 80。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2025-02-10。Apache-2.0 许可证,可免费使用和部署。

它主要面向的使用场景是:学术研究:用于探索新的声码器算法和相位重建技术。同类可对比的替代方案包括 WORLD、STRAIGHT、WaveNet Vocoder。

上一篇:ha-tts-bluetooth-speaker

下一篇:speech-tts-cors

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 245 2026-08-09