magphase 是音频音乐领域的开源项目,由 CSTR-Edinburgh 开发,2017 年首次发布。
它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 80。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2025-02-10。Apache-2.0 许可证,可免费使用和部署。
它主要面向的使用场景是:学术研究:用于探索新的声码器算法和相位重建技术。同类可对比的替代方案包括 WORLD、STRAIGHT、WaveNet Vocoder。

用幅度和相位重建自然语音,让 TTS 发声更真实
MagPhase 是一个基于 Python 的开源声码器,用于语音分析与合成,主要面向文本转语音(TTS)及相关应用。它解决了传统声码器在语音自然度和计算效率之间的平衡问题,通过提取幅度谱和相位信息,并采用相位估计与重建技术,生成高质量的语音波形。核心能力包括:对语音信号进行短时傅里叶变换(STFT)分析,提取幅度和相位特征;利用 MagPhase 算法合成语音,支持与 HTS(HMM-based Speech Synthesis System)等传统 TTS 前端集成;提供命令行工具和 Python API,方便研究人员和开发者进行实验与部署。项目代码结构清晰,依赖较少,适合作为学习声码器原理和二次开发的参考。
WORLD、STRAIGHT、WaveNet Vocoder
magphase 是音频音乐领域的开源项目,由 CSTR-Edinburgh 开发,2017 年首次发布。
它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 80。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2025-02-10。Apache-2.0 许可证,可免费使用和部署。
它主要面向的使用场景是:学术研究:用于探索新的声码器算法和相位重建技术。同类可对比的替代方案包括 WORLD、STRAIGHT、WaveNet Vocoder。
tango
开源
输入一句话,自动生成匹配的音频内容
A family of diffusion models for text-to-audio generation.
AuK
开源
一个模型搞定语音生成、编辑与分离
AuK: An Open-Source Foundational Model for Speech Generation and Editing
swift-tts
开源
Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine
A straightforward package containing version for Swift modern concurrency, Point-Fre···
ai-dj
开源
现场演出中实时用 AI 生成音乐,保持人类掌控
AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···