
awesome-controllable-speech-synthesis
一页看清可控语音合成论文、数据集与开源实现
这是一个围绕可控语音合成(Controllable Speech Synthesis)的系统性综述配套仓库,对应论文《Towards Controllable Speech Synthesis in the Era of Large Language Models: A Systematic Survey》。它解决的问题是:在大语言模型时代,可控语音合成方向论文数量激增、术语与分类混乱,研究者和工程人员难以快速定位某类控制能力(如情感、语速、音色、口音、风格)的代表工作与数据集。仓库核心能力是持续整理该领域的论文、方法、数据集、评测指标与开源实现,按控制维度分类索引,并随领域进展不断更新。它本身不是可直接运行的TTS工具,而是导航式资源集合,适合作为选题调研、方案选型和跟进前沿的入口。
项目数据
使用教程
核心亮点
- 按情感、语速、音色、风格等控制维度分类索引论文,便于按需求检索
- 配套系统性综述论文,分类框架有学术依据而非随意罗列
- 持续更新,跟踪LLM时代可控TTS的新方法与新数据集
不足之处
- 仅为资源列表,不提供可直接运行的模型或代码
- 早期项目,条目覆盖与更新频率有待观察
适用场景
- 调研可控TTS方向,快速了解某类控制能力的代表工作
- 为产品选型时对比不同情感/音色控制方案与数据集
- 撰写论文或综述时查找相关文献与评测指标
替代项目
Awesome-TTS、Awesome-Speech-Synthesis
项目介绍
上一篇:asmr-dubber
同类项目推荐
tango
开源
输入一句话,自动生成匹配的音频内容
A family of diffusion models for text-to-audio generation.
swift-tts
开源
Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine
A straightforward package containing version for Swift modern concurrency, Point-Fre···
ai-dj
开源
现场演出中实时用 AI 生成音乐,保持人类掌控
AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···
WhisperSubTranslate
开源
本地免费生成字幕并翻译,无需上传,隐私无忧
A free, local desktop app to extract subtitles (SRT) from video and translate them i···