vall-e 是音频音乐领域的开源项目,由 e-c-k-e-r 开发,2023 年首次发布。
它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 88。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2025-08-12。AGPL-3.0许可,可免费使用和修改,需自行部署。
它主要面向的使用场景是:个性化语音合成,如虚拟助手、有声书配音。同类可对比的替代方案包括 Bark、XTTS、Tortoise-TTS。

3秒参考音频,零样本克隆你的声音
VALL-E 是一个非官方的 PyTorch 实现,旨在复现微软提出的神经编解码语言模型 VALL-E。该项目解决的核心问题是:如何用极少的参考音频(仅需 3 秒)实现高质量、高相似度的零样本语音合成。其核心能力包括:将文本转换为离散的音频编码序列,并利用语言模型建模其依赖关系,从而生成与说话人音色、韵律高度匹配的语音。项目提供了完整的训练和推理代码,支持自定义数据集,并包含预训练模型权重。由于是早期项目,代码结构清晰,适合研究者和开发者快速上手,但功能上尚未完全对齐原论文,且依赖特定音频编解码器。
Bark、XTTS、Tortoise-TTS
vall-e 是音频音乐领域的开源项目,由 e-c-k-e-r 开发,2023 年首次发布。
它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 88。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2025-08-12。AGPL-3.0许可,可免费使用和修改,需自行部署。
它主要面向的使用场景是:个性化语音合成,如虚拟助手、有声书配音。同类可对比的替代方案包括 Bark、XTTS、Tortoise-TTS。
上一篇:TwitterPiBot
下一篇:resemble-alexa
tango
开源
输入一句话,自动生成匹配的音频内容
A family of diffusion models for text-to-audio generation.
AuK
开源
一个模型搞定语音生成、编辑与分离
AuK: An Open-Source Foundational Model for Speech Generation and Editing
swift-tts
开源
Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine
A straightforward package containing version for Swift modern concurrency, Point-Fre···
ai-dj
开源
现场演出中实时用 AI 生成音乐,保持人类掌控
AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···