VALL-E-X

听 3 秒原声就能学舌,任何人的音色都能复刻

微软 VALL-E X 零样本 TTS 模型的开源实现,仅需约 3 秒参考音频即可克隆目标说话人音色,并支持跨语种语音合成。训练与推理代码完整,是语音克隆与多语言 TTS 领域极具参考价值的项目。

开源 开源免费 音频音乐
GitHub 星标 ★ 7934
维护状态 低维护
是否开源
定价模式 开源免费

项目数据

分类音频音乐
开发团队Plachtaa
所属国家
官网地址
定价模式开源免费
价格区间
是否开源
开源协议MIT
主要语言Python
技术栈/模型emotional-speech,gpt,text-to-speech,transformer-architecture,tts,vall-e,voice-clone
GitHub 星标★ 7934
30天Star增速
HF 下载量
上线时间2023-07-29 00:00:00
最近更新2026-08-08 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数0

核心亮点

    不足之处

      适用场景

        替代项目

        项目介绍

        微软 VALL-E X 零样本 TTS 模型的开源实现,仅需约 3 秒参考音频即可克隆目标说话人音色,并支持跨语种语音合成。训练与推理代码完整,是语音克隆与多语言 TTS 领域极具参考价值的项目。。主要使用 Python 开发,GitHub 星标 7934。

        上一篇:EmotiVoice

        下一篇:vits

        同类项目推荐

        StyleTTS2 开源

        音色情绪几乎以假乱真,听不出是机器在读

        StyleTTS 2: Towards Human-Level Text-to-Speech through Style Diffusion and Adversari···

        ★ 6328 2026-08-09
        tuneflow-py 开源

        编曲软件里直接跑 AI,灵感落地不用切工具

        + Build your music algorithms and AI models with the next-gen DAW

        ★ 890 2026-08-09
        NeuroRVQ 开源

        NeuroRVQ: Multi-Scale Biosignal Tokenization for Generative Foundation Models

        ★ 51 2026-08-09
        voc2vec 开源

        This repository contains the code for the paper "voc2vec: A Foundation Model for Non···

        ★ 58 2026-08-09