voice-conversion
本站收录 42 个带「voice-conversion」标签的 AI 开源项目
TTS面向文本转语音的深度学习工具包,历经研究与生产环境双重考验。支持多语言、多语音模型,提供丰富的预训练模型与训练接口,既能快速搭建 TTS 服务,也能满足深入探索★ 46,083
voice-provoice-pro 是一个面向创作者和开发者的 Gradio WebUI 工具,集成了多种前沿的语音技术。它解决了音频内容生产中语音合成、克隆、分离和翻译的碎片★ 12,962
AmphionAmphion 是一个面向音频、音乐和语音生成的开源工具包,旨在支持可复现研究,并帮助初级研究者和工程师快速入门。它集成了多种主流模型与算法,涵盖文本到语音(T★ 10,305
espnet端到端语音处理工具包,覆盖语音识别、语音合成、语音翻译、说话人识别等多项任务。提供统一训练框架、丰富预训练模型与评测流程,是学术界与工业界语音技术研究的常用基础★ 9,974
abogenabogen 是一个将电子书(EPUB、PDF 和纯文本)自动转换为带同步字幕的有声书的开源工具。它解决了传统有声书制作成本高、周期长的问题,让普通用户也能快速★ 6,066
ApplioApplio 是一个专注于易用性和性能的语音转换工具,基于 PyTorch 实现,支持实时语音到语音转换(VC)、语音克隆和文本到语音(TTS)。它解决了传统语★ 3,770
audio.cppaudio.cpp 是一个基于 ggml 的纯 C++ 音频模型推理引擎,旨在为音频 AI 应用提供一体化、高性能的本地推理解决方案。它解决了传统音频 AI 工★ 3,180
awesome-speech-recognition-speech-synthesis-papers这是一个收录语音识别与语音合成领域经典论文的精选列表,涵盖自动语音识别(ASR)、说话人验证、语音合成、文本转语音(TTS)、语言建模、歌声合成(SVS)和声音★ 3,132
GPAGPA(General Purpose Audio)是一个基于Transformer的通用音频模型,由AutoArk团队开发,旨在用单一小型模型同时实现自动语音★ 3,107
SwitchAISwitchAI 是一款开源的 Android 应用,旨在让用户在一个统一的界面中轻松选择、启动和管理多个 AI 数字助手。它解决了用户需要在不同 AI 应用之★ 1,437
merlinMerlin 是一个基于深度学习的开源语音合成工具包,专注于文本到语音(TTS)和语音转换任务。它解决了传统语音合成系统依赖复杂信号处理、难以扩展的问题,提供了★ 1,321
TTS-Audio-SuiteTTS-Audio-Suite 是一个 ComfyUI 自定义节点集成包,旨在为本地多引擎、多语言的文本转语音(TTS)和语音转换(VC)提供一站式解决方案。它★ 1,216
YourTTSYourTTS 是一个面向所有人的零样本多说话人文本转语音(TTS)和零样本语音转换(VC)开源项目。它基于 VITS 架构,通过引入说话人编码器,能够在训练时★ 1,052
NISQANISQA是一个基于深度学习的非侵入式语音质量与TTS自然度评估工具。它解决了传统语音质量评估需要原始参考信号(侵入式)的问题,能够在无参考的情况下,仅凭待测语★ 974
dladla 是一个面向音频处理的深度学习开源项目,旨在为音频相关任务提供一套完整的解决方案。它涵盖了语音识别、说话人验证、关键词识别、语音合成、声音转换以及通用信号★ 770
bark-voice-cloning-HuBERT-quantizer这是一个用于声音克隆的开源项目,基于Bark模型和HuBERT量化器实现。它解决的核心问题是:如何用少量样本(甚至几秒钟的语音)克隆出特定音色,并用于文本到语音★ 710
vits2VITS2 是一个基于 PyTorch 的单阶段文本转语音(TTS)模型,旨在提升语音合成的质量和效率。它通过对抗学习和架构设计改进,解决了传统两阶段 TTS ★ 646
lora-svclora-svc 是一个基于 Whisper 和 LoRA 技术的歌声转换与克隆开源项目。它解决的核心问题是:如何用少量目标歌手的音频数据,快速克隆其音色并实现★ 646
CycleGAN-VC2CycleGAN-VC2 是一个基于 CycleGAN 的语音转换(Voice Conversion)开源项目,旨在实现无需平行语料的音色转换。它解决了传统语音★ 572
rvc-webuirvc-webui 是 liujing04 对 Retrieval-based-Voice-Conversion-WebUI(RVC)的重构项目,旨在提供更易用★ 522
VODERVODER(Voice Operation and Design Engine with Reproduction)是一个基于Python的语音操作与设计引擎,★ 520
Awesome-Singing-Voice-Synthesis-and-Singing-Voice-Conversion这是一个关于歌声合成(SVS)与歌声转换(SVC)的精选论文与项目列表,同时涵盖语音合成(TTS)、语音转换(VC)及相关领域(如音乐合成、自动音乐转录、MOS★ 494
speech_datasetspeech_dataset 是一个面向语音识别(ASR)研究的中文语音数据集仓库,旨在为深度学习语音模型提供训练与评估所需的音频资源。项目整理了多种来源的语音★ 471
nnmnkwiinnmnkwii 是一个用于构建语音合成系统的 Python 库,专注于快速原型设计和实验。它提供了一套简洁的 API,封装了语音处理中的常见操作,如频谱特征提★ 399
audio.cpp-webuiaudio.cpp-webui 是一个基于 ggml 的纯 C++ 音频模型推理引擎,为 audio.cpp 提供全任务 WebUI。它支持语音合成(TTS)、★ 369
ultimate-rvcultimate-rvc 是一个基于检索式语音转换(RVC)的音频内容创作应用,主要用于生成歌曲翻唱和语音合成。它解决了普通用户难以训练和使用高质量语音模型的问★ 330
nonparaSeq2seqVC_code这是一个基于非平行语料库的序列到序列语音转换(Voice Conversion, VC)实现代码。传统语音转换通常需要源和目标说话人的平行语料(即相同文本),而★ 248
CycleGAN-VC3CycleGAN-VC3 是一个基于 CycleGAN 的语音转换(Voice Conversion)开源项目,旨在将一个人的声音转换为另一个人的声音,同时保留★ 158
PitchExtractorPitchExtractor 是一个基于深度神经网络的音高提取工具,专为语音转换和语音合成(TTS)训练设计。它解决了传统音高提取算法(如基于自相关或频谱的方法★ 154
UnitSpeechUnitSpeech 是一个基于扩散模型的语音合成与声音转换开源项目,官方实现了同名论文《UnitSpeech: Speaker-adaptive Speech★ 136
AuxiliaryASRAuxiliaryASR 是一个面向语音转换和语音合成场景的辅助语音识别工具,核心解决文本与语音帧的自动对齐问题。它采用联合 CTC 和基于序列到序列(S2S)★ 130
Multi-Model-RVC-InferenceMulti-Model-RVC-Inference 是一个基于 Python 的语音转换推理工具,专注于 RVC(Retrieval-based Voice C★ 117
seq2seq-vcseq2seq-vc 是一个基于序列到序列(seq2seq)模型的语音转换工具包,旨在将一个人的声音转换为另一个人的声音,同时保留语言内容和韵律信息。它解决了传★ 113
VITSVITS 是一个基于 PyTorch 的文本转语音(TTS)与语音转换(VC)工具,支持将文本合成为自然语音,并能将一个人的声音特征迁移到另一个人上。它解决了传★ 93
ChatGPT-voice-controlChatGPT-voice-control 是一个为 ChatGPT 网页版设计的浏览器扩展,让用户可以通过语音与 ChatGPT 对话,并听到自然语音的回复。★ 92
Advanced-RVC-InferenceAdvanced-RVC-Inference 是一个面向 RVC(Retrieval-based Voice Conversion)模型的推理加速与部署工具,旨★ 87
awesome-TTS-Colab这是一个精选的TTS(文本转语音)和语音克隆模型资源列表,专门针对Google Colab环境优化。它汇集了多种开源语音合成项目,并提供了在Colab上直接运行★ 68
korean-voice-acting-engine这是一个本地优先的韩语配音引擎,专为Codex辅助训练、语音转换和音频审查设计。它解决了韩语语音合成与转换中依赖云端服务、数据隐私和定制化不足的问题。核心能力包★ 68
Voice-Privacy-Challenge-2020Voice-Privacy-Challenge-2020 是语音隐私挑战赛的官方基线方案,旨在解决语音数据中的说话人身份泄露问题。它通过说话人匿名化技术,在保留★ 63
GenVCGenVC 是一个基于自监督生成式语言模型的语音转换(Voice Conversion)开源项目,旨在将一个人的声音转换为另一个人的声音,同时保留语言内容和情感★ 60
learnable-speechlearnable-speech 是一个基于可学习音频编码器的文本转语音(TTS)项目,无需与文本参考对齐即可实现语音合成。它解决了传统 TTS 系统依赖音素对★ 56
jsut-labjsut-lab 是一个为日语语音合成数据集 JSUT v1.1 提供 HTS 风格全上下文标签(full-context labels)的开源项目。它解决了语★ 51