voice-cloning

本站收录 122 个带「voice-cloning」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

GPT-SoVITS仅需 1 分钟语音数据即可训练出高质量 TTS 模型的少样本声音克隆方案。集成语音识别、文本转语音与声音转换能力,训练与推理全流程自动化,让个人也能轻松打造专属★ 62,247Real-Time-Voice-CloningReal-Time-Voice-Cloning 是一个基于深度学习的实时语音克隆工具,能在5秒内克隆任意说话人的声音,并生成任意文本的语音。它解决了传统TTS需★ 60,156VoiceStudioVoiceStudio 是一个开源的 AI 语音工作站,旨在成为 ElevenLabs 的替代方案。它集成了语音克隆、配音、听写、转录、有声书创作和语音工作流编★ 47,464TTS面向文本转语音的深度学习工具包,历经研究与生产环境双重考验。支持多语言、多语音模型,提供丰富的预训练模型与训练接口,既能快速搭建 TTS 服务,也能满足深入探索★ 46,083VoxCPMVoxCPM2 是一款无分词器的多语言语音生成模型,支持多语种语音合成、创意音色设计与高保真声音克隆。无需传统分词器即可直接生成语音,带来更自然、更真实的合成效★ 38,137CosyVoice阿里通义实验室开源的多语言大规模语音生成模型,提供推理、训练与部署全栈能力。支持零样本语音克隆与跨语种语音合成,音色自然流畅,是构建语音助手、智能配音与内容创作★ 23,810ebook2audiobookebook2audiobook 是一个将电子书自动转换为有声书的开源工具,支持 EPUB、PDF 等格式,内置 1158 多种语言和声音克隆功能。它解决了传统有★ 20,249VideoLingoVideoLingo 是一个基于 Python 的全自动视频字幕处理工具,旨在实现从字幕切割、翻译、对齐到配音的一站式流程,达到 Netflix 级别的字幕质量★ 18,541voice-provoice-pro 是一个面向创作者和开发者的 Gradio WebUI 工具,集成了多种前沿的语音技术。它解决了音频内容生产中语音合成、克隆、分离和翻译的碎片★ 12,962PaddleSpeechPaddleSpeech 是百度开源的端到端语音工具包,基于飞桨深度学习框架,提供从语音识别、语音合成到说话人验证、语音翻译、关键词唤醒等全链路能力。它解决了语★ 12,689YuEYuE 是开源的全曲目音乐生成基础模型,功能类似 Suno.ai 但完全开放。支持生成带人声的完整歌曲,涵盖歌词、旋律与编曲,为音乐创作者提供可本地部署、可自由★ 10,578YouDub-webuiYouDub-webui 是一个开源的 AI 视频本地化工具,旨在将 YouTube 或 Bilibili 视频自动翻译并配音成中文。它解决了视频内容跨语言传播★ 5,553MOSS-TTS-NanoMOSS-TTS-Nano 是 MOSI.AI 与 OpenMOSS 团队开源的多语言轻量级语音合成模型,参数量仅 0.1B,专为实时语音生成设计。它解决了传统★ 4,428MOSS-TTSMOSS-TTS 是由 MOSI.AI 和 OpenMOSS 团队开发的开源语音与声音生成模型家族,专注于高保真、高表现力及复杂真实场景的语音合成。它解决了传统★ 4,147ApplioApplio 是一个专注于易用性和性能的语音转换工具,基于 PyTorch 实现,支持实时语音到语音转换(VC)、语音克隆和文本到语音(TTS)。它解决了传统语★ 3,770audio.cppaudio.cpp 是一个基于 ggml 的纯 C++ 音频模型推理引擎,旨在为音频 AI 应用提供一体化、高性能的本地推理解决方案。它解决了传统音频 AI 工★ 3,180MARS5-TTSMARS5-TTS 是 CAMB.AI 开源的语音合成模型,专注于高表现力的文本转语音和声音克隆。它解决的核心问题是传统 TTS 合成语音平淡、缺乏韵律和情感的★ 2,822Genie-TTSGenie-TTS 是一个专注于 GPT-SoVITS 模型的 ONNX 推理引擎与模型转换工具。它解决了 GPT-SoVITS 模型在部署和推理时依赖复杂 P★ 1,785mlx-servemlx-serve 是一个专为 Apple Silicon 设计的原生 LLM 推理服务器,使用 Zig 语言编写,无需 Python 环境。它兼容 OpenA★ 1,665MiniMax-MCPMiniMax-MCP 是 MiniMax 官方推出的 Model Context Protocol (MCP) 服务器,旨在将 MiniMax 的多模态生成能★ 1,584VibeVoice-ComfyUIVibeVoice-ComfyUI 是一个将微软 VibeVoice 文本转语音模型集成到 ComfyUI 的自定义节点,让用户能在 ComfyUI 的可视化工★ 1,565Chatterbox-TTS-ServerChatterbox-TTS-Server 是一个自托管的文本转语音(TTS)服务,基于强大的 Chatterbox 模型。它解决了用户需要灵活、可扩展的语音合★ 1,460Voice-Cloning-AppVoice-Cloning-App 是一个基于 Python 和 PyTorch 的开源语音克隆工具,旨在让用户通过简单的操作合成逼真的人声。它解决了传统语音合★ 1,437open-speech-corpora这是一个收录可公开获取的语音语料库的清单项目,旨在为语音技术研究与开发提供资源导航。它系统整理了用于自动语音识别(ASR)、语音合成(TTS)、语音情感识别、语★ 1,404MOSS-TTSDMOSS-TTSD 是一个面向表达性多说话人合成的口语对话生成模型。它解决了传统语音合成在长上下文建模、说话人灵活控制和多语言支持方面的不足,能够从短音频参考中★ 1,400Irodori-TTSIrodori-TTS 是一个基于 Flow Matching 的文本转语音(TTS)模型,特色在于通过表情符号(emoji)驱动风格控制。它解决了传统 TTS★ 1,363TwocastTwocast 是一个开源的 AI 播客生成器,专注于生成双语音频节目,支持多语言和多音色,被视为 NotebookLM 的替代方案。它主要解决用户快速将文本内★ 1,291audio-webuiaudio-webui 是一个面向音频相关神经网络的统一 Web 界面,旨在解决音频 AI 工具分散、使用门槛高的问题。它集成了多种主流音频生成与处理模型,如 ★ 1,243TTS-Audio-SuiteTTS-Audio-Suite 是一个 ComfyUI 自定义节点集成包,旨在为本地多引擎、多语言的文本转语音(TTS)和语音转换(VC)提供一站式解决方案。它★ 1,216alexandria-audiobookAlexandria 是一个基于 AI 的多角色有声书生成器,解决传统 TTS 只能单一音色、缺乏情感和角色区分的问题。它利用 LLM 对书籍文本进行脚本标注,★ 1,041Step-Audio-EditXStep-Audio-EditX 是一个基于 3B 参数大语言模型和强化学习的音频编辑模型,专注于情感、说话风格和副语言特征的精细编辑,同时具备强大的零样本语音★ 980Multilingual_Text_to_Speech这是一个基于 Tacotron 2 的多语言文本转语音(TTS)实现,专注于支持多语言实验,包括参数共享、语码切换和声音克隆。项目解决了单一语言 TTS 模型无★ 844CloneTTSCloneTTS 是一个运行在 Android 本地的轻量级文字转语音(TTS)引擎,主打离线运行和系统级集成。它解决了传统云端 TTS 依赖网络、延迟高、隐私★ 826vuiVui 是一个实时语音助手框架,基于 WebRTC 流式传输,集成了 faster-whisper 语音识别、本地 LLM(如 Qwen)和 Vui Nano ★ 769MimikaStudioMimikaStudio 是一款面向 macOS(Apple Silicon)的本地优先应用,专注于音频书转换与管理,并集成了 Agentic MCP(模型上下★ 741bark-voice-cloning-HuBERT-quantizer这是一个用于声音克隆的开源项目,基于Bark模型和HuBERT量化器实现。它解决的核心问题是:如何用少量样本(甚至几秒钟的语音)克隆出特定音色,并用于文本到语音★ 710chatterbox-tts-apiChatterbox TTS API 是一个本地部署的、兼容 OpenAI 接口的文本转语音服务,基于 Chatterbox 模型实现声音克隆。它解决了在本地或★ 685lora-svclora-svc 是一个基于 Whisper 和 LoRA 技术的歌声转换与克隆开源项目。它解决的核心问题是:如何用少量目标歌手的音频数据,快速克隆其音色并实现★ 646PandratorPandrator 是一款免费开源的本地化音频生成工具,主要将 PDF 和 EPUB 电子书转换为有声书,也能将字幕或视频进行配音(含翻译),并支持更多音频处理★ 629ParakeetParakeet 是百度 PaddlePaddle 生态下的并行语音合成工具包,旨在提供从文本到语音的完整训练与推理流程。它集成了多种主流 TTS 模型,包括自★ 628ComfyUI-VibeVoiceComfyUI-VibeVoice 是一个为 ComfyUI 设计的自定义节点,用于集成 VibeVoice 文本转语音(TTS)引擎。它解决了在 ComfyU★ 598Chatterbox-TTS-ExtendedChatterbox-TTS-Extended 是 Chatterbox 文本转语音项目的增强版,主要解决原始版本对输入文本长度和格式的限制问题。它允许用户直接★ 578qwen3-tts-apple-silicon这是一个在苹果自研芯片 Mac 上本地运行 Qwen3-TTS 文本转语音模型的工具,支持 M1/M2/M3/M4 全系列。它利用 MLX 框架实现 100% ★ 572CycleGAN-VC2CycleGAN-VC2 是一个基于 CycleGAN 的语音转换(Voice Conversion)开源项目,旨在实现无需平行语料的音色转换。它解决了传统语音★ 572FlashLabs-ChromaFlashLabs-Chroma 是全球首个开源的实时端到端语音对话模型,支持个性化声音克隆。它解决了传统语音对话系统延迟高、音色不自然、无法个性化定制的问题。★ 550VODERVODER(Voice Operation and Design Engine with Reproduction)是一个基于Python的语音操作与设计引擎,★ 520ai-avatar-system开箱即用的 AI 数字人平台,上传一张照片、克隆一段声音,即可通过唇形同步视频与任意面孔实时对话。完全开源、支持自托管,基于 Claude、Whisper、Ch★ 511ComfyUI-VoxCPMComfyUI-VoxCPM 是一个为 ComfyUI 设计的音频生成节点,专注于高表现力的语音合成和零样本声音克隆。它解决了在 ComfyUI 工作流中集成先★ 511awesome-ai-voiceawesome-ai-voice 是一个精选开源 AI 语音与音乐生成资源的列表,收录了文本转语音(TTS)、声音克隆、语音识别(ASR)以及音乐生成等领域的模★ 500talk-to-fengge这是一个基于实时语音技术的声音与性格克隆项目,旨在让用户与任何人的数字分身进行自然对话。它解决了传统语音助手缺乏个性化和真实感的问题,通过克隆目标人物的音色和说★ 468