voice-clone
本站收录 23 个带「voice-clone」标签的 AI 开源项目
GPT-SoVITS仅需 1 分钟语音数据即可训练出高质量 TTS 模型的少样本声音克隆方案。集成语音识别、文本转语音与声音转换能力,训练与推理全流程自动化,让个人也能轻松打造专属★ 62,247
voiceboxvoicebox 是一个开源的 AI 语音工作室,旨在提供一站式的声音克隆、语音转写和语音合成能力。它解决了个人开发者和小团队难以高效构建高质量语音 AI 应用★ 55,989
OpenVoice由 MIT 与 MyShell 联合打造的开源音频基础模型,支持即时声音克隆。仅需一段参考音频即可克隆任意音色,并支持多语言、多情感输出与细粒度音色控制,为各类★ 37,728
index-ttsindex-tts 是一个面向工业级应用的零样本文本转语音(TTS)系统,核心能力是仅凭几秒参考音频即可克隆说话人音色,并用于跨语言语音合成。它解决了传统语音合★ 24,226
VALL-E-X微软 VALL-E X 零样本 TTS 模型的开源实现,仅需约 3 秒参考音频即可克隆目标说话人音色,并支持跨语种语音合成。训练与推理代码完整,是语音克隆与多语★ 7,925
MOSS-TTS-NanoMOSS-TTS-Nano 是 MOSI.AI 与 OpenMOSS 团队开源的多语言轻量级语音合成模型,参数量仅 0.1B,专为实时语音生成设计。它解决了传统★ 4,428
metavoice-srcMetaVoice 是一个基于深度学习的情感语音合成基础模型,专注于生成高度自然、富有表现力的语音。它解决了传统 TTS 系统声音机械、缺乏情感和个性化的问题,★ 4,206
ApplioApplio 是一个专注于易用性和性能的语音转换工具,基于 PyTorch 实现,支持实时语音到语音转换(VC)、语音克隆和文本到语音(TTS)。它解决了传统语★ 3,770
Genie-TTSGenie-TTS 是一个专注于 GPT-SoVITS 模型的 ONNX 推理引擎与模型转换工具。它解决了 GPT-SoVITS 模型在部署和推理时依赖复杂 P★ 1,785
wunjo.wladradchenko.ruWunjo CE 是一个本地运行的开源多媒体创作工具,集成了人脸替换、唇形同步、视频生成、物体/文字/背景移除、风格重绘、音频分离和声音克隆等多项 AI 能力。★ 1,171
FireRedTTSFireRedTTS 是一个基于大语言模型(LLM)的开源语音合成(TTS)系统,旨在提供高质量、自然且可控的文本到语音生成能力。它结合了语言模型、扩散模型、流★ 926
Confucius4-TTSConfucius4-TTS 是一个多语言与跨语言零样本语音合成引擎,基于 PyTorch 构建。它解决的核心问题是:在无需针对特定说话人进行微调的情况下,用极★ 824
MimikaStudioMimikaStudio 是一款面向 macOS(Apple Silicon)的本地优先应用,专注于音频书转换与管理,并集成了 Agentic MCP(模型上下★ 741
chatterbox-tts-apiChatterbox TTS API 是一个本地部署的、兼容 OpenAI 接口的文本转语音服务,基于 Chatterbox 模型实现声音克隆。它解决了在本地或★ 685
PandratorPandrator 是一款免费开源的本地化音频生成工具,主要将 PDF 和 EPUB 电子书转换为有声书,也能将字幕或视频进行配音(含翻译),并支持更多音频处理★ 629
ChatTTS-OpenVoiceChatTTS-OpenVoice 是一个将 ChatTTS 与 OpenVoice 融合的开源语音克隆工具。它解决的核心问题是:ChatTTS 本身不支持个性★ 466
megatts2Megatts2 是 Megatts2 文本转语音模型的非官方实现,旨在复现并开源该模型的推理能力。它解决了官方实现未公开或难以获取的问题,为开发者提供了可本地★ 285
kkclawkkclaw 是一个基于 Electron 的桌面宠物 AI 助手,以一只可爱的龙虾形象出现在屏幕上。它集成了 OpenClaw AI 作为大脑,支持 Edge★ 174
GSV-TTS-LiteGSV-TTS-Lite 是一个专为 GPT-SoVITS 文本转语音模型设计的高性能推理引擎,专注于少样本语音克隆。它解决了 GPT-SoVITS 原始推理速★ 160
dsh-voice-ai-girlfriend这是一个面向 DeepSeek Harness(DSH)的语音 AI 女友插件,用 TypeScript 编写。它把语音识别、语音合成和数字人动画串成一条完整的★ 129
vibevoice-studioVibeVoice Studio 是一个基于 Python 和 FastAPI 构建的语音克隆与文本转语音(TTS)应用。它允许用户录制或上传音频来训练个性化语★ 64
RVCBenchRVCBench 是一个针对语音克隆鲁棒性、说话人隐私和音频保护的基准测试框架,覆盖 26 个 TTS 和 VC 模型。它解决当前语音合成技术被滥用(如深度伪造★ 56
learnable-speechlearnable-speech 是一个基于可学习音频编码器的文本转语音(TTS)项目,无需与文本参考对齐即可实现语音合成。它解决了传统 TTS 系统依赖音素对★ 56