speech-synthesis
本站收录 246 个带「speech-synthesis」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
TTS面向文本转语音的深度学习工具包,历经研究与生产环境双重考验。支持多语言、多语音模型,提供丰富的预训练模型与训练接口,既能快速搭建 TTS 服务,也能满足深入探索★ 46,083
VoxCPMVoxCPM2 是一款无分词器的多语言语音生成模型,支持多语种语音合成、创意音色设计与高保真声音克隆。无需传统分词器即可直接生成语音,带来更自然、更真实的合成效★ 38,137
SpeechSpeech 是一个面向研究人员和开发者的可扩展生成式 AI 框架,专注于大型语言模型、多模态和语音 AI(自动语音识别与文本转语音)。它提供统一的模块化架构,★ 18,524
leonLeon 是开源的 AI 个人助理,可部署在你自己的设备上,数据完全自主可控,支持语音交互与技能扩展,帮你处理日常任务,打造真正属于你的私人智能助手。★ 17,549
supertonicsupertonic 是一个极速的端侧多语言文本转语音(TTS)引擎,基于 ONNX Runtime 原生运行,支持 iOS、Flutter、Node.js、P★ 13,789
supertonicsupertonic 是一个超快速、完全离线的多语言文本转语音(TTS)引擎,基于 ONNX Runtime 原生运行,无需云端依赖。它解决了传统 TTS 服务★ 13,789
speech-to-speechspeech-to-speech 是一个构建本地语音代理的开源项目,旨在利用开源模型实现端到端的语音交互。它解决了传统语音助手依赖云端服务、延迟高、隐私风险大等★ 13,350
voice-provoice-pro 是一个面向创作者和开发者的 Gradio WebUI 工具,集成了多种前沿的语音技术。它解决了音频内容生产中语音合成、克隆、分离和翻译的碎片★ 12,962
PaddleSpeechPaddleSpeech 是百度开源的端到端语音工具包,基于飞桨深度学习框架,提供从语音识别、语音合成到说话人验证、语音翻译、关键词唤醒等全链路能力。它解决了语★ 12,689
edge-ttsedge-tts 是一个 Python 库,让你无需安装 Microsoft Edge、Windows 或申请 API key,就能直接调用微软 Edge 浏览★ 12,123
piper快速、本地的神经网络文本转语音系统,无需联网即可在低算力设备上流畅运行,支持多语言与多音色。模型体积小、延迟低,非常适合嵌入式设备、离线语音助手与隐私敏感场景的★ 11,293
AmphionAmphion 是一个面向音频、音乐和语音生成的开源工具包,旨在支持可复现研究,并帮助初级研究者和工程师快速入门。它集成了多种主流模型与算法,涵盖文本到语音(T★ 10,305
espnet端到端语音处理工具包,覆盖语音识别、语音合成、语音翻译、说话人识别等多项任务。提供统一训练框架、丰富预训练模型与评测流程,是学术界与工业界语音技术研究的常用基础★ 9,974
EmotiVoice网易有道开源的多音色、提示词可控 TTS 引擎,通过文本提示即可控制合成语音的情感与风格。支持多种情绪表达,中文合成效果出色,适合有声内容创作、短视频配音与情感★ 8,534
mlx-audio基于 Apple MLX 框架构建的语音库,集文本转语音、语音转文本与语音转语音于一体,可在 Apple Silicon 设备上高效运行。充分利用苹果芯片算力,★ 7,962
vitsVITS 采用条件变分自编码器与对抗训练实现端到端文本转语音。在保持高自然度的同时大幅简化合成流程,无需额外对齐模块即可直接生成高质量语音,是 TTS 领域的经★ 7,894
espeak-ngeSpeak NG 是一个开源的语音合成器(TTS),基于原 eSpeak 项目扩展而来,支持超过 100 种语言和口音。它采用共振峰合成技术,体积小、速度快,★ 6,896
StyleTTS2StyleTTS 2 通过风格扩散与对抗训练,结合大型语音语言模型,实现了接近人类水平的文本转语音。合成语音的自然度与韵律表现力出众,即使无参考语音也能生成高质★ 6,361
silero-modelsSilero Models 是一个提供预训练语音模型的集合,专注于让文本转语音(TTS)和语音识别(STT)变得极其简单。它解决了开发者在使用语音技术时面临的模★ 6,123
abogenabogen 是一个将电子书(EPUB、PDF 和纯文本)自动转换为带同步字幕的有声书的开源工具。它解决了传统有声书制作成本高、周期长的问题,让普通用户也能快速★ 6,066
DiffSingerDiffSinger 是一个基于浅层扩散机制的开源歌声合成(SVS)与语音合成(TTS)项目,源自 AAAI 2022 论文,官方代码实现。它解决的核心问题是传★ 4,864
WhisperSpeechWhisperSpeech 是一个基于 PyTorch 的开源文本转语音(TTS)系统,其核心思路是“反转 Whisper”——利用 OpenAI 的语音识别模★ 4,654
MOSS-TTS-NanoMOSS-TTS-Nano 是 MOSI.AI 与 OpenMOSS 团队开源的多语言轻量级语音合成模型,参数量仅 0.1B,专为实时语音生成设计。它解决了传统★ 4,428
metavoice-srcMetaVoice 是一个基于深度学习的情感语音合成基础模型,专注于生成高度自然、富有表现力的语音。它解决了传统 TTS 系统声音机械、缺乏情感和个性化的问题,★ 4,206
MOSS-TTSMOSS-TTS 是由 MOSI.AI 和 OpenMOSS 团队开发的开源语音与声音生成模型家族,专注于高保真、高表现力及复杂真实场景的语音合成。它解决了传统★ 4,147
RealtimeTTSRealtimeTTS 是一个专注于实时文本转语音(TTS)的 Python 库,旨在解决传统 TTS 引擎延迟高、难以集成到实时应用中的问题。它提供了统一的 ★ 4,039
TensorFlowTTSTensorFlowTTS 是一个基于 TensorFlow 2 的实时语音合成工具包,旨在提供最先进的语音合成能力。它解决了从文本到语音(TTS)的完整流程问★ 3,995
awesome-speech-recognition-speech-synthesis-papers这是一个收录语音识别与语音合成领域经典论文的精选列表,涵盖自动语音识别(ASR)、说话人验证、语音合成、文本转语音(TTS)、语言建模、歌声合成(SVS)和声音★ 3,132
tacotronTacotron 是一个基于 TensorFlow 的非官方实现,复现了 Google 的 Tacotron 语音合成模型,并提供了预训练模型。该项目旨在将文本★ 2,997
lingvoLingvo 是 Google 开源的深度学习框架,专注于序列建模任务,尤其擅长语音识别、机器翻译和语言模型。它基于 TensorFlow 构建,提供了一套模块★ 2,864
MARS5-TTSMARS5-TTS 是 CAMB.AI 开源的语音合成模型,专注于高表现力的文本转语音和声音克隆。它解决的核心问题是传统 TTS 合成语音平淡、缺乏韵律和情感的★ 2,822
VieNeu-TTSVieNeu-TTS 是一个专注于越南语的端侧实时文本转语音(TTS)引擎,支持即时声音克隆,无需云端依赖即可在本地 CPU 上运行,输出 24kHz 高质量音★ 2,712
maryttsMARY TTS 是一个用纯 Java 编写的开源多语言文本转语音合成系统。它解决了开发者需要将文本转换为自然语音但缺乏跨平台、可扩展 TTS 引擎的问题。核心★ 2,581
hifi-ganHiFi-GAN 是一个基于生成对抗网络的高保真语音合成声码器,由韩国首尔大学团队开发。它解决了传统神经声码器(如 WaveNet)推理速度慢、难以实时部署的问★ 2,372
chat-with-gptchat-with-gpt 是一个开源的 ChatGPT 语音对话应用,基于 TypeScript 构建。它解决了用户在使用 ChatGPT 时只能通过文本交互★ 2,348
Tacotron-2Tacotron-2 是 DeepMind 提出的端到端文本转语音(TTS)模型的 TensorFlow 实现。它解决传统语音合成系统需要大量人工特征工程和复杂★ 2,321
IMS-ToucanIMS-Toucan 是一个基于 PyTorch 的可控且快速的文本转语音(TTS)工具包,声称支持超过 7000 种语言。它旨在解决多语言语音合成中音色、情感★ 2,211
WaveRNNWaveRNN 是一个基于 PyTorch 的神经声码器与语音合成(TTS)项目,由 fatchord 开发。它实现了 WaveRNN 模型,能够将频谱特征(如★ 2,192
deepvoice3_pytorchdeepvoice3_pytorch 是百度 Deep Voice 3 文本转语音(TTS)模型的 PyTorch 非官方实现。Deep Voice 3 是一种★ 1,977
RHVoiceRHVoice 是一款免费开源的语音合成器,主要面向俄语及其他多种语言。它解决的是文本转语音(TTS)的需求,尤其擅长俄语,同时支持英语、巴西葡萄牙语、世界语、★ 1,844
dsnotedsnote 是一款面向 Linux 桌面(也支持 Sailfish OS)的离线语音笔记应用,主打在无网络环境下完成语音转文字、文字转语音和机器翻译。它解决的★ 1,675
ParallelWaveGANParallelWaveGAN 是一个基于 PyTorch 的非官方实现,集成了多种主流神经声码器,包括 Parallel WaveGAN、MelGAN、多频带★ 1,646
OpenSeq2SeqOpenSeq2Seq 是 NVIDIA 开源的序列到序列学习工具包,专注于语音识别、文本转语音和自然语言处理任务。它解决了研究人员在搭建和实验 seq2seq★ 1,559
ComfyUI_Custom_Nodes_AlekPetComfyUI_Custom_Nodes_AlekPet 是一套为 ComfyUI 设计的自定义节点扩展包,旨在丰富 ComfyUI 的功能边界。它主要解决 C★ 1,531
Chatterbox-TTS-ServerChatterbox-TTS-Server 是一个自托管的文本转语音(TTS)服务,基于强大的 Chatterbox 模型。它解决了用户需要灵活、可扩展的语音合★ 1,460
open-speech-corpora这是一个收录可公开获取的语音语料库的清单项目,旨在为语音技术研究与开发提供资源导航。它系统整理了用于自动语音识别(ASR)、语音合成(TTS)、语音情感识别、语★ 1,404
MOSS-TTSDMOSS-TTSD 是一个面向表达性多说话人合成的口语对话生成模型。它解决了传统语音合成在长上下文建模、说话人灵活控制和多语言支持方面的不足,能够从短音频参考中★ 1,400
voicefixerVoiceFixer 是一个基于深度学习的通用语音修复工具,旨在恢复受损的语音信号,使其更清晰、更自然。它能够处理多种类型的语音退化,包括背景噪声、混响、削波(★ 1,381
Irodori-TTSIrodori-TTS 是一个基于 Flow Matching 的文本转语音(TTS)模型,特色在于通过表情符号(emoji)驱动风格控制。它解决了传统 TTS★ 1,363
merlinMerlin 是一个基于深度学习的开源语音合成工具包,专注于文本到语音(TTS)和语音转换任务。它解决了传统语音合成系统依赖复杂信号处理、难以扩展的问题,提供了★ 1,321