tts
本站收录 747 个带「tts」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
unsloth本地运行与训练文本、扩散模型的 UI 工具,支持 Kimi、Gemma、Qwen3.6、DeepSeek-V4、FLUX 等最新模型,让个人开发者也能轻松微调与★ 77,026
GPT-SoVITS仅需 1 分钟语音数据即可训练出高质量 TTS 模型的少样本声音克隆方案。集成语音识别、文本转语音与声音转换能力,训练与推理全流程自动化,让个人也能轻松打造专属★ 62,247
Real-Time-Voice-CloningReal-Time-Voice-Cloning 是一个基于深度学习的实时语音克隆工具,能在5秒内克隆任意说话人的声音,并生成任意文本的语音。它解决了传统TTS需★ 60,156
LocalAI开源的本地 AI 推理引擎,无需 GPU 即可在任何硬件上运行 LLM、视觉、语音、图像与视频等多种模型,兼容 OpenAI API 接口,是构建私有化 AI ★ 49,323
VoiceStudioVoiceStudio 是一个开源的 AI 语音工作站,旨在成为 ElevenLabs 的替代方案。它集成了语音克隆、配音、听写、转录、有声书创作和语音工作流编★ 47,464
TTS面向文本转语音的深度学习工具包,历经研究与生产环境双重考验。支持多语言、多语音模型,提供丰富的预训练模型与训练接口,既能快速搭建 TTS 服务,也能满足深入探索★ 46,083
ChatTTS专为日常对话场景设计的生成式语音模型,能够生成自然流畅、富有表现力的对话语音。支持细粒度韵律与情感控制,中文合成效果出色,广泛应用于对话系统、有声内容创作与 A★ 39,879
VoxCPMVoxCPM2 是一款无分词器的多语言语音生成模型,支持多语种语音合成、创意音色设计与高保真声音克隆。无需传统分词器即可直接生成语音,带来更自然、更真实的合成效★ 38,137
OpenVoice由 MIT 与 MyShell 联合打造的开源音频基础模型,支持即时声音克隆。仅需一段参考音频即可克隆任意音色,并支持多语言、多情感输出与细粒度音色控制,为各类★ 37,728
MockingBird只需 5 秒即可克隆一个声音,实现任意文本的实时语音合成。项目基于 PyTorch,提供训练与推理全流程支持,声音相似度高、合成速度快,非常适合语音克隆研究与实★ 36,902
fish-speechfish-speech 是一个开源的文本转语音(TTS)模型,基于 VQGAN 和 Llama 架构,实现了目前最先进的语音合成效果。它解决了传统 TTS 系统★ 32,888
mastraMastra 是一个基于 TypeScript 的现代 AI 应用开发框架,旨在帮助开发者快速构建和部署 AI 驱动的应用与智能体。它解决了 AI 开发中常见的★ 28,426
readestReadest 是一款现代、功能丰富的跨平台电子书阅读器,专为深度阅读爱好者打造。它解决了传统阅读器在平台间切换不便、格式支持不全、阅读体验割裂的问题,提供从 ★ 24,712
index-ttsindex-tts 是一个面向工业级应用的零样本文本转语音(TTS)系统,核心能力是仅凭几秒参考音频即可克隆说话人音色,并用于跨语言语音合成。它解决了传统语音合★ 24,226
CosyVoice阿里通义实验室开源的多语言大规模语音生成模型,提供推理、训练与部署全栈能力。支持零样本语音克隆与跨语种语音合成,音色自然流畅,是构建语音助手、智能配音与内容创作★ 23,810
ebook2audiobookebook2audiobook 是一个将电子书自动转换为有声书的开源工具,支持 EPUB、PDF 等格式,内置 1158 多种语言和声音克隆功能。它解决了传统有★ 20,249
pot-desktoppot-desktop 是一款基于 Tauri 构建的跨平台划词翻译与 OCR 文字识别工具,支持 Windows、macOS 和 Linux。它解决了用户在阅★ 19,409
pyvideotranspyvideotrans 是一个开源的视频翻译与配音工具,能够将视频中的语音识别为文字,翻译成目标语言,并自动生成配音和字幕,最终嵌入视频中。它解决了视频内容跨★ 19,179
SpeechSpeech 是一个面向研究人员和开发者的可扩展生成式 AI 框架,专注于大型语言模型、多模态和语音 AI(自动语音识别与文本转语音)。它提供统一的模块化架构,★ 18,524
supertonicsupertonic 是一个极速的端侧多语言文本转语音(TTS)引擎,基于 ONNX Runtime 原生运行,支持 iOS、Flutter、Node.js、P★ 13,789
supertonicsupertonic 是一个超快速、完全离线的多语言文本转语音(TTS)引擎,基于 ONNX Runtime 原生运行,无需云端依赖。它解决了传统 TTS 服务★ 13,789
voice-provoice-pro 是一个面向创作者和开发者的 Gradio WebUI 工具,集成了多种前沿的语音技术。它解决了音频内容生产中语音合成、克隆、分离和翻译的碎片★ 12,962
PaddleSpeechPaddleSpeech 是百度开源的端到端语音工具包,基于飞桨深度学习框架,提供从语音识别、语音合成到说话人验证、语音翻译、关键词唤醒等全链路能力。它解决了语★ 12,689
KrillinAIKrillinAI 是一个基于大语言模型的 AI 视频翻译与配音工具,面向个人用户和 AI Agent 提供完整的视频本地化流水线,涵盖下载、转录、翻译、TTS★ 12,511
edge-ttsedge-tts 是一个 Python 库,让你无需安装 Microsoft Edge、Windows 或申请 API key,就能直接调用微软 Edge 浏览★ 12,123
piper快速、本地的神经网络文本转语音系统,无需联网即可在低算力设备上流畅运行,支持多语言与多音色。模型体积小、延迟低,非常适合嵌入式设备、离线语音助手与隐私敏感场景的★ 11,293
moonshineMoonshine 是一个专为语音代理和语音界面设计的超低延迟语音工具包,集成了语音转文字(STT)、意图识别和文字转语音(TTS)三大核心能力。它解决了传统语★ 11,157
voltagentvoltagent 是一个基于 TypeScript 的开源 AI Agent 工程平台,旨在帮助开发者构建、部署和管理复杂的 AI 智能体。它解决的核心问题是★ 10,703
TTSMozilla TTS 是一个基于深度学习的文本转语音(TTS)引擎,旨在提供高质量、自然且灵活的语音合成能力。它解决了传统 TTS 系统音质生硬、定制困难的问★ 10,172
clone-voiceclone-voice 是一个带 Web 界面的声音克隆工具,使用 Python 编写。它允许用户用自己的音色或任意声音来录制音频,核心能力包括声音克隆、语音合★ 8,967
Bert-VITS2Bert-VITS2 是一个基于 VITS2 架构、引入多语言 BERT 特征的开源语音合成(TTS)项目。它解决了传统端到端 TTS 模型在多语言、多说话人场★ 8,805
audiblezaudiblez 是一个将电子书转换为有声书的开源工具,主要解决用户希望“听书”而非“看书”的需求。它支持 EPUB 格式的电子书输入,利用 Kokoro 等 ★ 8,680
EmotiVoice网易有道开源的多音色、提示词可控 TTS 引擎,通过文本提示即可控制合成语音的情感与风格。支持多种情绪表达,中文合成效果出色,适合有声内容创作、短视频配音与情感★ 8,534
Vision-AgentsVision-Agents 是 Stream 推出的开源框架,用于快速构建语音与视觉智能体。它解决了开发者需要集成多种模型和视频提供商、并实现低延迟实时交互的痛★ 8,147
VALL-E-X微软 VALL-E X 零样本 TTS 模型的开源实现,仅需约 3 秒参考音频即可克隆目标说话人音色,并支持跨语种语音合成。训练与推理代码完整,是语音克隆与多语★ 7,925
vitsVITS 采用条件变分自编码器与对抗训练实现端到端文本转语音。在保持高自然度的同时大幅简化合成流程,无需额外对齐模块即可直接生成高质量语音,是 TTS 领域的经★ 7,894
ChatTTS-uiChatTTS-ui 是一个基于 Python 的本地网页界面,旨在为 ChatTTS 文本转语音模型提供便捷的操作入口。它解决了 ChatTTS 原生库缺乏可★ 7,660
MeloTTSMyShell.ai 开源的高质量多语言 TTS 库,支持英语、西班牙语、法语、中文、日语、韩语六种语言。合成速度快、音质自然,支持本地部署与批量推理,适合多语★ 7,650
wukong-robotwukong-robot 是一个基于 Python 的中文语音对话机器人/智能音箱开源项目。它解决了从零搭建一个具备语音交互能力的智能音箱的复杂问题,提供了完整★ 7,128
dramaclaw通用 AIGC 视频引擎,以一条流水线打通从剧本到成片的全部环节,支持漫剧、广告、产品视频、乙女游戏等内容形态,帮助创作者低成本、高效率地将创意转化为完整影视作★ 6,583
StyleTTS2StyleTTS 2 通过风格扩散与对抗训练,结合大型语音语言模型,实现了接近人类水平的文本转语音。合成语音的自然度与韵律表现力出众,即使无参考语音也能生成高质★ 6,361
Orpheus-TTSOrpheus-TTS 是一个开源文本转语音(TTS)项目,旨在生成接近真人发音的语音。它基于大型语言模型(LLM)技术,支持实时语音合成,能处理复杂文本并输出★ 6,345
silero-modelsSilero Models 是一个提供预训练语音模型的集合,专注于让文本转语音(TTS)和语音识别(STT)变得极其简单。它解决了开发者在使用语音技术时面临的模★ 6,123
tts-vuetts-vue 是一款基于微软语音合成服务的桌面工具,采用 Electron、Vue 3、Element Plus 和 Vite 构建。它解决了用户需要快速将文★ 6,098
abogenabogen 是一个将电子书(EPUB、PDF 和纯文本)自动转换为带同步字幕的有声书的开源工具。它解决了传统有声书制作成本高、周期长的问题,让普通用户也能快速★ 6,066
Kokoro-FastAPIKokoro-FastAPI 是一个将 Kokoro-82M 文本转语音模型封装成 Dockerized FastAPI 服务的开源项目,旨在为开发者提供跨平台★ 5,496
DiffSingerDiffSinger 是一个基于浅层扩散机制的开源歌声合成(SVS)与语音合成(TTS)项目,源自 AAAI 2022 论文,官方代码实现。它解决的核心问题是传★ 4,864
WhisperSpeechWhisperSpeech 是一个基于 PyTorch 的开源文本转语音(TTS)系统,其核心思路是“反转 Whisper”——利用 OpenAI 的语音识别模★ 4,654
tts-server-androidtts-server-android 是一个基于 Android 的本地 TTS(文本转语音)服务应用,旨在解决系统自带 TTS 引擎音色单一、网络延迟高和配置★ 4,510