text-to-speech

本站收录 637 个带「text-to-speech」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

MoneyPrinterTurbo利用 AI 大模型与自动化工作流,输入主题或关键词即可一键生成高清短视频,从文案、配音到剪辑全自动完成,是内容创作者的高效生产力工具。★ 126,990unsloth本地运行与训练文本、扩散模型的 UI 工具,支持 Kimi、Gemma、Qwen3.6、DeepSeek-V4、FLUX 等最新模型,让个人开发者也能轻松微调与★ 77,026GPT-SoVITS仅需 1 分钟语音数据即可训练出高质量 TTS 模型的少样本声音克隆方案。集成语音识别、文本转语音与声音转换能力,训练与推理全流程自动化,让个人也能轻松打造专属★ 62,247OpenMontage全球首个开源的智能体视频制作系统,提供 12 条生产流水线、100 余种工具以及 700 多个智能体技能与制作知识文件。可将 AI 编程助手转化为完整的视频生产★ 61,862VoiceStudioVoiceStudio 是一个开源的 AI 语音工作站,旨在成为 ElevenLabs 的替代方案。它集成了语音克隆、配音、听写、转录、有声书创作和语音工作流编★ 47,464TTS面向文本转语音的深度学习工具包,历经研究与生产环境双重考验。支持多语言、多语音模型,提供丰富的预训练模型与训练接口,既能快速搭建 TTS 服务,也能满足深入探索★ 46,083ChatTTS专为日常对话场景设计的生成式语音模型,能够生成自然流畅、富有表现力的对话语音。支持细粒度韵律与情感控制,中文合成效果出色,广泛应用于对话系统、有声内容创作与 A★ 39,879VoxCPMVoxCPM2 是一款无分词器的多语言语音生成模型,支持多语种语音合成、创意音色设计与高保真声音克隆。无需传统分词器即可直接生成语音,带来更自然、更真实的合成效★ 38,137OpenVoice由 MIT 与 MyShell 联合打造的开源音频基础模型,支持即时声音克隆。仅需一段参考音频即可克隆任意音色,并支持多语言、多情感输出与细粒度音色控制,为各类★ 37,728MockingBird只需 5 秒即可克隆一个声音,实现任意文本的实时语音合成。项目基于 PyTorch,提供训练与推理全流程支持,声音相似度高、合成速度快,非常适合语音克隆研究与实★ 36,902index-ttsindex-tts 是一个面向工业级应用的零样本文本转语音(TTS)系统,核心能力是仅凭几秒参考音频即可克隆说话人音色,并用于跨语言语音合成。它解决了传统语音合★ 24,226CosyVoice阿里通义实验室开源的多语言大规模语音生成模型,提供推理、训练与部署全栈能力。支持零样本语音克隆与跨语种语音合成,音色自然流畅,是构建语音助手、智能配音与内容创作★ 23,810dia一款能够一次性生成超逼真对话的 TTS 模型,无需多次迭代即可输出自然流畅、情感丰富的多角色对话语音。非常适合有声剧、播客、游戏配音与对话系统等需要高质量多角色★ 19,396pyvideotranspyvideotrans 是一个开源的视频翻译与配音工具,能够将视频中的语音识别为文字,翻译成目标语言,并自动生成配音和字幕,最终嵌入视频中。它解决了视频内容跨★ 19,179leonLeon 是开源的 AI 个人助理,可部署在你自己的设备上,数据完全自主可控,支持语音交互与技能扩展,帮你处理日常任务,打造真正属于你的私人智能助手。★ 17,549sherpa-onnxsherpa-onnx 是一个基于下一代 Kaldi 和 ONNX Runtime 的语音处理工具包,专注于离线场景下的语音识别(ASR)、文本转语音(TTS)★ 15,039supertonicsupertonic 是一个极速的端侧多语言文本转语音(TTS)引擎,基于 ONNX Runtime 原生运行,支持 iOS、Flutter、Node.js、P★ 13,789supertonicsupertonic 是一个超快速、完全离线的多语言文本转语音(TTS)引擎,基于 ONNX Runtime 原生运行,无需云端依赖。它解决了传统 TTS 服务★ 13,789voice-provoice-pro 是一个面向创作者和开发者的 Gradio WebUI 工具,集成了多种前沿的语音技术。它解决了音频内容生产中语音合成、克隆、分离和翻译的碎片★ 12,962edge-ttsedge-tts 是一个 Python 库,让你无需安装 Microsoft Edge、Windows 或申请 API key,就能直接调用微软 Edge 浏览★ 12,123piper快速、本地的神经网络文本转语音系统,无需联网即可在低算力设备上流畅运行,支持多语言与多音色。模型体积小、延迟低,非常适合嵌入式设备、离线语音助手与隐私敏感场景的★ 11,293AmphionAmphion 是一个面向音频、音乐和语音生成的开源工具包,旨在支持可复现研究,并帮助初级研究者和工程师快速入门。它集成了多种主流模型与算法,涵盖文本到语音(T★ 10,305TTSMozilla TTS 是一个基于深度学习的文本转语音(TTS)引擎,旨在提供高质量、自然且灵活的语音合成能力。它解决了传统 TTS 系统音质生硬、定制困难的问★ 10,172espnet端到端语音处理工具包,覆盖语音识别、语音合成、语音翻译、说话人识别等多项任务。提供统一训练框架、丰富预训练模型与评测流程,是学术界与工业界语音技术研究的常用基础★ 9,974EmotiVoice网易有道开源的多音色、提示词可控 TTS 引擎,通过文本提示即可控制合成语音的情感与风格。支持多种情绪表达,中文合成效果出色,适合有声内容创作、短视频配音与情感★ 8,534mlx-audio基于 Apple MLX 框架构建的语音库,集文本转语音、语音转文本与语音转语音于一体,可在 Apple Silicon 设备上高效运行。充分利用苹果芯片算力,★ 7,962VALL-E-X微软 VALL-E X 零样本 TTS 模型的开源实现,仅需约 3 秒参考音频即可克隆目标说话人音色,并支持跨语种语音合成。训练与推理代码完整,是语音克隆与多语★ 7,925vitsVITS 采用条件变分自编码器与对抗训练实现端到端文本转语音。在保持高自然度的同时大幅简化合成流程,无需额外对齐模块即可直接生成高质量语音,是 TTS 领域的经★ 7,894MeloTTSMyShell.ai 开源的高质量多语言 TTS 库,支持英语、西班牙语、法语、中文、日语、韩语六种语言。合成速度快、音质自然,支持本地部署与批量推理,适合多语★ 7,650ODSODS 是一个开源的本地 AI 服务器解决方案,旨在将个人电脑(PC、Mac 或 Linux)转变为功能全面的 AI 中心。它解决了用户对数据隐私、离线可用性和★ 6,900espeak-ngeSpeak NG 是一个开源的语音合成器(TTS),基于原 eSpeak 项目扩展而来,支持超过 100 种语言和口音。它采用共振峰合成技术,体积小、速度快,★ 6,896argmax-oss-swift专为 Apple Silicon 打造的端侧语音 AI 框架,支持在设备本地运行语音识别与合成等模型,无需联网与云端依赖。基于 Swift 开发,性能高效、隐私★ 6,385StyleTTS2StyleTTS 2 通过风格扩散与对抗训练,结合大型语音语言模型,实现了接近人类水平的文本转语音。合成语音的自然度与韵律表现力出众,即使无参考语音也能生成高质★ 6,361Awesome-Prompt-Engineering这是一个精选的提示工程(Prompt Engineering)资源列表,专注于GPT、ChatGPT、PaLM等生成式预训练模型。项目整理了从基础概念到高级技巧★ 6,347silero-modelsSilero Models 是一个提供预训练语音模型的集合,专注于让文本转语音(TTS)和语音识别(STT)变得极其简单。它解决了开发者在使用语音技术时面临的模★ 6,123abogenabogen 是一个将电子书(EPUB、PDF 和纯文本)自动转换为带同步字幕的有声书的开源工具。它解决了传统有声书制作成本高、周期长的问题,让普通用户也能快速★ 6,066dograhdograh 是一个开源的语音 AI 平台,旨在作为 Vapi 和 Retell 的自托管替代方案。它解决了企业在部署语音代理时对数据隐私和成本控制的担忧,支持★ 5,774YouDub-webuiYouDub-webui 是一个开源的 AI 视频本地化工具,旨在将 YouTube 或 Bilibili 视频自动翻译并配音成中文。它解决了视频内容跨语言传播★ 5,553Kokoro-FastAPIKokoro-FastAPI 是一个将 Kokoro-82M 文本转语音模型封装成 Dockerized FastAPI 服务的开源项目,旨在为开发者提供跨平台★ 5,496DiffSingerDiffSinger 是一个基于浅层扩散机制的开源歌声合成(SVS)与语音合成(TTS)项目,源自 AAAI 2022 论文,官方代码实现。它解决的核心问题是传★ 4,864fastrtcfastrtc 是一个专注于实时通信的 Python 库,旨在简化 WebRTC 音频/视频流的接入,让开发者能快速构建支持语音对话、实时转录和文本转语音的 A★ 4,629MOSS-TTS-NanoMOSS-TTS-Nano 是 MOSI.AI 与 OpenMOSS 团队开源的多语言轻量级语音合成模型,参数量仅 0.1B,专为实时语音生成设计。它解决了传统★ 4,428WhisperLiveWhisperLive 是一个基于 OpenAI Whisper 的近乎实时语音转写工具,旨在解决传统 Whisper 离线处理延迟高、无法用于直播或对话场景的★ 4,301metavoice-srcMetaVoice 是一个基于深度学习的情感语音合成基础模型,专注于生成高度自然、富有表现力的语音。它解决了传统 TTS 系统声音机械、缺乏情感和个性化的问题,★ 4,206MOSS-TTSMOSS-TTS 是由 MOSI.AI 和 OpenMOSS 团队开发的开源语音与声音生成模型家族,专注于高保真、高表现力及复杂真实场景的语音合成。它解决了传统★ 4,147RealtimeTTSRealtimeTTS 是一个专注于实时文本转语音(TTS)的 Python 库,旨在解决传统 TTS 引擎延迟高、难以集成到实时应用中的问题。它提供了统一的 ★ 4,039TensorFlowTTSTensorFlowTTS 是一个基于 TensorFlow 2 的实时语音合成工具包,旨在提供最先进的语音合成能力。它解决了从文本到语音(TTS)的完整流程问★ 3,995ApplioApplio 是一个专注于易用性和性能的语音转换工具,基于 PyTorch 实现,支持实时语音到语音转换(VC)、语音克隆和文本到语音(TTS)。它解决了传统语★ 3,770TTS-WebUITTS-WebUI 是一个集成了多种主流语音与音频生成模型的一站式 Web 界面,基于 Gradio 和 React 构建。它解决了用户在不同 TTS、语音克隆★ 3,276audio.cppaudio.cpp 是一个基于 ggml 的纯 C++ 音频模型推理引擎,旨在为音频 AI 应用提供一体化、高性能的本地推理解决方案。它解决了传统音频 AI 工★ 3,180