voice-synthesis

本站收录 22 个带「voice-synthesis」标签的 AI 开源项目

TTS面向文本转语音的深度学习工具包,历经研究与生产环境双重考验。支持多语言、多语音模型,提供丰富的预训练模型与训练接口,既能快速搭建 TTS 服务,也能满足深入探索★ 46,083dramaclaw通用 AIGC 视频引擎,以一条流水线打通从剧本到成片的全部环节,支持漫剧、广告、产品视频、乙女游戏等内容形态,帮助创作者低成本、高效率地将创意转化为完整影视作★ 6,583abogenabogen 是一个将电子书(EPUB、PDF 和纯文本)自动转换为带同步字幕的有声书的开源工具。它解决了传统有声书制作成本高、周期长的问题,让普通用户也能快速★ 6,066TwocastTwocast 是一个开源的 AI 播客生成器,专注于生成双语音频节目,支持多语言和多音色,被视为 NotebookLM 的替代方案。它主要解决用户快速将文本内★ 1,291Neural-Voice-Cloning-With-Few-Samples这是一个基于论文《Neural Voice Cloning With Few Samples》的开源实现,旨在解决少样本语音克隆问题。它通过少量参考音频(甚至几★ 432VocelloVocello 是一款专为 Apple Silicon 设计的本地、私密语音工作室。它允许用户编写脚本,选择或描述声音,并在设备端生成语音,速度超过实时,即使在★ 368ArtemisArtemis 是一个完全离线的本地 AI 女友后宫系统,旨在解决用户对个性化、可定制且隐私安全的 AI 伴侣需求。它整合了本地大语言模型(LLM)、GPT-S★ 366manim-voiceovermanim-voiceover 是一个专为 Manim 动画引擎设计的语音旁白插件,旨在解决数学动画视频制作中语音与画面同步困难的问题。它通过将文本转语音(TT★ 316saynaSayna 是一个面向 AI Agent 的统一语音层,旨在为现有智能体框架提供无缝的语音交互能力。它解决了 AI Agent 缺乏原生语音输入输出支持的问题,★ 314TensorVoxTensorVox 是一个用 C++ 编写的桌面端神经语音合成应用,专注于将文本实时转换为自然语音。它解决了传统 TTS 工具依赖云端、延迟高、集成复杂的问题,★ 214XTTSv2-Finetuning-for-New-LanguagesXTTSv2-Finetuning-for-New-Languages 是一个针对 Coqui XTTS v2 模型进行多语言微调的开源工具,旨在让开发者能够为★ 205GhostCut-auto_video_translationGhostCut-auto_video_translation 是一个基于 Python 的自动视频翻译与配音工具,主要解决视频硬字幕翻译、去除与重配音的痛点。★ 173Voice-synthesisVoice-synthesis 是一个基于 SV2TTS(说话人验证到多说话人语音合成)框架的实时语音合成实现,包含编码器、合成器和声码器三阶段。它允许用户仅用★ 170tts-arabic-pytorch这是一个基于 PyTorch 的阿拉伯语语音合成(TTS)工具包,实现了 Tacotron2 和 FastPitch 两种主流声学模型,并集成 HiFi-GAN★ 145chatterbox-finetuningChatterbox 微调工具包,专为 Chatterbox TTS 和 TURBO 模型设计,支持 23 种语言,具备智能词汇扩展、离线预处理、自动 VAD ★ 111com.rest.elevenlabs这是一个非官方的 Eleven Labs 语音合成 Unity 客户端,以 UPM 包形式分发,方便 Unity 开发者集成高质量的 AI 语音合成能力。它封装★ 109ElevenLabs-DotNetElevenLabs-DotNet 是一个非官方的 .NET 客户端库,用于调用 ElevenLabs 的 RESTful API,解决 C# 开发者集成高质量★ 98spokestack-androidSpokestack Android 是一个面向 Android 平台的可扩展移动语音框架,旨在帮助开发者快速为应用集成完整的语音交互能力。它涵盖唤醒词检测、自★ 74OtosakuTTS-iOSOtosakuTTS-iOS 是一个基于 Swift 的离线文本转语音(TTS)库,专为 iOS 和 macOS 平台设计。它利用 CoreML 优化的 Fas★ 63zerovoxzerovox 是一个基于深度学习的零样本(zero-shot)实时语音合成(TTS)系统,完全离线运行,免费且开源。它旨在解决传统 TTS 系统需要针对特定说★ 57rtvcrtvc 是一个基于 ElevenLabs API 的实时语音转录与克隆工具,使用 TypeScript 编写。它解决了开发者在应用中集成实时语音交互的需求,提★ 56NeuralTextToAudioNeuralTextToAudio 是一个基于文本提示生成合成音频的开源项目,旨在通过自然语言描述来控制音频生成过程,解决传统音频制作依赖专业设备和手工编辑、门★ 53