vits2
开源
一条流水线生成自然语音,又快又像真人
VITS2 是一个基于 PyTorch 的单阶段文本转语音(TTS)模型,旨在提升语音合成的质量和效率。它通过···
汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。
共收录 738 个开源项目
vits2
开源
一条流水线生成自然语音,又快又像真人
VITS2 是一个基于 PyTorch 的单阶段文本转语音(TTS)模型,旨在提升语音合成的质量和效率。它通过···
Bert-VITS2
开源
用BERT增强的VITS2,让语音合成更自然、多语言更流畅
Bert-VITS2 是一个基于 VITS2 架构、引入多语言 BERT 特征的开源语音合成(TTS)项目。它解决了传统···
YouTranslate
开源
一键克隆你的声音,把 YouTube 视频翻译成任何语言
YouTranslate 是一个基于 Python 的开源工具,用于将 YouTube 视频中的语音克隆并翻译成其他语言,···
so-vits-models
开源
一站式收藏AI模型,快速找到声音、图像、视频生成工具
这是一个收集AI模型与应用的资源汇总项目,聚焦于声音、图像、视频和文本生成领域。它整理了so-vit···
obsidian-voice
开源
让 Obsidian 笔记开口说话,通勤路上也能听知识
obsidian-voice 是一个 Obsidian 插件,旨在将笔记内容转换为语音朗读,提供类似有声书的移动端体验···
rvc-tts-webui
开源
上传参考音频,一键将合成语音变成你的声音
rvc-tts-webui 是一个基于 RVC(Retrieval-based Voice Conversion)和 edge-tts 的文本转语音 Gra···
sub-to-audio
开源
把字幕文件一键变成同步语音,自动配音不求人。
sub-to-audio 是一个将字幕文件转换为音频的工具,它利用 Coqui-ai TTS 引擎,根据字幕文件中的时间···
bark.cpp
开源
用C++跑Bark模型,轻量快速本地生成语音
bark.cpp 是一个将 Suno AI 的 Bark 文本转语音模型用 C/C++ 重新实现的开源项目,基于 ggml 推理引···
tts-edge-java
开源
Java 调用 Edge 免费语音,几行代码实现文本转 MP3
tts-edge-java 是一个基于微软 Edge 浏览器内置语音合成服务的 Java SDK,旨在为 Java 开发者提供简···
Advanced-RVC-Inference
开源
一键下载并加速运行 RVC 语音转换模型,省时省力
Advanced-RVC-Inference 是一个面向 RVC(Retrieval-based Voice Conversion)模型的推理加速与部署···
UnitSpeech
开源
无需转录文本,用少量语音样本即可克隆你的声音
UnitSpeech 是一个基于扩散模型的语音合成与声音转换开源项目,官方实现了同名论文《UnitSpeech: S···
SoniTranslate
开源
上传视频,自动生成多语言配音,轻松出海
SoniTranslate 是一个开源的视频同步翻译与配音工具,专注于将视频中的语音自动翻译成其他语言,并···
emospeech
开源
从语音中识别情绪,让机器听懂你的心情
emospeech 是一个基于 Python 的语音情感识别开源项目,旨在从语音信号中自动检测和分类人类情感状···
OpenMusenet2
开源
复现 OpenAI 音乐生成模型,用代码生成多风格 MIDI 音乐
OpenMusenet2 是 OpenAI Musenet 的开源实现,旨在复现并开放这一经典音乐生成模型。Musenet 基于 ···
PolyLangVITS
开源
一个模型搞定中英日韩语音合成,开箱即用
PolyLangVITS 是一个基于 VITS 的多语言语音合成项目,支持韩语、日语、英语和中文四种语言。它利用···
spear-tts-pytorch
开源
用PyTorch复现多说话人TTS,快速搭建语音合成实验
Spear-TTS-PyTorch 是一个基于 PyTorch 实现的多说话人文本转语音(TTS)注意力网络的开源项目。它···
StyleTTS2
开源
音色情绪几乎以假乱真,听不出是机器在读
StyleTTS 2 通过风格扩散与对抗训练,结合大型语音语言模型,实现了接近人类水平的文本转语音。合成···
TikTok-Voice-TTS
开源
一键调用 TikTok 语音接口,生成热门音色配音
这是一个简单的 Python 脚本,用于调用 TikTok 内置的文本转语音(TTS)接口,从而生成带有 TikTok···
audiocraft-infinity-webui
开源
网页上无限续写音乐和音效,让 AI 创作不停歇
audiocraft-infinity-webui 是一个为 Meta 的 AudioCraft 音频生成模型打造的无限时长音频生成 Web···
Multi-Model-RVC-Inference
开源
一键加载多个 RVC 模型,从 Hugging Face 直接推理语音转换。
Multi-Model-RVC-Inference 是一个基于 Python 的语音转换推理工具,专注于 RVC(Retrieval-based ···
mu2mi
开源
用 TypeScript 快速集成 AI 音乐生成与处理能力
mu2mi 是一个开源的 AI 音乐工具包,旨在为音乐创作者和开发者提供一套基于 TypeScript 的模块化工···
ttsmms
开源
一键调用MMS模型,让数百种语言开口说话
ttsmms 是一个基于 Meta 的 Massively Multilingual Speech (MMS) 项目的文本转语音(TTS)工具,旨···
tts.astromech
开源
让 Home Assistant 用 R2-D2 的哔哔声说话,给智能家居加点星战趣味。
tts.astromech 是一个为 Home Assistant 打造的文本转语音集成组件,能够将输入的文本转换为《星球···
SoundStorm-pytorch
开源
并行音频生成,让语音合成快数倍
SoundStorm-pytorch 是 Google SoundStorm 论文的非官方 PyTorch 实现,旨在解决传统自回归语音合成···