Silero-TTS-Service
开源
给 Home Assistant 装上离线高音质语音合成,一句话搞定本地 TTS。
Silero-TTS-Service 是一个基于 Silero TTS 模型的本地文本转语音后端服务,专为智能家居场景设计。···
汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。
共收录 738 个开源项目
Silero-TTS-Service
开源
给 Home Assistant 装上离线高音质语音合成,一句话搞定本地 TTS。
Silero-TTS-Service 是一个基于 Silero TTS 模型的本地文本转语音后端服务,专为智能家居场景设计。···
用图像扩散模型,像P图一样编辑音频
riffusion-manipulation 是一个基于 Riffusion 模型的音频操控工具集,用 Python 实现。它解决的核···
Auto-Synced-Translated-Dubs
开源
上传视频和字幕,自动生成多语言配音,音画同步无需手动。
Auto-Synced-Translated-Dubs 是一个自动视频配音翻译工具,它基于字幕文件提取文本,通过 AI 翻译···
Turkish-Text-to-Speech
开源
用 Fastpitch + HiFi-GAN 为土耳其语打造自然语音合成
Turkish-Text-to-Speech 是一个面向土耳其语等低资源语言的文本转语音(TTS)开源项目。它采用 Fas···
riffusion-hobby
开源
用 Stable Diffusion 实时生成音乐,输入文字即出旋律
riffusion-hobby 是一个基于 Stable Diffusion 的音乐生成开源项目,将图像生成技术应用于音频频谱···
phoenix10.1
开源
用文字一键生成你的专属电台,AI 主持不间断播报
phoenix10.1 是一个基于 Python 的个人电台生成工具,核心功能是利用文本转语音技术,将用户提供的···
AutoVocoder
开源
用可微信号处理,快速生成高质量语音波形
AutoVocoder 是一个基于可微数字信号处理(DDSP)的语音波形快速生成工具。它从学习到的语音表示(···
riffusion-app-hobby
开源
用 Stable Diffusion 实时生成音乐,输入文字即可创作独特旋律
riffusion-app-hobby 是一个基于 Stable Diffusion 的实时音乐生成 Web 应用,将图像生成模型应用于···
Chinese-FastSpeech2
开源
让中文语音合成更有韵律,告别机器腔
Chinese-FastSpeech2 是一个基于 FastSpeech2 的中文语音合成(TTS)开源项目。它针对中文发音特点···
TurkicTTS
开源
让十种突厥小语种也能拥有流畅语音合成
TurkicTTS 是一个面向突厥语系的多语言文本转语音(TTS)合成系统,专门支持阿塞拜疆语、巴什基尔语···
seq2seq-vc
开源
用序列模型实现声音转换,无需平行语料
seq2seq-vc 是一个基于序列到序列(seq2seq)模型的语音转换工具包,旨在将一个人的声音转换为另一···
lalalai
开源
调用 LALAL.AI API,快速实现人声分离与音频处理
LALAL.AI 的官方 API 示例库,专注于音频分离与处理。它提供了一系列 Python 脚本,演示如何调用 L···
manim-voiceover
开源
给 Manim 动画一键加配音,自动同步字幕
manim-voiceover 是一个专为 Manim 动画引擎设计的语音旁白插件,旨在解决数学动画视频制作中语音与···
DiffRoll
开源
用扩散模型把音频自动变成钢琴卷帘谱
DiffRoll 是一个基于扩散模型的自动音乐转录(AMT)开源项目,采用 PyTorch 实现。它解决的是将音频···
GenerSpeech
开源
用任意声音合成语音,零样本风格迁移
GenerSpeech 是一个基于 PyTorch 实现的文本到语音(TTS)模型,源自 NeurIPS 2022 论文,专注于零···
MSMC-TTS
开源
多阶段码本生成,让语音合成更自然清晰
MSMC-TTS 是一个多阶段多码本(Multi-Stage Multi-Codebook)的语音合成(TTS)开源项目,基于深度···
Perceiver-Music-Transformer
开源
用 Perceiver 架构高效生成超长音乐,突破 Transformer 长度限制
Perceiver-Music-Transformer 是 Google Perceiver-AR 架构在音乐生成领域的开源实现,旨在解决长序···
pattrns
开源
用代码写节奏,实时生成音乐序列
pattrns 是一个用 Rust 编写的实验性命令式音乐序列生成引擎。它解决的是传统音乐编程中序列生成方···
tts-server-android
开源
让安卓手机秒变智能朗读助手,自定义音色和接口
tts-server-android 是一个基于 Android 的本地 TTS(文本转语音)服务应用,旨在解决系统自带 TTS···
audio-development-tools
开源
一站式音频开发工具箱,从信号处理到AI生成全搞定
Audio Development Tools (ADT) 是一个面向音频技术研发的开源项目,旨在整合声音、语音和音乐领域···
tts-server-go
开源
一键部署,让阅读APP用上微软AI语音听书
tts-server-go 是一个用 Go 语言编写的轻量级服务,用于转发微软 TTS(文本转语音)服务。它主要解···
tts-react
开源
在 React 里一句话搞定文字转语音,轻松实现播报功能
tts-react 是一个基于 React 的文本转语音(TTS)组件库,旨在帮助开发者快速在 React 应用中集成语···
mkpl
开源
敲一行命令,目录秒变 M3U 播放列表
mkpl 是一个命令行工具,用于从命令行生成 M3U 格式的播放列表。它解决了手动创建和维护播放列表的···
KAN-TTS
开源
快速搭建定制语音合成系统,开箱即用
KAN-TTS 是一个基于 Python 的语音合成训练框架,旨在简化 TTS 模型的开发与训练流程。它提供了从数···