Step-Audio-EditX
开源
用一句话编辑语音情感和风格,还能零样本合成新声音
Step-Audio-EditX 是一个基于 3B 参数大语言模型和强化学习的音频编辑模型,专注于情感、说话风格和···
汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。
共收录 738 个开源项目
Step-Audio-EditX
开源
用一句话编辑语音情感和风格,还能零样本合成新声音
Step-Audio-EditX 是一个基于 3B 参数大语言模型和强化学习的音频编辑模型,专注于情感、说话风格和···
VieNeu-TTS
开源
在本地 CPU 上实时合成越南语语音,几秒克隆任意音色。
VieNeu-TTS 是一个专注于越南语的端侧实时文本转语音(TTS)引擎,支持即时声音克隆,无需云端依赖···
FlexiCodec
开源
低帧率下也能保真,让音频编解码更灵活高效
FlexiCodec 是一个面向低帧率场景的动态神经音频编解码器,由 ICLR 2026 论文提出。它解决传统音频···
silero-stress
开源
给俄语文本自动标重音,让TTS发音更准
Silero Stress 是一个面向俄语的预训练自动重音标注与同形异义词消歧工具。它解决了俄语文本中多音···
MOSS-Speech
开源
跳过文字,语音直接对话,更自然更高效
MOSS-Speech 是一个真正的语音到语音(speech-to-speech)大语言模型,无需文本作为中间引导。它直···
liquid-audio
开源
端到端语音互转,实时交互低延迟
Liquid Audio 是 Liquid AI 推出的语音到语音(speech-to-speech)音频模型系列,旨在解决传统语音···
VibeVoiceFusion
开源
一键微调多说话人语音,低显存批量合成
VibeVoiceFusion 是一个基于微软 VibeVoice(自回归+扩散架构)的全栈多说话人语音合成 Web 系统。···
voices
开源
Java 应用内秒级离线语音合成,无需外部服务
voices 是一个面向 Java 生态的快速进程内文本转语音(TTS)库。它基于 ONNX 运行时和 Piper TTS 引···
voxtream
开源
实时流式语音克隆,边听边合成,语速随心控
VoXtream 是一个全流式零样本文本转语音(TTS)模型,主打极低延迟和语速控制。它解决了传统 TTS 需···
ComfyUI-VoxCPM
开源
在 ComfyUI 里拖拽节点,即可生成高表现力语音并克隆任意声音。
ComfyUI-VoxCPM 是一个为 ComfyUI 设计的音频生成节点,专注于高表现力的语音合成和零样本声音克隆···
VoxCPM
开源
给 AI 一句描述,就能捏出从没听过的全新嗓音
VoxCPM2 是一款无分词器的多语言语音生成模型,支持多语种语音合成、创意音色设计与高保真声音克隆···
vibevoice-studio
开源
录段声音,就能用你的声音说话
VibeVoice Studio 是一个基于 Python 和 FastAPI 构建的语音克隆与文本转语音(TTS)应用。它允许用···
VibeVoice-ComfyUI
开源
在 ComfyUI 里拖拽节点,一键生成高质量多角色语音
VibeVoice-ComfyUI 是一个将微软 VibeVoice 文本转语音模型集成到 ComfyUI 的自定义节点,让用户能···
ComfyUI-VibeVoice
开源
在 ComfyUI 里拖拽生成带情感的多角色长语音
ComfyUI-VibeVoice 是一个为 ComfyUI 设计的自定义节点,用于集成 VibeVoice 文本转语音(TTS)引擎···
ddo-tts
开源
安装即用,Edge 语音秒变朗读神器
ddo-tts 是一款基于 Kotlin 开发的 Android 文字转语音应用,内置 EdgeTTS 引擎,无需额外部署或配···
Genie-TTS
开源
把 GPT-SoVITS 模型转成 ONNX,部署快、跑得稳,声音克隆更轻松。
Genie-TTS 是一个专注于 GPT-SoVITS 模型的 ONNX 推理引擎与模型转换工具。它解决了 GPT-SoVITS 模···
OpenWebTTS
开源
本地模型朗读PDF和EPUB,隐私无忧的Speechify替代品
OpenWebTTS 是一个开源的、可自托管的文本转语音(TTS)Web 应用,旨在作为 Speechify 的替代方案。···
ncnn-android-piper
开源
手机本地跑神经语音合成,离线秒出中文英文语音
ncnn-android-piper 是一个基于 ncnn 推理框架的本地神经网络语音合成(TTS)引擎,专为 Android 和···
lue
开源
终端里读书还能听书,支持多种格式,语音自然如有声书。
lue 是一个运行在终端里的电子书阅读器,核心亮点是集成了高品质的文本转语音(TTS)功能,让用户能···
HunyuanVideo-Foley
开源
看视频自动配音,让无声画面瞬间有真实的声音。
HunyuanVideo-Foley 是腾讯混元团队开源的多模态扩散模型,用于从视频内容自动生成高保真度的拟音音···
nabu
开源
在安卓上玩转本地 TTS 和 LLM,一键生成有声书
nabu 是一个面向边缘计算的多引擎 TTS 与 LLM 游乐场,基于 Kotlin 开发,专为 Android 设备设计。···
epub2mp3
开源
把电子书变成有声书,用 Edge TTS 一键转 MP3
epub2mp3 是一个用 Python 编写的命令行工具,它利用微软 Edge 的 TTS 服务,将 EPUB 电子书转换为···
ai-voice-cloner
开源
本地免费克隆你的声音,一键生成语音
这是一个本地运行的AI语音克隆桌面应用,无需联网即可使用,且不产生任何运行成本。它解决的是用户···
OtosakuTTS-iOS
开源
在 iPhone 上离线生成自然语音,保护隐私不联网。
OtosakuTTS-iOS 是一个基于 Swift 的离线文本转语音(TTS)库,专为 iOS 和 macOS 平台设计。它利用···