NekoSpeak
开源
手机本地离线朗读,隐私无忧,多种模型任选
NekoSpeak 是一款面向 Android 的本地离线 AI 语音合成应用,支持 Kokoro、KittenTTS、Pocket-tts ···
汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。
共收录 738 个开源项目
NekoSpeak
开源
手机本地离线朗读,隐私无忧,多种模型任选
NekoSpeak 是一款面向 Android 的本地离线 AI 语音合成应用,支持 Kokoro、KittenTTS、Pocket-tts ···
GSV-TTS-Lite
开源
让 GPT-SoVITS 语音克隆跑得更快,部署更简单
GSV-TTS-Lite 是一个专为 GPT-SoVITS 文本转语音模型设计的高性能推理引擎,专注于少样本语音克隆。···
LEMAS-TTS
开源
一个模型克隆10种语言的说话人声音,几秒音频即可合成新语音。
LEMAS-TTS 是一个多语言零样本文本转语音系统,支持中文、英语、西班牙语、俄语、法语、德语、意大···
youtube-auto-dub
开源
一键将 YouTube 视频自动翻译并配音成多语言,保留原声背景音乐。
youtube-auto-dub 是一个基于 AI 的 YouTube 视频自动配音流水线工具。它解决了视频内容跨语言传播···
opencode-smart-voice-notify
开源
编码时用语音播报任务结果,不错过任何关键状态。
这是一个为 OpenCode 打造的智能语音通知插件,主要解决开发者在编码时无法及时关注任务完成状态或···
AceForge
开源
在 Mac 上离线完成 AI 作曲、人声分离和语音合成
AceForge 是一款面向 Apple/OSX 平台的本地优先 AI 音乐工作站,基于 Ace-Step、DeMucs 和 XTTSv2 ···
cosyvoice-docker
开源
一条命令部署阿里 CosyVoice,带界面和 API,秒级克隆音色
CosyVoice 是阿里通义实验室开源的语音合成(TTS)大模型,支持中文、英文、日文等多种语言,具备零···
GPA
开源
一个模型搞定语音识别、合成和转换,轻量高效
GPA(General Purpose Audio)是一个基于Transformer的通用音频模型,由AutoArk团队开发,旨在用单···
T5Gemma-TTS
开源
上传一段语音,即刻克隆音色并生成多语言自然语音。
T5Gemma-TTS 是一个基于 T5Gemma 编码器-解码器大语言模型的多语言语音合成项目,专注于语音克隆和···
vibevoice-rs
开源
用Rust实现语音克隆与多说话人TTS,高性能低延迟。
vibevoice-rs 是一个基于 Rust 的文本转语音(TTS)引擎,实现了 VibeVoice 的语音克隆与多说话人合···
GLM-TTS
开源
几秒克隆音色,还能带情绪说话,让TTS更自然
GLM-TTS 是一个基于多奖励强化学习的零样本语音合成(TTS)项目,由智谱AI推出。它解决的核心问题是···
M3-TTS
开源
零样本合成高保真语音,多模态对齐+流匹配
M3-TTS 是一个基于 PyTorch 的开源语音合成项目,实现了论文《M3-TTS: Multi-modal DiT Alignment ···
mlx-audio-swift
开源
在苹果芯片上,用 Swift 轻松实现本地语音/音频 AI 处理。
mlx-audio-swift 是一个专为 Apple Silicon 设计的模块化 Swift 音频处理 SDK,基于 MLX 框架构建。···
soprano
开源
输入文本,秒出超逼真语音,让应用开口说话。
Soprano 是一个基于 Python 的文本转语音(TTS)开源项目,主打即时生成超逼真语音。它解决了传统 ···
NeuroRVQ
开源
把脑电心电变成token,让生成模型读懂生物信号
NeuroRVQ是一个面向生物信号(如脑电、心电、肌电等)的多尺度神经残差向量量化(Residual Vector ···
supertonic-py
开源
本地极速语音合成,离线也能开口说话
supertonic-py 是一个基于 ONNX Runtime 的轻量级端侧文本转语音(TTS)引擎,旨在提供极速、离线的···
supertonic
开源
手机上秒级生成多语言语音,离线也能用
supertonic 是一个极速的端侧多语言文本转语音(TTS)引擎,基于 ONNX Runtime 原生运行,支持 iOS···
supertonic
开源
离线秒级生成多语言语音,隐私安全不卡顿
supertonic 是一个超快速、完全离线的多语言文本转语音(TTS)引擎,基于 ONNX Runtime 原生运行,···
dia2
开源
让 AI 对话实时开口,边生成边播放不卡顿
dia2 是一个开源的实时流式对话语音合成(TTS)模型,基于开放权重架构,支持低延迟的音频流输出。···
TTS-Story
开源
用标签脚本一键生成多角色有声书,本地或云端引擎任选。
TTS-Story 是一个基于 Web 的多语音 TTS 工作室,专为将带标签的脚本转换为有声书而设计。它解决了···
FlashLabs-Chroma
开源
实时语音对话+声音克隆,几秒复刻你的音色
FlashLabs-Chroma 是全球首个开源的实时端到端语音对话模型,支持个性化声音克隆。它解决了传统语音···
Kani-TTS-Vie
开源
越南语语音合成,3秒推理,轻量模型即用
Kani-TTS-Vie 是一个针对越南语的快速文本转语音(TTS)开源项目,模型参数量仅 370M,推理时间约 ···
ComfyUI-Step_Audio_EditX_TTS
开源
在 ComfyUI 里拖拽节点,几秒克隆声音并编辑音频
ComfyUI-Step_Audio_EditX_TTS 是一个为 ComfyUI 开发的音频处理节点插件,集成了 Step Audio Edit···
ComfyUI-Maya1_TTS
开源
在 ComfyUI 里拖拽节点,生成带情感的语音
ComfyUI-Maya1_TTS 是一个 ComfyUI 自定义节点,用于集成 Maya1 语音合成模型。Maya1 是一个 3B 参···