podcast-llm
开源
输入一个标题,自动生成完整AI播客音频
podcast-llm 是一个能从零开始自动生成 AI 播客的开源工具,用户只需提供一个节目主题,它就能自动···
汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。
共收录 738 个开源项目
podcast-llm
开源
输入一个标题,自动生成完整AI播客音频
podcast-llm 是一个能从零开始自动生成 AI 播客的开源工具,用户只需提供一个节目主题,它就能自动···
obsidian-edge-tts
开源
在 Obsidian 里一键朗读笔记,免费高音质,解放双眼
obsidian-edge-tts 是一个 Obsidian 插件,利用微软 Edge 浏览器的朗读 API,为笔记提供免费且高质···
f5-tts-swift
开源
在苹果设备上本地运行高质量语音合成,无需联网
f5-tts-swift 是一个用 Swift 语言实现的 F5-TTS 文本转语音库,基于 MLX 框架构建,专为 Apple 生···
f5-tts-mlx
开源
在 Mac 上本地跑 F5-TTS,零样本克隆语音
f5-tts-mlx 是 F5-TTS 模型在 Apple MLX 框架上的实现,旨在让 TTS 模型在 Apple Silicon 芯片上高···
readest
开源
一套代码,全平台畅读,让电子书体验媲美原生应用。
Readest 是一款现代、功能丰富的跨平台电子书阅读器,专为深度阅读爱好者打造。它解决了传统阅读器···
openai-edge-tts
开源
免费替代 OpenAI TTS,一键部署,秒变语音合成 API
openai-edge-tts 是一个免费、高质量的文本转语音(TTS)API 端点,旨在作为 OpenAI、Azure 或 Ele···
edge-tts
开源
无需密钥,几行代码调用微软 Edge 免费语音合成
edge-tts 是一个基于 TypeScript 的 Node.js/Bun 库,让你无需安装 Microsoft Edge、Windows 系统或···
Awesome-Music-Generation
开源
一站式找全音乐生成模型,从旋律到歌曲不迷路
Awesome-Music-Generation 是一个聚焦音乐生成模型(MG²)的资源合集,收录了基于扩散模型、大语言···
fish-audio-python
开源
几行代码接入 Fish Audio,快速实现文本转语音和声音克隆。
fish-audio-python 是 Fish Audio 官方推出的 Python 库,用于快速接入其文本转语音(TTS)和语音克···
voc2vec
开源
让机器听懂笑声哭声,解锁非语言声音的语义
voc2vec 是一个针对非语言发声(如笑声、哭泣、叹息等)的基础模型,论文发表于 ICASSP 2025。它解···
SoCodec
开源
极低码率语音压缩,为语音语言模型提供高质量离散表示
SoCodec 是一个面向语音语言建模应用的低码率语音编解码器,基于 Python 实现。它解决了传统语音编···
piper-rs
开源
在 Rust 中离线合成语音,轻松集成 Piper 模型。
piper-rs 是一个用 Rust 编写的 Piper 文本转语音(TTS)模型推理库。它解决了在 Rust 生态中缺少高···
WavTokenizer
开源
每秒40个token,让音频语言建模又快又准
WavTokenizer 是一个先进的离散声学编解码器模型,专为音频语言建模设计,在 ICLR 2025 发表。它解···
ebook2audiobookpiper-tts
开源
一键把电子书变成有声书,支持多语言,Docker 部署即用
ebook2audiobookpiper-tts 是一个将电子书转换为有声书的开源工具,核心基于 Piper TTS 引擎,支持···
MeloTTS.cpp
开源
纯 C++ 轻量 TTS,OpenVINO 加速,多语言离线合成
MeloTTS.cpp 是一个轻量级的纯 C++ 文本转语音(TTS)推理管线,基于 OpenVINO 运行时实现,支持多···
fish-speech.rs
开源
用 Rust 原生跑 Fish Speech,快速生成语音
fish-speech.rs 是一个基于 Rust 和 Candle.rs 框架实现的 Fish Speech 文本转语音(TTS)引擎。它···
FireRedTTS
开源
用大模型驱动,一句话克隆声音,生成自然语音。
FireRedTTS 是一个基于大语言模型(LLM)的开源语音合成(TTS)系统,旨在提供高质量、自然且可控的···
SSR-Speech
开源
零样本语音编辑与合成,稳定安全又抗造
SSR-Speech 是一个面向零样本语音编辑与合成的开源项目,旨在解决现有语音编辑和合成技术中稳定性、···
voice-pro
开源
一站式网页工具,轻松搞定语音合成、克隆与处理
voice-pro 是一个面向创作者和开发者的 Gradio WebUI 工具,集成了多种前沿的语音技术。它解决了音···
QuickPiperAudiobook
开源
一条命令,把电子书变成自然流畅的有声书
QuickPiperAudiobook 是一个用 Go 编写的命令行工具,旨在将多种格式的电子书(如 EPUB、MOBI、TXT···
e2-tts-pytorch
开源
几行代码实现零样本语音克隆,让 TTS 不再复杂
E2-TTS 是一个基于 PyTorch 的零样本文本转语音(TTS)实现,对应论文《Embarrassingly Easy Fully···
optispeech
开源
轻量级 TTS,低资源跑出自然语音
OptiSpeech 是一个轻量级的端到端文本转语音(TTS)模型,旨在以较低的计算资源实现高质量语音合成···
CosyVoice
开源
输入文字就能生成多语种配音,一天的工作十分钟搞定
阿里通义实验室开源的多语言大规模语音生成模型,提供推理、训练与部署全栈能力。支持零样本语音克···
detail_tts
开源
一个框架搞定多种TTS生成模型,快速对比实验
detail_tts 是一个面向语音合成(TTS)研究的统一生成式模型框架,旨在将多种生成模型(如扩散模型···