音频音乐

汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。

共收录 738 个开源项目

podcast-llm 开源

输入一个标题,自动生成完整AI播客音频

podcast-llm 是一个能从零开始自动生成 AI 播客的开源工具,用户只需提供一个节目主题,它就能自动···

★ 152 评分 2024-10-28
obsidian-edge-tts 开源

在 Obsidian 里一键朗读笔记,免费高音质,解放双眼

obsidian-edge-tts 是一个 Obsidian 插件,利用微软 Edge 浏览器的朗读 API,为笔记提供免费且高质···

★ 319 评分 2024-10-27
f5-tts-swift 开源

在苹果设备上本地运行高质量语音合成,无需联网

f5-tts-swift 是一个用 Swift 语言实现的 F5-TTS 文本转语音库,基于 MLX 框架构建,专为 Apple 生···

★ 91 评分 2024-10-19
f5-tts-mlx 开源

在 Mac 上本地跑 F5-TTS,零样本克隆语音

f5-tts-mlx 是 F5-TTS 模型在 Apple MLX 框架上的实现,旨在让 TTS 模型在 Apple Silicon 芯片上高···

★ 644 评分 2024-10-13
readest 开源

一套代码,全平台畅读,让电子书体验媲美原生应用。

Readest 是一款现代、功能丰富的跨平台电子书阅读器,专为深度阅读爱好者打造。它解决了传统阅读器···

★ 24624 评分 2024-10-12
openai-edge-tts 开源

免费替代 OpenAI TTS,一键部署,秒变语音合成 API

openai-edge-tts 是一个免费、高质量的文本转语音(TTS)API 端点,旨在作为 OpenAI、Azure 或 Ele···

★ 2112 评分 2024-10-09
edge-tts 开源

无需密钥,几行代码调用微软 Edge 免费语音合成

edge-tts 是一个基于 TypeScript 的 Node.js/Bun 库,让你无需安装 Microsoft Edge、Windows 系统或···

★ 146 评分 2024-10-04
Awesome-Music-Generation 开源

一站式找全音乐生成模型,从旋律到歌曲不迷路

Awesome-Music-Generation 是一个聚焦音乐生成模型(MG²)的资源合集,收录了基于扩散模型、大语言···

★ 167 评分 2024-09-27
fish-audio-python 开源

几行代码接入 Fish Audio,快速实现文本转语音和声音克隆。

fish-audio-python 是 Fish Audio 官方推出的 Python 库,用于快速接入其文本转语音(TTS)和语音克···

★ 217 评分 2024-09-13
voc2vec 开源

让机器听懂笑声哭声,解锁非语言声音的语义

voc2vec 是一个针对非语言发声(如笑声、哭泣、叹息等)的基础模型,论文发表于 ICASSP 2025。它解···

★ 59 评分 2024-09-11
SoCodec 开源

极低码率语音压缩,为语音语言模型提供高质量离散表示

SoCodec 是一个面向语音语言建模应用的低码率语音编解码器,基于 Python 实现。它解决了传统语音编···

★ 92 评分 2024-09-02
piper-rs 开源

在 Rust 中离线合成语音,轻松集成 Piper 模型。

piper-rs 是一个用 Rust 编写的 Piper 文本转语音(TTS)模型推理库。它解决了在 Rust 生态中缺少高···

★ 64 评分 2024-08-31
WavTokenizer 开源

每秒40个token,让音频语言建模又快又准

WavTokenizer 是一个先进的离散声学编解码器模型,专为音频语言建模设计,在 ICLR 2025 发表。它解···

★ 1322 评分 2024-08-29
ebook2audiobookpiper-tts 开源

一键把电子书变成有声书,支持多语言,Docker 部署即用

ebook2audiobookpiper-tts 是一个将电子书转换为有声书的开源工具,核心基于 Piper TTS 引擎,支持···

★ 107 评分 2024-08-28
MeloTTS.cpp 开源

纯 C++ 轻量 TTS,OpenVINO 加速,多语言离线合成

MeloTTS.cpp 是一个轻量级的纯 C++ 文本转语音(TTS)推理管线,基于 OpenVINO 运行时实现,支持多···

★ 113 评分 2024-08-26
fish-speech.rs 开源

用 Rust 原生跑 Fish Speech,快速生成语音

fish-speech.rs 是一个基于 Rust 和 Candle.rs 框架实现的 Fish Speech 文本转语音(TTS)引擎。它···

★ 111 评分 2024-08-24
FireRedTTS 开源

用大模型驱动,一句话克隆声音,生成自然语音。

FireRedTTS 是一个基于大语言模型(LLM)的开源语音合成(TTS)系统,旨在提供高质量、自然且可控的···

★ 925 评分 2024-08-15
SSR-Speech 开源

零样本语音编辑与合成,稳定安全又抗造

SSR-Speech 是一个面向零样本语音编辑与合成的开源项目,旨在解决现有语音编辑和合成技术中稳定性、···

★ 159 评分 2024-08-06
voice-pro 开源

一站式网页工具,轻松搞定语音合成、克隆与处理

voice-pro 是一个面向创作者和开发者的 Gradio WebUI 工具,集成了多种前沿的语音技术。它解决了音···

★ 12938 评分 2024-07-29
QuickPiperAudiobook 开源

一条命令,把电子书变成自然流畅的有声书

QuickPiperAudiobook 是一个用 Go 编写的命令行工具,旨在将多种格式的电子书(如 EPUB、MOBI、TXT···

★ 1057 评分 2024-07-27
e2-tts-pytorch 开源

几行代码实现零样本语音克隆,让 TTS 不再复杂

E2-TTS 是一个基于 PyTorch 的零样本文本转语音(TTS)实现,对应论文《Embarrassingly Easy Fully···

★ 517 评分 2024-07-09
optispeech 开源

轻量级 TTS,低资源跑出自然语音

OptiSpeech 是一个轻量级的端到端文本转语音(TTS)模型,旨在以较低的计算资源实现高质量语音合成···

★ 130 评分 2024-07-08
CosyVoice 开源

输入文字就能生成多语种配音,一天的工作十分钟搞定

阿里通义实验室开源的多语言大规模语音生成模型,提供推理、训练与部署全栈能力。支持零样本语音克···

★ 23769 评分 2024-07-03
detail_tts 开源

一个框架搞定多种TTS生成模型,快速对比实验

detail_tts 是一个面向语音合成(TTS)研究的统一生成式模型框架,旨在将多种生成模型(如扩散模型···

★ 74 评分 2024-06-22