音频音乐

汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。

共收录 738 个开源项目

AuK 开源

一个模型搞定语音生成、编辑与分离

AuK 是一个开源语音生成与编辑基础模型,目标是把语音合成、语音编辑、说话人提取、语音增强和音源···

★ 1236 评分 2026-08-19
omi-read-aloud 开源

复制即朗读,AI 回复用耳朵听

omi-read-aloud 是一款轻量级的 macOS 菜单栏应用,核心功能是监听剪贴板,自动将复制的对话文本或···

★ 76 评分 2026-07-29
asmr-dubber 开源

音声作品一键识别翻译配音,产出双语字幕和双语音轨

asmr-dubber 是一个用 Python 编写的音视频字幕与配音工具,主要面向 ASMR、音声作品等需要跨语言处···

★ 204 评分 2026-07-23
chatgpt-web-voice 开源

用免费 token 在自家网站接入 ChatGPT 实时语音对话

这是一个通过逆向工程调用 ChatGPT 网页版实时语音接口的开源项目。它利用 WebRTC 和 DataChannel ···

★ 73 评分 2026-07-21
BokeBox 开源

把文章视频一键变成你的专属播客节目

BokeBox(播匣)是一个多源输入的私有AI播客工作室,能将视频、链接、文章和笔记等内容转化为口播音···

★ 96 评分 2026-07-16
wtonec 开源

给微信/QQ加装语音增强和文字转语音,聊天更个性

Wtonec 是一个针对微信和 QQ 的 LSPosed/Xposed 模块,主要提供语音增强、文字转语音(TTS)和语音···

★ 65 评分 2026-07-15
audio.cpp-webui 开源

纯 C++ 音频 AI 全家桶,网页即开即用,无需 Python

audio.cpp-webui 是一个基于 ggml 的纯 C++ 音频模型推理引擎,为 audio.cpp 提供全任务 WebUI。它···

★ 368 评分 2026-07-12
LA-Studio 开源

本地跑通语音克隆和翻译,一站式测试音频模型

LA Studio 是一个本地优先的 AI 音频平台,旨在帮助用户探索、下载并测试语音识别(STT)、文本转语···

★ 95 评分 2026-07-03
vocal-craft-studio 开源

一键批量克隆声音,生成印地语和英语自然语音

vocal-craft-studio 是一个专注于印地语和英语的 AI 语音工作室,提供批量声音克隆与文本转语音(T···

★ 120 评分 2026-06-28
talk-to-fengge 开源

克隆声音性格,1秒内实时对话

这是一个基于实时语音技术的声音与性格克隆项目,旨在让用户与任何人的数字分身进行自然对话。它解···

★ 467 评分 2026-06-25
audio.cpp 开源

纯 C++ 搞定音频 AI 推理,无 Python 依赖,性能拉满

audio.cpp 是一个基于 ggml 的纯 C++ 音频模型推理引擎,旨在为音频 AI 应用提供一体化、高性能的本···

★ 2965 评分 2026-06-23
vllm-chatterbox-stream 开源

用 vLLM 驱动,0.7 秒首响,23 语言实时语音合成,支持声音克隆

vllm-chatterbox-stream 是一个基于 vLLM 推理引擎的多语言文本转语音(TTS)服务,兼容 OpenAI AP···

★ 55 评分 2026-06-17
voice-studio 开源

本地多模型 AI 语音生成,替代 ElevenLabs,省钱又私密。

voice-studio 是一个开源的本地 AI 语音生成(TTS)工作室,支持多种模型,旨在替代 ElevenLabs 等···

★ 196 评分 2026-06-17
HiggsAudio-Studio 开源

离线一键生成多角色播客和有声书,支持声音克隆。

HiggsAudio-Studio 是一个面向 Windows 的便携式文本转语音(TTS)工具,集成了 Higgs Audio v3 模···

★ 83 评分 2026-06-13
LocalText2Voice 开源

本地一键把文字变成干净播客级音频,无需联网

LocalText2Voice 是一个完全离线的本地文本转语音生产工作流,专为生成干净旁白、结构化学习内容和···

★ 361 评分 2026-06-11
theDAW 开源

一个工具搞定编曲、打碟和视觉,还能用 AI 生成音乐

theDAW 是一个用 TypeScript 构建的全功能数字音频工作站(DAW),同时集成 DJ 和 VJ 功能,目标是···

★ 194 评分 2026-06-10
Higgs_v3-TTS-ComfyUI 开源

在 ComfyUI 里拖拽生成百种语言、可克隆声音的对话式语音。

Higgs_v3-TTS-ComfyUI 是一套专为 ComfyUI 设计的节点,用于集成 Higgs Audio v3 TTS 4B 模型。该模···

★ 74 评分 2026-06-05
xttsv2-vllm-streaming-server 开源

让 XTTS-v2 实时说话,0.5 秒首响,即插即用

这是一个基于 vLLM 的 XTTS-v2 实时流式语音合成服务器,提供与 OpenAI 兼容的 API 接口。它解决了···

★ 54 评分 2026-05-20
Confucius4-TTS 开源

一句话克隆音色,跨语言说外语

Confucius4-TTS 是一个多语言与跨语言零样本语音合成引擎,基于 PyTorch 构建。它解决的核心问题是···

★ 808 评分 2026-05-19
Irodori-TTS-Server 开源

一键部署 OpenAI 兼容的 TTS 服务,轻松实现语音合成与克隆

Irodori-TTS-Server 是一个基于 Python 的文本转语音(TTS)服务端,它实现了 OpenAI 的 Text-to-S···

★ 77 评分 2026-05-14
flowflow 开源

用 Rust 打造本地优先语音笔记,自动转写并语义搜索。

flowflow 是一款面向 iPhone 和 macOS 的语音笔记应用,完全使用 Rust 编写,基于 Dioxus 构建跨平···

★ 168 评分 2026-05-07
AuraPlayer 开源

动动嘴就能听歌,AI帮你搞定播放列表

AuraPlayer 是一个基于 Next.js 和 TypeScript 构建的智能音乐播放器,集成了 AI 代理能力,支持通···

★ 103 评分 2026-05-01
erm 开源

一键剪掉录音里的“嗯啊”,让口语更干净

erm 是一个本地运行的命令行工具,专门用于去除英语口语录音中的非流利停顿词(如 um、uh、er、erm···

★ 112 评分 2026-04-28
korean-voice-acting-engine 开源

本地跑通韩语配音训练、转换与审查全流程

这是一个本地优先的韩语配音引擎,专为Codex辅助训练、语音转换和音频审查设计。它解决了韩语语音合···

★ 68 评分 2026-04-27