AuK
开源
一个模型搞定语音生成、编辑与分离
AuK 是一个开源语音生成与编辑基础模型,目标是把语音合成、语音编辑、说话人提取、语音增强和音源···
汇聚全球AI音频与音乐生成项目,AI语音合成、音乐创作、音频处理工具一网打尽。
共收录 738 个开源项目
AuK
开源
一个模型搞定语音生成、编辑与分离
AuK 是一个开源语音生成与编辑基础模型,目标是把语音合成、语音编辑、说话人提取、语音增强和音源···
omi-read-aloud
开源
复制即朗读,AI 回复用耳朵听
omi-read-aloud 是一款轻量级的 macOS 菜单栏应用,核心功能是监听剪贴板,自动将复制的对话文本或···
asmr-dubber
开源
音声作品一键识别翻译配音,产出双语字幕和双语音轨
asmr-dubber 是一个用 Python 编写的音视频字幕与配音工具,主要面向 ASMR、音声作品等需要跨语言处···
chatgpt-web-voice
开源
用免费 token 在自家网站接入 ChatGPT 实时语音对话
这是一个通过逆向工程调用 ChatGPT 网页版实时语音接口的开源项目。它利用 WebRTC 和 DataChannel ···
BokeBox
开源
把文章视频一键变成你的专属播客节目
BokeBox(播匣)是一个多源输入的私有AI播客工作室,能将视频、链接、文章和笔记等内容转化为口播音···
wtonec
开源
给微信/QQ加装语音增强和文字转语音,聊天更个性
Wtonec 是一个针对微信和 QQ 的 LSPosed/Xposed 模块,主要提供语音增强、文字转语音(TTS)和语音···
audio.cpp-webui
开源
纯 C++ 音频 AI 全家桶,网页即开即用,无需 Python
audio.cpp-webui 是一个基于 ggml 的纯 C++ 音频模型推理引擎,为 audio.cpp 提供全任务 WebUI。它···
LA-Studio
开源
本地跑通语音克隆和翻译,一站式测试音频模型
LA Studio 是一个本地优先的 AI 音频平台,旨在帮助用户探索、下载并测试语音识别(STT)、文本转语···
vocal-craft-studio
开源
一键批量克隆声音,生成印地语和英语自然语音
vocal-craft-studio 是一个专注于印地语和英语的 AI 语音工作室,提供批量声音克隆与文本转语音(T···
talk-to-fengge
开源
克隆声音性格,1秒内实时对话
这是一个基于实时语音技术的声音与性格克隆项目,旨在让用户与任何人的数字分身进行自然对话。它解···
audio.cpp
开源
纯 C++ 搞定音频 AI 推理,无 Python 依赖,性能拉满
audio.cpp 是一个基于 ggml 的纯 C++ 音频模型推理引擎,旨在为音频 AI 应用提供一体化、高性能的本···
vllm-chatterbox-stream
开源
用 vLLM 驱动,0.7 秒首响,23 语言实时语音合成,支持声音克隆
vllm-chatterbox-stream 是一个基于 vLLM 推理引擎的多语言文本转语音(TTS)服务,兼容 OpenAI AP···
voice-studio
开源
本地多模型 AI 语音生成,替代 ElevenLabs,省钱又私密。
voice-studio 是一个开源的本地 AI 语音生成(TTS)工作室,支持多种模型,旨在替代 ElevenLabs 等···
HiggsAudio-Studio
开源
离线一键生成多角色播客和有声书,支持声音克隆。
HiggsAudio-Studio 是一个面向 Windows 的便携式文本转语音(TTS)工具,集成了 Higgs Audio v3 模···
LocalText2Voice
开源
本地一键把文字变成干净播客级音频,无需联网
LocalText2Voice 是一个完全离线的本地文本转语音生产工作流,专为生成干净旁白、结构化学习内容和···
theDAW
开源
一个工具搞定编曲、打碟和视觉,还能用 AI 生成音乐
theDAW 是一个用 TypeScript 构建的全功能数字音频工作站(DAW),同时集成 DJ 和 VJ 功能,目标是···
Higgs_v3-TTS-ComfyUI
开源
在 ComfyUI 里拖拽生成百种语言、可克隆声音的对话式语音。
Higgs_v3-TTS-ComfyUI 是一套专为 ComfyUI 设计的节点,用于集成 Higgs Audio v3 TTS 4B 模型。该模···
xttsv2-vllm-streaming-server
开源
让 XTTS-v2 实时说话,0.5 秒首响,即插即用
这是一个基于 vLLM 的 XTTS-v2 实时流式语音合成服务器,提供与 OpenAI 兼容的 API 接口。它解决了···
Confucius4-TTS
开源
一句话克隆音色,跨语言说外语
Confucius4-TTS 是一个多语言与跨语言零样本语音合成引擎,基于 PyTorch 构建。它解决的核心问题是···
Irodori-TTS-Server
开源
一键部署 OpenAI 兼容的 TTS 服务,轻松实现语音合成与克隆
Irodori-TTS-Server 是一个基于 Python 的文本转语音(TTS)服务端,它实现了 OpenAI 的 Text-to-S···
flowflow
开源
用 Rust 打造本地优先语音笔记,自动转写并语义搜索。
flowflow 是一款面向 iPhone 和 macOS 的语音笔记应用,完全使用 Rust 编写,基于 Dioxus 构建跨平···
AuraPlayer
开源
动动嘴就能听歌,AI帮你搞定播放列表
AuraPlayer 是一个基于 Next.js 和 TypeScript 构建的智能音乐播放器,集成了 AI 代理能力,支持通···
erm
开源
一键剪掉录音里的“嗯啊”,让口语更干净
erm 是一个本地运行的命令行工具,专门用于去除英语口语录音中的非流利停顿词(如 um、uh、er、erm···
korean-voice-acting-engine
开源
本地跑通韩语配音训练、转换与审查全流程
这是一个本地优先的韩语配音引擎,专为Codex辅助训练、语音转换和音频审查设计。它解决了韩语语音合···