audio-generation
本站收录 37 个带「audio-generation」标签的 AI 开源项目
LocalAI开源的本地 AI 推理引擎,无需 GPU 即可在任何硬件上运行 LLM、视觉、语音、图像与视频等多种模型,兼容 OpenAI API 接口,是构建私有化 AI ★ 49,323
CosyVoice阿里通义实验室开源的多语言大规模语音生成模型,提供推理、训练与部署全栈能力。支持零样本语音克隆与跨语种语音合成,音色自然流畅,是构建语音助手、智能配音与内容创作★ 23,810
YuEYuE 是开源的全曲目音乐生成基础模型,功能类似 Suno.ai 但完全开放。支持生成带人声的完整歌曲,涵盖歌词、旋律与编曲,为音乐创作者提供可本地部署、可自由★ 10,578
AmphionAmphion 是一个面向音频、音乐和语音生成的开源工具包,旨在支持可复现研究,并帮助初级研究者和工程师快速入门。它集成了多种主流模型与算法,涵盖文本到语音(T★ 10,305
vllm-omni面向全模态模型的统一高效推理框架,支持文本、图像、视频、音频等多种模态的高性能推理,延续 vLLM 的工程优势,为多模态大模型应用提供稳定快速的部署方案。★ 7,135
TTS-WebUITTS-WebUI 是一个集成了多种主流语音与音频生成模型的一站式 Web 界面,基于 Gradio 和 React 构建。它解决了用户在不同 TTS、语音克隆★ 3,276
Chatterbox-TTS-ServerChatterbox-TTS-Server 是一个自托管的文本转语音(TTS)服务,基于强大的 Chatterbox 模型。它解决了用户需要灵活、可扩展的语音合★ 1,460
sglang-omniSGLang-Omni 是一个基于 SGLang 的高性能多模态推理服务框架,专注于语音相关模型(TTS、ASR)及全模态(omni)模型的部署。它解决了传统语★ 1,302
tangotango 是一个用于文本生成音频的扩散模型家族,旨在解决从文字描述直接合成高质量音频的问题。它基于文本提示生成对应的音频内容,如音效、环境声等,核心能力包括文★ 1,241
TTS-Audio-SuiteTTS-Audio-Suite 是一个 ComfyUI 自定义节点集成包,旨在为本地多引擎、多语言的文本转语音(TTS)和语音转换(VC)提供一站式解决方案。它★ 1,216
MOVAMOVA 是一个统一的多模态基础模型,能够在一个模型中同时生成同步的视频和音频,解决了传统视频生成中音画分离、需要额外配音或后期对齐的痛点。它基于扩散模型架构,★ 1,119
ai-audio-datasets覆盖语音、音乐与音效的 AI 音频数据集合集,为生成式 AI、AIGC、模型训练与智能音频工具开发提供高质量训练数据,是构建音频 AI 应用、开展相关研究的实用★ 970
audio-ai-hub音频 AI 研究一站式导航,系统汇集论文、开源模型、基准测试与数据集,覆盖音频大模型、语音识别、TTS、音乐与音频生成等领域,是音频 AI 研究者与工程师快速了★ 960
flatkey-cliflatkey-cli 是一个基于 JavaScript 的媒体生成命令行工具,专注于生成式 AI 领域。它解决了开发者在终端中快速调用多种 AI 媒体生成能力★ 906
GameFactory-3AGameFactory-3A 是一个开源的 3A 游戏生成技能与资产框架,旨在为游戏开发者提供从概念到成品的全流程生成工具链。它整合了 3D 模型生成、图像生成★ 814
genblazeGenblaze 是一个开源 Python SDK,用于编排跨视频、音频和图像提供商的生成式 AI 媒体管道,并为每个输出内置来源追踪。它解决了在多个 AI 服★ 551
audio-development-toolsAudio Development Tools (ADT) 是一个面向音频技术研发的开源项目,旨在整合声音、语音和音乐领域的开发工具链。它解决音频开发者缺乏统一★ 469
MM-DiffusionMM-Diffusion是CVPR 2023提出的多模态扩散模型,用于联合生成音频和视频。它解决的是传统生成模型只能处理单一模态、难以实现音视频同步生成的问题。★ 453
FunCodecFunCodec 是一个面向研究的音频量化工具包,旨在为音频生成任务提供高效、灵活的神经编解码方案。它解决了音频信号在离散表示上的压缩与重建问题,使得文本到语音★ 449
awesome-audio-plaza这是一个每日更新的音频方向前沿论文精选列表,聚焦音乐生成、零样本语音合成、语音识别和通用音频生成等热门子领域。项目以GitHub仓库形式维护,通过持续追踪arX★ 410
JavisDiTJavisDiT 是一个面向音频-视频联合生成的扩散 Transformer 模型系列,由 ICLR 2026 论文官方实现。它解决的是传统视频生成中音频与画面★ 383
Dia-TTS-ServerDia-TTS-Server 是一个自托管的 Dia TTS 模型推理服务器,旨在解决高质量对话式语音合成部署复杂的问题。它基于 Python 和 FastAP★ 355
modular-diffusionmodular-diffusion 是一个基于 PyTorch 的模块化扩散模型设计与训练库。它旨在解决扩散模型研究中的代码复用和灵活定制问题,提供高度解耦的组★ 291
Kitten-TTS-ServerKitten-TTS-Server 是一个自托管的轻量级文本转语音(TTS)API 服务器,基于 Kitten TTS 模型构建,提供直观的 Web 界面和 G★ 279
ComfyUI-fal-APIComfyUI-fal-API 是一个将 fal.ai 平台 1400+ 生成式 AI 模型接入 ComfyUI 的官方自定义节点插件。它解决了 ComfyUI★ 220
Catch-A-WaveformCatch-A-Waveform 是 NeurIPS 2021 论文的官方 PyTorch 实现,旨在解决从单个极短音频样本(如几秒钟)中学习并生成新音频的问题★ 190
easyttsEasyTTS 是一个致力于简化 TTS(文本转语音)前端流程的开源项目,主要面向有声小说制作场景。它通过正则规则对小说文本进行智能分句,并利用 RoBERTa★ 149
Minimalistic-Comfy-Wrapper-WebUIMCWW(Minimalistic-Comfy-Wrapper-WebUI)是一个基于 Gradio 的 ComfyUI 附加界面,专注于推理场景,不依赖节点图★ 141
Qwen3-TTS-EasyFinetuningQwen3-TTS-EasyFinetuning 是一个面向 Qwen3-TTS 模型的简易微调工具,旨在让开发者快速实现声音克隆和多语言高质量语音合成。它解决★ 125
word2waveWord2Wave 是一个从文本提示生成短音频样本的开源框架,基于 WaveGAN 和 COALA 模型。它解决了文本到音频生成中数据稀缺和生成质量不高的问题,★ 119
AceForgeAceForge 是一款面向 Apple/OSX 平台的本地优先 AI 音乐工作站,基于 Ace-Step、DeMucs 和 XTTSv2 构建。它解决的是音乐★ 93
OmniVAEOmniVAE 是一个面向音视频联合生成的统一变分自编码器(VAE),旨在解决音频与视频模态在生成任务中难以对齐和协同建模的问题。它通过引入跨模态对齐机制,将音★ 90
DualCodecDualCodec 是一个面向语音和音频生成的低帧率神经音频编解码器,发表于 Interspeech 2025。它主要解决传统音频编解码器在生成式 AI 场景中★ 73
mcpRunAPI MCP server 是一个基于 Model Context Protocol 的官方服务器,用于连接 RunAPI AI 平台。它主要解决开发者★ 56
NeuralTextToAudioNeuralTextToAudio 是一个基于文本提示生成合成音频的开源项目,旨在通过自然语言描述来控制音频生成过程,解决传统音频制作依赖专业设备和手工编辑、门★ 53
awesome-agent-apis这是一个精选的AI代理API与工具目录,聚合了660多个由muapi托管的生成式媒体模型,以及社区提交的第三方API工具,覆盖SEO、数据丰富、社交媒体、网络爬★ 7
muapi-climuapi-cli 是 muapi.ai 的官方命令行工具,让你在终端里直接生成图片、视频和音频。它解决了 AI 创作需要频繁切换网页或编写复杂代码的痛点,将多★ 6