audio-webui

一个网页搞定多种音频AI,不用写代码就能玩转音乐生成和语音合成

audio-webui 是一个面向音频相关神经网络的统一 Web 界面,旨在解决音频 AI 工具分散、使用门槛高的问题。它集成了多种主流音频生成与处理模型,如 AudioCraft、AudioLDM、Bark(文本转语音)、RVC(歌声转换)等,用户无需编写代码,通过浏览器即可完成模型加载、参数配置、任务执行和结果预览。项目基于 Python 构建,采用 all-in-one 设计,支持文本生成音乐、语音合成、声音克隆、音频风格迁移等核心能力,并提供直观的图形化操作界面。对于音频创作者、研究人员和爱好者,它降低了使用先进音频 AI 模型的技术门槛,提升了实验和创作效率。项目仍处于成长阶段,社区活跃度中等,适合对生成式音频感兴趣的开发者快速上手和二次开发。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1244
维护状态 低维护
是否开源
定价模式 free

项目数据

分类音频音乐
开发团队gitmylo
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型ai,aio,all-in-one,artificial-intelligence,audiocraft,audioldm,bark,bark-gui,generative-audio,generative-music,music,rvc,rvc-gui,text-to-audio,text-to-speech,tts,voice-cloning
GitHub 星标★ 1244
30天Star增速
HF 下载量
上线时间2023-05-05 00:00:00
最近更新2026-09-14 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:入门 约 15 分钟 部署方式:本地安装 7 步

环境要求

  • Python 3.10(低于 3.10 不支持 "|" 类型注解,3.11 目前不支持 TTS 库)
  • 已安装 Git(可在终端执行 git --version 验证)
  • 部分功能需要安装 ffmpeg
  • Windows 系统需要安装 Visual Studio C++ 生成工具

安装与启动步骤

  1. 1检查 Git

    打开终端/命令行,输入命令确认 Git 是否可用;若提示找不到命令,请先到 git-scm.com 下载安装。

    git --version
  2. 2确认 Python 版本

    本项目只在 Python 3.10 上可用,版本过低或 3.11 都可能报错,请先确认当前解释器版本。

    python --version
  3. 3安装 ffmpeg

    部分音频功能依赖 ffmpeg,README 指向 ffmpeg.org,按系统方式安装并确保加入 PATH。

  4. 4安装 C++ 生成工具

    仅 Windows 需要:安装 Visual Studio C++ build tools,否则部分依赖编译会失败。

  5. 5获取项目代码

    README 的 Downloading 章节未在节选中给出,按官方仓库地址克隆到本地目录后进入项目文件夹。

    git clone https://github.com/gitmylo/audio-webui.git
    cd audio-webui
  6. 6运行安装脚本

    Windows 双击或执行 run.bat,Linux/MacOS 执行 run.sh;脚本会自动在 venv 中安装全部依赖。

    run.bat
  7. 7启动 WebUI

    安装完成后再次运行同一个脚本即可启动;Linux/MacOS 使用 run.sh,启动后按终端提示的地址访问。

    bash run.sh

如何确认成功

运行 run.bat 或 run.sh 后终端无报错、依赖自动装完并出现 Web 服务访问地址,浏览器打开该地址看到界面即成功。

常见问题

Q:可以用 Python 3.11 或更低版本吗?

A:不建议。README 明确说明代码在 Python 3.10 上运行,低于 3.10 不支持 "|" 类型注解,3.11 目前对 TTS 库缺乏支持。

Q:提示找不到 git 命令怎么办?

A:说明未安装 Git,去 git-scm.com/downloads 下载安装后,重新在终端执行 git --version 确认可用。

Q:Windows 安装依赖时编译失败?

A:需要预先安装 Visual Studio C++ build tools,装好后重新运行 run.bat 让脚本重新安装依赖。

Q:某些功能运行报错缺少组件?

A:部分功能依赖 ffmpeg,请先安装 ffmpeg;其他常见问题可查看仓库 readme/common_issues.md 或提交 issue。

Q:能用 Docker 部署吗?

A:README 仅给出社区 Docker 仓库(LajaSoft/audio-webui-docker、jacen92/audio-webui-docker),不由作者维护,相关问题需到对应仓库反馈。

注意事项

  • 运行脚本会自动创建 venv 并安装依赖,首次运行耗时较长,请保持网络畅通。
  • Docker 相关仓库为社区维护,非官方支持。
  • README 节选中未包含 Downloading 章节内容,克隆地址按官方仓库地址给出,如与文档不同以官方说明为准。
  • 遇到问题可先查阅 Common issues 页面,再在项目仓库提交 issue。

核心亮点

  • 集成 AudioCraft、Bark、RVC 等多个主流模型,免去独立部署的繁琐
  • 纯 Web 操作,无需编程基础,降低音频 AI 使用门槛
  • 支持文本生成音乐、语音克隆、声音转换等多样化任务,功能全面

不足之处

  • 模型加载和推理对硬件要求较高,普通电脑可能运行缓慢
  • 文档/社区待观察

适用场景

  • 音乐创作者快速生成背景音乐或音效
  • 播客或视频制作者用 Bark 生成语音旁白
  • 声音爱好者用 RVC 进行歌声转换或声音克隆实验

替代项目

Audiocraft WebUI、Bark WebUI、RVC WebUI

项目介绍

audio-webui 是音频音乐领域的开源项目,由 gitmylo 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,244)位列前 30%,在音频音乐分类的 738 个项目里位列前 14%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-14。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:音乐创作者快速生成背景音乐或音效。同类可对比的替代方案包括 Audiocraft WebUI、Bark WebUI、RVC WebUI。

上一篇:WavTokenizer

下一篇:XZVoice

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 245 2026-08-09