Amphion

一站式音频生成工具箱,快速上手语音、音乐与歌声合成

Amphion 是一个面向音频、音乐和语音生成的开源工具包,旨在支持可复现研究,并帮助初级研究者和工程师快速入门。它集成了多种主流模型与算法,涵盖文本到语音(TTS)、歌声合成、音乐生成、音频修复和音效转换等任务。核心能力包括统一的模型训练与推理框架、预训练模型库、数据预处理工具以及客观评估指标。项目基于 Python 实现,模块化设计便于扩展,支持 FastSpeech2、NaturalSpeech2、MaskGCT、AudioLDM 等前沿模型。通过提供标准化流程和示例代码,Amphion 降低了音频生成领域的研究门槛,促进了学术成果的复现与对比。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 10303
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队open-mmlab
所属国家
定价模式free
价格说明开源工具包,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型audio-generation,audio-synthesis,audioldm,audit,emilia,fastspeech2,maskgct,music-generation,naturalspeech2,singing-voice-conversion,speech-synthesis,text-to-audio,text-to-speech,vall-e,vits,vocoder,voice-conversion
GitHub 星标★ 10303
30天Star增速
HF 下载量
上线时间2023-11-15 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:进阶 约 20 分钟 部署方式:本地安装 7 步

环境要求

  • Python 3.9.15(conda 创建环境时指定该版本)
  • Conda(用于创建名为 amphion 的虚拟环境)
  • Git(用于克隆代码仓库)
  • Docker 方式还需:Docker、NVIDIA Driver、NVIDIA Container Toolkit、CUDA

安装与启动步骤

  1. 1克隆仓库

    从 GitHub 拉取 Amphion 源码,并进入项目根目录,后续所有操作都在该目录内进行。

    git clone https://github.com/open-mmlab/Amphion.git
    cd Amphion
  2. 2创建 conda 环境

    按 README 指定版本创建名为 amphion 的 Python 3.9.15 虚拟环境,避免污染系统环境。

    conda create --name amphion python=3.9.15
  3. 3激活环境

    切换到刚创建的 amphion 环境,之后的依赖安装与运行都必须在该环境下进行。

    conda activate amphion
  4. 4安装依赖

    在项目根目录执行 env.sh 脚本,一键安装 Amphion 所需的全部 Python 依赖包。

    sh env.sh
  5. 5拉取 Docker 镜像

    Docker 方式的可选步骤,直接拉取官方镜像 realamphion/amphion,无需自行配置环境。

    docker pull realamphion/amphion
  6. 6启动 Docker 容器

    以 GPU 方式启动容器,并把当前目录挂载到容器 /app;使用 Docker 时必须挂载数据集目录。

    docker run --runtime=nvidia --gpus all -it -v .:/app realamphion/amphion
  7. 7查看任务说明

    按需查阅 TTS、VC、AC、SVC、TTA、Vocoder、评估、可视化等任务的 README 了解具体用法。

如何确认成功

README 未给出统一验证命令;确认 conda 环境 amphion 已激活、sh env.sh 执行无报错,或 Docker 容器能正常进入即算成功。

常见问题

Q:Setup Installer 和 Docker 镜像该选哪个?

A:两种方式任选其一即可。本地无 GPU 或想手动管理依赖选 Setup Installer;已有 NVIDIA 驱动和 CUDA 环境,想省去配依赖可选 Docker 镜像。

Q:用 Docker 时必须挂载数据集吗?

A:是。README 明确指出使用 Docker 时通过 -v 参数挂载数据集目录是必要的,否则容器内无法访问数据。具体可参考 egs/datasets/docker.md。

Q:装好后怎么跑具体任务?

A:README 只给出总览,各任务用法分散在子文档中:TTS 见 egs/tts/README.md,SVC 见 egs/svc/README.md,TTA 见 egs/tta/README.md,评估见 egs/metrics/README.md。

Q:支持哪些模型和任务?

A:覆盖文本到语音、语音转换、口音转换、歌声转换、文本到音频、声码器与客观评估,集成了 FastSpeech2、NaturalSpeech2、MaskGCT、AudioLDM 等模型。

Q:没有 GPU 能安装吗?

A:README 的 Docker 路线明确要求 NVIDIA Driver、NVIDIA Container Toolkit 和 CUDA,即需要 NVIDIA GPU 环境;纯 CPU 使用情况 README 未作说明。

注意事项

  • 项目采用 MIT 开源协议,可自由使用与修改。
  • conda 环境名固定为 amphion,激活后务必确认命令行前缀已切换。
  • Docker 启动命令中的 -v .:/app 会把当前目录挂载进容器,请确保在 Amphion 根目录执行。
  • README 未提供端口、密钥等配置项,本教程未涉及相关配置。

核心亮点

  • 整合多种主流音频生成模型,覆盖 TTS、歌声、音乐等任务,开箱即用
  • 提供统一训练与推理接口,支持可复现研究,降低入门门槛
  • 包含数据预处理、特征提取和评估指标,形成完整工具链

不足之处

  • 文档与社区支持相对有限,新手可能需依赖源码自行探索
  • 部分模型依赖特定硬件(如 GPU)和大量数据,实际部署成本较高

适用场景

  • 学术研究:复现基线模型或对比不同音频生成算法
  • 教育学习:快速理解 TTS、歌声合成等核心技术实现
  • 产品原型:基于预训练模型快速构建音频生成应用

替代项目

Coqui TTS、ESPnet、DiffSinger

项目介绍

Amphion 是音频音乐领域的开源项目,由 open-mmlab 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(10,303)位列前 5%,在音频音乐分类的 738 个项目里位列前 3%。

近 41 天,它的 GitHub 星标从 10,228 增加到 10,303,净增 75。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:学术研究:复现基线模型或对比不同音频生成算法。同类可对比的替代方案包括 Coqui TTS、ESPnet、DiffSinger。

上一篇:edge-tts

下一篇:TTS

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09