GPA

一个模型搞定语音识别、合成和转换,轻量高效

GPA(General Purpose Audio)是一个基于Transformer的通用音频模型,由AutoArk团队开发,旨在用单一小型模型同时实现自动语音识别(ASR)、文本转语音(TTS)和语音转换(VC)三大核心任务。它解决了传统音频处理中需要为不同任务分别训练多个模型、导致资源占用大和部署复杂的问题。GPA的核心能力在于其统一的模型架构,能够在一个紧凑的模型中高效处理多种音频任务,支持多语言和多种语音场景。项目基于Python实现,技术栈涵盖ASR、TTS、VC和Transformer,适合在资源受限的环境下部署,如边缘设备或实时应用。目前项目处于成长阶段,GitHub星标超过2200,社区活跃度较高,提供了预训练模型和推理示例,便于开发者快速集成和二次开发。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3106
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队AutoArk
所属国家
定价模式free
价格说明开源项目,Apache-2.0 许可证,可免费使用和部署,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型asr,automatic-speech-recognition,text-to-speech,transformer,tts,vc,voice-conversion
GitHub 星标★ 3106
30天Star增速
HF 下载量
上线时间2025-12-16 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:进阶 约 10 分钟 部署方式:本地安装 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(项目基于 Python 实现)
  • Git(用于克隆 GitHub 仓库)
  • 确定运行形态:ONNX CLI 工具 / FastAPI 服务 / 浏览器 UI
  • 如需 FP16、FP32 解码器,需额外的算力余量

安装与启动步骤

  1. 1克隆仓库

    把 GPA 官方仓库拉到本地,后续所有运行方式都从仓库内的子目录文档开始。

    git clone https://github.com/AutoArk/GPA
    cd GPA
  2. 2选择版本目录

    按需求进入 GPA_1.5(统一 ASR/TTS,接近 SOTA)或 GPA_TTS(轻量边缘 TTS)目录。

    ls GPA_1.5 GPA_TTS
  3. 3阅读子目录说明

    安装与运行命令以各子目录 README 为准,先通读再动手,避免环境装错版本。

    cat GPA_1.5/README.md
    cat GPA_1.5/onnx_runtime/README.md
    cat GPA_TTS/README.md
  4. 4获取运行时资源

    从 Hugging Face 下载 GPA-v1.5 ONNX 运行时资源包,得到模型与运行时文件。

  5. 5选定运行方式

    ONNX 版本支持三种入口:ONNX CLI 工具、FastAPI 服务或浏览器 UI,按 ONNX 运行指南启动。

如何确认成功

按 GPA_1.5/onnx_runtime/README.md 中对应入口(CLI、FastAPI 或浏览器 UI)的说明确认服务或界面可用。

常见问题

Q:应该从哪个版本开始?

A:推荐 GPA-v1.5,用单一统一模型同时提供接近 SOTA 的 ASR 与 TTS 性能,详见 GPA_1.5/README.md。

Q:只想在边缘设备上做 TTS 怎么办?

A:使用独立的 GPA_TTS 轻量运行时,含 INT8/INT4 量化并支持声音克隆,是体积最小的开源 TTS 运行时之一。

Q:不想配复杂环境有别的选择吗?

A:可以用 GPA-v1.5 ONNX Runtime,通过 ONNX CLI 工具、FastAPI 服务或浏览器 UI 运行 ASR/TTS。

Q:合成音质不够好怎么提升?

A:GPA_TTS 除 INT8 外还提供 FP16/FP32 的 SparkDetokenizer 解码器,可在 CLI、API 或 Web UI 中运行时选择。

注意事项

  • 本次 README 节选只有公告信息,未给出具体安装命令,实际步骤请以仓库内 GPA_1.5、GPA_TTS 等子目录文档为准。
  • ONNX 运行时资源包来自 Hugging Face 仓库 AutoArk-AI/GPA-v1.5-onnx-runtime,需自行下载而非随代码仓库提供。
  • GPA-v1.0 的快速开始、部署、基准与评测文档已迁移,旧链接可能失效。

核心亮点

  • 单一模型覆盖ASR、TTS、VC三大任务,大幅降低部署和维护成本
  • 模型体积小,适合边缘设备和实时推理场景
  • 基于Transformer架构,支持多语言,泛化能力较强

不足之处

  • 文档/社区待观察
  • 模型在复杂噪声环境下的鲁棒性尚未充分验证

适用场景

  • 智能语音助手(如家居设备、车载系统)
  • 实时语音翻译和跨语言沟通工具
  • 内容创作中的语音合成与角色声音转换

替代项目

Whisper、Coqui TTS、RVC

项目介绍

GPA 是音频音乐领域的开源项目,由 AutoArk 开发,2025 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(3,106)位列前 30%,在音频音乐分类的 738 个项目里位列前 7%。

近 42 天,它的 GitHub 星标从 2,283 增加到 3,106,净增 823。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。Apache-2.0 许可证,可免费使用和部署,无付费版本。

它主要面向的使用场景是:智能语音助手(如家居设备、车载系统)。同类可对比的替代方案包括 Whisper、Coqui TTS、RVC。

上一篇:IMS-Toucan

下一篇:WaveRNN

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09