Genie-TTS

把 GPT-SoVITS 模型转成 ONNX,部署快、跑得稳,声音克隆更轻松。

Genie-TTS 是一个专注于 GPT-SoVITS 模型的 ONNX 推理引擎与模型转换工具。它解决了 GPT-SoVITS 模型在部署和推理时依赖复杂 PyTorch 环境、性能受限的问题,通过将模型转换为 ONNX 格式,实现跨平台、高性能的语音合成与声音克隆。核心能力包括:一键将 GPT-SoVITS 的 GPT 和 SoVITS 模型转换为 ONNX 格式,提供轻量级推理接口,支持实时或近实时的语音克隆,并兼容多种音频输入输出。项目旨在简化 TTS 系统的生产部署,降低资源占用,适合边缘设备或服务端集成。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1782
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队High-Logic
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型gpt-sovits,text-to-speech,tts,vits,voice-clone,voice-cloning
GitHub 星标★ 1782
30天Star增速
HF 下载量
上线时间2025-08-25 00:00:00
最近更新2026-09-22 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • Python 版本 >= 3.10
  • 操作系统需支持音频播放(推理在 CPU 上运行)
  • 建议以管理员模式运行,避免性能下降
  • 首次运行需联网,程序会自动下载所需模型文件
  • 仅支持 GPT-SoVITS V2、V2ProPlus 模型

安装与启动步骤

  1. 1确认 Python 版本

    先检查本机 Python 是否为 3.10 或更高版本,版本过低需先升级 Python 环境。

  2. 2安装 genie-tts

    用 pip 从 PyPI 安装 genie-tts 包,安装完成后即可在 Python 中导入使用。

    pip install genie-tts
  3. 3以管理员模式运行

    Windows 下建议用管理员身份打开终端/编辑器再执行脚本,避免推理性能下降。

  4. 4加载预置角色

    首次运行会自动下载所需文件,需要联网并耐心等待下载完成。

    import genie
    
    genie.load_predefined_character('mika')
  5. 5运行语音合成

    character_name 必须与已加载的角色名一致,save_path 为输出音频路径,可自行修改。

    import genie
    
    genie.load_predefined_character('mika')
    
    genie.tts(
        character_name='mika',
        text='どうしようかな……やっぱりやりたいかも……!',
        play=True,
        save_path='output.wav',
    )
    
    genie.wait_for_playback_done()
    
    print(" Audio generation complete!")

关键配置

配置项必填说明示例
character_name是指定要合成的角色名,必须与已加载的角色一致mika
text是要合成的文本内容どうしようかな……やっぱりやりたいかも……!
play否是否直接播放合成出的音频True
save_path否合成音频的输出文件路径output.wav

如何确认成功

终端打印 “ Audio generation complete!”,并能听到合成语音、在指定路径看到输出音频文件,即为成功。

常见问题

Q:第一次运行很慢或像卡住了怎么办?

A:首次运行会自动下载所需模型文件,需保持网络畅通并耐心等待;下载完成后后续运行会快很多。

Q:支持哪些语言?

A:支持日语、英语、中文、韩语。

Q:支持哪些 GPT-SoVITS 模型版本?

A:支持 GPT-SoVITS V2 和 V2ProPlus,其他版本未在 README 中声明支持。

Q:合成没有声音或播放异常怎么办?

A:建议以管理员模式运行 GENIE,README 提示非管理员模式可能导致性能下降。

Q:怎么换成别的角色?

A:先用 genie.load_predefined_character 加载角色,再在 genie.tts 的 character_name 中填入相同名称。

注意事项

  • README 建议以管理员模式运行,避免性能下降。
  • 首次运行会自动下载所需文件,必须联网。
  • 推理在 CPU 上运行,官方称首次推理延迟约 1.13s。
  • README 未提供 git clone 源码部署与 ONNX 转换的具体命令,本教程仅覆盖 pip 安装与推理用法。

核心亮点

  • 模型转换一键化,降低 ONNX 部署门槛
  • 推理性能优化,适合生产环境
  • 支持声音克隆,保留原模型音色特征

不足之处

  • 依赖 GPT-SoVITS 生态,模型版本兼容性需关注
  • 文档/社区待观察

适用场景

  • 将 GPT-SoVITS 模型部署到服务器或边缘设备
  • 构建低延迟的语音克隆应用
  • 集成到现有 TTS 服务中,替换 PyTorch 推理

替代项目

GPT-SoVITS、VITS、Coqui TTS

项目介绍

Genie-TTS 是音频音乐领域的开源项目,由 High-Logic 开发,2025 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,782)位列前 30%,在音频音乐分类的 738 个项目里位列前 11%。

近 42 天,它的 GitHub 星标从 1,715 增加到 1,782,净增 67。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-22。MIT许可证,完全免费,无付费版本。

它主要面向的使用场景是:将GPT-SoVITS模型部署到服务器或边缘设备。同类可对比的替代方案包括 GPT-SoVITS、VITS、Coqui TTS。

上一篇:read-aloud

下一篇:ParallelWaveGAN

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09