GLM-TTS

几秒克隆音色,还能带情绪说话,让TTS更自然

GLM-TTS 是一个基于多奖励强化学习的零样本语音合成(TTS)项目,由智谱AI推出。它解决的核心问题是传统TTS在语音克隆和情感表达上的不足,能够仅凭几秒参考音频就克隆音色,并生成带有丰富情感(如开心、悲伤、愤怒等)的语音。项目采用多奖励强化学习框架,联合优化语音的自然度、相似度和情感表现力,同时支持对语速、停顿等细节的控制。核心能力包括零样本语音克隆、情感可控合成、细粒度韵律调整,以及通过边缘计算优化实现低延迟推理。该模型在多个公开数据集上达到领先水平,适合用于有声内容创作、虚拟助手、游戏配音等场景。

开源 unknown 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1067
维护状态 低维护
是否开源
定价模式 unknown

项目数据

分类音频音乐
开发团队zai-org
所属国家
官网地址https://audio.z.ai
定价模式unknown
价格说明官网为audio.z.ai,提供在线体验,但定价信息未明确,需进一步确认。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型edge-computing,llm,tts
GitHub 星标★ 1067
30天Star增速
HF 下载量
上线时间2025-12-06 00:00:00
最近更新2026-09-21 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 5 步

环境要求

  • Python 3.10 - 3.12(README 明确要求)
  • 可访问 GitHub,用于克隆可选依赖仓库
  • 可访问 HuggingFace 或 ModelScope 获取模型权重

安装与启动步骤

  1. 1获取项目代码

    从 GitHub 克隆 GLM-TTS 仓库到本地,README 未直接给出该命令,仓库地址见项目主页。

    git clone https://github.com/zai-org/GLM-TTS
  2. 2安装Python依赖

    确认 Python 版本在 3.10 至 3.12 之间,然后在项目根目录安装 requirements.txt 中的依赖。

    pip install -r requirements.txt
  3. 3装强化学习依赖

    可选的强化学习相关依赖,进入 grpo/modules 目录克隆 s3prl 和 LaughterSegmentation 两个仓库。

    cd grpo/modules
    git clone https://github.com/s3prl/s3prl
    git clone https://github.com/omine-me/LaughterSegmentation
  4. 4下载模型权重

    README 只给出了权重页面链接,未提供下载命令,需自行从 HuggingFace 或 ModelScope 获取权重。

  5. 5运行推理

    README 的 Quick Start 仅列出“Running Inference Demo”小节标题,未给出具体命令,也可先在官网在线体验。

如何确认成功

README 未提供启动验证方式,需以仓库 Quick Start 中 Running Inference Demo 章节的实际内容为准。

常见问题

Q:对 Python 版本有什么要求?

A:README 明确要求使用 Python 3.10 至 Python 3.12 之间的版本,其他版本未做说明。

Q:强化学习依赖是必须安装的吗?

A:不是。README 将 grpo/modules 下 s3prl 与 LaughterSegmentation 的克隆标注为 optional(可选)。

Q:模型权重从哪里获取?

A:README 给出两个渠道:HuggingFace 的 zai-org/GLM-TTS 和 ModelScope 的 ZhipuAI/GLM-TTS。

Q:不部署本地环境能体验吗?

A:可以,README 提供了官网 https://audio.z.ai 的 Audio.Z.AI 入口,可先在线试用。

注意事项

  • README 未给出推理脚本的具体运行命令,启动方式请以仓库 Running Inference Demo 章节的后续更新为准。
  • 模型权重不随代码仓库提供,需另外从 HuggingFace 或 ModelScope 下载。
  • README 提到 2D Vocos 声码器以及经强化学习优化的模型权重仍在开发中(Coming Soon),后续可能更新。
  • 首次安装建议使用独立的 Python 虚拟环境,避免与系统环境中的依赖冲突。

核心亮点

  • 多奖励强化学习联合优化,语音自然度和情感表现力显著优于传统方法
  • 零样本克隆仅需数秒参考音频,无需微调即可适配新说话人
  • 支持细粒度控制(语速、停顿、情感强度),创作灵活性高

不足之处

  • 模型体积和推理资源消耗较大,边缘部署仍需优化
  • 文档和社区生态尚不完善,上手门槛较高

适用场景

  • 有声书/播客自动配音,快速生成多角色情感语音
  • 虚拟助手/客服机器人,让回复更自然有温度
  • 游戏或影视角色配音,低成本制作多情感台词

替代项目

XTTS (Coqui)、Bark (Suno)、VALL-E (Microsoft)

项目介绍

GLM-TTS 是音频音乐领域的开源项目,由 zai-org 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,067)位列前 30%,在音频音乐分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-21。官网为audio.z.ai,提供在线体验,但定价信息未明确,需进一步确认。从国内网络环境看,可直接访问。

它主要面向的使用场景是:有声书/播客自动配音,快速生成多角色情感语音。同类可对比的替代方案包括 XTTS (Coqui)、Bark (Suno)、VALL-E (Microsoft)。

上一篇:1SHOT

下一篇:kokoro-tts

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 245 2026-08-09