metavoice-src

几秒样本克隆音色,生成有情感的真人级语音

MetaVoice 是一个基于深度学习的情感语音合成基础模型,专注于生成高度自然、富有表现力的语音。它解决了传统 TTS 系统声音机械、缺乏情感和个性化的问题,支持零样本语音克隆,即只需几秒参考音频即可模仿音色。核心能力包括:情感控制(如喜悦、悲伤)、跨语言合成(支持英语等)、长文本处理、实时推理优化。项目基于 PyTorch 构建,提供预训练模型和推理脚本,适合开发者集成到语音助手、有声书、游戏角色配音等场景。其技术亮点在于细粒度韵律建模和说话人编码,能捕捉语速、停顿、重音等细微变化,实现类人表达。

开源 unknown 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4207
维护状态 低维护
是否开源 是
定价模式 unknown

项目数据

分类音频音乐
开发团队metavoiceio
所属国家
定价模式unknown
价格说明官网存在但定价信息不明确,需进一步确认。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型ai,deep-learning,pytorch,speech,speech-synthesis,text-to-speech,tts,voice-clone,zero-shot-tts
GitHub 星标★ 4207
30天Star增速
HF 下载量
上线时间2024-02-06 00:00:00
最近更新2026-09-15 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:进阶 约 30 分钟 部署方式:Docker 8 步

环境要求

  • GPU 显存 >= 12GB
  • Python >= 3.10 且 < 3.12
  • 已安装 pipx(用于安装 poetry,pipx 官方有安装说明)
  • Linux 环境(README 的 ffmpeg 安装脚本为静态二进制方式)
  • 已安装 Docker 与 docker-compose(走 Quickstart 容器方式时需要)

安装与启动步骤

  1. 1安装 ffmpeg

    下载 ffmpeg 静态包并校验 md5,解压后把 ffprobe 和 ffmpeg 移到 /usr/local/bin,最后清理压缩包。

    wget https://johnvansickle.com/ffmpeg/builds/ffmpeg-git-amd64-static.tar.xz
    wget https://johnvansickle.com/ffmpeg/builds/ffmpeg-git-amd64-static.tar.xz.md5
    md5sum -c ffmpeg-git-amd64-static.tar.xz.md5
    tar xvf ffmpeg-git-amd64-static.tar.xz
    sudo mv ffmpeg-git-*-static/ffprobe ffmpeg-git-*-static/ffmpeg /usr/local/bin/
    rm -rf ffmpeg-git-*
  2. 2安装 Rust

    项目依赖 Rust 工具链,若未安装则执行;安装完成后需要重启终端让环境变量生效。

    curl --proto '=https' --tlsv1.2 -sSf https://sh.rustup.rs | sh
  3. 3安装 poetry

    用 pipx 安装 poetry;安装后同样需要重启终端。README 推荐使用 poetry 管理依赖。

    pipx install poetry
  4. 4设置 keyring 后端

    在 Linux 上 poetry install 可能卡在 keyring 后端,先导出该环境变量可避免卡住。

    export PYTHON_KEYRING_BACKEND=keyring.backends.fail.Keyring
  5. 5安装项目依赖

    在项目根目录用 poetry 安装依赖;如需 W&B 观测集成,改用带 observable 扩展的命令。

    poetry install
    poetry install -E observable
  6. 6启动 Web UI

    用 docker-compose 后台启动 UI 容器,随后可查看容器状态与实时日志。

    docker-compose up -d ui && docker-compose ps && docker-compose logs -f
  7. 7启动 API 服务端

    启动 server 容器,README 提示访问 /docs 查看 API 定义文档。

    docker-compose up -d server && docker-compose ps && docker-compose logs -f
  8. 8本地推理调用

    在交互式 Python 会话中调用参考实现 fast_inference.py 的 synthesise,传入文本与参考音频路径。

    tts.synthesise(text="This is a demo of text to speech by MetaVoice-1B, an open-source foundational audio model.", spk_ref_path="assets/bria.mp3")

关键配置

配置项必填说明示例
wandb_log否是否启用可选的 W&B 日志集成True
PYTHON_KEYRING_BACKEND否Linux 下避免 poetry install 因 keyring 卡住keyring.backends.fail.Keyring

如何确认成功

docker-compose ps 显示容器为 Up,访问 Web UI 或 /docs 查看 API;本地 synthesise() 首次启动需 30-90 秒编译。

常见问题

Q:显存不够 12GB 能跑吗?

A:README 明确要求 GPU VRAM >= 12GB,未提供更低显存的运行方案,低于该配置无法保证可用。

Q:为什么第一次合成要等很久?

A:脚本需要 30-90 秒启动(取决于硬件),因为要对模型做 torch.compile 以获得快速推理,编译完成后即可加速。

Q:推理速度能超过实时吗?

A:在 Ampere、Ada-Lovelace、Hopper 架构 GPU 上,编译完成后 synthesise() 的实时因子 RTF < 1.0,快于实时。

Q:poetry install 一直卡住怎么办?

A:在 Linux 上先执行 export PYTHON_KEYRING_BACKEND=keyring.backends.fail.Keyring,可避免 keyring 后端导致的挂起。

Q:可以商用吗?

A:MetaVoice-1B 以 Apache 2.0 许可发布,README 说明可无限制使用。

注意事项

  • Python 版本必须满足 >=3.10 且 <3.12。
  • 安装 Rust 与 poetry 后需重启终端使其生效。
  • 零样本克隆需约 30 秒参考音频,美式与英式口音效果较好;微调克隆 README 提到印度说话人最少 1 分钟数据。
  • 可通过编辑 fam/llm/config/finetune_params.py 调整学习率、冻结层等微调超参。

核心亮点

  • 零样本语音克隆,仅需数秒参考音频即可模仿音色
  • 支持情感控制,可生成喜悦、悲伤等不同情绪语音
  • 基于 PyTorch,提供预训练模型和易用推理接口

不足之处

  • 文档/社区待观察
  • 跨语言支持有限,主要聚焦英语

适用场景

  • 有声书和播客的个性化配音
  • 游戏角色或虚拟偶像的语音生成
  • 语音助手的情感化交互

替代项目

Coqui TTS、XTTS、Bark

项目介绍

metavoice-src 是音频音乐领域的开源项目,由 metavoiceio 开发,2024 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(4,207)位列前 10%,在音频音乐分类的 738 个项目里位列前 6%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-15。官网存在但定价信息不明确,需进一步确认。从国内网络环境看,当前已无法正常访问。

它主要面向的使用场景是:有声书和播客的个性化配音。同类可对比的替代方案包括 Coqui TTS、XTTS、Bark。

上一篇:TTS

下一篇:TensorFlowTTS

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09