MockingBird

5 秒复刻一个声音,你说什么它就能说什么

只需 5 秒即可克隆一个声音,实现任意文本的实时语音合成。项目基于 PyTorch,提供训练与推理全流程支持,声音相似度高、合成速度快,非常适合语音克隆研究与实时语音交互应用的二次开发。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 36904
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队babysor
所属国家
官网地址
定价模式free
价格说明开源项目,本地部署,完全免费。
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型ai,deep-learning,pytorch,speech,text-to-speech,tts
GitHub 星标★ 36904
30天Star增速
HF 下载量
上线时间2021-08-07 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 7 步

环境要求

  • Python 3.7 或更高版本(遇到 torch 安装失败建议改用 Python 3.9)
  • 已安装 PyTorch(推荐 Repo Tag 0.0.1 搭配 Pytorch 1.9.0、Torchvision 0.10.0、cudatoolkit 10
  • 已安装 ffmpeg
  • Git(用于克隆仓库)
  • 可选:conda 或 mamba 用于创建虚拟环境

安装与启动步骤

  1. 1克隆项目仓库

    把 MockingBird 源码下载到本地,之后所有命令都在该目录下执行。

    git clone https://github.com/babysor/MockingBird.git
    cd MockingBird
  2. 2安装 PyTorch

    按 PyTorch 官网指引安装。若报找不到 torch==1.9.0+cu102,通常是 Python 版本过低,换成 3.9 即可。

  3. 3安装 ffmpeg

    从 ffmpeg 官方下载页按操作系统选择安装包,音频处理依赖它。

  4. 4安装其余依赖

    安装 requirements.txt 中剩余的必要 Python 包,建议在虚拟环境中执行。

    pip install -r requirements.txt
  5. 5安装 webrtcvad

    如需语音活动检测功能,单独安装 webrtcvad-wheels。

    pip install webrtcvad-wheels
  6. 6改用 conda 建环境

    这是上面安装方式的替代方案,env.yml 只含运行所需依赖,暂不含 monotonic-align。

    conda env create -n env_name -f env.yml
    conda activate env_name
  7. 7运行工具箱

    启动 demo_toolbox.py 进行推理,M1 Mac 需用 x86 架构的 pythonM1 来执行。

    python demo_toolbox.py

如何确认成功

执行 python demo_toolbox.py 能正常打开 Toolbox 图形界面并完成一次推理,即表示环境就绪。

常见问题

Q:安装时提示找不到 torch==1.9.0+cu102 版本怎么办?

A:一般是因为 Python 版本太低,可尝试把 Python 换成 3.9,即可顺利安装。

Q:加载 Tacotron 时出现 size mismatch for encoder.embedding.weight 报

A:这是权重形状不匹配导致的,作者已在 issue #37 中给出处理办法,请参考该 issue。

Q:M1 Mac 上 PyQt5 装不上或跑不起来?

A:可在 Rosetta 终端中用系统 Python 建虚拟环境安装 pyqt5,或放弃 demo_toolbox.py 改用项目里的 web.py。

Q:requirements.txt 安装后运行异常?

A:该文件导出于较早时间,与新版依赖不兼容,建议使用 Repo Tag 0.0.1 与文档推荐的 PyTorch/环境组合。

注意事项

  • 作者已不再积极更新本仓库,README 中另有云端托管版本链接可供参考。
  • README 推荐环境为 Repo Tag 0.0.1 + Pytorch1.9.0 + Torchvision0.10.0 + cudatoolkit10.2 + requirements.txt + webrtcvad-wheels。
  • env.yml 只包含运行项目所需依赖,暂时不含 monotonic-align,GPU 版 PyTorch 需按官网另行安装。
  • M1 Mac 上使用 demo_toolbox.py 需通过 Rosetta 终端按 x86 架构安装 PyQt5、pyworld、ctc-segmentation 等依赖。

核心亮点

  • 5秒极速克隆任意人声,实时生成语音,技术门槛低
  • 基于PyTorch的深度学习方案,支持多种预训练模型,生态成熟
  • 36.9k星标验证社区活跃度,中文语音克隆领域标杆项目

不足之处

  • 声音克隆存在伦理滥用风险,项目对深度伪造防范机制不足
  • 实时推理对硬件要求较高,CPU环境下延迟明显

适用场景

  • 个性化语音助手定制,如智能家居、车载语音
  • 有声书/播客内容生成,快速制作多角色配音
  • 游戏或影视角色配音预演,降低制作成本

替代项目

Coqui TTS、Real-Time-Voice-Cloning、so-vits-svc

项目介绍

MockingBird 是音频音乐领域的开源项目,由 babysor 开发,2021 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(36,904)位列前 1%,在音频音乐分类的 738 个项目里位列前 1%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。本地部署,完全免费。

它主要面向的使用场景是:个性化语音助手定制,如智能家居、车载语音。同类可对比的替代方案包括 Coqui TTS、Real-Time-Voice-Cloning、so-vits-svc。

上一篇:OpenVoice

下一篇:VoxCPM

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09