Neural-Voice-Cloning-with-Few-Samples

用几句话克隆你的声音,快速生成个性化语音

这是一个基于百度研究论文《Neural Voice Cloning with Few Samples》的Python实现,旨在用少量样本(甚至一句话)克隆目标说话人的声音。项目解决了传统语音合成需要大量高质量录音数据的问题,通过预训练多说话人模型和微调适配,实现少样本下的声音克隆。核心能力包括:支持从少量音频中提取说话人特征并生成对应音色的语音;提供训练和推理脚本,可自定义数据集;基于Tacotron等经典语音合成架构。项目结构清晰,适合研究者和开发者学习少样本语音克隆的原理与实现,但代码相对早期,依赖较旧。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 254
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队Sharad24
所属国家
官网地址
定价模式free
价格说明开源项目,可自行部署使用,完全免费。
访问状态
是否开源是
开源协议
主要语言Python
技术栈/模型encodings,mel-spectrogram,speaker-embeddings,speaker-encodings,speech,speech-processing,speech-synthesis,voice-cloning
GitHub 星标★ 254
30天Star增速
HF 下载量
上线时间2018-03-30 00:00:00
最近更新2026-08-18 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

核心亮点

  • 忠实复现百度少样本语音克隆论文,学术参考价值高
  • 代码结构清晰,便于学习少样本语音克隆的核心流程
  • 支持自定义数据集,可训练自己的声音克隆模型

不足之处

  • 依赖较旧的TensorFlow版本,环境配置可能困难
  • 文档和注释较少,上手门槛较高
  • 模型效果受限于基础架构,音质可能不如现代方案

适用场景

  • 学术研究:复现论文实验,理解少样本语音克隆原理
  • 个性化语音合成:用少量录音生成个人专属语音助手
  • 教育演示:展示AI语音克隆技术的基本流程

替代项目

Real-Time-Voice-Cloning、Coqui TTS、Tacotron2

项目介绍

Neural-Voice-Cloning-with-Few-Samples 是音频音乐领域的开源项目,由 Sharad24 开发,2018 年首次发布。

它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 254。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-18。可自行部署使用,完全免费。

它主要面向的使用场景是:学术研究:复现论文实验,理解少样本语音克隆原理。同类可对比的替代方案包括 Real-Time-Voice-Cloning、Coqui TTS、Tacotron2。

上一篇:CycleGAN-VC3

下一篇:Voice-synthesis

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09