EmotiVoice

打几个字就能让配音带情绪,开心难过随你指挥

网易有道开源的多音色、提示词可控 TTS 引擎,通过文本提示即可控制合成语音的情感与风格。支持多种情绪表达,中文合成效果出色,适合有声内容创作、短视频配音与情感化语音交互应用。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 8529
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队netease-youdao
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署,无在线服务。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型ai,deep-learning,emotion,emotivoice,multi-speaker,prompt,python,pytorch,speech,speech-synthesis,style,text-to-speech,tts
GitHub 星标★ 8529
30天Star增速
HF 下载量
上线时间2023-11-08 00:00:00
最近更新2026-09-22 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:入门 约 10 分钟 部署方式:Docker 6 步

环境要求

  • 一台带 NVIDIA GPU 的机器(Docker 方式必需)
  • 已安装 Docker 并配置好 NVIDIA Container Toolkit(Linux 或 Windows WSL2)
  • 本地完整安装需要 Conda,Python 版本 3.8
  • 本地安装需自备 PyTorch、torchaudio 运行环境

安装与启动步骤

  1. 1拉取Docker镜像

    README 推荐的最简体验方式,先把官方镜像拉到本地,镜像较大会有一定下载时间。

    docker pull syq163/emoti-voice:latest
  2. 2启动容器

    映射 8501(Web 界面)和 8000(OpenAI 兼容 TTS API)端口,后台常驻运行。

    docker run -dp 127.0.0.1:8501:8501 -p 127.0.0.1:8000:8000 syq163/emoti-voice:latest
  3. 3打开Web界面

    在浏览器访问本地 8501 端口,即可使用多音色与情感可控的合成能力。

  4. 4本地创建conda环境

    不使用 Docker 时走完整安装,先建一个 Python 3.8 的独立环境并激活。

    conda create -n EmotiVoice python=3.8 -y
    conda activate EmotiVoice
  5. 5安装Python依赖

    先装 PyTorch 与 torchaudio,再安装推理所需的其余依赖包。

    pip install torch torchaudio
    pip install numpy numba scipy transformers soundfile yacs g2p_en jieba pypinyin pypinyin_dict
  6. 6下载NLTK数据

    下载英文词性标注数据包,缺少它时英文文本处理会报错。

    python -m nltk.downloader "averaged_perceptron_tagger_eng"

关键配置

配置项必填说明示例
8501否Web UI 端口,浏览器通过它访问交互界面127.0.0.1:8501:8501
8000否OpenAI 兼容 TTS API 的访问端口127.0.0.1:8000:8000

如何确认成功

浏览器打开 http://localhost:8501 能看到 EmotiVoice 界面;OpenAI 兼容 TTS API 可通过 http://localhost:8000/ 访问。

常见问题

Q:没有 NVIDIA GPU 能用吗?

A:README 说明 Docker 方式需要带 NVIDIA GPU 的机器。若无 GPU,可参考 Full installation 部分在本地环境自行安装尝试,但官方未给出无 GPU 的保证。

Q:镜像有更新怎么办?

A:执行 docker pull syq163/emoti-voice:latest 拉取最新镜像,然后重新执行 docker run 命令启动新容器即可。

Q:容器启动后浏览器打不开页面?

A:先确认 NVIDIA Container Toolkit 已按 Linux 或 Windows WSL2 的说明配置好,再检查 docker run 的端口映射是否为 127.0.0.1:8501:8501。

Q:有编程调用的接口吗?

A:有。该版本起提供 OpenAI 兼容 TTS API,地址为 http://localhost:8000/,可通过脚本批量生成结果。

注意事项

  • Docker 方式需提前装好 NVIDIA Container Toolkit,否则容器无法使用 GPU。
  • 官方镜像更新于 2024 年 1 月 4 日,旧版本请先 docker pull 再重新运行。
  • 本地完整安装固定使用 Python 3.8 的 conda 环境,避免与其他项目依赖冲突。
  • README 未提供源码克隆地址与额外启动脚本,本地安装后的运行方式请以仓库文档为准。

核心亮点

  • 支持多音色和提示词控制,用户可通过文本提示灵活调节情感和风格,生成高表现力的语音
  • 基于PyTorch实现,代码结构清晰,便于二次开发和集成到现有AI工作流
  • 提供完整的训练和推理脚本,支持自定义数据集微调,适合研究或产品原型验证

不足之处

  • 文档/社区待观察
  • 中文情感语音合成效果在复杂语境下可能不稳定,需大量调参

适用场景

  • 游戏或动画角色配音,快速生成带情感的多角色语音
  • 有声书或播客制作,批量合成不同风格和情感的旁白
  • 智能客服或语音助手,根据用户情绪动态调整回复语气

替代项目

Coqui TTS、MeloTTS、Bark

项目介绍

EmotiVoice 是音频音乐领域的开源项目,由 netease-youdao 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(8,529)位列前 6%,在音频音乐分类的 738 个项目里位列前 4%。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-22。Apache-2.0许可证,可免费使用和部署,无在线服务。

它主要面向的使用场景是:游戏或动画角色配音,快速生成带情感的多角色语音。同类可对比的替代方案包括 Coqui TTS、MeloTTS、Bark。

上一篇:piper

下一篇:VALL-E-X

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09