VieNeu-TTS

在本地 CPU 上实时合成越南语语音,几秒克隆任意音色。

VieNeu-TTS 是一个专注于越南语的端侧实时文本转语音(TTS)引擎,支持即时声音克隆,无需云端依赖即可在本地 CPU 上运行,输出 24kHz 高质量音频。它解决了越南语 TTS 领域缺乏轻量级、实时且支持声音克隆的开源方案的问题,为开发者提供了可嵌入移动应用、桌面程序或边缘设备的语音合成能力。核心能力包括:基于深度学习的语音合成、零样本声音克隆(只需几秒参考音频)、CPU 实时推理(低延迟)、越南语特有的声调和发音处理,以及简洁的 Python API 接口。项目代码开源,模型经过优化,适合在资源受限的环境下部署,同时支持自定义说话人音色,为越南语语音交互、内容创作和无障碍辅助等应用场景提供了灵活的工具。

开源 unknown 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2649
维护状态 活跃
是否开源 是
定价模式 unknown

项目数据

分类音频音乐
开发团队pnnbao97
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型deep-learning,on-device-ml,real-time,speech-synthesis,text-to-speech,tts,vietnamese,vietnamese-language
GitHub 星标★ 2649
30天Star增速
HF 下载量
上线时间2025-10-28 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • Python 环境且 pip 可用
  • CPU 即可运行(v3 Turbo 走 ONNX Runtime,不依赖 torch)
  • 如需 GPU 加速:NVIDIA 显卡 + CUDA 环境
  • 使用 uv 管理依赖(README 推荐的安装方式)
  • Docker 部署仅在旧版 v2 场景需要,且需 NVIDIA Container Toolkit

安装与启动步骤

  1. 1安装 CPU 版

    默认路径,无需 torch,通过 ONNX Runtime 运行 v3 Turbo,最省事。

    pip install vieneu
  2. 2可选:安装 GPU 版

    仅 NVIDIA 显卡需要。Linux 直接装 vieneu[cuda];Windows 必须先装 CUDA 版 torch。

    pip install torch==2.8.0 torchaudio==2.8.0 --index-url https://download.pytorch.org/whl/cu128
    pip install "transformers==4.57.6"
    pip install vieneu
  3. 3加载并合成语音

    导入 Vieneu 后调用 infer(),voice 可指定内置音色,返回音频数据。

    import time
    from vieneu import Vieneu
    
    vieneu = Vieneu()
    audio = vieneu.infer("Bản tin sáng nay.", voice="Minh Quân")
  4. 4按需切换精度/模式

    CPU 默认 fp32;int8 更快但需 CPU 支持 VNNI。低配设备可试 v3nano。

    Vieneu(precision="int8")
    Vieneu(mode="v3nano")
  5. 5可选:Docker 起服务

    该镜像对应已废弃的 v2 服务,--tunnel 会生成公网地址,需查容器日志。

    docker run --gpus all -p 23333:23333 -v huggingface_cache:/root/.cache/huggingface pnnbao/vieneu-tts:latest --tunnel

关键配置

配置项必填说明示例
mode否选择模型,默认 v3turbo,v3nano 更快但质量更低v3nano
precision否仅 CPU/ONNX 路径生效,int8 约快 1.6 倍但需 VNNIint8
voice否指定内置音色名称Minh Quân
backbone_repo否加载自己微调(LoRA)后的 v3 Turbo 模型finetune/output/my_voice/merged
style否v3 Turbo 已弃用并忽略,风格改为跟随参考音频tin_tuc

如何确认成功

执行 infer() 能正常返回音频即成功;Docker 方式请查看容器日志中的 bore 公网地址(如 bore.pub:31631)。

常见问题

Q:CPU 和 GPU 到底选哪个?

A:GPU 优势来自批处理,只有长文本或大批量合成长文本时才划算;短文本交互式调用 CPU/ONNX 通常更快。

Q:int8 精度下音频出现杂音怎么办?

A:int8 需要 CPU 支持 VNNI(AVX-512 VNNI / AVX-VNNI),老 CPU 上会输出乱码音频,改回默认 fp32 即可。

Q:v4 为什么装不到?

A:v4 因克隆能力被滥用风险已闭源,只通过 VieNeu API / vieneu.io 提供,仓库最新开源版是 v3 Turbo。

Q:Windows 上怎么最快装好?

A:用官网 vieneu.io/#/download 的独立安装包,不需要装 uv 或手动 clone 仓库;macOS 安装包尚未发布。

注意事项

  • 官方建议用 uv 管理依赖(uv sync 流程),本文只列出 README 明确给出的 pip 与 Docker 命令。
  • README 中的 API Server 与 remote 模式仅适配 v2,已废弃,仅保留给已有部署。
  • v3 Turbo 的 Docker Web UI 与 apps/web_stream.py 的 FastAPI 流式示例是服务化替代方案。
  • 模型面向越南语,英文/双语场景在 v3nano 下质量会明显下降。

核心亮点

  • 支持零样本声音克隆,仅需数秒参考音频即可复刻音色,灵活性高。
  • CPU 实时推理,无需 GPU,延迟低,适合边缘设备和离线场景。
  • 输出 24kHz 高保真音频,音质优于多数同体积 TTS 模型。

不足之处

  • 仅支持越南语,多语言扩展需额外适配,通用性受限。
  • 文档/社区待观察,教程和示例相对较少,上手需一定探索。

适用场景

  • 越南语语音助手或客服机器人的本地语音播报。
  • 内容创作者快速生成越南语配音,支持自定义音色。
  • 无障碍阅读工具,将越南语文本实时转为语音。

替代项目

Coqui TTS、MeloTTS、Piper TTS

项目介绍

VieNeu-TTS 是音频音乐领域的开源项目,由 pnnbao97 开发,2025 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(2,649)位列前 30%,在音频音乐分类的 738 个项目里位列前 9%。

近 42 天,它的 GitHub 星标从 2,324 增加到 2,649,净增 325。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。从国内网络环境看,可直接访问。

它主要面向的使用场景是:越南语语音助手或客服机器人的本地语音播报。同类可对比的替代方案包括 Coqui TTS、MeloTTS、Piper TTS。

上一篇:Tacotron-2

下一篇:vall-e

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09