VoxCPM

给 AI 一句描述,就能捏出从没听过的全新嗓音

VoxCPM2 是一款无分词器的多语言语音生成模型,支持多语种语音合成、创意音色设计与高保真声音克隆。无需传统分词器即可直接生成语音,带来更自然、更真实的合成效果,代表新一代 TTS 技术方向。

开源 unknown 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 37886
维护状态 较活跃
是否开源 是
定价模式 unknown

项目数据

分类音频音乐
开发团队OpenBMB
所属国家
官网地址https://voxcpm.com
定价模式unknown
价格说明官网存在但定价信息未明确,需进一步确认。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型audio,deeplearning,minicpm,multilingual,python,pytorch,speech,speech-synthesis,text-to-speech,tts,tts-model,voice-cloning,voice-design,voxcpm
GitHub 星标★ 37886
30天Star增速
HF 下载量
上线时间2025-09-16 00:00:00
最近更新2026-09-22 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数7

使用教程

难度:入门 约 15 分钟 部署方式:库/依赖 5 步

环境要求

  • Python ≥ 3.10 且 < 3.13
  • PyTorch ≥ 2.5.0
  • CUDA ≥ 12.0(生产部署需 NVIDIA GPU)
  • 如需高吞吐服务,准备 NVIDIA RTX 4090 等可用显卡

安装与启动步骤

  1. 1检查环境版本

    确认 Python 版本落在 3.10~3.12 之间,并已装好 PyTorch 2.5.0 及以上、CUDA 12.0 及以上。

    python --version
  2. 2安装 VoxCPM

    通过 pip 安装官方发布的 voxcpm 包,这是 README 中给出的唯一安装方式。

    pip install voxcpm
  3. 3安装推理引擎

    如需多并发请求与异步 API 的高吞吐生产部署,额外安装 Nano-vLLM-VoxCPM。

    pip install nano-vllm-voxcpm
  4. 4编写生成脚本

    用 README 的示例代码加载本地模型权重、生成语音分块并写入 wav 文件,注意采样率为 48000。

    from nanovllm_voxcpm import VoxCPM
    import numpy as np, soundfile as sf
    
    server = VoxCPM.from_pretrained(model="/path/to/VoxCPM", devices=[0])
    chunks = list(server.generate(target_text="Hello from VoxCPM!"))
    sf.write("out.wav", np.concatenate(chunks), 48000)
    server.stop()
  5. 5可选源码安装

    README 也给出从最新 main 源码安装 vllm-omni 的方式,适用于需要自行扩展的场景。

    uv pip install vllm==0.19.0 --torch-backend=auto
    git clone https://github.com/vllm-project/vllm-omni.git && cd vllm-omni
    uv pip install -e .

关键配置

配置项必填说明示例
model是本地 VoxCPM 模型权重目录路径/path/to/VoxCPM
devices是指定使用的 GPU 设备编号列表[0]
target_text是待合成的目标文本内容Hello from VoxCPM!

如何确认成功

运行示例脚本后目录下生成 out.wav 音频文件,即表示推理成功。

常见问题

Q:支持哪些 Python 版本?

A:README 要求 Python ≥ 3.10 且 < 3.13,即 3.10、3.11、3.12 可用,3.13 暂不支持。

Q:一定要装 CUDA 吗?

A:README 列出 CUDA ≥ 12.0 为环境要求,且高吞吐部署基于 NVIDIA GPU,建议准备可用的 CUDA 环境。

Q:如何提升推理吞吐?

A:改用 Nano-vLLM-VoxCPM 引擎,RTF 可从约 0.3 降到约 0.13,并支持批量并发与 FastAPI HTTP 服务。

Q:模型权重从哪里获取?

A:README 提供了 Hugging Face 的 openbmb/VoxCPM2 与 ModelScope 的 OpenBMB/VoxCPM2 两个下载入口。

注意事项

  • README 的 CLI Usage 章节内容为空,具体命令行参数请查阅官方文档 voxcpm.readthedocs.io。
  • Nano-vLLM-VoxCPM 与 vLLM-Omni 均为独立仓库,部署细节需参考各自文档。
  • RTF 约 0.13 的数据是在 NVIDIA RTX 4090 上测得,其他显卡表现可能不同。
  • 生成的音频采样率为 48000 Hz,写入文件时需保持一致。

核心亮点

  • 无分词器架构直接建模语音,支持多语言生成,减少传统TTS的误差累积
  • 支持创造性声音设计和高保真声音克隆,适合个性化语音合成场景
  • 基于PyTorch和MiniCPM系列,技术栈成熟,社区关注度高(35k+星标)

不足之处

  • 文档/社区待观察
  • 训练和推理资源需求可能较高,对硬件有门槛

适用场景

  • 多语言语音合成与配音
  • 个性化声音克隆与虚拟角色声音设计
  • 低资源语言或方言的语音生成研究

替代项目

Coqui TTS、Bark、XTTS

项目介绍

VoxCPM 是音频音乐领域的开源项目,由 OpenBMB 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(37,886)位列前 1%,在音频音乐分类的 738 个项目里位列前 1%。

近 44 天,它的 GitHub 星标从 35,132 增加到 37,886,净增 2,754。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-22。官网存在但定价信息未明确,需进一步确认。从国内网络环境看,可直接访问。

它主要面向的使用场景是:多语言语音合成与配音。同类可对比的替代方案包括 Coqui TTS、Bark、XTTS。

上一篇:MockingBird

下一篇:dia

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09