CosyVoice

输入文字就能生成多语种配音,一天的工作十分钟搞定

阿里通义实验室开源的多语言大规模语音生成模型,提供推理、训练与部署全栈能力。支持零样本语音克隆与跨语种语音合成,音色自然流畅,是构建语音助手、智能配音与内容创作应用的理想基座。

开源 free 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 23732
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类对话助手
开发团队QwenAudio
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用、训练和部署,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型audio-generation,cantonese,chatbot,chatgpt,chinese,cosyvoice,cross-lingual,english,fine-grained,fine-tuning,gpt-4o,japanese,korean,multi-lingual,natural-language-generation,python,text-to-speech,tts,voice-cloning
GitHub 星标★ 23732
30天Star增速
HF 下载量
上线时间2024-07-03 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 8 步

环境要求

  • Git(需支持 --recursive 拉取子模块)
  • 已安装 Conda / Miniconda
  • Python 3.10
  • 可访问 GitHub 与 pip 镜像源(README 使用阿里云镜像)
  • 可选:NVIDIA GPU 与 Docker(用于服务化部署)

安装与启动步骤

  1. 1克隆仓库

    使用 --recursive 一次性拉取主仓库及子模块,目录名默认为 CosyVoice。

    git clone --recursive https://github.com/FunAudioLLM/CosyVoice.git
  2. 2补齐子模块

    若因网络问题子模块没拉全,进入目录后反复执行该命令直到成功。

    cd CosyVoice
    git submodule update --init --recursive
  3. 3创建 Conda 环境

    新建名为 cosyvoice 的环境并指定 Python 3.10,需先自行安装 Miniconda。

    conda create -n cosyvoice -y python=3.10
  4. 4安装依赖

    激活环境后按 requirements.txt 安装依赖,README 使用阿里云镜像并信任该主机。

    conda activate cosyvoice
    pip install -r requirements.txt -i https://mirrors.aliyun.com/pypi/simple/ --trusted-host=mirrors.aliyun.com
  5. 5解决 sox 兼容问题

    仅当遇到 sox 兼容问题时执行:Ubuntu 与 CentOS 命令不同,按系统二选一。

    sudo apt-get install sox libsox-dev
  6. 6运行示例脚本

    按 example.py 中的用法体验各模型,README 推荐优先使用 Fun-CosyVoice3-0.5B。

    python example.py
  7. 7构建部署镜像

    如需服务化部署,进入 runtime/python 目录构建镜像,镜像名为 cosyvoice:v1.0。

    cd runtime/python
    docker build -t cosyvoice:v1.0 .
  8. 8启动 gRPC/FastAPI 服务

    用 NVIDIA runtime 启动容器并暴露 50000 端口,二选一启动 grpc 或 fastapi 服务端。

    docker run -d --runtime=nvidia -p 50000:50000 cosyvoice:v1.0 /bin/bash -c "cd /opt/CosyVoice/CosyVoice/runtime/python/grpc && python3 server.py --port 50000 --max_conc 4 --model_dir iic/CosyVoice-300M && sleep infinity"

关键配置

配置项必填说明示例
--port是服务监听端口,客户端需连接同一端口50000
--max_conc否gRPC 服务端最大并发数4
--model_dir是指定加载的模型目录或 ModelScope 模型名iic/CosyVoice-300M
--mode是客户端调用模式:sft、zero_shot、cross_lingual、instructzero_shot
python是Conda 环境所用 Python 版本3.10

如何确认成功

本地运行 python example.py 无报错即安装成功;服务化部署可用 docker ps 看到容器运行,并通过 client.py 连接 50000 端口触发合成。

常见问题

Q:克隆时子模块没拉下来怎么办?

A:进入 CosyVoice 目录后执行 git submodule update --init --recursive,若因网络失败可重复执行直到成功。

Q:安装依赖时报 sox 兼容错误怎么办?

A:Ubuntu 执行 sudo apt-get install sox libsox-dev;CentOS 执行 sudo yum install sox sox-devel。

Q:应该选哪个模型版本?

A:README 强烈推荐使用 Fun-CosyVoice3-0.5B,其内容一致性、音色相似度与韵律自然度优于 CosyVoice 2.0。

Q:vLLM 对版本有要求吗?

A:支持 vLLM 0.11.x+(V1 engine)与 0.9.0(legacy);低于 0.9.0 不支持推理,0.10.x 等中间版本未测试。

注意事项

  • 运行示例前务必先 conda activate cosyvoice 激活环境。
  • docker run 使用 --runtime=nvidia,需具备 NVIDIA 容器运行环境。
  • vLLM 依赖要求较多,建议用 conda create -n cosyvoice_vllm --clone cosyvoice 克隆新环境以免污染原环境。
  • 训练与推理的高级脚本位于 examples/libritts 目录,TensorRT-LLM 加速部署见 runtime/triton_trtllm。

核心亮点

  • 多语言支持,覆盖中英日粤等语种,跨语言语音生成能力强
  • 提供推理、训练、部署全栈能力,适合从研究到生产的完整链路
  • 细粒度语音控制与微调能力,支持自定义音色和风格

不足之处

  • 文档/社区待观察,部分高级功能(如微调)使用门槛较高
  • 模型体积大,推理资源消耗较高,轻量化部署需额外优化

适用场景

  • 多语言语音合成与配音,如影视、游戏本地化
  • 智能助手与聊天机器人的语音交互,提升自然度
  • 个性化音色定制,如虚拟主播、有声书制作

替代项目

ChatTTS、XTTS (Coqui)、Bark (Suno)

项目介绍

CosyVoice 是音频音乐领域的开源项目,由 QwenAudio 开发,2024 年首次发布。

在全站 13,109 个收录项目中,它的 GitHub 星标数(23,732)位列前 2%,在音频音乐分类的 738 个项目里位列前 2%。

近 41 天,它的 GitHub 星标从 22,726 增加到 23,732,净增 1,006。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。Apache-2.0许可证,可免费使用、训练和部署,无付费版本。

它主要面向的使用场景是:多语言语音合成与配音,如影视、游戏本地化。同类可对比的替代方案包括 ChatTTS、XTTS (Coqui)、Bark (Suno)。

上一篇:没有了!

下一篇:GPT-SoVITS

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09