faster-qwen3-tts

让 Qwen3-TTS 边生成边出声,实时对话不卡顿

faster-qwen3-tts 是基于阿里 Qwen3-TTS 模型构建的实时语音合成开源项目,用 Python 实现,目标是把原本偏研究向、推理较慢的 Qwen3-TTS 改造成可低延迟流式输出的 TTS 引擎。它解决的核心问题是:大模型 TTS 音质好但推理慢,难以用于实时对话、语音助手等场景。项目通过流式解码、推理优化和工程封装,让 Qwen3-TTS 能在生成过程中边出音频边播放,显著降低首包延迟,同时保留原模型的音色克隆、多语言和自然韵律能力。对外提供简洁的 Python 调用接口,方便接入聊天机器人、AI 陪伴、实时字幕配音等应用。项目目前处于成长阶段,星标约 1.3k,适合想快速搭建实时语音交互原型的开发者。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1370
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类音频音乐
开发团队andimarafioti
所属国家
官网地址
定价模式free
价格说明开源项目,免费使用
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型
GitHub 星标★ 1370
30天Star增速
HF 下载量
上线时间2026-02-16 00:00:00
最近更新2026-09-29 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-01
浏览次数0

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • Python 3.10 或更高版本
  • PyTorch 2.5.1 或更高版本
  • Torch 后端:需要 NVIDIA GPU 并支持 CUDA
  • GGML 后端:Apple Silicon Mac,macOS 14 或更新版本(Intel Mac 与 Rosetta Python 不支持)

安装与启动步骤

  1. 1确认环境条件

    Torch 后端需 NVIDIA GPU 与 CUDA;无独显的 Apple Silicon Mac 走 GGML 后端,需 macOS 14+ 且为原生 Python。

  2. 2安装主包

    一条命令同时装好运行库与 CLI,默认附带 qwen-tts-hf 兼容包(提供 qwen_tts 模块)。

    pip install faster-qwen3-tts
  3. 3查看驱动 CUDA 版本

    运行后看输出右上角 CUDA Version,用于判断当前驱动匹配哪个 PyTorch wheel。

    nvidia-smi
  4. 4驱动较旧时换 PyTorch

    若驱动偏旧导致 torch.cuda.is_available() 为 False,按驱动的 CUDA 版本重装匹配的 wheel,例如 CUDA 12.4。

    pip install "torch==2.5.1" "torchaudio==2.5.1" --index-url https://download.pytorch.org/whl/cu124
  5. 5新显卡特殊处理

    RTX 50 系/Blackwell 需 CUDA 12.8 的 PyTorch wheel(PyTorch 2.7+);README 未给出具体安装命令,请按官方 wheel 索引自行安装。

如何确认成功

README 未提供启动验证命令;可确认 pip 安装无报错,NVIDIA 环境下 torch.cuda.is_available() 返回 True。

常见问题

Q:Intel Mac 或 Rosetta 下的 Python 能用吗?

A:不能。Metal wheel 仅支持原生 Apple Silicon Python,Intel Mac 与 Rosetta Python 均不受支持。

Q:能同时安装 qwen-tts 和 qwen-tts-hf 吗?

A:不可以。两者提供同一个 qwen_tts 包,默认安装已包含 qwen-tts-hf,同一环境内不要重复安装。

Q:报错 operation not permitted when stream is capturing?

A:这是 fast path 的 CUDA-graph 捕获问题,torch<=2.5.0 不可靠,请升级到 PyTorch 2.5.1 以上。

Q:提示 NVIDIA driver on your system is too old 怎么办?

A:用 nvidia-smi 查看驱动支持的 CUDA 版本,安装与之匹配的 PyTorch wheel,而非默认 wheel。

Q:RTX 50 系显卡默认装不上?

A:Blackwell 需 CUDA 12.8 的 PyTorch wheel,请改装 cu128 构建(PyTorch 2.7+)。

注意事项

  • 默认安装使用 qwen-tts-hf 兼容构建,与上游 qwen-tts 冲突,切勿共存
  • CUDA-graph 快速路径要求 PyTorch 2.5.1+,低于该版本可能捕获失败
  • README 的 Quick Start 未给出调用示例与端口等信息,实际使用前请查阅仓库最新文档
  • 命令行工具会自动选择后端:Apple Silicon 原生 Python 环境自动启用 GGML Metal 运行时

核心亮点

  • 基于 Qwen3-TTS,音色克隆与多语言能力开箱可用
  • 流式输出降低首包延迟,适合实时语音交互场景
  • Python 接口简洁,方便接入现有 LLM 对话链路

不足之处

  • 依赖 Qwen3-TTS 权重与 GPU 环境,部署门槛不低
  • 项目较新,文档与社区案例仍在积累中

适用场景

  • AI 语音助手实时对话
  • 虚拟主播/陪伴类应用配音
  • 实时字幕与视频配音生成

替代项目

CosyVoice、GPT-SoVITS

项目介绍

faster-qwen3-tts 是音频音乐领域的开源项目,由 andimarafioti 开发,是 2026 年新上线的项目。

在全站 13,465 个收录项目中,它的 GitHub 星标数(1,370)位列前 30%,在音频音乐分类的 757 个项目里位列前 14%。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-29。免费使用。

它主要面向的使用场景是:AI语音助手实时对话。同类可对比的替代方案包括 CosyVoice、GPT-SoVITS。

上一篇:piper1-gpl

下一篇:MorshuTalk

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1241 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1413 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 250 2026-08-09