faster-qwen3-tts 是音频音乐领域的开源项目,由 andimarafioti 开发,是 2026 年新上线的项目。
在全站 13,465 个收录项目中,它的 GitHub 星标数(1,370)位列前 30%,在音频音乐分类的 757 个项目里位列前 14%。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-29。免费使用。
它主要面向的使用场景是:AI语音助手实时对话。同类可对比的替代方案包括 CosyVoice、GPT-SoVITS。

让 Qwen3-TTS 边生成边出声,实时对话不卡顿
faster-qwen3-tts 是基于阿里 Qwen3-TTS 模型构建的实时语音合成开源项目,用 Python 实现,目标是把原本偏研究向、推理较慢的 Qwen3-TTS 改造成可低延迟流式输出的 TTS 引擎。它解决的核心问题是:大模型 TTS 音质好但推理慢,难以用于实时对话、语音助手等场景。项目通过流式解码、推理优化和工程封装,让 Qwen3-TTS 能在生成过程中边出音频边播放,显著降低首包延迟,同时保留原模型的音色克隆、多语言和自然韵律能力。对外提供简洁的 Python 调用接口,方便接入聊天机器人、AI 陪伴、实时字幕配音等应用。项目目前处于成长阶段,星标约 1.3k,适合想快速搭建实时语音交互原型的开发者。
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
1确认环境条件
Torch 后端需 NVIDIA GPU 与 CUDA;无独显的 Apple Silicon Mac 走 GGML 后端,需 macOS 14+ 且为原生 Python。
2安装主包
一条命令同时装好运行库与 CLI,默认附带 qwen-tts-hf 兼容包(提供 qwen_tts 模块)。
pip install faster-qwen3-tts3查看驱动 CUDA 版本
运行后看输出右上角 CUDA Version,用于判断当前驱动匹配哪个 PyTorch wheel。
nvidia-smi4驱动较旧时换 PyTorch
若驱动偏旧导致 torch.cuda.is_available() 为 False,按驱动的 CUDA 版本重装匹配的 wheel,例如 CUDA 12.4。
pip install "torch==2.5.1" "torchaudio==2.5.1" --index-url https://download.pytorch.org/whl/cu1245新显卡特殊处理
RTX 50 系/Blackwell 需 CUDA 12.8 的 PyTorch wheel(PyTorch 2.7+);README 未给出具体安装命令,请按官方 wheel 索引自行安装。
README 未提供启动验证命令;可确认 pip 安装无报错,NVIDIA 环境下 torch.cuda.is_available() 返回 True。
Q:Intel Mac 或 Rosetta 下的 Python 能用吗?
A:不能。Metal wheel 仅支持原生 Apple Silicon Python,Intel Mac 与 Rosetta Python 均不受支持。
Q:能同时安装 qwen-tts 和 qwen-tts-hf 吗?
A:不可以。两者提供同一个 qwen_tts 包,默认安装已包含 qwen-tts-hf,同一环境内不要重复安装。
Q:报错 operation not permitted when stream is capturing?
A:这是 fast path 的 CUDA-graph 捕获问题,torch<=2.5.0 不可靠,请升级到 PyTorch 2.5.1 以上。
Q:提示 NVIDIA driver on your system is too old 怎么办?
A:用 nvidia-smi 查看驱动支持的 CUDA 版本,安装与之匹配的 PyTorch wheel,而非默认 wheel。
Q:RTX 50 系显卡默认装不上?
A:Blackwell 需 CUDA 12.8 的 PyTorch wheel,请改装 cu128 构建(PyTorch 2.7+)。
CosyVoice、GPT-SoVITS
faster-qwen3-tts 是音频音乐领域的开源项目,由 andimarafioti 开发,是 2026 年新上线的项目。
在全站 13,465 个收录项目中,它的 GitHub 星标数(1,370)位列前 30%,在音频音乐分类的 757 个项目里位列前 14%。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-29。免费使用。
它主要面向的使用场景是:AI语音助手实时对话。同类可对比的替代方案包括 CosyVoice、GPT-SoVITS。
上一篇:piper1-gpl
下一篇:MorshuTalk
tango
开源
输入一句话,自动生成匹配的音频内容
A family of diffusion models for text-to-audio generation.
AuK
开源
一个模型搞定语音生成、编辑与分离
AuK: An Open-Source Foundational Model for Speech Generation and Editing
swift-tts
开源
Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine
A straightforward package containing version for Swift modern concurrency, Point-Fre···
ai-dj
开源
现场演出中实时用 AI 生成音乐,保持人类掌控
AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···