HiFTNet 是音频音乐领域的开源项目,由 yl4579 开发,2023 年首次发布。
它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 260。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-25。MIT许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:实时语音助手和交互式对话系统的语音合成。同类可对比的替代方案包括 HiFi-GAN、WaveGAN、MelGAN。

让语音合成又快又清晰,实时生成高质量人声。
HiFTNet 是一个基于神经网络的声码器(vocoder),用于将声学特征(如梅尔频谱)快速合成为高质量语音波形。它针对传统神经声码器推理速度慢的问题,提出结合谐波加噪声滤波(Harmonic-plus-Noise Filter)与逆短时傅里叶变换(ISTFT)的方法,在保持高音质的同时大幅提升合成速度。核心能力包括:利用谐波模型有效表示语音的周期成分,减少神经网络需生成的信息量;通过ISTFT快速重建波形,避免逐样本自回归生成;支持与主流TTS系统集成,适用于实时语音合成场景。项目代码基于Python和深度学习框架,提供预训练模型和推理脚本,方便开发者直接使用或微调。HiFTNet在音质和速度之间取得了良好平衡,尤其适合需要低延迟的交互式语音应用。
HiFi-GAN、WaveGAN、MelGAN
HiFTNet 是音频音乐领域的开源项目,由 yl4579 开发,2023 年首次发布。
它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 260。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-25。MIT许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:实时语音助手和交互式对话系统的语音合成。同类可对比的替代方案包括 HiFi-GAN、WaveGAN、MelGAN。
tango
开源
输入一句话,自动生成匹配的音频内容
A family of diffusion models for text-to-audio generation.
AuK
开源
一个模型搞定语音生成、编辑与分离
AuK: An Open-Source Foundational Model for Speech Generation and Editing
swift-tts
开源
Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine
A straightforward package containing version for Swift modern concurrency, Point-Fre···
ai-dj
开源
现场演出中实时用 AI 生成音乐,保持人类掌控
AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···