
AuK
一个模型搞定语音生成、编辑与分离
AuK 是一个开源语音生成与编辑基础模型,目标是把语音合成、语音编辑、说话人提取、语音增强和音源分离等任务统一到一个模型框架中。它解决的是传统语音流水线中模型碎片化的问题:过去做一段带背景音乐的播客或视频配音,往往需要分别调用 ASR、降噪、分离、TTS 和音频编辑工具,流程长且容易累积误差。AuK 以 PyTorch 实现,提供 Python 接口,定位为可扩展的基座模型,让开发者用一套权重完成从语音生成到后期编辑的多种操作,降低搭建语音处理应用的工程成本。项目处于早期阶段,星标约 536,适合研究者和小团队快速验证想法,但生产级稳定性仍需自行评估。
项目数据
使用教程
⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。
环境要求
- Python 3.10 环境(README 明确要求)
- uv 或 Conda 之一,用于创建隔离环境
- 可访问 GitHub 的网络
- PyTorch 运行环境(项目基于 PyTorch 实现)
安装与启动步骤
-
1克隆仓库
README 明确给出此命令,从 GitHub 拉取 AuK 源码到本地当前目录。
git clone https://github.com/Tencent-Hunyuan/AuK cd AuK -
2创建 Python 3.10 环境
README 只说明用 uv 或 Conda 二选一创建隔离的 Python 3.10 环境,节选中未给出具体命令,请按仓库文档执行。
-
3查阅后续安装说明
节选内容到此截止,依赖安装与权重获取步骤未展示,需打开仓库 README 全文继续操作,勿自行猜测参数。
-
4在线 Demo 先试效果
若只想快速体验,可直接使用 README 给出的 HuggingFace Space 或 ModelScope Studio 在线演示,无需本地部署。
如何确认成功
README 未提供本地启动验证命令;可先访问 README 中的 HuggingFace 或 ModelScope 在线 Demo 确认模型效果。
常见问题
Q:用 uv 还是 Conda 创建环境?
A:README 说明两者任选其一,都用于建立隔离的 Python 3.10 环境,节选中未给出对应命令,请查看仓库文档。
Q:模型权重从哪里下载?
A:本次 README 节选未提供权重下载地址,请查看仓库 README 全文或官网 auk-project.github.io 上的说明。
Q:AuK 能做哪些语音任务?
A:按官方描述,它把语音合成、语音编辑、说话人提取、语音增强和音源分离统一在同一模型框架中。
Q:不装环境能直接体验吗?
A:可以,README 提供了 HuggingFace Demo Space 与 ModelScope Demo Space 两个在线入口。
注意事项
- README 节选未包含完整安装命令,实际依赖与权重获取请以仓库文档为准,本教程未虚构任何命令。
- 项目处于早期阶段,生产环境稳定性需自行评估。
- 务必使用独立的 Python 3.10 环境,避免与系统已有依赖冲突。
- 仓库地址为 https://github.com/Tencent-Hunyuan/AuK,官网 https://auk-project.github.io。
核心亮点
- 统一框架覆盖生成、编辑、分离、增强等多任务,减少多模型拼接成本
- 基于 PyTorch,Python 接口对研究者友好,便于二次开发和微调
- 开源权重与代码,可本地部署,适合隐私敏感或离线语音处理场景
不足之处
- 项目处于早期,文档和预训练权重的完整度可能有限
- 多任务统一模型在单项任务上的效果未必优于专用 SOTA 模型
适用场景
- 播客或视频后期:自动分离人声与背景音乐并做语音增强
- 有声内容创作:用生成与编辑能力快速修改配音中的错词或语气
- 语音数据预处理:从混合音频中提取说话人片段用于训练或分析
替代项目
FunASR、CosyVoice、Demucs
项目介绍
上一篇:supertonic
下一篇:asmr-dubber
同类项目推荐
tango
开源
输入一句话,自动生成匹配的音频内容
A family of diffusion models for text-to-audio generation.
swift-tts
开源
Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine
A straightforward package containing version for Swift modern concurrency, Point-Fre···
ai-dj
开源
现场演出中实时用 AI 生成音乐,保持人类掌控
AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···
WhisperSubTranslate
开源
本地免费生成字幕并翻译,无需上传,隐私无忧
A free, local desktop app to extract subtitles (SRT) from video and translate them i···