AuK

一个模型搞定语音生成、编辑与分离

AuK 是一个开源语音生成与编辑基础模型,目标是把语音合成、语音编辑、说话人提取、语音增强和音源分离等任务统一到一个模型框架中。它解决的是传统语音流水线中模型碎片化的问题:过去做一段带背景音乐的播客或视频配音,往往需要分别调用 ASR、降噪、分离、TTS 和音频编辑工具,流程长且容易累积误差。AuK 以 PyTorch 实现,提供 Python 接口,定位为可扩展的基座模型,让开发者用一套权重完成从语音生成到后期编辑的多种操作,降低搭建语音处理应用的工程成本。项目处于早期阶段,星标约 536,适合研究者和小团队快速验证想法,但生产级稳定性仍需自行评估。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1070
维护状态 活跃
是否开源
定价模式 free

项目数据

分类音频音乐
开发团队Tencent-Hunyuan
所属国家
定价模式free
价格说明开源项目,免费使用
访问状态
是否开源
开源协议NOASSERTION
主要语言Python
技术栈/模型deep-learning,foundation-models,python,pytorch,separation,speaker-extraction,speech,speech-editing,speech-enhancement,text-to-speech,zero-shot-tts
GitHub 星标★ 1070
30天Star增速
HF 下载量
上线时间2026-08-19 00:00:00
最近更新2026-09-17 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-13
浏览次数9

使用教程

难度:进阶 约 10 分钟 部署方式:库/依赖 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 3.10 环境(README 明确要求)
  • uv 或 Conda 之一,用于创建隔离环境
  • 可访问 GitHub 的网络
  • PyTorch 运行环境(项目基于 PyTorch 实现)

安装与启动步骤

  1. 1克隆仓库

    README 明确给出此命令,从 GitHub 拉取 AuK 源码到本地当前目录。

    git clone https://github.com/Tencent-Hunyuan/AuK
    cd AuK
  2. 2创建 Python 3.10 环境

    README 只说明用 uv 或 Conda 二选一创建隔离的 Python 3.10 环境,节选中未给出具体命令,请按仓库文档执行。

  3. 3查阅后续安装说明

    节选内容到此截止,依赖安装与权重获取步骤未展示,需打开仓库 README 全文继续操作,勿自行猜测参数。

  4. 4在线 Demo 先试效果

    若只想快速体验,可直接使用 README 给出的 HuggingFace Space 或 ModelScope Studio 在线演示,无需本地部署。

如何确认成功

README 未提供本地启动验证命令;可先访问 README 中的 HuggingFace 或 ModelScope 在线 Demo 确认模型效果。

常见问题

Q:用 uv 还是 Conda 创建环境?

A:README 说明两者任选其一,都用于建立隔离的 Python 3.10 环境,节选中未给出对应命令,请查看仓库文档。

Q:模型权重从哪里下载?

A:本次 README 节选未提供权重下载地址,请查看仓库 README 全文或官网 auk-project.github.io 上的说明。

Q:AuK 能做哪些语音任务?

A:按官方描述,它把语音合成、语音编辑、说话人提取、语音增强和音源分离统一在同一模型框架中。

Q:不装环境能直接体验吗?

A:可以,README 提供了 HuggingFace Demo Space 与 ModelScope Demo Space 两个在线入口。

注意事项

  • README 节选未包含完整安装命令,实际依赖与权重获取请以仓库文档为准,本教程未虚构任何命令。
  • 项目处于早期阶段,生产环境稳定性需自行评估。
  • 务必使用独立的 Python 3.10 环境,避免与系统已有依赖冲突。
  • 仓库地址为 https://github.com/Tencent-Hunyuan/AuK,官网 https://auk-project.github.io。

核心亮点

  • 统一框架覆盖生成、编辑、分离、增强等多任务,减少多模型拼接成本
  • 基于 PyTorch,Python 接口对研究者友好,便于二次开发和微调
  • 开源权重与代码,可本地部署,适合隐私敏感或离线语音处理场景

不足之处

  • 项目处于早期,文档和预训练权重的完整度可能有限
  • 多任务统一模型在单项任务上的效果未必优于专用 SOTA 模型

适用场景

  • 播客或视频后期:自动分离人声与背景音乐并做语音增强
  • 有声内容创作:用生成与编辑能力快速修改配音中的错词或语气
  • 语音数据预处理:从混合音频中提取说话人片段用于训练或分析

替代项目

FunASR、CosyVoice、Demucs

项目介绍

AuK 是一个音频音乐领域的开源项目,官方简介:AuK: An Open-Source Foundational Model for Speech Generation and Editing。项目使用 Python 开发,在 GitHub 上获得 536 星标。

上一篇:supertonic

下一篇:asmr-dubber

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1238 2026-08-09
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 244 2026-08-09
WhisperSubTranslate 开源

本地免费生成字幕并翻译,无需上传,隐私无忧

A free, local desktop app to extract subtitles (SRT) from video and translate them i···

★ 734 2026-08-15