项目预览
项目数据
项目介绍
Star 增长趋势
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
技术标签
使用教程
—
环境要求
- Python 环境,需可直接使用 pip 安装包
- 已安装 pip 包管理器
- 网络可访问 PyPI 以下载 msst 包
- 训练与推理前需查阅仓库 docs 目录中的文档(getting_started、cli、compatibility 等)
安装与启动步骤
-
1安装 msst 包
README 中给出的唯一安装命令,安装后即可使用该训练框架的 Python 包与命令行入口。
pip install msst -
2阅读入门文档
按 README 指引先看 getting_started 文档,了解 MSST 包的基本使用流程和数据准备方式。
-
3了解命令行用法
查阅 cli 文档,掌握命令语法与 shell 示例,训练时通过 --model_type 指定模型架构。
-
4确认模型与设备兼容性
看 compatibility 文档,确认所选模型 extras、运行设备以及支持的音频格式是否满足需求。
关键配置
| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
--model_type | 是 | 选择训练使用的模型架构,不同取值对应不同网络 | bs_roformer |
如何确认成功
pip install msst 无报错即安装成功;再按 docs/getting_started.md 中的示例运行一次,能正常执行即配置完成。
常见问题
Q:这个仓库支持哪些模型架构?
A:README 列出 mdx23c、htdemucs、segm_models、torchseg、bs_roformer、mel_band_roformer、swin_upernet、bandit、SCNet 等,训练时用 --model_type 指定对应 Key。
Q:安装好包之后怎么开始训练?
A:README 未直接给出训练命令,需查阅仓库 docs 目录下的 getting_started.md 和 cli.md,按其中的示例与参数说明操作。
Q:要安装的包名是什么?
A:包名为 msst,执行 pip install msst 即可,不需要克隆仓库源码。
Q:仓库代码的来源是什么?
A:基于 kuielab 为 SDX23 挑战赛提供的代码(sdx23 仓库 mdx_AB 分支),由 MVSep.com 整理发布。
注意事项
- README 仅给出 pip install msst 一条安装命令,训练数据准备、配置文件和训练参数的细节需到 docs 目录文档中查看。
- 切模型只改 --model_type 参数,可用 Key 见 README 的 Models 章节。
- 不同模型对依赖(extras)、设备和音频格式的要求不同,正式训练前先看 compatibility 文档。
核心亮点
- 集成 Demucs、MDX-Net、BS-RoFormer 等多种主流分离架构,训练脚本统一
- 提供完整数据处理、增强与评估流程,降低复现门槛
- 支持自定义数据集与配置,便于微调或对比实验
不足之处
- 训练对 GPU 显存和算力要求较高,普通设备难以从头训练
- 文档与教程相对偏研究向,新手需要一定音频深度学习基础
适用场景
- 研究者复现和对比不同音乐源分离模型
- 开发者训练定制人声/伴奏分离模型用于产品
- 音乐制作人批量分离歌曲音轨做混音或采样
替代项目
demucs、spleeter、MDX-Net
上一篇:MuLaCover
下一篇:没有了!
同类项目推荐
AuK
开源
一个模型搞定语音生成、编辑与分离
AuK: An Open-Source Foundational Model for Speech Generation and Editing
tango
开源
输入一句话,自动生成匹配的音频内容
A family of diffusion models for text-to-audio generation.
VoiceStudio
开源
开源语音全能工作站,克隆、配音、转录一站式搞定
VoiceStudio is the open-source, fully-local ElevenLabs alternative — voice cloning,···
swift-tts
开源
Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine
A straightforward package containing version for Swift modern concurrency, Point-Fre···
