riffusion-manipulation 是音频音乐领域的开源项目,由 chavinlo 开发,2022 年首次发布。
它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 96。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-04-20。开源工具,本地部署,完全免费。
它主要面向的使用场景是:音乐制作人进行音色风格转换或局部重绘。同类可对比的替代方案包括 Riffusion、AudioLDM、MusicGen。
用图像扩散模型,像P图一样编辑音频
riffusion-manipulation 是一个基于 Riffusion 模型的音频操控工具集,用 Python 实现。它解决的核心问题是:如何利用 Stable Diffusion 图像生成技术对音频进行创造性编辑,而不仅仅是生成。项目将音频转换为频谱图,再通过扩散模型对频谱图进行修改(如风格迁移、局部重绘、插值融合等),最后将修改后的频谱图还原为音频。其核心能力包括:加载 Riffusion 预训练模型、对音频进行频谱图转换、执行多种图像编辑操作(如 img2img、inpainting)、以及将结果导出为音频文件。项目代码结构清晰,适合开发者学习如何将图像扩散模型应用于音频领域,并在此基础上构建自定义的音频处理流水线。
Riffusion、AudioLDM、MusicGen
riffusion-manipulation 是音频音乐领域的开源项目,由 chavinlo 开发,2022 年首次发布。
它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 96。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-04-20。开源工具,本地部署,完全免费。
它主要面向的使用场景是:音乐制作人进行音色风格转换或局部重绘。同类可对比的替代方案包括 Riffusion、AudioLDM、MusicGen。
tango
开源
输入一句话,自动生成匹配的音频内容
A family of diffusion models for text-to-audio generation.
AuK
开源
一个模型搞定语音生成、编辑与分离
AuK: An Open-Source Foundational Model for Speech Generation and Editing
swift-tts
开源
Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine
A straightforward package containing version for Swift modern concurrency, Point-Fre···
ai-dj
开源
现场演出中实时用 AI 生成音乐,保持人类掌控
AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···