riffusion-manipulation

用图像扩散模型,像P图一样编辑音频

riffusion-manipulation 是一个基于 Riffusion 模型的音频操控工具集,用 Python 实现。它解决的核心问题是:如何利用 Stable Diffusion 图像生成技术对音频进行创造性编辑,而不仅仅是生成。项目将音频转换为频谱图,再通过扩散模型对频谱图进行修改(如风格迁移、局部重绘、插值融合等),最后将修改后的频谱图还原为音频。其核心能力包括:加载 Riffusion 预训练模型、对音频进行频谱图转换、执行多种图像编辑操作(如 img2img、inpainting)、以及将结果导出为音频文件。项目代码结构清晰,适合开发者学习如何将图像扩散模型应用于音频领域,并在此基础上构建自定义的音频处理流水线。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 96
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队chavinlo
所属国家
官网地址
定价模式free
价格说明开源工具,本地部署,完全免费
访问状态
是否开源是
开源协议
主要语言Python
技术栈/模型ai,diffusers,diffusion,generative-music,music,riffusion,stable-diffusion
GitHub 星标★ 96
30天Star增速
HF 下载量
上线时间2022-12-16 00:00:00
最近更新2026-04-20 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

核心亮点

  • 提供音频到频谱图、频谱图到音频的完整转换工具,开箱即用
  • 基于 Riffusion 官方模型,支持 img2img 和 inpainting 等高级编辑操作
  • 代码简洁,适合作为二次开发的基础库

不足之处

  • 文档/社区待观察
  • 依赖 Riffusion 模型,模型体积大,推理速度较慢
  • 功能相对单一,主要面向技术用户,缺少图形界面

适用场景

  • 音乐制作人进行音色风格转换或局部重绘
  • AI 爱好者学习扩散模型在音频领域的应用
  • 开发者构建自定义音频生成或编辑工具链

替代项目

Riffusion、AudioLDM、MusicGen

项目介绍

riffusion-manipulation 是音频音乐领域的开源项目,由 chavinlo 开发,2022 年首次发布。

它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 96。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-04-20。开源工具,本地部署,完全免费。

它主要面向的使用场景是:音乐制作人进行音色风格转换或局部重绘。同类可对比的替代方案包括 Riffusion、AudioLDM、MusicGen。

上一篇:Awesome-Music-Generation

下一篇:flux-generator

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09