riffusion-hobby

用 Stable Diffusion 实时生成音乐,输入文字即出旋律

riffusion-hobby 是一个基于 Stable Diffusion 的音乐生成开源项目,将图像生成技术应用于音频频谱图,实现实时音乐创作。它解决了传统音乐生成模型难以实时交互的问题,通过将音频转换为频谱图,再利用扩散模型生成新的频谱图,最后还原为音频。核心能力包括:支持文本提示词生成音乐风格、实时流式音频生成、可调节的参数控制(如节奏、音色)、以及基于 Web 界面的交互体验。项目基于 Python 和 diffusers 库构建,适合音乐爱好者、AI 研究者和创意开发者探索 AI 音乐生成的新范式。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3902
维护状态 低维护
是否开源
定价模式 free

项目数据

分类图像生成
开发团队riffusion
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,可免费自行部署使用,无在线服务。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型ai,audio,diffusers,diffusion,music,stable-diffusion
GitHub 星标★ 3902
30天Star增速
HF 下载量
上线时间2022-11-25 00:00:00
最近更新2026-09-20 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 6 步

环境要求

  • Python 3.9 或 3.10(CI 中已测试)
  • 建议使用 conda 或 virtualenv 创建独立虚拟环境
  • 需要安装 ffmpeg 才能处理 WAV 以外的音频格式
  • 若 torchaudio 无后端,需要额外安装 libsndfile
  • 需准备可用的 torch 设备(CPU 或 GPU)

安装与启动步骤

  1. 1获取项目代码

    把 GitHub 上的 riffusion-hobby 仓库克隆到本地,后续所有命令都在该目录中执行。

    git clone https://github.com/riffusion/riffusion-hobby.git
    cd riffusion-hobby
  2. 2创建虚拟环境

    README 强烈建议用 conda 建独立环境,Python 版本指定 3.9 以免依赖冲突。

    conda create --name riffusion python=3.9
  3. 3激活环境

    激活刚创建的 riffusion 环境,之后的安装与启动都在该环境中进行。

    conda activate riffusion
  4. 4安装 Python 依赖

    通过 requirements.txt 一次性安装 diffusers、torch 等项目所需依赖,耗时较长请耐心等待。

    python -m pip install -r requirements.txt
  5. 5安装 ffmpeg

    只有需要 WAV 以外的音频格式时才必须安装。Linux 用 apt、Mac 用 brew,conda 环境也可直接装。

    conda install -c conda-forge ffmpeg
  6. 6启动模型服务

    以 Flask 服务方式启动推理接口,默认监听本机 3013 端口,供 Web 应用或 API 调用。

    python -m riffusion.server --host 127.0.0.1 --port 3013

关键配置

配置项必填说明示例
--host模型服务监听的地址,默认本机回环地址。127.0.0.1
--port模型服务监听端口,Web 应用需按此地址连接。3013
--checkpoint指定 diffusers 格式的模型目录或 HuggingFace ID。riffusion/riffusion-model-v1
--device指定使用的 torch 设备,如 cpu 或 cuda。cuda
num_inference_steps推理步数,请求体参数,越大越慢但通常更精细。50
alpha起止提示词之间的插值系数,控制风格过渡程度。0.75

如何确认成功

向 http://127.0.0.1:3013/run_inference 发送 POST 请求,能返回含 image 与 audio 的 base64 结果即成功。

常见问题

Q:只能用 WAV 音频吗?

A:不是。但要使用 WAV 以外的音频格式,必须先安装 ffmpeg,否则会处理失败。

Q:安装依赖时提示 torchaudio 没有后端怎么办?

A:需要额外安装 libsndfile,README 指向了 issue 12 中给出的解决办法。

Q:diffusers 相关报错如何处理?

A:README 建议尝试升级 diffusers,该项目在 0.9 到 0.11 版本上做过测试。

Q:Windows 上怎么装?

A:README 提供了 Reddit 上的 Windows 简易安装指南链接,可参考该文档操作。

Q:项目还在维护吗?

A:README 明确标注该项目已不再积极维护,使用中遇到问题可能不会得到修复。

注意事项

  • 项目已停止积极维护,依赖版本较旧,建议在独立虚拟环境中安装。
  • 官方 CI 仅测试过 Python 3.9 和 3.10,不要用更高版本 Python 以免踩坑。
  • 模型权重可从 HuggingFace 的 riffusion/riffusion-model-v1 获取,也可用 --checkpoint 指定本地目录。
  • 项目采用 MIT 许可证,二次开发请按 README 中的 Citation 引用原始论文。

核心亮点

  • 实时生成:基于流式架构,边生成边播放,交互体验流畅
  • 文本控制:通过提示词描述风格,降低音乐创作门槛
  • 技术新颖:将图像扩散模型迁移到音频领域,创新性强

不足之处

  • 生成质量受限于频谱图分辨率,细节可能丢失
  • 依赖 GPU 资源,低配设备难以流畅运行
  • 文档/社区待观察

适用场景

  • 音乐灵感快速草拟,输入风格关键词获取旋律片段
  • AI 音乐教育,演示扩散模型在音频生成中的应用
  • 创意编程与艺术装置,实时生成背景音乐

替代项目

MusicGen、AudioLDM、DiffSinger

项目介绍

riffusion-hobby 是音频音乐领域的开源项目,由 riffusion 开发,2022 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(3,902)位列前 30%,在音频音乐分类的 738 个项目里位列前 7%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-20。MIT许可证,可免费自行部署使用,无在线服务。

它主要面向的使用场景是:音乐灵感快速草拟,输入风格关键词获取旋律片段。同类可对比的替代方案包括 MusicGen、AudioLDM、DiffSinger。

上一篇:facet

下一篇:riffusion-app-hobby

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 245 2026-08-09