stable-diffusion-videos

两张图之间自动过渡,静态画面秒变动画

通过探索 Stable Diffusion 的潜在空间并在文本提示词之间平滑变形,让 AI 生成酷炫的动态视频。无需复杂训练管线,仅凭提示词即可驱动出令人惊艳的影像,适合创意实验与内容创作。

开源 free 设计创意
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4709
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类设计创意
开发团队nateraw
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署,无在线服务。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型ai-art,huggingface,huggingface-diffusers,machine-learning,stable-diffusion
GitHub 星标★ 4709
30天Star增速
HF 下载量
上线时间2022-09-06 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数1

使用教程

难度:进阶 约 15 分钟 部署方式:库/依赖 5 步

环境要求

  • Python 环境(可用 pip 安装依赖)
  • 建议具备 NVIDIA GPU 与 CUDA,示例代码使用 .to("cuda") 与 torch.float16
  • Apple M1 芯片需使用 torch.float32,MPS 不支持 float16
  • 能访问 Hugging Face 以下载 CompVis/stable-diffusion-v1-4 模型权重

安装与启动步骤

  1. 1安装依赖库

    用 pip 从 PyPI 安装 stable_diffusion_videos,它会一并带出所需的推理依赖。建议在独立虚拟环境中执行,避免污染全局环境。

    pip install stable_diffusion_videos
  2. 2准备 Python 脚本

    新建一个 .py 文件,导入 StableDiffusionWalkPipeline 与 torch,按 README 示例从预训练模型加载管线并迁移到 cuda。

    touch make_video.py
  3. 3填写提示词与参数

    在脚本中调用 pipeline.walk,填写起止提示词、随机种子、插值步数、分辨率与输出目录。分辨率大于 512 用 64 的倍数,小于 512 用 8 的倍数。

  4. 4运行生成视频

    执行脚本,管线会在两个提示词的潜在空间之间插值生成画面并合成视频,首次运行需要下载模型权重,耗时较长。

    python make_video.py
  5. 5或使用 Colab

    不想本地配置环境,可直接打开 README 提供的 Colab 笔记本在线跑通流程,无需本地 GPU。

关键配置

配置项必填说明示例
CompVis/stable-diffusion-v1-4是from_pretrained 传入的模型 ID,决定使用的 Stable Diffusion 权重CompVis/stable-diffusion-v1-4
torch_dtype否推理精度,CUDA 用 float16 省显存,Apple M1 必须改为 float32torch.float16
prompts是变形起止的文本提示词列表,至少两个['a cat', 'a dog']
seeds是与提示词一一对应的随机种子,保证画面可控可复现[42, 1337]
num_interpolation_steps是两个提示词之间的插值步数,越大过渡越平滑、耗时越长3
output_dir是生成的图片与视频的保存目录dreams

如何确认成功

脚本正常跑完后,检查 output_dir(如 dreams)目录下是否生成了插值图片和视频文件。

常见问题

Q:在 Apple M1 上运行报错怎么办?

A:MPS 不支持 torch.float16,按 README 提示把 torch_dtype 改成 torch.float32 即可。

Q:分辨率可以随便设吗?

A:README 要求 height/width 大于 512 时用 64 的倍数,小于 512 时用 8 的倍数,否则可能报错或画面异常。

Q:没有本地 GPU 能玩吗?

A:可以,使用 README 中提供的 Colab 笔记本在线运行,免费 GPU 即可完成示例生成。

Q:运行很慢或提示显存不足?

A:首次运行需下载模型权重;显存不足可改用 float16、降低分辨率或减少 num_interpolation_steps。

注意事项

  • README 未给出 Python 版本与 CUDA 版本要求,请自行确认环境兼容性
  • 示例代码在 README 中被截断,output_dir 之后的内容请参考仓库 examples 目录
  • 生成的视频与图片会写入 output_dir,注意磁盘空间占用

核心亮点

  • 通过潜在空间插值实现文本提示间的平滑过渡,生成连贯视频,而非简单帧拼接
  • 基于Hugging Face Diffusers构建,易于集成和扩展,支持自定义Stable Diffusion模型
  • 提供CLI和Python API,使用门槛低,适合快速原型验证和创意实验

不足之处

  • 文档/社区待观察
  • 视频生成速度较慢,依赖GPU资源,长视频生成可能不稳定

适用场景

  • 创意广告和短视频制作,实现文本到动态视觉的快速生成
  • 艺术家的生成艺术探索,用于制作风格迁移或概念可视化视频
  • AI教育演示,展示Stable Diffusion的潜在空间特性

替代项目

Deforum Stable Diffusion、Stable Diffusion WebUI (AUTOMATIC1111) 的动画扩展、RunwayML

项目介绍

stable-diffusion-videos 是视频领域的开源项目,由 nateraw 开发,2022 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(4,709)位列前 9%,在视频分类的 473 个项目里位列前 6%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。Apache-2.0许可证,可免费使用和部署,无在线服务。

它主要面向的使用场景是:创意广告和短视频制作,实现文本到动态视觉的快速生成。同类可对比的替代方案包括 Deforum Stable Diffusion、Stable Diffusion WebUI (AUTOMATIC1111) 的动画扩展、RunwayML。

上一篇:MoneyPrinterTurbo

下一篇:video

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 125106 2026-08-09
seedance-2.0-api 开源

快速上手字节Seedance 2.0,文本/图片一键生成视频

Seedance 2.0 API — text-to-video and image-to-video examples

★ 332 2026-08-26
openscreen 开源

免费无水印录屏做演示,替代 Screen Studio

Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···

★ 3185 2026-08-10
MagicDance 开源

一张图+任意动作,生成身份不变的逼真人物视频

[ICML 2024] MagicPose(also known as MagicDance): Realistic Human Poses and Facial Ex···

★ 777 2026-08-09