sd-webui-text2video

在 Stable Diffusion WebUI 里直接输入文字,一键生成视频片段

sd-webui-text2video 是一个为 Stable Diffusion WebUI(Auto1111)开发的扩展插件,旨在让用户无需额外安装复杂的依赖,就能直接在熟悉的 WebUI 界面中实现文本生成视频(text2video)功能。它集成了 ModelScope 和 VideoCrafter 等先进的扩散模型,将文本描述转化为连贯的视频片段。该扩展解决了 Stable Diffusion 生态中视频生成门槛高、工具链割裂的问题,通过复用 WebUI 现有的 Gradio 界面和底层依赖,用户只需输入提示词、调整参数,即可生成短视频。其核心能力包括:支持多种文本生成视频模型、提供友好的参数配置界面、与 WebUI 无缝集成,以及支持视频预览和导出。项目目前处于成长阶段,代码开源,适合希望探索 AI 视频生成的研究者、开发者和创意工作者。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1322
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队kabachuha
所属国家
官网地址
定价模式free
价格说明开源扩展,免费使用,需自行部署到Auto1111 WebUI。
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型automatic1111,extension,gradio,modelscope,stable-diffusion,text2video,videocrafter,webui
GitHub 星标★ 1322
30天Star增速
HF 下载量
上线时间2023-03-19 00:00:00
最近更新2026-08-20 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:进阶 约 20 分钟 部署方式:本地安装 6 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 已安装并可正常运行的 AUTOMATIC1111 Stable Diffusion WebUI
  • NVIDIA GPU,显存建议 6GB 以上(256x256 + 低显存 VAE)
  • 如需长视频:12GB 显存可跑 24 帧 256x256,支持 Torch2 注意力优化可到 125 帧
  • 无需任何账号登录,模型均为可下载权重

安装与启动步骤

  1. 1准备 Auto1111

    该扩展运行在 AUTOMATIC1111 WebUI 之上,请先确保 WebUI 本身能正常启动出图。

  2. 2获取扩展代码

    把扩展放进 WebUI 的 extensions 目录(README 未给出具体命令,此处按扩展常规方式推断)。

    git clone https://github.com/kabachuha/sd-webui-text2video extensions/sd-webui-text2video
  3. 3重启 WebUI

    重启 WebUI 让扩展被加载,首次运行会自行下载所需模型权重,无需登录。

  4. 4调整显存设置

    显存有限时选择 256x256 分辨率并启用低显存 VAE;4GB 显存可尝试 192x192。

  5. 5生成视频

    在界面输入提示词(README 示例:best quality, anime girl dancing),生成短视频片段。

  6. 6接入自训练模型

    用 ExponentialML/Text-To-Video-Finetuning 的转换脚本,把 Diffusers 格式模型转回原始权重格式后使用。

如何确认成功

重启 WebUI 后能加载扩展并进入其 text2video 相关页签,即视为安装成功。

常见问题

Q:需要登录或申请模型权限吗?

A:不需要。README 说明该扩展只用 Auto1111 WebUI 已有的依赖和可下载的模型权重,全程无需任何登录。

Q:显存不够怎么办?

A:README 指出 6GB 显存配低显存 VAE 可跑 256x256,也有用户在 4GB 显存下跑通 192x192,可先降低分辨率。

Q:能生成多长的视频?

A:24 帧 256x256 可放进 12GB 的 RTX 2080 Ti;显卡支持 Torch2 注意力优化时可做到 125 帧(8 秒),250 帧(16 秒)约需 20GB。

Q:可以用自己微调的模型吗?

A:可以。借助 ExponentialML 的 Text-To-Video-Finetuning 仓库微调,再用其 PR 中的脚本把 Diffusers 格式转成原始权重格式即可在本扩展使用。

注意事项

  • README 节选未提供安装命令、参数或路径,步骤中的克隆路径按 Auto1111 扩展惯例推断,请以官方仓库说明为准。
  • 项目维护状态曾多次变更(2023-11-21 起先后停止维护、由 Deforum-art 维护,后由原作者恢复维护),使用前请确认仓库当前状态。
  • 显存需求与分辨率、帧数强相关,长视频会显著增加显存占用。
  • 该扩展复用 WebUI 的 Gradio 界面与底层依赖,因此必须先有可用的 Auto1111 环境。

核心亮点

  • 深度集成 Auto1111 WebUI,无需额外安装复杂依赖,上手门槛低
  • 支持 ModelScope 和 VideoCrafter 两大主流文本生成视频模型,选择灵活
  • 复用 WebUI 的 Gradio 界面,参数调整和视频预览体验流畅

不足之处

  • 生成视频长度和分辨率受限于模型,通常较短且清晰度有限
  • 文档/社区待观察

适用场景

  • 在 Stable Diffusion 工作流中快速生成概念视频或动态预览
  • 用于短视频创作、广告素材的快速原型设计
  • 作为 AI 视频生成教学和实验的平台

替代项目

Deforum Stable Diffusion Extension、Text2Video-Zero、AnimateDiff

项目介绍

sd-webui-text2video 是视频领域的开源项目,由 kabachuha 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,322)位列前 30%,在视频分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-20。开源扩展,免费使用,需自行部署到Auto1111 WebUI。

它主要面向的使用场景是:在StableDiffusion工作流中快速生成概念视频或动态预览。同类可对比的替代方案包括 Deforum Stable Diffusion Extension、Text2Video-Zero、AnimateDiff。

上一篇:swd

下一篇:ebsynth_utility

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 125106 2026-08-09
seedance-2.0-api 开源

快速上手字节Seedance 2.0,文本/图片一键生成视频

Seedance 2.0 API — text-to-video and image-to-video examples

★ 332 2026-08-26
openscreen 开源

免费无水印录屏做演示,替代 Screen Studio

Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···

★ 3185 2026-08-10
auto-subs 开源

在剪辑软件里直接生成字幕,省去导出导入的麻烦

On-device subtitle generation that connects directly to DaVinci Resolve, Premiere, a···

★ 4266 2026-08-10