Gen-L-Video

用多文本拼接生成长视频,时间协同去噪无缝衔接

Gen-L-Video 是一个基于扩散模型的多文本到长视频生成与编辑的开源项目,对应论文《Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising》。它主要解决现有文本到视频模型只能生成短视频、且难以支持多文本分段编辑的问题。核心能力是通过时间协同去噪(Temporal Co-Denoising)机制,将多个短视频片段无缝拼接成长视频,同时支持在视频不同段落应用不同的文本提示,实现内容变化和风格统一。项目基于 Stable Diffusion 等扩散模型,提供了视频生成和编辑的完整流程,包括对现有视频进行局部修改、扩展时长等。技术栈涉及 Jupyter Notebook 示例,适合研究者复现和二次开发。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 307
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队G-U-N
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0许可,可免费使用和修改,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Jupyter Notebook
技术栈/模型diffusion-models,long-video-generation,stable-diffusion,text-to-video,text2video,video-editing,video-generation
GitHub 星标★ 307
30天Star增速
HF 下载量
上线时间2023-05-30 00:00:00
最近更新2026-08-20 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

核心亮点

  • 提出时间协同去噪方法,解决多文本长视频生成中的片段衔接问题
  • 支持视频编辑,可对已有视频进行局部修改和时长扩展
  • 基于 Stable Diffusion,生态兼容性好,便于集成现有模型

不足之处

  • 项目为早期研究代码,文档和社区支持待观察
  • 依赖 Jupyter Notebook,工程化程度较低,部署使用门槛较高

适用场景

  • 研究者复现论文,探索多文本视频生成方法
  • 创作者对现有视频进行多段文本驱动的编辑和扩展
  • 开发基于扩散模型的视频生成工具,需长视频能力

替代项目

ModelScope Text-to-Video、VideoFusion、CogVideo

项目介绍

Gen-L-Video 是视频领域的开源项目,由 G-U-N 开发,2023 年首次发布。

它收录于视频分类,该分类目前共有 473 个项目,GitHub 星标数为 307。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-20。Apache-2.0许可,可免费使用和修改,无付费版本。

它主要面向的使用场景是:研究者复现论文,探索多文本视频生成方法。同类可对比的替代方案包括 ModelScope Text-to-Video、VideoFusion、CogVideo。

上一篇:RAVE

下一篇:LAMP

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 125106 2026-08-09
seedance-2.0-api 开源

快速上手字节Seedance 2.0,文本/图片一键生成视频

Seedance 2.0 API — text-to-video and image-to-video examples

★ 332 2026-08-26
openscreen 开源

免费无水印录屏做演示,替代 Screen Studio

Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···

★ 3185 2026-08-10
MagicDance 开源

一张图+任意动作,生成身份不变的逼真人物视频

[ICML 2024] MagicPose(also known as MagicDance): Realistic Human Poses and Facial Ex···

★ 777 2026-08-09