MM-Diffusion 是视频领域的开源项目,由 researchmm 开发,2022 年首次发布。
它收录于视频分类,该分类目前共有 472 个项目,GitHub 星标数为 453。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-08。MIT许可证,可免费使用和部署。
它主要面向的使用场景是:短视频自动配音。同类可对比的替代方案包括 VideoFusion、Imagen Video、Make-A-Video。

一个模型同时生成匹配的音频和视频,告别音画不同步。
MM-Diffusion是CVPR 2023提出的多模态扩散模型,用于联合生成音频和视频。它解决的是传统生成模型只能处理单一模态、难以实现音视频同步生成的问题。核心能力在于通过设计多模态扩散过程,让音频和视频在生成过程中相互约束、协同进化,从而生成时间上对齐、内容上匹配的音视频片段。该模型基于Denoising Diffusion Probabilistic Models(DDPM)扩展而来,支持从文本或类别条件生成短视频及其对应音频。项目提供了完整的训练和推理代码,以及预训练模型,方便研究者复现和二次开发。
VideoFusion、Imagen Video、Make-A-Video
MM-Diffusion 是视频领域的开源项目,由 researchmm 开发,2022 年首次发布。
它收录于视频分类,该分类目前共有 472 个项目,GitHub 星标数为 453。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-08。MIT许可证,可免费使用和部署。
它主要面向的使用场景是:短视频自动配音。同类可对比的替代方案包括 VideoFusion、Imagen Video、Make-A-Video。
上一篇:CVPR23_LFDM
下一篇:flatten
MoneyPrinterTurbo
开源
输入一句话,高清短视频自动出炉,文案配音全包了
利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···
seedance-2.0-api
开源
快速上手字节Seedance 2.0,文本/图片一键生成视频
Seedance 2.0 API — text-to-video and image-to-video examples
openscreen
开源
免费无水印录屏做演示,替代 Screen Studio
Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···
auto-subs
开源
在剪辑软件里直接生成字幕,省去导出导入的麻烦
On-device subtitle generation that connects directly to DaVinci Resolve, Premiere, a···