Wan2.2

输入一句话,高清视频直接生成

阿里开源的先进大规模视频生成模型 Wan2.2,基于新一代架构实现高质量文生视频与图生视频,在画面质感、运动连贯性与语义理解上表现出色,为开发者与创作者提供强大的视频生成底座。

开源 unknown 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 17598
维护状态 活跃
是否开源 是
定价模式 unknown

项目数据

分类视频生成
开发团队Wan-Video
所属国家
官网地址https://wan.video
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型aigc,video-generation
GitHub 星标★ 17598
30天Star增速
HF 下载量
上线时间2025-07-28 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:高级 约 60 分钟 部署方式:模型权重 8 步

环境要求

  • Linux 环境,已安装 Git 与 Python 及 pip
  • 已配置可用的 CUDA GPU 环境(A14B 模型建议 80GB 显存,TI2V-5B 可 24GB 如 RTX 4090)
  • 提前从 Hugging Face 或 ModelScope 获取模型权重并放到仓库目录下
  • 使用提示词扩展时需申请 Dashscope API Key 或准备本地 Qwen 模型

安装与启动步骤

  1. 1克隆项目仓库

    把 Wan2.2 源码下载到本地并进入项目根目录,后续所有命令都在该目录执行。

    git clone https://github.com/Wan-Video/Wan2.2.git
    cd Wan2.2
  2. 2安装基础依赖

    安装 requirements.txt 中的依赖。若 flash_attn 安装失败,先装其它包最后再单独装它。

    pip install -r requirements.txt
  3. 3安装语音驱动依赖

    仅当要用 CosyVoice 为语音驱动视频生成合成语音时才需要,普通文生/图生视频可跳过。

    pip install -r requirements_s2v.txt
  4. 4准备模型权重

    README 未给出下载命令,请从 Hugging Face 或 ModelScope 下载权重,并放到 ./Wan2.2-T2V-A14B 等对应目录。

  5. 5单卡文生视频

    用 t2v-A14B 跑文生视频,720P 约需 80GB 显存;显存不足可加 --t5_cpu 进一步省显存。

    python generate.py  --task t2v-A14B --size 1280*720 --ckpt_dir ./Wan2.2-T2V-A14B --offload_model True --convert_model_dtype --prompt "Two anthropomorphic cats in comfy boxing gear and bright gloves fight intensely on a spotlighted stage."
  6. 6多卡文生视频

    用 FSDP + DeepSpeed Ulysses 做 8 卡并行加速推理,nproc_per_node 按实际卡数调整。

    torchrun --nproc_per_node=8 generate.py --task t2v-A14B --size 1280*720 --ckpt_dir ./Wan2.2-T2V-A14B --dit_fsdp --t5_fsdp --ulysses_size 8 --prompt "Two anthropomorphic cats in comfy boxing gear and bright gloves fight intensely on a spotlighted stage."
  7. 7开启提示词扩展

    用 Dashscope 的 qwen-plus 扩展提示词提升画质,需先配置 DASH_API_KEY,国际站还要设 DASH_API_URL。

    DASH_API_KEY=your_key torchrun --nproc_per_node=8 generate.py  --task t2v-A14B --size 1280*720 --ckpt_dir ./Wan2.2-T2V-A14B --dit_fsdp --t5_fsdp --ulysses_size 8 --prompt "Two anthropomorphic cats in comfy boxing gear and bright gloves fight intensely on a spotlighted stage" --use_prompt_extend --prompt_extend_method 'dashscope' --prompt_extend_target_lang 'zh'
  8. 8图生视频

    用 i2v-A14B 以示例图片生成视频,size 表示生成视频面积,宽高比跟随输入图。

    python generate.py --task i2v-A14B --size 1280*720 --ckpt_dir ./Wan2.2-I2V-A14B --offload_model True --convert_model_dtype --image examples/i2v_input.JPG --prompt "Summer beach vacation style, a white cat wearing sunglasses sits on a surfboard."

关键配置

配置项必填说明示例
DASH_API_KEY否Dashscope API 密钥,用于调用 qwen 模型扩展提示词sk-xxxxxxxxxxxxxxxx
DASH_API_URL否阿里云国际站用户需设为国际站接口地址https://dashscope-intl.aliyuncs.com/api/v1
--ckpt_dir是模型权重所在目录路径,不同任务指向对应模型文件夹./Wan2.2-T2V-A14B
--prompt_extend_model否指定提示词扩展使用的本地或 Hugging Face 模型Qwen/Qwen2.5-7B-Instruct
--ulysses_size否多卡并行时的 Ulysses 并行度,通常等于 GPU 卡数8

如何确认成功

命令执行完成且日志无 OOM 或报错,运行目录下能看到生成的视频结果文件即成功。

常见问题

Q:运行时报 OOM 显存不足怎么办?

A:加上 --offload_model True、--convert_model_dtype,必要时再加 --t5_cpu;也可改用 ti2v-5B 模型或改用多卡 FSDP 推理。

Q:pip 安装 flash_attn 失败怎么办?

A:README 提示可先安装 requirements.txt 中的其它包,最后再单独安装 flash_attn。

Q:没有 80GB 显存能跑 A14B 吗?

A:单卡 A14B 建议至少 80GB 显存;显存较小时可改用 ti2v-5B(24GB 可跑)或使用多卡并行。

Q:提示词扩展有哪两种方式?

A:一是用 Dashscope 云端 API(配 DASH_API_KEY,t2v 用 qwen-plus、i2v 用 qwen-vl-max);二是用本地 Qwen 模型,通过 --prompt_extend_method local_qwen 指定。

注意事项

  • README 未提供模型权重下载命令,需自行从 Hugging Face 或 ModelScope 获取并放到对应 --ckpt_dir 目录。
  • A14B 单卡推理约需 80GB 显存,多卡命令中的 --nproc_per_node 与 --ulysses_size 请按实际卡数填写。
  • 文图生视频 ti2v-5B 的 720P 分辨率必须写 1280*704 或 704*1280,与其它任务不同。
  • 图生视频任务的 --size 表示生成视频面积,宽高比会自动跟随输入图片。

核心亮点

  • 开源了大规模视频生成模型权重,支持从文本或图像生成视频,技术架构先进,在学术和工业界均有较高影响力。
  • 提供多阶段训练和推理代码,覆盖从基础模型到高级应用的完整流程,便于研究者复现和二次开发。
  • 模型支持多种分辨率与长视频生成,在生成质量和时间一致性上表现突出,社区反馈积极。

不足之处

  • 文档/社区待观察:部分高级功能的配置和使用说明不够详尽,新手入门门槛较高。
  • 训练和推理资源消耗大,对硬件要求高,普通开发者难以在消费级GPU上运行。

适用场景

  • 影视级视频内容自动生成,用于广告、短片和动画的快速原型制作。
  • 科研领域:研究视频生成模型架构、训练策略及评估方法。
  • 交互式创意工具,辅助设计师和内容创作者生成视觉素材。

替代项目

Open-Sora-Plan、CogVideoX、Mochi 1

项目介绍

Wan2.2 是视频领域的开源项目,由 Wan-Video 开发,2025 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(17,598)位列前 3%,在视频分类的 473 个项目里位列前 2%。

近 41 天,它的 GitHub 星标从 17,082 增加到 17,598,净增 516。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。从国内网络环境看,可直接访问。

它主要面向的使用场景是:影视级视频内容自动生成,用于广告、短片和动画的快速原型制作。同类可对比的替代方案包括 Open-Sora-Plan、CogVideoX、Mochi 1。

上一篇:LivePortrait

下一篇:waoowaoo

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 125106 2026-08-09
seedance-2.0-api 开源

快速上手字节Seedance 2.0,文本/图片一键生成视频

Seedance 2.0 API — text-to-video and image-to-video examples

★ 332 2026-08-26
openscreen 开源

免费无水印录屏做演示,替代 Screen Studio

Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···

★ 3185 2026-08-10
MagicDance 开源

一张图+任意动作,生成身份不变的逼真人物视频

[ICML 2024] MagicPose(also known as MagicDance): Realistic Human Poses and Facial Ex···

★ 777 2026-08-09