DreamOmni2

一句话指令,精准编辑和生成图像,多模态统一搞定。

DreamOmni2 是一个基于多模态指令的图像编辑与生成统一模型,来自 CVPR2026 Highlight 论文的官方实现。它解决的是传统图像编辑工具难以理解复杂自然语言指令、且生成与编辑能力割裂的问题。核心能力包括:接受文本、图像、区域框等多模态输入,精准执行局部编辑、风格迁移、物体插入/移除、全景生成等任务;采用统一的 Transformer 架构,将编辑和生成任务整合到同一框架,支持多轮交互式修改;同时具备高分辨率输出和细粒度控制能力。项目提供完整的训练和推理代码,支持主流深度学习框架,并附带预训练模型权重,方便研究者复现和二次开发。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1982
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队JIA-Lab-research
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型image-editing,image-generation,unified-generation-editing-model
GitHub 星标★ 1982
30天Star增速
HF 下载量
上线时间2025-09-28 00:00:00
最近更新2026-09-16 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:进阶 约 15 分钟 部署方式:本地安装 5 步

环境要求

  • 已安装 Git,可访问 GitHub
  • 已安装 Python 与 pip(能执行 pip install)
  • 已安装 huggingface-cli(huggingface_hub)用于下载权重
  • 磁盘空间充足,用于存放 DreamOmni2 模型权重
  • 网络可访问 GitHub 与 Hugging Face

安装与启动步骤

  1. 1克隆代码仓库

    从 GitHub 拉取 DreamOmni2 官方代码到本地,README 提供的仓库地址为 dvlab-research/DreamOmni2。

    git clone https://github.com/dvlab-research/DreamOmni2
  2. 2进入项目目录

    切换到刚克隆下来的 DreamOmni2 目录,后续安装与下载都在该目录内执行。

    cd ./DreamOmni2
  3. 3安装 Python 依赖

    按 README 要求安装 requirements.txt 中列出的必要依赖,建议先建好虚拟环境再执行。

    pip install -r requirements.txt
  4. 4下载模型权重

    用 huggingface-cli 把 xiabs/DreamOmni2 权重下载到项目下的 models 目录,README 明确要求放在此目录。

    huggingface-cli download --resume-download --local-dir-use-symlinks False xiabs/DreamOmni2 --local-dir ./models
  5. 5在线体验(可选)

    若只想快速试用,README 提供了 Hugging Face 编辑/生成两个官方 Space,可直接在浏览器中使用。

如何确认成功

克隆后目录内出现 requirements.txt,且 ./models 目录成功下载到 DreamOmni2 权重文件,即表示环境准备完成。

常见问题

Q:下载权重中途断了怎么办?

A:README 的下载命令自带 --resume-download,重新执行同一条命令即可断点续传,无需删除已下载文件。

Q:没有本地环境能先看看效果吗?

A:可以。README 提供了官方 Hugging Face Space 编辑与生成两个在线 Demo,直接在浏览器打开即可体验。

Q:权重必须放在某个固定路径吗?

A:README 明确将权重下载到 ./models 目录,建议保持该路径不变,避免后续代码默认读取不到。

Q:跑通安装后怎么推理?

A:README 节选中只给出了克隆、装依赖、下载权重三步,未提供推理脚本命令,请以仓库后续文档为准。

注意事项

  • README 节选中未给出推理/训练的具体启动命令,相关用法需查看仓库完整文档。
  • 模型权重文件较大,下载耗时较长,请预留足够的磁盘空间与时间。
  • 官方同时提供 Hugging Face Space 在线 Demo,可作为本地部署前的快速验证方式。
  • 安装依赖建议在独立虚拟环境中进行,避免污染系统 Python 环境。

核心亮点

  • 多模态指令理解能力强,支持文本+图像+区域框组合输入,编辑意图把握准确
  • 统一编辑与生成架构,一个模型搞定局部修改、风格迁移和全景生成,无需切换工具
  • CVPR 2026 Highlight 论文官方实现,代码质量高,提供预训练权重,复现门槛低

不足之处

  • 模型参数量较大,推理资源需求高,普通消费级显卡难以流畅运行
  • 文档/社区待观察

适用场景

  • 设计师快速生成和迭代创意素材,如根据描述修改产品图背景或风格
  • 影视后期制作中,对视频帧进行局部重绘或物体替换,保持风格一致
  • 电商场景中,根据用户自然语言描述自动生成商品展示图或个性化定制图

替代项目

InstructPix2Pix、ControlNet、SEED-X

项目介绍

DreamOmni2 是图像领域的开源项目,由 JIA-Lab-research 开发,2025 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,982)位列前 30%,在图像分类的 839 个项目里位列前 10%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-16。Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:设计师快速生成和迭代创意素材,如根据描述修改产品图背景或风格。同类可对比的替代方案包括 InstructPix2Pix、ControlNet、SEED-X。

上一篇:gpt-image2-ecommerce

下一篇:comfy-prompt-studio

同类项目推荐

satori 开源

网页代码一键变高清图,放大不糊,不用截图

Enlightened library to convert HTML and CSS to SVG

★ 13967 2026-08-09
C2GAN 开源

用关键点精准控制图像生成,让AI画出你想要的结构

[ACM MM 2019 Oral] Cycle In Cycle Generative Adversarial Networks for Keypoint-Guide···

★ 70 2026-08-09
imagen-pytorch 开源

说句话生成高清图,放大也不糊

Implementation of Imagen, Google's Text-to-Image Neural Network, in Pytorch

★ 8427 2026-08-09