DF-GAN

用简单结构高效实现文本到图像生成,性能媲美复杂模型。

DF-GAN是一个用于文本到图像合成的生成对抗网络模型,发表于CVPR 2022 oral。它针对现有文本生成图像方法中生成器结构复杂、训练不稳定且依赖额外辅助网络的问题,提出了一个简单而有效的基线。其核心是深度融合模块(DF block),通过将文本嵌入在多个尺度上以通道级方式与图像特征深度融合,并利用目标感知判别器(Target-Aware Discriminator)强化文本与图像的语义对齐。DF-GAN在CUB鸟类和COCO数据集上取得了当时最优的FID和IS分数,同时保持了较少的参数和更快的训练速度。该模型为文本到图像生成领域提供了一个简洁、高效且易于复现的基准方法,适合作为后续研究的起点。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 326
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队tobran
所属国家
官网地址
定价模式free
价格说明开源项目,完全免费,需自行部署使用
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型generative-adversarial-network,text-to-image
GitHub 星标★ 326
30天Star增速
HF 下载量
上线时间2020-08-14 00:00:00
最近更新2026-07-14 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

核心亮点

  • 结构简洁,无额外辅助网络,训练更稳定
  • 深度融合模块有效提升文本与图像语义对齐
  • 在CUB和COCO上达到当时最优FID/IS,且参数更少

不足之处

  • 代码和文档相对简略,社区生态未形成
  • 仅支持特定数据集,通用性待验证

适用场景

  • 学术研究:作为文本生成图像的基线对比方法
  • 创意设计:根据文字描述快速生成概念图
  • 数据增强:为NLP任务生成图像样本

替代项目

AttnGAN、StackGAN、DALL-E

项目介绍

DF-GAN 是图像领域的开源项目,由 tobran 开发,2020 年首次发布。

它收录于图像分类,该分类目前共有 837 个项目,GitHub 星标数为 326。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-07-14。完全免费,需自行部署使用。

它主要面向的使用场景是:学术研究:作为文本生成图像的基线对比方法。同类可对比的替代方案包括 AttnGAN、StackGAN、DALL-E。

上一篇:FIBO

下一篇:stable-diffusion-colab

同类项目推荐

satori 开源

网页代码一键变高清图,放大不糊,不用截图

Enlightened library to convert HTML and CSS to SVG

★ 13967 2026-08-09
C2GAN 开源

用关键点精准控制图像生成,让AI画出你想要的结构

[ACM MM 2019 Oral] Cycle In Cycle Generative Adversarial Networks for Keypoint-Guide···

★ 70 2026-08-09
ComfyUI 开源

像搭积木一样连节点,生图流程自己搭

The most powerful and modular diffusion model GUI, api and backend with a graph/node···

★ 134493 2026-08-09