DallEval

测出文生图模型的推理短板与偏见,优化生成质量

DallEval 是一个用于评估文本到图像生成模型的推理能力与社会偏见的开源项目,源自 ICCV 2023 论文。它提供了系统的评估框架和工具,帮助研究者和开发者深入理解模型在复杂推理任务(如空间关系、计数、属性绑定等)上的表现,同时检测模型生成内容中可能存在的性别、种族等社会偏见。核心能力包括:定义多维度的评估任务、提供标准化的测试数据集、实现自动化评估指标与可视化分析。通过该工具,用户可以对比不同模型的优劣,定位模型在特定认知任务上的短板,并量化偏见程度,从而指导模型改进和负责任的 AI 部署。项目代码基于 Jupyter Notebook,易于扩展和复现实验结果。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 141
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队j-min
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,免费使用,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言Jupyter Notebook
技术栈/模型evaluation,text-to-image,vision-and-language
GitHub 星标★ 141
30天Star增速
HF 下载量
上线时间2022-02-02 00:00:00
最近更新2026-08-24 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

核心亮点

  • 首个系统评估文生图模型推理能力与偏见的开源工具,填补空白
  • 提供细粒度任务分解(如空间、计数、属性),可精准定位模型弱点
  • 基于 ICCV 2023 论文,方法论严谨,评估指标有学术背书

不足之处

  • 项目处于早期阶段,文档和社区支持待观察
  • 依赖特定数据集和模型接口,扩展新模型需一定适配成本

适用场景

  • 对比不同文生图模型(如 DALL-E、Stable Diffusion)的推理能力
  • 在模型迭代中检测社会偏见,确保生成内容公平性
  • 学术研究:复现论文实验或扩展新的评估维度

替代项目

T2I-CompBench、HEIM (Holistic Evaluation of Text-to-Image Models)、Winoground

项目介绍

DallEval 是评测安全领域的开源项目,由 j-min 开发,2022 年首次发布。

它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 141。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-24。MIT许可证,免费使用,无付费版本。

它主要面向的使用场景是:对比不同文生图模型(如DALL-E、StableDiffusion)的推理能力。同类可对比的替代方案包括 T2I-CompBench、HEIM (Holistic Evaluation of Text-to-Image Models)、Winoground。

上一篇:WatermarkDM

下一篇:SafeGen_CCS2024

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12