visual-question-answering
本站收录 12 个带「visual-question-answering」标签的 AI 开源项目
awesome-multimodal-in-medical-imaging这是一个关于医学影像中多模态学习应用资源的精选列表,收录了论文、数据集、代码和工具,覆盖多模态融合、跨模态生成、医学视觉语言模型等方向。它解决了医学影像领域多模★ 982
MMMUMMMU 是一个大规模多学科多模态理解与推理基准测试集,旨在评估和推动 AI 模型在专家级通用人工智能(AGI)方向上的能力。它包含来自艺术、工程、科学等六大领★ 597
KG-MM-SurveyKG-MM-Survey 是一份关于知识图谱与多模态学习交叉领域的系统性综述列表。它整理了知识图谱如何与图像、文本等多模态数据结合的研究工作,覆盖跨模态检索、实★ 507
MathVistaMathVista 是一个专注于视觉数学推理的开源项目,提供数据集、代码和评估工具,用于测试和提升 AI 模型在包含图表、几何图形、数学表达式等视觉场景下的数学★ 367
MMStarMMStar 是一个用于评估大型视觉语言模型(LVLMs)的基准测试工具,源自 NeurIPS 2024 论文。它解决了现有评估基准中模型可能通过语言先验或训练★ 217
tifaTIFA 是一个用于评估文本到图像生成模型忠实度的开源工具,由微软研究院开发。它通过将输入文本提示分解为若干原子问题,并利用视觉问答(VQA)模型对生成的图像进★ 189
FrozenBiLMFrozenBiLM 是一个用于零样本视频问答(VideoQA)的开源模型,来自 NeurIPS 2022 论文。它解决的是在没有任何视频标注数据的情况下,直接★ 159
RWKV_APPRWKV_APP 是一个基于 Flutter 构建的跨平台本地优先聊天应用,支持 Android、iOS、Windows、macOS 和 Linux。它旨在为 ★ 129
Flipped-VQAFlipped-VQA 是一个面向视频问答(VideoQA)的推理框架,核心思想是让大型语言模型(LLM)作为时间与因果推理器,通过翻转视频问答中的问题与答案生★ 77
VIEScoreVIEScore 是一个面向条件图像合成评估的可解释性指标框架,源自 ACL 2024 论文。它解决传统图像生成评估指标(如 FID、CLIP Score)黑盒★ 68
VisualWebBenchVisualWebBench 是一个针对多模态大语言模型(MLLMs)在网页理解与定位(Grounding)任务上的评估框架,源自同名论文。它解决的核心问题是:★ 68
PhyXPhyX 是一个专注于物理推理能力评估的开源基准测试项目,旨在回答“你的模型是否具备物理推理的‘智慧’”。它通过设计一系列需要物理常识和因果推断的任务,来测试大★ 55