vqa
本站收录 10 个带「vqa」标签的 AI 开源项目
VLMEvalKitVLMEvalKit 是一个开源的大语言多模态模型(LMMs)评估工具包,旨在解决多模态模型评测标准不统一、评测流程繁琐的问题。它支持 220 多个主流 LMM★ 4,418
InternGPTInternGPT(iGPT)是一个开源的AI模型演示平台,旨在让开发者轻松展示和交互体验多种前沿AI模型。它集成了DragGAN、ChatGPT、ImageB★ 3,206
maestroMaestro 是一个专注于多模态模型微调的开源工具,旨在简化 PaliGemma 2、Florence-2 和 Qwen2.5-VL 等视觉-语言模型的定制流★ 2,696
Multi-Modality-ArenaMulti-Modality-Arena 是一个基于 Gradio 构建的多模态模型评测平台,灵感来自 Chatbot Arena,但专注于视觉-语言模型(VL★ 566
LRV-InstructionLRV-Instruction 是一个用于缓解大型多模态模型(LMM)幻觉问题的开源项目,其核心方法是通过鲁棒的指令微调来提升模型对视觉内容的忠实度。项目针对当★ 297
OmniFusionOmniFusion是一个多模态AI模型,旨在让用户通过文本和图像进行自然交互。它解决了传统单一模态模型无法同时理解和处理文字与图片信息的问题,核心能力包括图像★ 235
mPLUG-2mPLUG-2 是阿里巴巴达摩院提出的模块化多模态基础模型,发表于 ICML 2023。它旨在统一处理文本、图像和视频三种模态,解决传统多模态模型在跨模态理解和★ 227
Awesome-LLM-Papers-Comprehensive-Topics这是一个精选大语言模型(LLM)论文与代码仓库的清单,覆盖了从基础架构、训练方法到应用落地等非常全面的主题。它旨在解决LLM领域信息过载、论文检索困难的问题,通★ 223
FrozenBiLMFrozenBiLM 是一个用于零样本视频问答(VideoQA)的开源模型,来自 NeurIPS 2022 论文。它解决的是在没有任何视频标注数据的情况下,直接★ 159
DSGDSG(Davidsonian Scene Graph)是一个用于文本到图像生成评估的开源项目,发表于ICLR 2024。它针对当前文本到图像模型评估中仅关注整★ 109