vision-language-models

本站收录 13 个带「vision-language-models」标签的 AI 开源项目

awesome-vlm-architectures这是一个精心整理的视觉语言模型(VLM/MLLM)架构目录,收录了155+个相关模型,涵盖论文、架构图、训练配方、数据集以及发布时间线。项目以可视化的方式呈现多★ 1,324JarvisArtJarvisArt 是一个基于大语言模型的智能照片修图代理,旨在解放人类艺术创造力。它通过理解用户的自然语言指令,自动完成从图像分析、风格迁移到细节调整等一系列★ 8724KAgent4KAgent 是一个基于智能体(Agent)的任意图像 4K 超分辨率开源项目,发表于 NeurIPS 2025。它解决传统超分模型对输入图像类型敏感、难以处★ 831ParseBenchParseBench 是一个面向 AI Agent 的文档解析基准测试工具,旨在解决 LLM 应用中文档解析能力难以量化评估的问题。它提供了一套标准化的评测流程★ 592awesome-vla-for-ad这是一个聚焦视觉-语言-动作模型(VLA)在自动驾驶领域应用的精选资源列表,系统梳理了该方向从过去到未来的研究脉络。项目解决了自动驾驶领域研究者难以快速获取VL★ 483Code-as-WorldCode-as-World 是一个面向物理推理的智能体研究项目,核心思路是让 AI 智能体通过生成可执行代码来发现和表达物理世界的规律。它把视频理解、视觉语言模★ 467EVEEVE是北京智源人工智能研究院(BAAI)推出的免编码器视觉语言模型系列。传统视觉语言模型通常依赖预训练的视觉编码器(如ViT)来提取图像特征,而EVE直接以像★ 376Awesome-LVLM-Hallucination这是一个持续更新的精选列表,汇总了大型视觉语言模型(LVLM)幻觉研究的最新论文、资源和相关工作。它旨在解决LVLM在生成文本时可能产生与图像内容不符的幻觉信息★ 332DriveBenchDriveBench 是一个面向自动驾驶场景的视觉语言模型(VLM)评测基准,源自 ICCV 2025 论文。它系统性地从可靠性、数据和指标三个维度,评估 GP★ 252Awesome-Anomaly-Detection-Foundation-Models这是一个精选列表,汇集了基于基础模型(如大语言模型、视觉-语言模型、图基础模型、时间序列基础模型)进行异常检测的相关论文和资源。项目旨在为研究者和工程师提供一个★ 223GPA-LMGPA-LM是一个关于游戏智能体与大模型交叉领域的论文实时列表,收录了题为《A Survey on Game Playing Agents and Large ★ 163GeoPixelGeoPixel 是一个面向高分辨率遥感影像分析的像素级定位多模态大模型。它解决的是遥感图像中多目标精细定位与理解的问题,能够对图像中的多个目标进行像素级的分割★ 155SpatialEvalSpatialEval 是一个用于评估多模态大语言模型(MLLMs)和纯语言模型(LLMs)空间推理能力的基准测试工具,相关论文发表于 NeurIPS 2024★ 61