vision-and-language

本站收录 24 个带「vision-and-language」标签的 AI 开源项目

awesome-generative-ai-guide这是一个聚合生成式AI研究资源的一站式仓库,主要面向研究人员、工程师和学习者。项目整理了最新的生成式AI论文、研究动态、面试题、实用笔记和代码示例,帮助用户快速★ 29,638maestroMaestro 是一个专注于多模态模型微调的开源工具,旨在简化 PaliGemma 2、Florence-2 和 Qwen2.5-VL 等视觉-语言模型的定制流★ 2,696OmAgentOmAgent 是一个用于快速构建多模态语言智能体的开源框架,旨在帮助开发者从原型到生产环境无缝部署。它解决了传统语言模型在处理图像、视频等非文本数据时的局限,★ 2,666awesome-japanese-llm这是一个专门汇总日本语大语言模型(LLM)资源的精选清单项目,旨在解决日语NLP领域模型分散、信息难找的问题。它系统整理了各类支持日语的LLM,包括开源模型、商★ 1,433ONE-PEACEONE-PEACE 是一个跨视觉、音频、语言三种模态的通用表示模型,旨在探索一种能处理无限模态的统一表征框架。它解决了传统模型只能处理单一或少数模态、难以共享和★ 1,060PointLLMPointLLM 是一个让大语言模型直接理解三维点云的开源多模态模型,解决了传统大模型只能处理文本和图像、无法感知三维结构的问题。它首次将点云编码器与 LLaM★ 1,056DoRADoRA(权重分解低秩适配)是ICML 2024口头报告论文的官方PyTorch实现,一种参数高效微调方法。它通过将预训练权重分解为幅度和方向两个分量,并对方向★ 1,000groundingLMMGLaMM(Grounding Large Multimodal Model)是CVPR 2024提出的首个能够将自然语言响应与对象分割掩码无缝集成的多模态大模★ 970Awesome-Prompting-on-Vision-Language-Model这是一个关于视觉语言模型提示工程的精选论文列表,源自一篇系统综述论文。它系统梳理了提示工程在视觉语言基础模型上的应用,包括文本提示、视觉提示和综合提示等方向。项★ 513Awesome_Matching_Pretraining_Transfering这是一个精选论文列表项目,收录了大型多模态模型(LMM)在感知、生成、统一方面的前沿研究,同时覆盖参数高效微调(PEFT)、视觉-语言预训练(VLP)以及传统图★ 446GiTGiT是一个面向通用视觉任务的Transformer模型,源自ECCV 2024 Oral论文。它通过统一的语言接口,将图像分类、目标检测、图像分割和图像生成等★ 365RS5MRS5M是一个面向遥感领域的大规模视觉-语言数据集,由复旦大学等机构发布,旨在解决遥感图像理解中缺乏高质量图文对数据的问题。该数据集包含超过500万张遥感图像及★ 318ChatGPT-OpenAI-Smart-Speaker这是一个基于Python的开源AI智能音箱项目,旨在将普通音箱升级为支持语音和视觉交互的智能助手。它利用OpenAI的GPT-4模型,结合语音识别(STT)、文★ 316LRV-InstructionLRV-Instruction 是一个用于缓解大型多模态模型(LMM)幻觉问题的开源项目,其核心方法是通过鲁棒的指令微调来提升模型对视觉内容的忠实度。项目针对当★ 297LLaVARLLaVAR 是一个面向文本密集型图像理解的多模态对话助手,基于 LLaVA 架构进行增强,通过指令微调提升模型对图像中文字内容的识别与推理能力。它解决了传统视★ 268FrozenBiLMFrozenBiLM 是一个用于零样本视频问答(VideoQA)的开源模型,来自 NeurIPS 2022 论文。它解决的是在没有任何视频标注数据的情况下,直接★ 159X-PromptX-Prompt 是一个面向自回归视觉语言基础模型的通用上下文图像生成框架。它解决的是现有自回归模型在图像生成时难以灵活利用上下文信息、缺乏统一提示机制的问题。★ 158DallEvalDallEval 是一个用于评估文本到图像生成模型的推理能力与社会偏见的开源项目,源自 ICCV 2023 论文。它提供了系统的评估框架和工具,帮助研究者和开发★ 141VLM-GrounderVLM-Grounder 是一个面向零样本 3D 视觉定位的智能体框架,基于视觉语言模型(VLM)实现。它解决了传统 3D 视觉定位依赖大量标注数据和预训练检测★ 133Awesome-Colorful-LLM这是一个精选资源列表,汇总了近期大型语言模型(LLM)在多领域的最新进展,涵盖视觉、音频、智能体、机器人、数学等基础科学。项目旨在帮助研究者和开发者快速追踪LL★ 130VideoGLaMMVideoGLaMM 是一个面向视频像素级视觉定位的大型多模态模型,由南洋理工大学等机构在 CVPR 2025 发表。它解决的是视频中细粒度对象理解与定位问题,★ 106ZoomEyeZoomEye 是一个增强多模态大语言模型(MLLMs)的视觉探索能力的开源项目,核心思路是模仿人类“缩放”观察图像的行为。它通过树状图像探索策略,让模型能够从★ 95ShowAnythingShowAnything 是一个基于视觉与语言模型的视频生成与编辑工具,旨在通过自然语言指令或交互式点击,实现对视频中任意目标的精准识别、分割与编辑。它解决了传★ 84safe-clipSafe-CLIP 是一个针对视觉-语言模型的安全增强工具,主要解决 CLIP 类模型在图像生成和检索任务中可能生成或检索到 NSFW(不宜工作场所)内容的问题★ 68