vision-language-model
本站收录 75 个带「vision-language-model」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
LLaVA视觉指令微调(Visual Instruction Tuning)的开创性工作,NeurIPS 2023 Oral 论文。通过指令微调赋予视觉语言模型 GPT-★ 25,045
X-AnyLabelingX-AnyLabeling 是一款轻量、高效、跨平台的桌面标注工具,专为文本、图像、视频和多模态数据设计。它集成了丰富的内置标注工具(如矩形框、多边形、关键点等★ 10,569
InternVLInternVL 是一个开源的多模态对话模型家族,旨在成为 GPT-4o 的开源替代方案,在 CVPR 2024 上获得 Oral 论文。它解决了开源社区缺乏高★ 10,169
minimind-vMiniMind-V 是一个从零开始训练视觉多模态大模型(VLM)的开源项目,目标是在极低资源条件下(如单张消费级显卡)用约2小时训练出一个仅65M参数的小型视★ 8,701
mlx-vlmMLX-VLM 是一个专为 Mac 用户设计的视觉语言模型(VLM)推理与微调工具包,基于 Apple 的 MLX 框架构建。它解决了在 Mac 上运行大型多模★ 5,549
MineContextMineContext 是一个主动式的上下文感知 AI 助手,基于 Context-Engineering 理念构建,结合 ChatGPT Pulse 技术,旨★ 5,532
align-anythingAlign Anything 是一个面向全模态模型的对齐训练框架,旨在解决多模态模型(文本、图像、音频、视频等)在人类反馈对齐方面的碎片化问题。它提供统一的训练★ 4,670
lmms-evallmms-eval 是一个面向多模态大模型的一站式评测工具包,支持文本、图像、视频和音频任务的统一评估。它解决了多模态模型评测标准不一、任务分散、复现困难的问题★ 4,437
DeepSeek-VLDeepSeek-VL 是深度求索推出的开源视觉语言模型,旨在弥合真实世界视觉理解与语言模型之间的鸿沟。它解决的是多模态理解问题,即让模型能同时处理图像和文本,★ 4,179
MiniMax-01MiniMax-01 是 MiniMax 官方发布的模型仓库,包含 MiniMax-Text-01 和 MiniMax-VL-01 两个模型,分别对应大型语言模★ 3,468
OGAMOGAM 是一款面向手机和 Mac 的离线 AI 全能工具箱,目标是把原本依赖云端 API 的多种 AI 能力全部搬到本地设备上运行。它基于 GGUF 格式的本★ 3,177
InternLM-XComposerInternLM-XComposer 是上海人工智能实验室推出的多模态大模型系统,最新版本 2.5-OmniLive 专注于长时流式视频与音频的实时交互。它解决★ 2,928
CradleCradle 是一个旨在实现通用计算机控制(GCC)的智能体框架,是这一领域的首次尝试。它让智能体能够像人类一样操作任何计算机软件,通过标准化通用环境,以最小化★ 2,594
Qwen-VL-Series-Finetune这是阿里云 Qwen-VL 系列多模态大模型的开源微调实现,面向需要让视觉语言模型适配自有数据的开发者。项目支持 Qwen2-VL、Qwen2.5-VL、Qwe★ 1,972
Awesome-LLM4ADAwesome-LLM4AD 是一个持续更新的精选资源列表,聚焦于大语言模型(LLM)、视觉语言模型(VLM)、视觉语言动作模型(VLA)以及世界模型在自动驾驶★ 1,890
video-search-and-summarization这是NVIDIA推出的视频搜索与摘要参考架构(VSS Blueprint),旨在帮助开发者快速构建GPU加速的视频分析智能体。它解决了传统视频分析中检索效率低、★ 1,884
vllm-mlxvllm-mlx 是一个专为 Apple Silicon 芯片设计的开源推理服务器,兼容 OpenAI 和 Anthropic API 协议。它解决了在 Mac★ 1,607
thepipethepipe 是一个基于视觉语言模型(VLM)的文档数据清洗工具,专门解决从复杂文档(如扫描件、PDF、PPT、表格、手写笔记等)中提取干净结构化数据的问题。★ 1,529
OvisOvis是一个多模态大语言模型(MLLM)架构,旨在从结构上对齐视觉和文本嵌入。它解决了传统多模态模型在融合视觉与语言信息时存在的语义鸿沟问题,通过创新的嵌入对★ 1,525
awesome-japanese-llm这是一个专门汇总日本语大语言模型(LLM)资源的精选清单项目,旨在解决日语NLP领域模型分散、信息难找的问题。它系统整理了各类支持日语的LLM,包括开源模型、商★ 1,433
mlx-tunemlx-tune 是一个专为 Apple Silicon Mac 设计的 LLM 微调工具,基于 MLX 框架原生运行,让开发者无需云端 GPU 即可在本地完成★ 1,414
VisRAGVisRAG 是一个基于视觉语言模型(VLM)的解析免检索增强生成(RAG)框架。传统 RAG 依赖文本解析(如 PDF 转文本),而 VisRAG 直接将文档★ 981
groundingLMMGLaMM(Grounding Large Multimodal Model)是CVPR 2024提出的首个能够将自然语言响应与对象分割掩码无缝集成的多模态大模★ 970
Chat-UniViChat-UniVi 是一个统一图像与视频理解的多模态大语言模型,由 CVPR 2024 Highlight 论文提出。它通过一种统一的视觉表示方法,将图像和视★ 944
dsh-vision-toolkitdsh-vision-toolkit 是一个为纯文本大模型补上视觉能力的工具箱,以 DeepSeek Harness 插件形式提供。它解决的核心问题是:很多文本★ 884
OpenCUAOpenCUA 是一个为计算机使用智能体(Computer-Use Agents)提供开放基础的开源项目,入选 NeurIPS 2025 Spotlight。它★ 849
VoxPoserVoxPoser 是一个将大语言模型(LLM)与机器人操作相结合的框架,旨在让机器人仅通过自然语言指令就能完成复杂的物理操作任务。它解决了传统机器人编程需要专业★ 838
Awesome-Robotics-3DAwesome-Robotics-3D 是一个精选资源列表,专注于大模型(LLM/VLM)时代下机器人领域的 3D 视觉研究。它系统整理了相关论文、代码和网站,★ 825
OmniVinciOmniVinci 是一个全模态大语言模型,旨在联合理解视觉、音频和语言信息。它解决的是传统多模态模型往往只支持文本与图像,而难以同时处理音频、视频等多种模态数★ 683
SpatialVIDSpatialVID 是一个面向视频生成与空间智能研究的大规模视频数据集,由 CVPR 2026 论文提出。它解决了现有视频数据集缺乏空间标注、难以支撑 4D ★ 601
GromaGroma 是一个基于多模态大语言模型(MLLM)的视觉定位模型,核心创新在于“局部视觉标记化”(Localized Visual Tokenization)。★ 586
LLaVA-MiniLLaVA-Mini 是一个统一的大规模多模态模型(LMM),旨在高效处理图像、高分辨率图像和视频的理解任务。它解决了传统多模态模型在处理高分辨率图像和视频时计★ 576
Multi-Modality-ArenaMulti-Modality-Arena 是一个基于 Gradio 构建的多模态模型评测平台,灵感来自 Chatbot Arena,但专注于视觉-语言模型(VL★ 566
ARIS-in-AI-OfferARIS-in-AI-Offer 是一个面向 AI 领域秋招的中英双语面试速查表项目,由 ARIS 工具链自动生成。它解决 AI 求职者备考资料分散、更新不及时★ 559
InstructCVInstructCV 是一个基于指令微调文本到图像扩散模型的视觉通用框架,源自 ICLR 2024 论文。它旨在解决传统视觉模型任务单一、泛化能力弱的问题,通过★ 463
Open-LLaVA-NeXTOpen-LLaVA-NeXT 是一个开源实现,旨在复现和训练 LLaVA-NeXT 多模态大模型。它解决了社区中缺乏完整、可复现的 LLaVA-NeXT 训练★ 440
OlympusOlympus 是一个面向计算机视觉任务的通用任务路由器,由 CVPR 2025 Highlight 论文官方开源。它旨在解决多模态大模型(如 LLaVA)在处★ 427
OPERAOPERA是一个针对多模态大语言模型幻觉问题的开源工具,源自CVPR 2024 Highlight论文。它通过过度信任惩罚和回溯分配机制,有效缓解模型在生成文本★ 414
Stream-OmniStream-Omni 是一个类似 GPT-4o 的多模态对话助手,能够同时处理文本、语音和视觉输入,并支持多种模态组合的交互。它解决了传统对话系统只能处理单一★ 392
colpali-cookbooksColPali Cookbooks 是一个面向多模态 RAG(检索增强生成)场景的实战教程仓库,专注于 ColPali 模型的微调与适配。它解决了传统文本嵌入无★ 357
EvoCUAEvoCUA 是一个正在演进中的计算机使用智能体(Computer Use Agent)开源项目,旨在让 AI 像人一样操作电脑,自动完成跨应用的复杂任务。它解★ 348
franken_ocrfranken_ocr 是一个用纯 Rust 实现的 CPU 端 OCR 推理引擎,目标模型是百度 Unlimited-OCR——一个基于 DeepSeek-O★ 332
Awesome-Multimodal-LLM-Autonomous-Driving这是一个聚焦多模态大语言模型(MLLM)在自动驾驶领域应用的精选资源列表,源自WACV 2024综述论文。项目系统梳理了该交叉方向的研究进展,包括数据集、模型架★ 311
embodied-agentsembodied-agents 是一个旨在将最先进的 Transformer 模型无缝集成到机器人技术栈中的开源项目。它主要解决机器人与大模型(如视觉语言模型)★ 300
vidore-benchmarkViDoRe 是一个针对视觉文档检索(Vision Document Retrieval)的基准测试项目,源自 ColPali 论文。它提供了一套标准化的评估代★ 279
Medical_Image_AnalysisMedical_Image_Analysis 是一个专注于医学图像分析的开源项目,旨在利用基础模型(Foundation Models)解决医学影像领域的核心问★ 242
FM-AD-SurveyFM-AD-Survey 是一个持续更新的综述论文仓库,专注于大型基础模型(Foundation Models)在自动驾驶场景生成与分析中的应用。它系统收集和整★ 238
GenAI4ADGenAI4AD 是一个系统梳理生成式人工智能(GenAI)在自动驾驶全栈中应用的开源项目。它并非一个可直接运行的模型,而是一份深度综述与知识图谱,覆盖从感知、★ 233
AttackVLMAttackVLM 是一个针对视觉语言模型(VLM)的红队攻击工具集,源自 NeurIPS 2023 论文。它提供了一系列对抗性攻击方法,用于评估和揭示 VLM★ 231
InCTRLInCTRL 是 CVPR 2024 论文的官方实现,提出了一种基于上下文残差学习的通用异常检测方法。它解决的是传统异常检测模型泛化能力差、需要针对每个新场景重★ 202