llava
本站收录 29 个带「llava」标签的 AI 开源项目
LLaVA视觉指令微调(Visual Instruction Tuning)的开创性工作,NeurIPS 2023 Oral 论文。通过指令微调赋予视觉语言模型 GPT-★ 25,045
SUPIRSUPIR 是一个面向真实世界图像修复的开源项目,旨在通过深度学习算法将低质量、模糊或有噪声的照片恢复为高分辨率、逼真的图像。它基于 Stable Diffus★ 5,673
mlx-vlmMLX-VLM 是一个专为 Mac 用户设计的视觉语言模型(VLM)推理与微调工具包,基于 Apple 的 MLX 框架构建。它解决了在 Mac 上运行大型多模★ 5,549
VLMEvalKitVLMEvalKit 是一个开源的大语言多模态模型(LMMs)评估工具包,旨在解决多模态模型评测标准不统一、评测流程繁琐的问题。它支持 220 多个主流 LMM★ 4,418
LLamaSharpLLamaSharp 是一个面向 C#/.NET 开发者的本地大语言模型推理库,基于 llama.cpp 的高效 C++ 内核封装,提供纯托管代码的 API 接★ 3,804
EagleEagle 是一个前沿的视觉-语言模型(VLM)项目,强调以数据为中心的策略来提升模型性能。它解决了当前多模态模型在数据利用效率和训练效果上的瓶颈,通过精心设计★ 3,641
OmAgentOmAgent 是一个用于快速构建多模态语言智能体的开源框架,旨在帮助开发者从原型到生产环境无缝部署。它解决了传统语言模型在处理图像、视频等非文本数据时的局限,★ 2,666
Video-ChatGPTVideo-ChatGPT 是一个面向视频对话的多模态大模型,发表于 ACL 2024。它结合了大型语言模型(如 Vicuna、LLaMA)与预训练视觉编码器(★ 1,512
tagguitaggui 是一个面向图像数据集的标签管理与自动标注工具,主要解决 Stable Diffusion 等模型训练前数据准备阶段中标签混乱、手工标注效率低的问题★ 1,351
LLaVA-ppLLaVA++ 是在经典多模态模型 LLaVA 基础上做的扩展版本,核心思路是把 LLaVA 的视觉编码器与更强的语言模型 Phi-3、LLaMA-3 结合,从★ 842
PaddleMIXPaddleMIX是百度飞桨生态下的多模态大模型套件,旨在统一支持主流多模态任务,包括图文理解、视觉问答、图像生成等。它集成了端到端的大规模多模态预训练模型和扩★ 723
LLaVA-MiniLLaVA-Mini 是一个统一的大规模多模态模型(LMM),旨在高效处理图像、高分辨率图像和视频的理解任务。它解决了传统多模态模型在处理高分辨率图像和视频时计★ 576
RLAIF-VRLAIF-V 是一个面向多模态大语言模型的可信度优化框架,核心解决开源模型在视觉问答中过度自信、生成不可信内容的问题。它利用开源AI反馈(RLAIF)替代昂贵★ 461
Open-LLaVA-NeXTOpen-LLaVA-NeXT 是一个开源实现,旨在复现和训练 LLaVA-NeXT 多模态大模型。它解决了社区中缺乏完整、可复现的 LLaVA-NeXT 训练★ 440
OlympusOlympus 是一个面向计算机视觉任务的通用任务路由器,由 CVPR 2025 Highlight 论文官方开源。它旨在解决多模态大模型(如 LLaVA)在处★ 427
lmms-finetunelmms-finetune 是一个极简的多模态大模型微调代码库,旨在降低 LMM(Large Multimodal Model)微调的门槛。它支持多种主流模型,★ 376
HallusionBenchHallusionBench 是一个针对多模态大语言模型(如 GPT-4V、LLaVA-1.5)的图像上下文推理基准测试集,旨在揭示模型在视觉问答中因视觉错觉或★ 343
ViP-LLaVAViP-LLaVA是CVPR 2024收录的多模态大模型,旨在让模型理解任意视觉提示(如点、框、涂鸦等),而不仅限于文本指令。它解决了现有视觉语言模型只能处理全★ 338
LRV-InstructionLRV-Instruction 是一个用于缓解大型多模态模型(LMM)幻觉问题的开源项目,其核心方法是通过鲁棒的指令微调来提升模型对视觉内容的忠实度。项目针对当★ 297
VideoGPT-plusVideoGPT-plus 是论文《VideoGPT+: Integrating Image and Video Encoders for Enhanced V★ 294
ai-devicesai-devices 是一个基于 TypeScript 的 AI 设备模板项目,集成了 Whisper 语音识别、TTS 语音合成、Groq 加速推理、Llam★ 291
LLaVARLLaVAR 是一个面向文本密集型图像理解的多模态对话助手,基于 LLaVA 架构进行增强,通过指令微调提升模型对图像中文字内容的识别与推理能力。它解决了传统视★ 268
LLaVA-MoDLLaVA-MoD 是一个面向多模态大语言模型的高效压缩方案,通过结合混合专家(MoE)与知识蒸馏技术,将原本庞大的 LLaVA 模型压缩为轻量级版本,同时保持★ 227
VideoHighlighterVideoHighlighter 是一个基于 Ollama 的本地 AI 视频分析工具,目标是让视频理解完全离线、免费运行。它通过视觉搜索、自动高光提取、场景/★ 142
Modality-Integration-RateModality-Integration-Rate 是 ICCV 2025 论文的官方代码,提出了一种名为“模态整合率”(Modality Integratio★ 114
Awesome-Token-Merge-for-MLLMs这是一个关于多模态大语言模型(MLLMs)中Token合并、减少、重采样和丢弃技术的论文列表项目。它系统整理了该方向的前沿研究,帮助研究者和开发者快速了解如何通★ 90
HoliTomHoliTom是一个针对视频大语言模型(Video LLM)的推理加速工具,核心思路是“整体令牌合并”(Holistic Token Merging)。视频模型★ 86
MLM_FilterMLM_Filter 是一个用于图像-文本数据过滤的开源工具,基于论文《Finetuned Multimodal Language Models are Hig★ 71
captaincaptain 是一个为计算机赋予“AI 大脑”的开源项目,核心定位是图像生成与理解。它基于 TypeScript 构建,集成了 LLaVA、LLM、LoRA ★ 61