vision-transformer

本站收录 30 个带「vision-transformer」标签的 AI 开源项目

VARNeurIPS 2024 最佳论文奖的官方实现,提出视觉自回归建模(VAR),通过下一尺度预测生成图像,以超简单易用的方式达到超越扩散模型的最新效果,并揭示了视★ 8,733mlx-vlmMLX-VLM 是一个专为 Mac 用户设计的视觉语言模型(VLM)推理与微调工具包,基于 Apple 的 MLX 框架构建。它解决了在 Mac 上运行大型多模★ 5,549modlensmodlens 是首个为 DeepSeek Harness 打造的视觉插件,旨在为纯文本编码代理(如 DeepSeek、GLM 等)提供视觉理解能力。它解决了文★ 4,071scenicScenic 是 Google 开源、基于 JAX 的计算机视觉研究库,目标是为视觉任务提供一套干净、模块化且高性能的训练与推理框架。它解决的是研究代码重复造轮★ 3,839towheeTowhee 是一个专注于神经数据处理的 Python 框架,旨在让构建和运行 AI 驱动的数据管道变得简单高效。它解决的是从原始数据(文本、图像、音视频等)到★ 3,450InternLM-XComposerInternLM-XComposer 是上海人工智能实验室推出的多模态大模型系统,最新版本 2.5-OmniLive 专注于长时流式视频与音频的实时交互。它解决★ 2,928EVAEVA是北京智源人工智能研究院(BAAI)开源的一系列视觉基础模型,专注于视觉表示学习。它通过大规模对比学习预训练,为图像分类、目标检测、语义分割等下游视觉任务★ 2,695InternVideoInternVideo 是一个面向多模态理解的开源视频基础模型项目,由上海人工智能实验室发布,相关论文发表于 ECCV2024。它旨在解决视频理解中模型泛化能力★ 2,398MambaVisionMambaVision是CVPR 2025官方发布的PyTorch实现,提出了一种混合Mamba-Transformer视觉骨干网络。它针对视觉任务中Mamba★ 2,235lightly-trainlightly-train 是一个面向视觉模型的一体化训练框架,支持 YOLO、ViT、RT-DETR、DINOv3 等主流架构,覆盖预训练、微调和蒸馏全流程。★ 1,692SpargeAttnSpargeAttn 是一个训练无关的稀疏注意力加速库,旨在加速任意模型(尤其是视频生成模型)的推理过程。它通过利用注意力分数中的稀疏性,动态跳过不重要的计算,★ 1,257Awesome-Foundation-ModelsAwesome-Foundation-Models 是一个精选基础模型列表,专注于视觉和语言任务。它系统整理了各类预训练模型,包括多模态、视觉、语言等方向,为研★ 1,178ONE-PEACEONE-PEACE 是一个跨视觉、音频、语言三种模态的通用表示模型,旨在探索一种能处理无限模态的统一表征框架。它解决了传统模型只能处理单一或少数模态、难以共享和★ 1,060Awesome-CV-MasterHubAwesome-CV-MasterHub 是一个计算机视觉领域的论文精选列表,汇总了图像生成、分类、描述、去雾、去噪、增强、融合等多个方向的最新研究成果。它解决★ 978FasterViTFasterViT 是一个面向视觉任务的高效 Transformer 模型,由 NVIDIA 研究人员开发,相关论文发表于 ICLR 2024。它旨在解决传统 ★ 925unicomunicom 是一个大规模视觉表示模型,旨在通过自监督或弱监督学习从海量图像数据中提取通用视觉特征。它解决了传统视觉模型在跨领域泛化能力不足的问题,通过在大规模★ 702eomtEoMT(Encoder-only Mask Transformer)是一个CVPR 2025 Highlight项目,提供仅编码器的掩码Transformer★ 629RAG-Driven-Generative-AI这是一个面向开发者的RAG(检索增强生成)实战教程仓库,提供基于LlamaIndex、Deep Lake和Pinecone构建生成式AI应用的完整代码示例。项目★ 628Remote-Sensing-RVSARemote-Sensing-RVSA 是遥感领域的基础模型开源项目,对应 TGRS'22 论文《Advancing Plain Vision Transfor★ 469NanoLLMNanoLLM 是一个专注于本地大模型推理优化的开源工具库,提供类似 HuggingFace 的简洁 API,支持模型量化、视觉/语言模型、多模态智能体、语音处★ 381GiTGiT是一个面向通用视觉任务的Transformer模型,源自ECCV 2024 Oral论文。它通过统一的语言接口,将图像分类、目标检测、图像分割和图像生成等★ 365Awesome-Multimodal-LLM-Autonomous-Driving这是一个聚焦多模态大语言模型(MLLM)在自动驾驶领域应用的精选资源列表,源自WACV 2024综述论文。项目系统梳理了该交叉方向的研究进展,包括数据集、模型架★ 311ImageFolderImageFolder 是一个面向自回归(AR)和变量自回归(VAR)图像生成模型的高性能图像分词器。它解决了传统图像生成中像素级建模效率低、难以捕捉全局结构的★ 307AnomalyDINOAnomalyDINO 是一个基于 DINOv2 的少样本异常检测开源模型,发表于 WACV2025。它针对工业质检中标注样本稀缺的问题,通过增强 patch ★ 255MTPMTP 是 JSTARS'24 论文的官方实现,提出了一种面向遥感基础模型的多任务预训练方法。它通过同时学习多个遥感任务(如场景分类、语义分割、目标检测等)来训★ 253ControlVARControlVAR 是一个基于自回归扩散模型的图像生成控制框架,旨在解决传统扩散模型在条件生成中控制粒度不足的问题。它通过将可变长度自回归(VAR)与扩散模型★ 127Awesome-Token-Merge-for-MLLMs这是一个关于多模态大语言模型(MLLMs)中Token合并、减少、重采样和丢弃技术的论文列表项目。它系统整理了该方向的前沿研究,帮助研究者和开发者快速了解如何通★ 90FedKTLFedKTL 是一个面向异构联邦学习的知识迁移框架,核心解决在客户端数据分布不均、算力差异大的场景下,如何高效利用服务端预训练生成模型(如GAN)向客户端迁移知★ 69computer-vision-challenge这是一个面向所有人的计算机视觉实战项目合集,基于Jupyter Notebook编写,涵盖CNN、图像分类、目标检测等经典算法。项目通过一系列可运行的代码示例和★ 68HMARHMAR 是一个面向图像生成任务的高效分层掩码自回归模型,发表于 CVPR 2025。它针对现有自回归图像生成方法计算开销大、生成速度慢的问题,提出了一种分层掩★ 63