vlm

本站收录 95 个带「vlm」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

transformersHugging Face 出品的模型定义框架,支持文本、视觉、音频与多模态模型,覆盖推理与训练全流程,是当前研究和生产中最主流的开源模型生态基石。★ 166,817UI-TARS-desktopUI-TARS-desktop 是字节跳动开源的多模态 AI Agent 桌面栈,目标是把前沿视觉语言模型与 Agent 基础设施打通,让 AI 能像人一样操作★ 39,158sglangSGLang 是一个高性能的大语言模型和多模态模型服务框架,旨在解决 LLM 推理服务中吞吐量低、延迟高、显存利用率不足等问题。它通过 RadixAttenti★ 36,594runanywhere-sdksrunanywhere-sdks 是一个面向生产环境的 C++ 工具包,旨在让 AI 模型在本地设备上高效运行。它解决了云端推理带来的延迟、隐私和成本问题,提供★ 10,318PixelRAGPixelRAG 是一个面向像素级原生搜索的开源项目,旨在终结传统网页解析的繁琐流程。它解决的核心问题是:当信息以图像、图表、截图等视觉形式存在时,传统基于文本★ 10,116notebooks这是一个计算机视觉领域的教程合集,基于 Jupyter Notebook 编写,旨在帮助开发者从基础到前沿系统学习视觉模型与技术。项目覆盖了从 ResNet 等★ 9,696anomaly-detection-resources这是一个异常检测领域的精选资源清单,汇集了书籍、论文、视频和工具箱,覆盖从经典统计方法到深度学习、大语言模型(LLM)和视觉语言模型(VLM)的最新进展。项目持★ 9,406GenieXGenieX 是一个专为高通设备设计的开源推理引擎,旨在让开发者通过几行代码即可在本地运行前沿的大语言模型(LLM)和视觉语言模型(VLM)。它充分利用高通芯片★ 8,406ERNIEERNIE是百度开源的预训练语言模型系列,本仓库为ERNIE 4.5及ERNIEKit工业级开发工具包的官方实现,基于PaddlePaddle深度学习框架。ER★ 7,737VLM-R1VLM-R1 是一个将强化学习(RL)应用于视觉语言模型(VLM)的开源项目,旨在提升模型在视觉理解任务中的推理能力。它基于 DeepSeek-R1 的 RL ★ 6,029UltraRAGUltraRAG 是一个基于 Python 的低代码 MCP(Model Context Protocol)框架,用于构建复杂且创新的 RAG(检索增强生成)流★ 5,711LLM-RL-VisualizedLLM-RL-Visualized 是一个专注于大语言模型(LLM)和强化学习(RL)算法可视化的开源项目,由《大模型算法》作者倾力打造。项目提供了100多张原★ 4,922star-vectorStarVector 是一个用于 SVG 生成的基础模型,它将矢量图转换任务重构为代码生成任务。基于视觉-语言建模架构,StarVector 能同时处理图像和文★ 4,611lmms-evallmms-eval 是一个面向多模态大模型的一站式评测工具包,支持文本、图像、视频和音频任务的统一评估。它解决了多模态模型评测标准不一、任务分散、复现困难的问题★ 4,437PromptEnhancerPromptEnhancer 是一个提示词重写工具,旨在将用户输入的图像生成提示词优化为更清晰、结构化的版本,从而提升生成图像的质量。它基于视觉语言模型(VLM★ 3,779evalscopeevalscope 是一个面向大语言模型(LLM)、视觉语言模型(VLM)和生成式 AI(AIGC)的评估与性能基准测试框架。它旨在解决模型评测流程繁琐、标准不★ 3,490MiniMax-01MiniMax-01 是 MiniMax 官方发布的模型仓库,包含 MiniMax-Text-01 和 MiniMax-VL-01 两个模型,分别对应大型语言模★ 3,468Local-File-OrganizerLocal-File-Organizer 是一款基于 AI 的本地文件管理工具,旨在通过智能整理本地文本和图片文件来提升文件检索效率。它利用 Llama3.2 ★ 3,340Skywork-R1VSkywork-R1V 是由昆仑万维 Skywork AI 开发的多模态推理模型系列,专注于视觉-语言联合推理任务。它解决了传统多模态模型在复杂视觉问答中推理能★ 3,172OSWorldOSWorld 是一个用于评估多模态 AI 智能体在真实计算机环境中执行开放式任务能力的基准测试平台,发表于 NeurIPS 2024。它解决了现有基准测试环境★ 3,165DeepCameraDeepCamera 是一个开源的 AI 摄像头技能平台,定位为智能 NVR 和闭路监控系统。它解决传统监控只能录像、无法理解视频内容的问题,通过本地 VLM(★ 3,079OmAgentOmAgent 是一个用于快速构建多模态语言智能体的开源框架,旨在帮助开发者从原型到生产环境无缝部署。它解决了传统语言模型在处理图像、视频等非文本数据时的局限,★ 2,666CradleCradle 是一个旨在实现通用计算机控制(GCC)的智能体框架,是这一领域的首次尝试。它让智能体能够像人类一样操作任何计算机软件,通过标准化通用环境,以最小化★ 2,594paperbananapaperbanana 是 Google Research 论文中 PaperBanana 的开源实现与扩展,旨在自动化生成学术图表、示意图和研究可视化,并拓展★ 2,386Gpt-Agreement-PaymentGpt-Agreement-Payment 是一套针对 ChatGPT Plus/Team/Pro 订阅协议进行端到端重放的工具集,核心解决自动化订阅流程中遇到★ 2,278tokenspeedTokenSpeed 是一个主打极致推理速度的 LLM 推理引擎,目标是让大模型在现有硬件上跑出“光速”级别的 token 生成速度。它通过优化内存访问、算子融★ 2,186Awesome-LM-SSPAwesome-LM-SSP 是一个聚焦大模型安全、隐私与可信度的精选阅读清单,收录了相关论文、工具、数据集和攻击防御方法。它系统梳理了提示注入、越狱攻击、隐私★ 2,081Qwen-VL-Series-Finetune这是阿里云 Qwen-VL 系列多模态大模型的开源微调实现,面向需要让视觉语言模型适配自有数据的开发者。项目支持 Qwen2-VL、Qwen2.5-VL、Qwe★ 1,972video-search-and-summarization这是NVIDIA推出的视频搜索与摘要参考架构(VSS Blueprint),旨在帮助开发者快速构建GPU加速的视频分析智能体。它解决了传统视频分析中检索效率低、★ 1,884OpenGUIOpenGUI 是一个面向 Android 的 GUI 智能体框架,旨在让 AI 像人一样“看、想、操作”手机应用。它通过无障碍服务(Accessibility★ 1,811awesome-yolo-object-detectionawesome-yolo-object-detection 是一个精选 YOLO 目标检测系列开源项目和数据集的资源合集。它系统整理了 YOLO 从 v1 到 ★ 1,794react-native-executorchreact-native-executorch 是一个将 Meta 的 ExecuTorch 推理引擎封装为 React Native 原生模块的开源库,让开发★ 1,750AngelSlimAngelSlim 是一个面向大语言模型的开源压缩工具包,旨在让模型压缩更易用、更全面、更高效。它解决了模型部署中体积大、推理慢、成本高的问题,提供从剪枝、量化★ 1,668Awesome-Jailbreak-on-LLMs这是一个聚焦大语言模型越狱攻击方法的精选资源库,系统整理了学术界和工业界关于LLM安全漏洞的最新研究。项目收集了论文、代码、数据集、评估工具和分析报告,覆盖从提★ 1,659awesome-vlm-architectures这是一个精心整理的视觉语言模型(VLM/MLLM)架构目录,收录了155+个相关模型,涵盖论文、架构图、训练配方、数据集以及发布时间线。项目以可视化的方式呈现多★ 1,324cosmo-edgecosmo-edge 是一个面向生产环境的 C++ 边缘 AI 推理引擎,专注视频分析与端侧视觉语言模型(VLM)部署。它解决的核心问题是:边缘设备芯片平台碎片★ 1,235AutomodelAutomodel 是一个基于 PyTorch 分布式原生的 LLM/VLM 训练库,目标是让大模型微调像调用 Hugging Face 一样简单。它直接兼容 ★ 985mindnlpmindnlp 是一个开源项目,旨在将 Hugging Face 生态的 Transformers 和 Diffusers 模型无缝迁移到华为 MindSpor★ 920MindActMindAct 是一个让 Hugging Face 的 Transformers 与 Diffusers 模型无缝运行在华为昇腾 MindSpore 框架上的适★ 920gpt-assistant-androidgpt-assistant-android 是一款安卓端的全场景 GPT 语音助手,通过无障碍服务监听音量键,实现一键唤起语音对话,无需手动打开应用。它解决了移★ 906NEONEO 是一个从第一性原理出发构建的原生视觉-语言模型系列,旨在解决当前多模态模型依赖外部视觉编码器、架构复杂且训练不透明的问题。项目强调端到端的原生多模态理解★ 896awesome-ai-persona-skills这是一个汇集了100多个人格化AI技能的合集项目,旨在为多智能体系统提供丰富的角色扮演能力。它解决了AI对话中角色单一、缺乏个性的问题,通过'蒸馏'技术将名人的★ 893UniPicUniPic 是一个开源的 SOTA 多图像编辑模型,专注于通过自然语言指令对多张输入图像进行联合编辑。它解决了传统图像编辑模型只能处理单张图像、难以理解多图之★ 875Awesome-Robotics-3DAwesome-Robotics-3D 是一个精选资源列表,专注于大模型(LLM/VLM)时代下机器人领域的 3D 视觉研究。它系统整理了相关论文、代码和网站,★ 825mobilegymMobileGym 是一个面向移动端 GUI 智能体研究的可验证、高并行仿真平台,论文已被 EMNLP 2026 收录。它把安卓模拟器搬进浏览器,无需真机或本地★ 801dingoDingo 是一个面向 AI 数据、模型与应用的质量评测工具,用 Python 编写。它要解决的问题是:大模型项目里数据质量参差不齐、模型输出难以量化评估,团队★ 757SparkVSRSparkVSR 是一个基于稀疏关键帧传播的交互式视频超分辨率工具,由 ECCV 2026 论文提出。它解决传统视频超分方法计算量大、无法实时交互的问题,通过智★ 741VLM2VecVLM2Vec 是一个将视觉语言模型(VLM)适配为多功能嵌入模型的开源项目,核心解决多模态内容(图像、文本、视频等)的统一向量化表示问题。它提出了 MMEB(★ 689yzmayzma 是一个用 Go 语言直接封装 llama.cpp 的本地推理框架,目标是让 Go 开发者无需依赖 CGO 或外部服务,就能在应用中嵌入大语言模型和多模★ 642optimum-intelOptimum Intel 是 Hugging Face 与 Intel 合作推出的优化工具库,旨在通过 Intel 的 OpenVINO 等工具加速 Tran★ 624