VLM2Vec

把视觉语言模型变成万能嵌入器,搞定多模态搜索和分类

VLM2Vec 是一个将视觉语言模型(VLM)适配为多功能嵌入模型的开源项目,核心解决多模态内容(图像、文本、视频等)的统一向量化表示问题。它提出了 MMEB(多模态嵌入基准)系列,包括 MMEB、MMEB-V2 和 MMEB-V3,用于评估模型在分类、检索、视觉问答、视觉推理等任务上的表现。项目提供完整的训练和评估代码,支持从预训练 VLM 出发,通过对比学习等方法生成通用嵌入,使模型能够同时处理多种模态输入并输出语义向量。其核心能力在于将 VLM 的强语义理解能力迁移到嵌入任务,从而提升跨模态检索和下游任务的准确率。项目代码基于 Python 和深度学习框架,适合研究多模态表示学习或构建多模态搜索系统的开发者使用。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 686
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类搜索知识
开发团队TIGER-AI-Lab
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,代码公开,可自由使用,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型benchmark,contrastive-learning,embedding,image-retrieval,mmeb,multimodal,rag,representation-learning,video-retrieval,visual-document-retrieval,vlm
GitHub 星标★ 686
30天Star增速
HF 下载量
上线时间2024-10-07 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

核心亮点

  • 提出 MMEB 系列基准,覆盖分类、检索、VQA 等多种任务,评估全面
  • 支持图像、文本、视频等多模态输入,统一输出嵌入向量,适用性广
  • 提供从训练到评估的完整代码,基于主流 VLM,易于复现和扩展

不足之处

  • 项目仍处于早期,文档和社区支持有待完善
  • 依赖大规模预训练 VLM,训练和推理资源需求较高

适用场景

  • 多模态内容搜索(如按图搜文、按文搜图)
  • 视觉问答和推理任务的嵌入表示
  • 多模态分类和聚类(如商品图片+描述分类)

替代项目

CLIP、BridgeTower、UniIR

项目介绍

VLM2Vec 是开发框架领域的开源项目,由 TIGER-AI-Lab 开发,2024 年首次发布。

它收录于开发框架分类,该分类目前共有 803 个项目,GitHub 星标数为 686。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。Apache-2.0许可证,代码公开,可自由使用,无付费版本。

它主要面向的使用场景是:多模态内容搜索(如按图搜文、按文搜图)。同类可对比的替代方案包括 CLIP、BridgeTower、UniIR。

上一篇:swiftide

下一篇:RAGLight

同类项目推荐

langchain 开源

组装 AI 应用的乐高积木,从想法到上线不换工具

The agent engineering platform.

★ 146874 2026-08-09
transformers 开源

全球最大的模型仓库全家桶,想用的模型一把抓

Transformers: the model-definition framework for state-of-the-art machine learning m···

★ 166529 2026-08-09
pi 开源

一套 TypeScript 工具包,快速搭出能写代码的 AI agent

AI agent toolkit: unified LLM API, agent loop, TUI, coding agent CLI

★ 108504 2026-09-12