Lexicon3D

测出视觉模型对三维世界的真实理解力

Lexicon3D 是一个面向复杂三维场景理解的开源评测框架,发表于 NeurIPS 2024。它系统性地探究了视觉基础模型(如 CLIP、DINOv2 等)在三维场景中的感知能力,通过设计多样化的三维任务(如物体识别、空间关系判断、场景描述等),揭示现有视觉模型在从二维图像迁移到三维空间时的表现与局限。项目提供了标准化的评测流程、数据集和基准结果,帮助研究者量化模型对三维结构的理解程度,并指导未来三维视觉模型的改进方向。核心能力包括:多任务三维评测基准、跨模型对比分析、以及可扩展的评测接口。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 102
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队YunzeMan
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型foundation-models,llm,scene-understanding,vlm
GitHub 星标★ 102
30天Star增速
HF 下载量
上线时间2024-06-24 00:00:00
最近更新2026-09-14 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

核心亮点

  • 首个系统评测视觉基础模型三维理解力的基准,填补空白
  • 覆盖多种三维任务,从物体识别到空间关系,维度全面
  • 提供标准化评测代码和结果,便于复现与扩展

不足之处

  • 项目处于早期阶段,文档和社区支持尚待完善
  • 评测任务可能偏向特定场景,泛化性需进一步验证

适用场景

  • 三维视觉模型性能横向对比
  • 研究视觉基础模型的空间推理短板
  • 指导三维场景理解模型的迭代优化

替代项目

ScanNet、SUN RGB-D、SemanticKITTI

项目介绍

Lexicon3D 是计算机视觉领域的开源项目,由 YunzeMan 开发,2024 年首次发布。

它收录于计算机视觉分类,该分类目前共有 447 个项目,GitHub 星标数为 102。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-14。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:三维视觉模型性能横向对比。同类可对比的替代方案包括 ScanNet、SUN RGB-D、SemanticKITTI。

上一篇:VideoGLaMM

下一篇:EndoDAC

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4019 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90930 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
Olympus 开源

一个路由搞定所有视觉任务,免去逐个微调

[CVPR 2025 Highlight] Official code for "Olympus: A Universal Task Router for Comput···

★ 427 2026-08-09