GPT4Point

让AI看懂3D点云,听懂人话,直接生成和编辑3D模型。

GPT4Point 是一个面向3D点云与语言统一理解与生成的框架,来自CVPR 2024 Highlight。它解决的是3D点云数据与自然语言之间跨模态对齐的难题,使模型能够理解点云内容并根据文本指令生成或编辑3D对象。核心能力包括:基于大语言模型构建点云-文本对齐的预训练范式,支持点云描述、问答、生成和编辑等多种任务;提供PointQA数据集和基准,用于训练和评估;采用分层点云标记器将点云转换为语言模型可处理的token序列,实现端到端生成。项目代码开源,支持自定义数据集和模型微调,为3D视觉语言研究提供了统一的基础设施。

开源 free 数字人3D
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 447
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类数字人3D
开发团队Pointcept
所属国家
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型3d-generation,llm,multimodal-learning
GitHub 星标★ 447
30天Star增速
HF 下载量
上线时间2023-08-12 00:00:00
最近更新2026-09-07 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数1

使用教程

核心亮点

  • 首个统一框架同时覆盖点云理解与生成,任务范围广
  • 提供PointQA数据集和基准,便于复现和对比
  • 基于LLM架构,可复用成熟语言模型生态,扩展性强

不足之处

  • 早期项目,文档和社区支持尚待完善
  • 依赖大规模点云-文本配对数据,数据获取成本高

适用场景

  • 3D内容自动生成与编辑,辅助游戏/影视资产制作
  • 自动驾驶场景中基于语言指令的点云理解与交互
  • 机器人抓取与操作中的3D场景语义解析

替代项目

PointCLIP、Point-BERT、ULIP

项目介绍

GPT4Point 是计算机视觉领域的开源项目,由 Pointcept 开发,2023 年首次发布。

它收录于计算机视觉分类,该分类目前共有 447 个项目,GitHub 星标数为 447。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-07。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:3D内容自动生成与编辑,辅助游戏/影视资产制作。同类可对比的替代方案包括 PointCLIP、Point-BERT、ULIP。

上一篇:ArtEq

下一篇:sparsefusion

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4019 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90930 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2046 2026-08-14