PointLLM

让大模型看懂三维点云,直接对话物体细节

PointLLM 是一个让大语言模型直接理解三维点云的开源多模态模型,解决了传统大模型只能处理文本和图像、无法感知三维结构的问题。它首次将点云编码器与 LLaMA 等大语言模型深度融合,通过两阶段训练(先对齐点云与文本特征,再指令微调)实现三维物体识别、描述和自然语言问答。核心能力包括:基于 Objaverse 大规模三维数据集训练、支持点云与文本的跨模态理解、可生成细粒度的物体描述并回答开放性问题。项目提供了完整的训练、评估和推理代码,并附带人工评估基准,在三维理解任务上显著优于现有方法。其创新点在于将点云表示与大模型生成能力结合,为具身智能、三维场景理解等方向提供了基础模型。

开源 free 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1056
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类对话助手
开发团队InternRobotics
所属国家
定价模式free
价格说明开源项目,代码公开,可自行部署使用,无收费计划。
访问状态
是否开源是
开源协议
主要语言Python
技术栈/模型3d,chatbot,foundation-models,gpt-4,large-language-models,llama,multimodal,objaverse,point-cloud,pointllm,representation-learning,vision-and-language
GitHub 星标★ 1056
30天Star增速
HF 下载量
上线时间2023-08-17 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:进阶 约 10 分钟 部署方式:本地安装 4 步

环境要求

  • Ubuntu 20.04 操作系统
  • NVIDIA 显卡驱动 515.65.01,CUDA 11.7
  • Python 3.10.13(README 用 conda 创建 python=3.10 环境)
  • PyTorch 2.0.1
  • Transformers 4.28.0.dev(transformers.git@cae78c46)
  • 已安装 conda 与 git,并能访问 GitHub

安装与启动步骤

  1. 1克隆项目仓库

    从 README 给出的 SSH 地址克隆仓库并进入项目目录,需提前配置好 GitHub SSH key。

    git clone git@github.com:OpenRobotLab/PointLLM.git
    cd PointLLM
  2. 2创建 conda 环境

    新建名为 pointllm 的独立环境,Python 版本按 README 固定为 3.10,避免污染系统环境。

    conda create -n pointllm python=3.10 -y
  3. 3激活环境并升级 pip

    激活刚创建的环境,再升级 pip 以支持 PEP 660 的可编辑安装方式。

    conda activate pointllm
    pip install --upgrade pip
  4. 4安装依赖包

    在项目根目录执行可编辑安装,按照 setup 脚本自动拉取并安装 PointLLM 全部依赖。

    pip install -e .

如何确认成功

README 节选只覆盖安装步骤,未给出启动或推理命令;环境激活后能正常导入项目包即视为安装成功。

常见问题

Q:克隆时提示 Permission denied (publickey) 怎么办?

A:README 给出的是 SSH 地址,需先在本地配置 GitHub SSH key;若使用 HTTPS 方式,请自行核对仓库的正确 HTTPS 地址后再克隆。

Q:没有 NVIDIA 显卡可以运行吗?

A:README 的测试环境为 NVIDIA 驱动 515.65.01 + CUDA 11.7,说明依赖 NVIDIA GPU;节选中没有提供纯 CPU 的运行方案。

Q:conda 环境名必须是 pointllm 吗?

A:不是必须的,可以自行改名,但创建与激活时的名称要保持一致,后续命令中的环境名需同步替换。

Q:Transformers 4.28.0.dev 怎么安装?

A:README 只标注了版本来源为 transformers.git@cae78c46,没有给出具体安装命令,需要按仓库说明从对应提交安装。

注意事项

  • README 节选只包含 Installation 部分,训练、评估、推理命令均未提供,需查看仓库其他文档。
  • README 里的克隆地址是 git@github.com:OpenRobotLab/PointLLM.git,与项目主页显示的 InternRobotics/PointLLM 不同,克隆失败时请核对仓库地址。
  • 建议保留 conda 环境隔离,Python 版本严格按 README 使用 3.10。

核心亮点

  • 首个将点云编码器与大语言模型深度融合的方案,技术路线新颖
  • 基于 Objaverse 大规模数据集训练,覆盖广泛三维物体类别
  • 提供人工评估基准,验证了模型在描述和问答任务上的有效性

不足之处

  • 训练和推理计算资源需求高,普通开发者难以复现
  • 文档/社区待观察,生态和工具链尚不成熟

适用场景

  • 三维物体识别与描述,用于机器人或AR场景理解
  • 点云数据的自然语言交互,辅助三维内容标注
  • 多模态大模型研究,探索点云与文本对齐方法

替代项目

Point-BERT、PointGPT、3D-LLM

项目介绍

PointLLM 是开源模型领域的开源项目,由 InternRobotics 开发,2023 年首次发布。

在全站 13,109 个收录项目中,它的 GitHub 星标数(1,056)位列前 30%,在开源模型分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。代码公开,可自行部署使用,无收费计划。

它主要面向的使用场景是:三维物体识别与描述,用于机器人或AR场景理解。同类可对比的替代方案包括 Point-BERT、PointGPT、3D-LLM。

上一篇:z80ai

下一篇:SoulChat

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
awesome-ltx2 开源

找齐 LTX-2 模型、工作流和 LoRA,一键上手视频生成。

All available LTX-2 models, encoders, workflows, LoRAs for ComfyUI

★ 593 2026-08-10