GaussianPretrain

用3D高斯做自监督预训练,让自动驾驶感知模型少标注也能涨点

GaussianPretrain 是面向自动驾驶视觉预训练的开源项目,核心思路是用 3D 高斯表示作为预训练目标,让模型在无标注或弱标注数据上学习场景的几何与外观结构。它解决的是自动驾驶 3D 感知任务中标注成本高、预训练信号不足的问题:传统 2D 预训练难以迁移到 3D 任务,而纯监督训练又依赖大量昂贵标注。项目通过高斯泼溅式的场景重建作为自监督代理任务,让骨干网络在预训练阶段就理解空间结构,随后微调到下游任务。官方展示在 3D 目标检测、HD 地图构建和 Occupancy 预测三类任务上均有明显提升,说明该预训练范式对多种 3D 感知头都有增益。代码为 Python,便于与现有自动驾驶感知框架结合,适合研究预训练策略和 3D 表示学习的团队参考。

开源 free 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 113
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类计算机视觉
开发团队Public-BOTs
所属国家
官网地址
定价模式free
价格说明开源项目,免费使用
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型
GitHub 星标★ 113
30天Star增速
HF 下载量
上线时间2024-11-20 00:00:00
最近更新2026-09-07 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-20
浏览次数0

使用教程

核心亮点

  • 以3D高斯重建作为预训练代理任务,预训练信号直接对齐3D几何,比2D图像预训练更适配检测、建图、Occupancy等下游任务
  • 在3D目标检测、HD地图构建、Occupancy预测三类任务上均报告了提升,验证了预训练范式的跨任务泛化性
  • 基于Python实现,便于接入现有自动驾驶感知代码库和训练流程

不足之处

  • 项目处于早期阶段,星标仅113,社区生态和第三方复现验证较少
  • 高斯重建预训练会引入额外训练开销与显存占用,工程落地成本需评估

适用场景

  • 自动驾驶公司或高校团队在标注有限的3D感知数据上做预训练,再微调检测与Occupancy模型
  • 研究3D自监督预训练范式的论文工作,对比高斯表示与其他代理任务的迁移效果
  • 为HD地图构建任务提供更强的骨干初始化,减少对高精地图标注的依赖

替代项目

BEVFormer、OccNet、UniAD

项目介绍

GaussianPretrain 是一个计算机视觉领域的开源项目,官方简介:GussianPretrain for Visual Pre-training in Autonomous Driving, showcasing significant improvements across various 3D perception tasks, including 3D object detection, HD-map construction, and Occupancy prediction.。项目使用 Python 开发,在 GitHub 上获得 113 星标。

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 3995 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90893 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2035 2026-08-14