
GaussianPretrain
用3D高斯做自监督预训练,让自动驾驶感知模型少标注也能涨点
GaussianPretrain 是面向自动驾驶视觉预训练的开源项目,核心思路是用 3D 高斯表示作为预训练目标,让模型在无标注或弱标注数据上学习场景的几何与外观结构。它解决的是自动驾驶 3D 感知任务中标注成本高、预训练信号不足的问题:传统 2D 预训练难以迁移到 3D 任务,而纯监督训练又依赖大量昂贵标注。项目通过高斯泼溅式的场景重建作为自监督代理任务,让骨干网络在预训练阶段就理解空间结构,随后微调到下游任务。官方展示在 3D 目标检测、HD 地图构建和 Occupancy 预测三类任务上均有明显提升,说明该预训练范式对多种 3D 感知头都有增益。代码为 Python,便于与现有自动驾驶感知框架结合,适合研究预训练策略和 3D 表示学习的团队参考。
开源
free
计算机视觉
GitHub 星标
★ 113
维护状态
较活跃
是否开源
是
定价模式
free
项目数据
分类计算机视觉
开发团队Public-BOTs
所属国家
定价模式free
价格说明开源项目,免费使用
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型
GitHub 星标★ 113
30天Star增速
HF 下载量
上线时间2024-11-20 00:00:00
最近更新2026-09-07 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-20
浏览次数0
使用教程
核心亮点
- 以3D高斯重建作为预训练代理任务,预训练信号直接对齐3D几何,比2D图像预训练更适配检测、建图、Occupancy等下游任务
- 在3D目标检测、HD地图构建、Occupancy预测三类任务上均报告了提升,验证了预训练范式的跨任务泛化性
- 基于Python实现,便于接入现有自动驾驶感知代码库和训练流程
不足之处
- 项目处于早期阶段,星标仅113,社区生态和第三方复现验证较少
- 高斯重建预训练会引入额外训练开销与显存占用,工程落地成本需评估
适用场景
- 自动驾驶公司或高校团队在标注有限的3D感知数据上做预训练,再微调检测与Occupancy模型
- 研究3D自监督预训练范式的论文工作,对比高斯表示与其他代理任务的迁移效果
- 为HD地图构建任务提供更强的骨干初始化,减少对高精地图标注的依赖
替代项目
BEVFormer、OccNet、UniAD
项目介绍
同类项目推荐
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
[DEIMv2] Real Time Object Detection Meets DINOv3