BEVT

用图像预训练加速视频 Transformer,省数据省算力

BEVT 是 CVPR 2022 论文《BEVT: BERT Pretraining of Video Transformers》的官方 PyTorch 实现。它主要解决视频理解中 Transformer 模型预训练数据稀缺、训练成本高的问题,提出将视频 Transformer 的预训练分解为空间(图像)和时间(视频)两个维度:先通过图像数据(如 ImageNet)预训练空间编码器,再在视频数据上仅预训练时间模块,从而大幅降低对大规模视频标注数据的依赖。核心能力包括:支持图像与视频联合预训练、可加载公开图像模型权重、提供视频分类等下游任务的微调代码。项目代码结构清晰,基于 PyTorch 和 torchvision,适合研究视频 Transformer 预训练方法的开发者使用。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 161
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队xyzforever
所属国家
官网地址
定价模式free
价格说明开源模型,Apache-2.0 许可证,完全免费,需自行部署使用
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型action-recognition,bert,deep-learning,foundation-models,masked-autoencoder,pytorch,self-supervised-learning,video-representation-learning,video-understanding
GitHub 星标★ 161
30天Star增速
HF 下载量
上线时间2022-03-02 00:00:00
最近更新2026-03-11 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

核心亮点

  • 官方实现,论文代码一致,复现结果可靠
  • 两阶段预训练策略,可复用 ImageNet 权重,降低视频数据需求
  • 代码简洁,基于 PyTorch,易于二次开发和定制

不足之处

  • 文档较少,缺少详细的使用教程和配置说明
  • 依赖特定版本库,环境配置可能较繁琐

适用场景

  • 视频动作识别模型预训练
  • 视频 Transformer 研究中的预训练基线
  • 在数据受限场景下训练视频理解模型

替代项目

TimeSformer、VideoMAE、ViViT

项目介绍

BEVT 是计算机视觉领域的开源项目,由 xyzforever 开发,2022 年首次发布。

它收录于计算机视觉分类,该分类目前共有 447 个项目,GitHub 星标数为 161。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-03-11。Apache-2.0 许可证,完全免费,需自行部署使用。

它主要面向的使用场景是:视频动作识别模型预训练。同类可对比的替代方案包括 TimeSformer、VideoMAE、ViViT。

上一篇:vesselFM

下一篇:GeoPixel

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4019 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90930 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2046 2026-08-14