FrozenBiLM

冻结语言模型,零样本看懂视频回答问题

FrozenBiLM 是一个用于零样本视频问答(VideoQA)的开源模型,来自 NeurIPS 2022 论文。它解决的是在没有任何视频标注数据的情况下,直接回答关于视频内容的问题。其核心思路是冻结双向语言模型(如 BERT)的权重,仅训练一个轻量的视频-文本对齐模块,将视频特征映射到语言模型的语义空间中,从而利用语言模型已有的知识进行推理。该模型支持多种视频问答基准,并提供完整的训练和评估代码。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 159
维护状态 低维护
是否开源
定价模式 free

项目数据

分类开源模型
开发团队antoyang
所属国家
官网地址
定价模式free
价格说明开源模型,Apache-2.0许可,完全免费,需自行部署。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型large-language-models,multimodal-learning,pre-training,video-question-answering,video-understanding,videoqa,vision-and-language,visual-question-answering,vqa,weakly-supervised-learning
GitHub 星标★ 159
30天Star增速
HF 下载量
上线时间2022-09-25 00:00:00
最近更新2026-04-12 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 零样本能力强:无需视频标注数据即可在多个 VideoQA 基准上达到领先效果
  • 训练高效:只训练轻量对齐层,显存和算力需求远低于端到端微调
  • 代码完整:提供数据处理、训练、评估全流程,易于复现

不足之处

  • 文档偏学术,上手门槛较高
  • 依赖特定视频特征提取器,灵活性受限

适用场景

  • 学术研究:探索零样本视频理解与语言模型结合
  • 视频检索:根据自然语言问题定位视频片段
  • 自动化视频审核:对视频内容进行问答式检查

替代项目

Frozen in Time、VideoCLIP、VIOLET

项目介绍

FrozenBiLM 是计算机视觉领域的开源项目,由 antoyang 开发,2022 年首次发布。

它收录于计算机视觉分类,该分类目前共有 446 个项目,GitHub 星标数为 159。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-04-12。Apache-2.0许可,完全免费,需自行部署。

它主要面向的使用场景是:学术研究:探索零样本视频理解与语言模型结合。同类可对比的替代方案包括 Frozen in Time、VideoCLIP、VIOLET。

上一篇:MovieChat

下一篇:talk2bev

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4019 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90930 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2046 2026-08-14