
ml-slowfast-llava
不训练也能做视频问答,双路抽帧直接跑出强基线
SlowFast-LLaVA 是一个面向视频理解的多模态大语言模型方案,核心卖点是无需额外训练即可直接使用。它针对视频问答(Video QA)任务中现有模型普遍需要大规模视频指令微调、成本高且易过拟合的问题,提出双路径时空建模:Slow 路径以较低帧率抽取关键帧捕捉长程语义,Fast 路径以较高帧率采样密集帧捕捉快速运动细节,两者特征拼接后送入 LLM 生成答案。项目提供完整推理代码与配置,兼容主流视频问答基准,可直接加载开源权重运行,无需重新训练即可获得有竞争力的结果,为研究者提供低成本、可复现的视频 LLM 基线。
开源
free
开源模型
GitHub 星标
★ 294
维护状态
活跃
是否开源
是
定价模式
free
项目数据
分类开源模型
开发团队apple-aiml-research
所属国家
定价模式free
价格说明开源免费,需自行部署
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型multimodal-large-language-models,video-question-answering
GitHub 星标★ 294
30天Star增速
HF 下载量
上线时间2024-08-26 00:00:00
最近更新2026-09-11 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-15
浏览次数0
使用教程
核心亮点
- 完全免训练,直接复用现有图像 LLM 权重即可推理视频问答
- Slow/Fast 双路径设计同时兼顾长程语义与快速动作细节
- 代码结构清晰,配置化抽帧参数,便于在自有视频数据上快速验证
不足之处
- 仅提供推理基线,缺少训练脚本与微调流程
- 依赖外部图像 LLM 权重,需自行准备模型与显存环境
适用场景
- 科研人员快速搭建视频问答基线做对比实验
- 工程团队在无标注视频数据上验证多模态方案可行性
- 教学场景演示视频 LLM 的免训练时空建模思路
替代项目
Video-LLaVA、LLaVA-NeXT-Video
项目介绍
同类项目推荐
awesome-claude-fable-5-prompt-va···
开源
一站式掌握 Claude Fable 5 玩法,快速选型不踩坑
Ultimate Claude Fable 5 Guide 2026: Use Cases, Integrations & Benchmarks
Machine-Learning
开源
跟着博客笔记,边看边跑机器学习代码
All content related to machine learning from my blog
Diffusion-Models-Papers-Survey-T···
开源
学视频生成怕绕路?这份资料库帮你理清
Diffusion model papers, survey, and taxonomy
CoreML-Models
开源
下载即用的苹果端 AI 模型库,免去转换烦恼
Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···