video-search-and-summarization

用NVIDIA全家桶,把视频变成可搜索、可问答、自动出报告的智能体。

这是NVIDIA推出的视频搜索与摘要参考架构(VSS Blueprint),旨在帮助开发者快速构建GPU加速的视频分析智能体。它解决了传统视频分析中检索效率低、无法进行自然语言交互、以及缺乏实时验证告警的问题。核心能力包括:基于视觉语言模型(如NVIDIA Cosmos)和大型语言模型(如NVIDIA Nemotron)的视觉问答、结合RAG(检索增强生成)的视频内容搜索、以及自动生成摘要报告。该架构采用C++实现,并深度整合了NVIDIA NIM微服务,提供端到端的参考实现,覆盖从视频摄入、索引、检索到生成答案的完整流程。它特别适合需要处理海量视频数据、要求低延迟响应和实时告警的场景,例如智慧城市、工业安全监控和媒体内容管理。通过模块化设计和预训练模型,开发者可以基于此蓝图快速定制自己的视频分析应用,降低开发门槛。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1876
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类搜索知识
开发团队NVIDIA-AI-Blueprints
所属国家
定价模式free
价格说明开源参考架构,可自行部署,无在线服务,全部功能免费。
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型computer-vision,generative-ai,long-video-understanding,model-context-protocol,multimodal-ai,natural-language-search,nvidia-nim,rag,real-time-video-analytics,retrieval-augmented-generation,skills,video-agent,video-analytics,video-rag,video-search,video-summarization,video-understanding,vision-agent,vision-language-model,vlm
GitHub 星标★ 1876
30天Star增速
HF 下载量
上线时间2024-10-22 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:高级 约 45 分钟 部署方式:Docker 6 步

环境要求

  • NVIDIA GPU 硬件环境(自备硬件或裸金属云实例)
  • Docker 与 Docker Compose 环境(用于 Docker Compose 部署方式)
  • 可访问 NVIDIA 官方文档与 build.nvidia.com 在线服务
  • 若走云端方案,需准备 AWS 账号与 2xRTX PRO 6000 SE 实例配额

安装与启动步骤

  1. 1克隆代码仓库

    把 VSS Blueprint 仓库下载到本地,后续所有部署脚本都在该目录内。

    git clone https://github.com/NVIDIA-AI-Blueprints/video-search-and-summarization.git
  2. 2进入部署脚本目录

    README 的部署 notebook 位于 deploy/docker/scripts 目录下,先切换进去。

    cd video-search-and-summarization/deploy/docker/scripts
  3. 3阅读官方部署文档

    README 未给出完整命令,先按官方文档确认前置条件与硬件要求,再动手部署。

  4. 4方式一:Launchable 云端部署

    不想自己准备软硬件时,用 Jupyter 打开 deploy_vss_launchable.ipynb,在 Brev 上完成部署。

  5. 5方式二:Docker Compose 部

    在自己硬件或裸金属云实例上,按官方文档执行 Docker Compose 方式部署 VSS agent。

  6. 6对照在线 Demo 验证

    打开 build.nvidia.com 上的官方 Demo,对比本地部署效果是否一致。

如何确认成功

按官方文档确认各服务容器启动成功,并能在本地界面用自然语言检索到视频内容,或与在线 Demo 效果一致。

常见问题

Q:没有 GPU 显卡可以部署吗?

A:可以选 Launchable 部署方式,官方文档和 notebook 会引导你在 AWS 的 2xRTX PRO 6000 SE 实例上完成部署,无需自备硬件。

Q:Launchable 和 Docker Compose 该怎么选?

A:想快速上手、不关心软硬件要求就选 Launchable;要在自己的硬件或裸金属云实例上跑 VSS agent,就选 Docker Compose。

Q:为什么 README 里没有具体安装命令?

A:README 只给出 Quickstart 入口,完整前置条件和部署步骤都放在 docs.nvidia.com/vss 官方文档里,请以文档为准。

Q:部署需要准备哪些模型服务?

A:该蓝图依赖 NVIDIA NIM 微服务,并使用视觉语言模型与大型语言模型完成问答、检索和摘要,具体清单见官方文档。

注意事项

  • README 节选未包含完整安装命令,所有部署细节请以 https://docs.nvidia.com/vss/latest/index.html 为准。
  • Launchable 方案使用 AWS 临时(Ephemeral)存储,实例回收后数据不会保留,重要视频需另行备份。
  • 建议先体验 build.nvidia.com 上的在线 Demo,确认功能符合需求后再投入本地部署。

核心亮点

  • 深度融合NVIDIA Cosmos和Nemotron模型,视频理解准确度高
  • 提供完整的RAG流水线和NIM微服务集成,开箱即用
  • 支持实时验证告警,降低误报,适合安防监控场景

不足之处

  • 重度依赖NVIDIA GPU和闭源生态,非N卡用户难以部署
  • 文档和社区支持尚待完善,上手门槛较高

适用场景

  • 智慧城市视频监控,实时识别异常事件并告警
  • 媒体资料库视频检索,支持自然语言问答
  • 工业安全巡检,自动生成每日安全报告

替代项目

Twelve Labs、VideoDB、LangChain Video Analytics

项目介绍

video-search-and-summarization 是行业应用领域的开源项目,由 NVIDIA-AI-Blueprints 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,876)位列前 30%,在行业应用分类的 545 个项目里位列前 14%。

近 42 天,它的 GitHub 星标从 1,796 增加到 1,876,净增 80。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。开源参考架构,可自行部署,无在线服务,全部功能免费。

它主要面向的使用场景是:智慧城市视频监控,实时识别异常事件并告警。同类可对比的替代方案包括 Twelve Labs、VideoDB、LangChain Video Analytics。

上一篇:JustHireMe

下一篇:simba

同类项目推荐

xmgai-like 开源

换脸、艺术二维码随手玩,副业灵感一包带走。

本开源 AI 副业搞钱项目集成了强大功能,包括 AI 艺术二维码生成、AI 换脸、Delle3 绘画等···

★ 60 2026-08-09
spoken-to-signed-translation 开源

把口语文本一路转成手语视频的流水线

a text-to-gloss-to-pose-to-video pipeline for spoken to signed language translation

★ 102 2026-09-11
LiveTranslate 开源

直播看片实时翻译,字幕秒出,跨语言无压力

Real-time audio translation, captures system audio + mic, runs ASR (Whisper/SenseVoi···

★ 691 2026-08-13