claude-real-video

让 Claude 看懂视频:自动提取关键帧和字幕,喂给大模型

claude-real-video 是一个让 Claude 等大语言模型真正“看懂”视频的开源工具。它解决的是 LLM 无法直接处理视频的问题,通过从视频 URL 或本地文件中提取场景感知、去重后的关键帧和文字转录,将视频内容转化为 LLM 可理解的文本和图像序列。核心能力包括:自动场景切分、帧去重、语音转录,以及将结果打包成适合 LLM 输入的格式。项目完全本地运行,保护隐私,采用 MIT 许可,基于 Python 实现,易于集成到现有工作流中。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2175
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队HUANGCHIHHUNGLeo
所属国家
定价模式free
价格说明完全开源,MIT许可证,本地运行,无任何付费功能。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型claude,claude-code,cli,codex,codex-cli,ffmpeg,keyframe-extraction,llm,multimodal,ocr,openai-codex,python,scene-detection,transcription,video-analysis,whisper
GitHub 星标★ 2175
30天Star增速
HF 下载量
上线时间2026-06-30 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数7

使用教程

难度:入门 约 10 分钟 部署方式:命令行工具 5 步

环境要求

  • Python 环境(可用 pip 安装包)
  • 网络可访问 PyPI 与 GitHub
  • 若要在 AI Agent 中使用,需要支持 skills 的宿主(Claude Code、Cursor、Codex、Copilot、Gemini CLI 等)
  • 推荐安装带 whisper 附加项的版本,否则没有语音转文字能力

安装与启动步骤

  1. 1安装视频理解包

    用 pip 安装 claude-real-video,推荐加 [whisper] 附加项以获得关键帧、去重和语音转录的完整能力。

    pip install "claude-real-video[whisper]"
  2. 2安装 Agent 技能

    一条命令把该技能安装进 Claude Code、Cursor、Codex、Copilot、Gemini CLI 等 50 多个 agent 宿主。

    npx skills add HUANGCHIHHUNGLeo/claude-real-video
  3. 3接入 Claude Code 插件市场

    在 Claude Code 内依次执行两条插件命令;如需要自动更新,可在 /plugin → Marketplaces 中开启。

    /plugin marketplace add HUANGCHIHHUNGLeo/claude-real-video
    /plugin install claude-real-video@claude-real-video
  4. 4用命令行处理视频

    只做命令行用途时,不需要任何插件,把视频链接替换进去即可运行 crv。

    crv ""
  5. 5让 Agent 看视频

    把视频链接粘贴到已装好技能的 agent 中,直接向它提问视频内容。

如何确认成功

把视频链接粘进 agent 并提问,能基于画面与转录回答;或直接运行 crv "" 得到关键帧与转录结果。

常见问题

Q:不加 [whisper] 会怎样?

A:pip 的附加项不会自动安装,不装 [whisper] 就没有语音转文字;只有自带字幕的视频仍能得到转录文本。

Q:必须用 Claude Code 插件吗?

A:不是。只做命令行使用的话,完成 pip 安装后直接用 crv "" 即可,无需插件市场步骤。

Q:crv 和 crv Pro 分别是什么?

A:crv 是 claude-real-video 这个 PyPI 包的简称;crv Pro 是付费附加组件,在 Capafy 上以 llm-real-video Pro 的名称出售。

Q:关键帧会不会太多、太费 token?

A:不会。同一段 58 秒片段按固定 1 fps 会得到 58 帧,crv 只保留真正有差异的 26 帧,配合 --grid 可打包成 3 张联系表,token 更少且不丢内容。

注意事项

  • 安装时注意引号,pip install "claude-real-video[whisper]" 才能正确识别附加项。
  • README 的安装步骤没有显式要求 ffmpeg,但项目技术栈包含 ffmpeg,视频处理报错时请先检查系统是否已安装。
  • 插件市场命令是在 Claude Code 内部执行的斜杠命令,不是终端命令,不要复制到 bash 中运行。

核心亮点

  • 场景感知切分,智能去重关键帧,避免冗余信息
  • 支持 URL 和本地文件,本地运行保护隐私
  • 输出格式适配 LLM,可直接用于 Claude 等模型

不足之处

  • 依赖外部转录服务,可能产生额外成本
  • 文档/社区待观察

适用场景

  • 视频内容摘要与问答
  • 视频会议纪要与要点提取
  • 视频素材的自动化标注与检索

替代项目

Video-LLaVA、LLaVA-NeXT-Video、VideoPrism

项目介绍

claude-real-video 是计算机视觉领域的开源项目,由 HUANGCHIHHUNGLeo 开发,是 2026 年新上线的项目。

在全站 13,090 个收录项目中,它的 GitHub 星标数(2,175)位列前 30%,在计算机视觉分类中处于中上游。

近 42 天,它的 GitHub 星标从 2,009 增加到 2,175,净增 166。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。完全开源,MIT许可证,本地运行,无任何付费功能。

它主要面向的使用场景是:视频内容摘要与问答。同类可对比的替代方案包括 Video-LLaVA、LLaVA-NeXT-Video、VideoPrism。

上一篇:LISA

下一篇:awesome-yolo-object-detection

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4019 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90930 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
Olympus 开源

一个路由搞定所有视觉任务,免去逐个微调

[CVPR 2025 Highlight] Official code for "Olympus: A Universal Task Router for Comput···

★ 427 2026-08-09