claude-video-vision

让 Claude 直接看懂视频,抽帧加语音分析一步到位

开源 free 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1358
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类视频生成
开发团队jordanrendric
所属国家
定价模式free
价格说明开源免费,需自行部署
访问状态
是否开源是
开源协议MIT
主要语言TypeScript
技术栈/模型claude-code,claude-code-plugin,ffmpeg,gemini,mcp,mcp-server,multimodal,video-analysis,whisper
GitHub 星标★ 1358
30天Star增速
HF 下载量
上线时间2026-03-31 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-11
浏览次数0

项目介绍

claude-video-vision 是一个 Claude Code 插件,通过 MCP 协议为 Claude 赋予观看和理解视频的能力。它解决的核心问题是:Claude 本身只能处理文本和图片,无法直接分析视频内容。该插件借助 ffmpeg 从视频中抽取关键帧,再调用多模态模型(如 Gemini)对画面进行理解,同时结合 Whisper 做音频转录,最终把视觉与语音信息合并成结构化上下文交给 Claude。用户只需在 Claude Code 中调用插件,就能对本地视频提问,例如总结内容、定位特定片段、提取字幕或分析画面细节。项目用 TypeScript 编写,集成方式轻量,适合开发者快速接入现有工作流。

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:入门 约 10 分钟 部署方式:命令行工具 5 步

环境要求

  • 已安装 Claude Code(插件在 Claude Code 内使用)
  • 系统已安装 ffmpeg(用于从视频抽取帧)
  • 可联网访问 npm(MCP 服务首次使用时通过 npx 自动安装)
  • 处理 YouTube 链接时需安装 yt-dlp
  • Node.js/npx 环境(npx 拉取 claude-video-vision 包)

安装与启动步骤

  1. 1添加插件市场

    在 Claude Code 内执行,把该项目仓库添加为插件市场来源。两条命令要一条一条分别执行。

    /plugin marketplace add https://github.com/jordanrendric/claude-video-vision
  2. 2安装插件

    上一步成功后再执行安装命令。MCP 服务会在首次使用时由 npx 从 npm 自动安装,无需手动构建。

    /plugin install claude-video-vision
  3. 3运行配置向导

    用向导选择处理后端(Gemini API、本地 Whisper 或 OpenAI API)并完成基础配置。

    /setup-video-vision
  4. 4本地开发方式

    不走插件市场的替代方案:克隆仓库后,用 --plugin-dir 指向本地目录启动 Claude Code。

    git clone https://github.com/jordanrendric/claude-video-vision.git
    claude --plugin-dir /your/path/claude-video-vision
  5. 5检查配置文件

    配置保存在 ~/.claude-video-vision/config.json,可查看或手动修改后端、帧格式、最大帧数等参数。

    cat ~/.claude-video-vision/config.json

关键配置

配置项必填说明示例
backend是选择音频处理后端:本地 Whisper 或云 APIlocal
whisper_model否Whisper 模型规格,auto 会按内存自动挑选auto
frame_format否抽帧图片格式,屏幕录制建议用 png 保清晰jpeg
frame_resolution否抽帧的图像分辨率512
max_frames否单次最多抽取的帧数上限100
frame_describer_model否用于描述画面的模型sonnet

如何确认成功

在 Claude Code 中对着一个本地视频提问,能返回带时间戳的音频转录文字与关键帧画面信息,即说明插件已生效。

常见问题

Q:需要提前下载 Whisper 模型吗?

A:不需要。Whisper 模型会在首次使用时自动下载到 ~/.claude-video-vision/models/,可选 tiny、base、small、medium、large-v3-turbo、large-v3 或 auto。

Q:可以直接分析 YouTube 视频吗?

A:可以。直接传入 YouTube URL,MCP 服务会用 yt-dlp 下载视频,并保留来源元数据与字幕作为上下文。

Q:可以完全本地处理不上云吗?

A:可以。把 backend 设为 local 使用本地 Whisper,也可在云 API 与完全本地处理之间切换。

Q:抽帧格式怎么选?

A:frame_format 支持 jpeg、png、webp,默认 jpeg 以兼容旧配置;屏幕录制等需要文字与 UI 边缘无损的场景建议用 png。

注意事项

  • 插件是感知层而非解释层:它只提供帧图像和带时间戳的转录,理解与回答由 Claude 完成。
  • 抽帧的 fps、时间范围和分辨率会由 Claude 根据你的问题自适应调整,可用 default_fps 等配置干预。
  • 首次使用需联网下载 npm 包和 Whisper 模型,请预留等待时间。

核心亮点

  • 通过 MCP 协议无缝接入 Claude Code,无需改动现有工作流
  • ffmpeg 抽帧加 Whisper 音频转录,视觉与语音双通道理解视频
  • TypeScript 实现,插件结构清晰,便于二次开发和自定义模型

不足之处

  • 依赖外部多模态模型(如 Gemini)和 Whisper,需额外配置 API 或本地环境
  • 视频处理耗时较长,长视频的抽帧与转录成本较高

适用场景

  • 开发者用 Claude Code 快速总结本地录屏或教程视频内容
  • 内容创作者批量提取视频字幕与关键画面做二次剪辑
  • 团队把会议录像交给 Claude 自动生成纪要与要点

替代项目

video-analyzer、llava、whisper.cpp

上一篇:ComfyUI-MiniMaxH3-Studio

下一篇:没有了!

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 129457 2026-08-09
openscreen 开源

免费无水印录屏做演示,替代 Screen Studio

Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···

★ 3966 2026-08-10
seedance-2.0-api 开源

快速上手字节Seedance 2.0,文本/图片一键生成视频

Seedance 2.0 API — text-to-video and image-to-video examples

★ 329 2026-08-26
auto-subs 开源

在剪辑软件里直接生成字幕,省去导出导入的麻烦

On-device subtitle generation that connects directly to DaVinci Resolve, Premiere, a···

★ 4338 2026-08-10