项目预览
项目数据
项目介绍
Star 增长趋势
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
技术标签
使用教程
—
环境要求
- 已安装 Claude Code(插件在 Claude Code 内使用)
- 系统已安装 ffmpeg(用于从视频抽取帧)
- 可联网访问 npm(MCP 服务首次使用时通过 npx 自动安装)
- 处理 YouTube 链接时需安装 yt-dlp
- Node.js/npx 环境(npx 拉取 claude-video-vision 包)
安装与启动步骤
-
1添加插件市场
在 Claude Code 内执行,把该项目仓库添加为插件市场来源。两条命令要一条一条分别执行。
/plugin marketplace add https://github.com/jordanrendric/claude-video-vision -
2安装插件
上一步成功后再执行安装命令。MCP 服务会在首次使用时由 npx 从 npm 自动安装,无需手动构建。
/plugin install claude-video-vision -
3运行配置向导
用向导选择处理后端(Gemini API、本地 Whisper 或 OpenAI API)并完成基础配置。
/setup-video-vision -
4本地开发方式
不走插件市场的替代方案:克隆仓库后,用 --plugin-dir 指向本地目录启动 Claude Code。
git clone https://github.com/jordanrendric/claude-video-vision.git claude --plugin-dir /your/path/claude-video-vision -
5检查配置文件
配置保存在 ~/.claude-video-vision/config.json,可查看或手动修改后端、帧格式、最大帧数等参数。
cat ~/.claude-video-vision/config.json
关键配置
| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
backend | 是 | 选择音频处理后端:本地 Whisper 或云 API | local |
whisper_model | 否 | Whisper 模型规格,auto 会按内存自动挑选 | auto |
frame_format | 否 | 抽帧图片格式,屏幕录制建议用 png 保清晰 | jpeg |
frame_resolution | 否 | 抽帧的图像分辨率 | 512 |
max_frames | 否 | 单次最多抽取的帧数上限 | 100 |
frame_describer_model | 否 | 用于描述画面的模型 | sonnet |
如何确认成功
在 Claude Code 中对着一个本地视频提问,能返回带时间戳的音频转录文字与关键帧画面信息,即说明插件已生效。
常见问题
Q:需要提前下载 Whisper 模型吗?
A:不需要。Whisper 模型会在首次使用时自动下载到 ~/.claude-video-vision/models/,可选 tiny、base、small、medium、large-v3-turbo、large-v3 或 auto。
Q:可以直接分析 YouTube 视频吗?
A:可以。直接传入 YouTube URL,MCP 服务会用 yt-dlp 下载视频,并保留来源元数据与字幕作为上下文。
Q:可以完全本地处理不上云吗?
A:可以。把 backend 设为 local 使用本地 Whisper,也可在云 API 与完全本地处理之间切换。
Q:抽帧格式怎么选?
A:frame_format 支持 jpeg、png、webp,默认 jpeg 以兼容旧配置;屏幕录制等需要文字与 UI 边缘无损的场景建议用 png。
注意事项
- 插件是感知层而非解释层:它只提供帧图像和带时间戳的转录,理解与回答由 Claude 完成。
- 抽帧的 fps、时间范围和分辨率会由 Claude 根据你的问题自适应调整,可用 default_fps 等配置干预。
- 首次使用需联网下载 npm 包和 Whisper 模型,请预留等待时间。
核心亮点
- 通过 MCP 协议无缝接入 Claude Code,无需改动现有工作流
- ffmpeg 抽帧加 Whisper 音频转录,视觉与语音双通道理解视频
- TypeScript 实现,插件结构清晰,便于二次开发和自定义模型
不足之处
- 依赖外部多模态模型(如 Gemini)和 Whisper,需额外配置 API 或本地环境
- 视频处理耗时较长,长视频的抽帧与转录成本较高
适用场景
- 开发者用 Claude Code 快速总结本地录屏或教程视频内容
- 内容创作者批量提取视频字幕与关键画面做二次剪辑
- 团队把会议录像交给 Claude 自动生成纪要与要点
替代项目
video-analyzer、llava、whisper.cpp
下一篇:没有了!
同类项目推荐
MoneyPrinterTurbo
开源
输入一句话,高清短视频自动出炉,文案配音全包了
利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···
openscreen
开源
免费无水印录屏做演示,替代 Screen Studio
Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···
seedance-2.0-api
开源
快速上手字节Seedance 2.0,文本/图片一键生成视频
Seedance 2.0 API — text-to-video and image-to-video examples
auto-subs
开源
在剪辑软件里直接生成字幕,省去导出导入的麻烦
On-device subtitle generation that connects directly to DaVinci Resolve, Premiere, a···
