koma

丢进视频,自动出摘要、章节、字幕和关键帧

koma 是一个可自托管的 AI 视频分析工具,用 TypeScript 编写。它解决的核心问题是:面对长视频或大量视频素材时,人工观看、记录和整理成本极高。koma 通过整合语音识别、计算机视觉与 ffmpeg 处理管线,自动为视频生成内容摘要、章节划分、关键帧提取、完整文字转录,并支持导出 SRT 字幕和结构化 JSON 数据。用户只需把视频交给它,就能快速拿到可检索、可复用的文本与图像信息,方便做二次编辑、归档或接入其他系统。它强调自托管,数据留在自己服务器上,适合对隐私和可控性有要求的团队。项目目前处于早期阶段,星标约 197,功能方向清晰,但生态和文档仍在成长中。

开源 unknown 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 197
维护状态 较活跃
是否开源 是
定价模式 unknown

项目数据

分类视频生成
开发团队yuxino-labs
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议
主要语言TypeScript
技术栈/模型computer-vision,ffmpeg,keyframe-extraction,self-hosted,speech-to-text,structured-data,subtitles,transcription,typescript,video-analysis,video-summarization,video-understanding,yt-dlp
GitHub 星标★ 197
30天Star增速
HF 下载量
上线时间2026-08-08 00:00:00
最近更新2026-09-29 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-30
浏览次数0

使用教程

核心亮点

  • 一条流水线同时产出摘要、章节、关键帧、转录和 SRT/JSON,省去多工具拼接
  • 自托管部署,视频数据不出本地,适合隐私敏感场景
  • 基于 ffmpeg 和语音识别/视觉技术,输出结构化数据便于二次开发

不足之处

  • 项目早期,文档和社区案例较少,上手可能需要读源码
  • 自托管对服务器算力和环境配置有一定要求,轻量设备体验受限

适用场景

  • 播客或访谈视频自动生成章节和字幕文件
  • 企业内部培训视频归档,提取摘要和关键帧做检索
  • 内容创作者批量处理素材,快速导出转录文本用于剪辑或文案

替代项目

whisper.cpp、VideoLingo、auto-subtitle

项目介绍

koma 是视频领域的开源项目,由 yuxino-labs 开发,是 2026 年新上线的项目。

它收录于视频分类,该分类目前共有 505 个项目,GitHub 星标数为 197。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-29。

它主要面向的使用场景是:播客或访谈视频自动生成章节和字幕文件。同类可对比的替代方案包括 whisper.cpp、VideoLingo、auto-subtitle。

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 126990 2026-08-09
openscreen 开源

免费无水印录屏做演示,替代 Screen Studio

Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···

★ 3358 2026-08-10
seedance-2.0-api 开源

快速上手字节Seedance 2.0,文本/图片一键生成视频

Seedance 2.0 API — text-to-video and image-to-video examples

★ 332 2026-08-26
auto-subs 开源

在剪辑软件里直接生成字幕,省去导出导入的麻烦

On-device subtitle generation that connects directly to DaVinci Resolve, Premiere, a···

★ 4293 2026-08-10