WhisperJAV

给JAV视频一键生成高准确率字幕,嘈杂环境也能听清

WhisperJAV 是一个面向日语成人视频(JAV)场景的自动语音识别(ASR)与字幕生成工具。它解决了通用语音识别模型在噪声环境、多人对话、特殊语气词等场景下准确率低的问题,通过集成 Qwen3-ASR、本地大语言模型(LLM)、Whisper 以及 TEN-VAD 语音活动检测技术,实现了对嘈杂音频的鲁棒识别,并自动生成带时间轴的字幕文件。核心能力包括:高噪声容忍度、多模型协同优化、本地化处理保障隐私、以及针对日语口语和术语的专门优化。项目基于 Python 开发,适合需要批量处理视频字幕、内容检索或无障碍观看的用户。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2268
维护状态 活跃
是否开源
定价模式 free

项目数据

分类开源模型
开发团队meizhong986
所属国家
定价模式free
价格说明开源项目,MIT许可证,本地部署,完全免费。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型aitranslate,hallucination,japanese,llm,modelscope,qwen3,qwen3-asr,speech-to-text,speechenhancement,subtitling,ten-vad,whisper,zipformer
GitHub 星标★ 2268
30天Star增速
HF 下载量
上线时间2023-10-18 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:入门 约 20 分钟 部署方式:本地安装 8 步

环境要求

  • Windows 系统(官方推荐使用独立 .exe 安装包)
  • 无需 Python 知识,安装程序会自动配置 Python、PyTorch、FFmpeg 及依赖
  • NVIDIA 显卡可选:有卡则自动装匹配的 CUDA 版,无卡则装 CPU-only 版
  • 至少预留约 3 GB 空间用于首次下载模型;安装过程需 10–20 分钟

安装与启动步骤

  1. 1下载安装包

    从 GitHub Releases 页面下载最新的 Windows .exe 安装包,页面地址见官网链接。

  2. 2运行安装程序

    双击运行 .exe,无需管理员权限,默认安装到 %LOCALAPPDATA%WhisperJAV。

  3. 3等待环境配置

    安装程序自动装 Python、PyTorch、FFmpeg 和依赖,并检测 NVIDIA 驱动选择 CUDA 或 CPU 版本,约 10–20 分钟。

  4. 4启动图形界面

    从桌面快捷方式启动,或执行命令打开 GUI;添加文件、选择模式后点击 Start。

    whisperjav-gui
  5. 5命令行转写单个视频

    最简用法,使用默认参数直接处理视频文件,字幕输出到视频旁边。

    whisperjav video.mp4
  6. 6批量处理整个文件夹

    传入文件夹路径并指定输出目录,可批量生成字幕。

    whisperjav /path/to/folder --output-dir ./subtitles
  7. 7调整模式与灵敏度

    用 --mode 选择处理模式、--sensitivity 控制识别灵敏度,适合嘈杂音频。

    whisperjav video.mp4 --mode balanced --sensitivity aggressive
  8. 8升级或回滚版本

    全平台通用的升级命令;如需回退到旧版本可加 --rollback 参数。

    whisperjav-upgrade

关键配置

配置项必填说明示例
--mode选择处理模式,默认使用默认模式balanced
--sensitivity控制识别灵敏度,嘈杂场景可调高aggressive
--output-dir指定字幕输出目录,适合批量处理./subtitles
--output-format输出字幕格式,默认 SRT,可选 WebVTT 或两者both

如何确认成功

运行结束后在视频同目录或 --output-dir 指定目录下看到同名 .srt 字幕文件即成功。

常见问题

Q:需要自己先装 Python 吗?

A:不需要。Windows 独立安装包会自动配置 Python、PyTorch、FFmpeg 和全部依赖,无需 Python 知识。

Q:没有 NVIDIA 显卡能用吗?

A:可以。安装程序检测不到 GPU 时会安装 CPU-only 版本,功能完整但识别速度较慢。

Q:为什么首次运行很慢?

A:首次转录会自动下载约 3 GB 的模型文件,下载完成后后续使用会快很多。

Q:支持哪些输入格式?

A:任何 FFmpeg 能读取的格式都可以,如 MP4、MKV、AVI、WMV、MP3、WAV、FLAC 等。

Q:怎么升级或退回旧版本?

A:执行 whisperjav-upgrade 升级;若需回滚则执行 whisperjav-upgrade --rollback。

注意事项

  • 媒体文件全部在本机处理,不会上传云端,隐私有保障
  • 安装耗时 10–20 分钟,期间请勿中断,安装程序会自动匹配 CUDA 或 CPU 版本
  • 无需管理员权限,默认安装路径为 %LOCALAPPDATA%WhisperJAV
  • 官方还提供 Colab 和 Kaggle 在线笔记本版本,适合没有本地环境的用户

核心亮点

  • 集成多种先进模型(Qwen3-ASR、Whisper、TEN-VAD),在噪声环境下识别准确率显著优于单一模型
  • 支持本地化运行,无需上传视频,保护隐私且降低延迟
  • 自动生成字幕文件,可直接用于播放器加载,提升观看体验

不足之处

  • 主要针对日语场景,对其他语言支持可能有限
  • 依赖多个模型,配置和部署门槛相对较高

适用场景

  • 日语视频字幕自动生成
  • 嘈杂环境下的语音转写(如综艺、采访)
  • 本地视频内容索引与检索

替代项目

Whisper、faster-whisper、Vosk

项目介绍

WhisperJAV 是语音识别领域的开源项目,由 meizhong986 开发,2023 年首次发布。

在全站 12,961 个收录项目中,它的 GitHub 星标数(2,257)位列前 30%,在语音识别分类中处于中上游。

近 42 天,它的 GitHub 星标从 2,092 增加到 2,257,净增 165。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-19。MIT许可证,本地部署,完全免费。

它主要面向的使用场景是:日语视频字幕自动生成。同类可对比的替代方案包括 Whisper、faster-whisper、Vosk。

上一篇:openless

下一篇:FireRedASR

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1616 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3755 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13