
faster-whisper-GUI
本地拖拽音频,一键生成字幕文本
faster-whisper-GUI 是一个基于 PySide6 的桌面图形界面工具,旨在为 faster-whisper 语音识别模型提供易用的操作界面。它解决了原始 faster-whisper 命令行工具对普通用户不友好的问题,让用户无需编写代码即可完成音频/视频文件的转录。核心能力包括:支持多种 faster-whisper 模型(如 tiny、base、small、medium、large-v3),可自动下载模型;内置 VAD(语音活动检测)过滤静音,提升转录效率和准确性;支持批量处理文件,可导出为 txt、srt、vtt 等字幕格式;提供实时转录预览和参数调节(如语言、beam size、温度等)。项目界面简洁,功能聚焦,适合个人用户快速完成本地语音转文字任务。
项目数据
核心亮点
- 提供图形界面,无需命令行即可使用 faster-whisper,降低使用门槛
- 内置 VAD 检测,自动跳过静音段,转录速度更快且更准确
- 支持批量转换和多种导出格式(txt/srt/vtt),满足字幕制作需求
不足之处
- 界面功能相对基础,缺少高级编辑和校对功能
- 文档/社区待观察
适用场景
- 个人用户快速将会议录音转成文字稿
- 视频创作者为本地视频生成字幕文件
- 语言学习者转录外语音频以便对照学习
替代项目
WhisperDesktop、Buzz、SubtitleEdit
项目介绍
上一篇:speechbrain
下一篇:没有了!
同类项目推荐
whisper-diarization
开源
给语音转写加上说话人标签,会议记录一目了然
Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper
LiveCaptions-Translator
开源
实时捕获系统音频,一键翻译成你懂的语言
Lightweight and powerful real-time audio/speech translation tool based on Windows Li···
speechbrain
开源
一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务
A PyTorch-based Speech Toolkit
cheetah
开源
在设备上实时把语音转文字,离线低延迟还保护隐私
On-device streaming speech-to-text engine powered by deep learning