whishper

本地运行,一键将音频转文字、翻译并编辑字幕

whishper 是一个基于 Whisper 模型的本地语音转文字工具,提供网页界面,让用户无需上传数据即可完成音频转录、翻译和字幕编辑。它解决了云端语音服务带来的隐私泄露和网络依赖问题,核心能力包括:支持多种音频格式的转录,利用 Whisper 模型实现高精度识别;内置翻译功能,可将转录文本翻译成多种语言;提供字幕编辑界面,方便用户调整时间轴和文本;所有处理均在本地运行,保障数据安全。项目使用 SvelteKit 和 Go 构建,技术栈轻量,部署简单,适合个人用户和小型团队使用。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3074
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类语音识别
开发团队pluja
所属国家
定价模式free
价格说明完全开源免费,本地部署,无付费版本
访问状态
是否开源是
开源协议AGPL-3.0
主要语言Svelte
技术栈/模型ai,audio-to-text,golang,speech-recognition,speech-to-text,stt,subtitles,sveltekit,transcription,ui,web,web-whisper,webapp,whisper
GitHub 星标★ 3074
30天Star增速
HF 下载量
上线时间2023-08-26 00:00:00
最近更新2026-09-23 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数5

使用教程

难度:入门 约 15 分钟 部署方式:本地安装 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 一台可本地运行的机器(转录、翻译、字幕编辑均在本地完成,可离线使用)
  • 可选 NVIDIA GPU:有 GPU 可获得更快的转录速度
  • 无 GPU 也可运行:项目基于 FasterWhisper,CPU 同样支持
  • 按官方文档 https://whishper-docs.pages.dev 获取具体安装与开发指引

安装与启动步骤

  1. 1查阅官方文档

    README 未在本仓库给出完整安装命令,安装与开发步骤以官方文档为准,请先打开文档确认当前推荐方式。

  2. 2克隆项目仓库

    从 GitHub 获取源码到本地,后续按官方文档指引完成安装与启动。

    git clone https://github.com/pluja/whishper.git
  3. 3进入项目目录

    切换到克隆下来的项目根目录,准备按文档执行后续步骤。

    cd whishper
  4. 4按文档安装启动

    README 仅提到有 quick start 脚本或几步手动流程,具体命令留在官方文档,请照其执行。

  5. 5打开网页界面

    启动后在浏览器访问本地 Web UI 地址,即可上传文件或输入 URL 开始转录。

如何确认成功

按官方文档启动服务后,在浏览器打开文档给出的本地 Web UI 地址,能进入转录界面即表示成功。

常见问题

Q:数据会上传到云端吗?

A:不会。转录、翻译和字幕编辑 100% 在本机完成,甚至可以离线使用,数据不出本地。

Q:没有独立显卡能运行吗?

A:可以。项目支持 CPU 运行,并基于 FasterWhisper 作为后端,在 CPU 上也能获得较快的转录速度。

Q:支持哪些输出格式?

A:可下载 TXT、JSON、VTT、SRT,也可以直接把原始文本复制到剪贴板。

Q:翻译功能支持哪些语言?

A:支持 LibreTranslate 所覆盖的语言,转录完成后可在界面内直接翻译。

Q:这个分支还会更新吗?

A:不会。作者正在 v4 分支进行完全重写,当前分支不再发布新版本或更新。

注意事项

  • 当前分支已停止维护,作者正在 v4 分支重写,安装前建议先确认自己要用哪个分支。
  • README 未提供具体安装命令、端口和配置项,所有命令与参数请以官方文档为准,不要凭猜测填写。
  • 支持通过 URL 转录,来源为 yt-dlp 所支持的任何站点。
  • 翻译依赖 LibreTranslate,字幕编辑支持 CPS 警告、分段拆分与插入等功能。

核心亮点

  • 完全本地处理,保护隐私,无需上传音频到云端
  • 集成 Whisper 模型,支持多语言高精度转录
  • 内置字幕编辑界面,可微调时间轴和文本,提升效率

不足之处

  • 依赖本地硬件性能,转录速度受限于 CPU/GPU
  • 文档/社区待观察

适用场景

  • 记者或内容创作者快速将采访录音转为文字稿
  • 视频制作者为多语言视频生成和编辑字幕
  • 隐私敏感场景(如医疗、法律)下的音频转录

替代项目

WhisperDesktop、Buzz、SubtitleEdit

项目介绍

whishper 是语音识别领域的开源项目,由 pluja 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(3,074)位列前 30%,在语音识别分类中处于中上游。

近 45 天,它的 GitHub 星标从 3,053 增加到 3,074,净增 21。

项目仍在小幅维护中,最近一次代码更新于 2026-09-23。完全开源免费,本地部署,无付费版本。从国内网络环境看,可直接访问。

它主要面向的使用场景是:记者或内容创作者快速将采访录音转为文字稿。同类可对比的替代方案包括 WhisperDesktop、Buzz、SubtitleEdit。

上一篇:willow

下一篇:awesome-diarization

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1616 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3755 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13