noScribe 是语音识别领域的开源项目,由 kaixxx 开发,2023 年首次发布。
在全站 12,961 个收录项目中,它的 GitHub 星标数(2,171)位列前 30%,在语音识别分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。开源免费,需自行部署。
它主要面向的使用场景是:社会科学研究者整理深度访谈录音,需要区分访谈者与受访者。同类可对比的替代方案包括 whisper.cpp、Buzz、WhisperX。

录音拖进去,自动出带说话人标签的文字稿
noScribe 是一款面向访谈、口述史与定性研究场景的桌面音频转写工具,本质上是 OpenAI Whisper(通过 faster-whisper 加速)与 pyannote 说话人分离模型的图形化封装。它解决的核心问题是:研究者手头有大量录音,却不想写代码或折腾命令行,也能得到带说话人标签、带时间戳、可直接用于分析的文本。核心能力包括自动语音识别、多人对话的说话人区分、时间轴对齐、以及对长音频的批量处理;界面提供参数调节,可在识别精度与速度之间取舍,并支持导出为常见文本或字幕格式。相比纯脚本方案,它把模型下载、音频预处理、分轨与结果整理串成一条完整流程,降低了非技术用户的使用门槛,适合需要反复整理访谈材料的社会科学、新闻与用户研究工作者。
⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。
1打开官方网站
README 未提供具体安装命令,明确说明下载、安装与使用说明统一见官网 https://noscribe.de,请先访问该站点。
2下载对应系统安装包
在官网按你的操作系统(Windows / macOS / Linux)下载安装程序;软件免费开源,采用 GPL-3.0 许可。
3安装并启动程序
按官网安装说明完成安装后启动 noScribe,它是一个图形化桌面应用,全程在本地电脑运行,不上传录音。
4导入音频并设置语言
在界面中选择待转写的访谈录音,并指定语言。软件支持约 60 种语言,可在识别精度与速度之间取舍。
5启用说话人区分
多人对话场景可开启说话人分离(基于 pyannote),让转写结果自动区分不同发言人并附带时间轴。
6校对并导出结果
使用内置编辑器复核、修正转写文本,然后导出为可用于定性研究分析的文本或字幕格式文件。
应用窗口正常打开,导入音频后能生成带时间戳和说话人标签的转写文本。
Q:noScribe 收费吗?
A:完全免费且开源,遵循 GPL-3.0 协议,官方唯一网站是 https://noscribe.de。请勿使用收费的 noscribe(dot)ai,该平台与本项目无关。
Q:转写会把录音上传到云端吗?
A:不会。软件完全在本地电脑运行,访谈录音不会离开本机,适合需要保密的研究资料。
Q:支持哪些操作系统?
A:官方提供 Windows、macOS 和 Linux 版本。
Q:支持多少种语言和多人对话?
A:大约支持 60 种语言,并能区分不同说话人,适合访谈、口述史等多人对话场景。
Q:README 里有安装命令吗?
A:没有。README 只指向官网 https://noscribe.de,安装与使用请以官网对应章节为准。
whisper.cpp、Buzz、WhisperX
noScribe 是语音识别领域的开源项目,由 kaixxx 开发,2023 年首次发布。
在全站 12,961 个收录项目中,它的 GitHub 星标数(2,171)位列前 30%,在语音识别分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。开源免费,需自行部署。
它主要面向的使用场景是:社会科学研究者整理深度访谈录音,需要区分访谈者与受访者。同类可对比的替代方案包括 whisper.cpp、Buzz、WhisperX。
上一篇:OpenWhisper
obs-localvocal
开源
直播录屏时,本地AI实时生成字幕,保护隐私零延迟
OBS plugin for local speech recognition and captioning using AI
LiveCaptions-Translator
开源
实时捕获系统音频,一键翻译成你懂的语言
Lightweight and powerful real-time audio/speech translation tool based on Windows Li···
speechbrain
开源
一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务
A PyTorch-based Speech Toolkit
whisper-diarization
开源
给语音转写加上说话人标签,会议记录一目了然
Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper