audiotext 是语音识别领域的开源项目,由 HenestrosaDev 开发,2023 年首次发布。
它收录于语音识别分类,该分类目前共有 257 个项目,GitHub 星标数为 353。
项目目前处于活跃维护状态,最近一次代码更新于 2026-10-05。开源免费,需自行部署。
它主要面向的使用场景是:把YouTube视频或播客链接转成带时间轴的字幕文件。同类可对比的替代方案包括 Buzz、whisper.cpp。

拖入音视频或粘贴链接,一键出文字、字幕和摘要
audiotext 是一款基于 Python 的桌面语音转文字工具,面向需要处理音视频字幕与摘要的用户。它支持导入本地音频、视频文件,也能直接处理 URL 链接、YouTube 视频以及麦克风实时录音,统一转写成文本。核心能力包括语音识别、自动翻译、内容摘要和字幕文件生成,底层依赖 ffmpeg 做音视频解码,界面用 CustomTkinter 搭建,操作门槛较低。相比纯命令行方案,它把识别、翻译、总结、字幕导出整合进一个图形界面,适合内容创作者、学生或办公场景快速把会议录音、网课、播客转成可编辑文字,再进一步生成双语字幕或要点总结。项目星标数不高,属于早期工具,功能覆盖较全但生态和稳定性仍在成长阶段。
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
—
Buzz、whisper.cpp
audiotext 是语音识别领域的开源项目,由 HenestrosaDev 开发,2023 年首次发布。
它收录于语音识别分类,该分类目前共有 257 个项目,GitHub 星标数为 353。
项目目前处于活跃维护状态,最近一次代码更新于 2026-10-05。开源免费,需自行部署。
它主要面向的使用场景是:把YouTube视频或播客链接转成带时间轴的字幕文件。同类可对比的替代方案包括 Buzz、whisper.cpp。
下一篇:没有了!
obs-localvocal
开源
直播录屏时,本地AI实时生成字幕,保护隐私零延迟
OBS plugin for local speech recognition and captioning using AI
LiveCaptions-Translator
开源
实时捕获系统音频,一键翻译成你懂的语言
Lightweight and powerful real-time audio/speech translation tool based on Windows Li···
speechbrain
开源
一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务
A PyTorch-based Speech Toolkit
whisper-diarization
开源
给语音转写加上说话人标签,会议记录一目了然
Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper