speech-rest-api 是语音识别领域的开源项目,由 askrella 开发,2023 年首次发布。
它收录于语音识别分类,该分类目前共有 212 个项目,GitHub 星标数为 99。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-05-24。本地部署,完全免费。
它主要面向的使用场景是:为应用快速添加语音转文字功能,如会议记录、字幕生成。同类可对比的替代方案包括 faster-whisper、whisper.cpp、Coqui TTS。

一键部署语音转写与合成 API,快速集成 Whisper 能力
speech-rest-api 是一个基于 Python 的语音处理 REST API 服务,主要提供语音转文字(ASR)和文字转语音(TTS)两大核心能力。它整合了 OpenAI Whisper 和 Speechbrain 等主流模型,通过统一的 HTTP 接口对外提供服务,解决了开发者需要快速集成语音功能但不想深入底层模型调用的痛点。项目支持多种音频格式输入,输出标准化的文本或语音数据,并提供了简单的 API 调用方式,方便前后端分离或微服务架构中直接使用。其核心优势在于将复杂的模型推理封装为简洁的 REST 端点,降低了语音 AI 的应用门槛,适合快速原型开发或中小型项目集成。
faster-whisper、whisper.cpp、Coqui TTS
speech-rest-api 是语音识别领域的开源项目,由 askrella 开发,2023 年首次发布。
它收录于语音识别分类,该分类目前共有 212 个项目,GitHub 星标数为 99。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-05-24。本地部署,完全免费。
它主要面向的使用场景是:为应用快速添加语音转文字功能,如会议记录、字幕生成。同类可对比的替代方案包括 faster-whisper、whisper.cpp、Coqui TTS。
上一篇:SpeakoFlow
下一篇:deepgram-go-sdk
obs-localvocal
开源
直播录屏时,本地AI实时生成字幕,保护隐私零延迟
OBS plugin for local speech recognition and captioning using AI
LiveCaptions-Translator
开源
实时捕获系统音频,一键翻译成你懂的语言
Lightweight and powerful real-time audio/speech translation tool based on Windows Li···
speechbrain
开源
一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务
A PyTorch-based Speech Toolkit
whisper-diarization
开源
给语音转写加上说话人标签,会议记录一目了然
Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper