speech-rest-api

一键部署语音转写与合成 API,快速集成 Whisper 能力

speech-rest-api 是一个基于 Python 的语音处理 REST API 服务,主要提供语音转文字(ASR)和文字转语音(TTS)两大核心能力。它整合了 OpenAI Whisper 和 Speechbrain 等主流模型,通过统一的 HTTP 接口对外提供服务,解决了开发者需要快速集成语音功能但不想深入底层模型调用的痛点。项目支持多种音频格式输入,输出标准化的文本或语音数据,并提供了简单的 API 调用方式,方便前后端分离或微服务架构中直接使用。其核心优势在于将复杂的模型推理封装为简洁的 REST 端点,降低了语音 AI 的应用门槛,适合快速原型开发或中小型项目集成。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 99
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队askrella
所属国家
官网地址
定价模式free
价格说明开源项目,本地部署,完全免费
访问状态
是否开源是
开源协议
主要语言Python
技术栈/模型artificial-intelligence,openai,python3,speech-recognition,speech-to-text,text-to-speech,whisper,whisper-ai
GitHub 星标★ 99
30天Star增速
HF 下载量
上线时间2023-02-20 00:00:00
最近更新2026-05-24 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

核心亮点

  • 基于 OpenAI Whisper,语音识别准确率高,支持多语言
  • 同时提供 ASR 和 TTS 两种能力,接口统一,集成成本低
  • 使用 FastAPI 构建,性能好,自动生成 API 文档,易于调试

不足之处

  • 项目星标较少,社区活跃度低,长期维护性待观察
  • 文档相对简略,高级配置和部署细节不够详细

适用场景

  • 为应用快速添加语音转文字功能,如会议记录、字幕生成
  • 构建文字转语音服务,用于语音助手、有声内容生成
  • 作为微服务在内部系统中提供统一的语音处理能力

替代项目

faster-whisper、whisper.cpp、Coqui TTS

项目介绍

speech-rest-api 是语音识别领域的开源项目,由 askrella 开发,2023 年首次发布。

它收录于语音识别分类,该分类目前共有 212 个项目,GitHub 星标数为 99。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-05-24。本地部署,完全免费。

它主要面向的使用场景是:为应用快速添加语音转文字功能,如会议记录、字幕生成。同类可对比的替代方案包括 faster-whisper、whisper.cpp、Coqui TTS。

上一篇:SpeakoFlow

下一篇:deepgram-go-sdk

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1616 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3755 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13