speech_recognition

一行代码搞定语音转文字,支持多引擎在线离线

这是一个Python语音识别模块,支持多种引擎和API,涵盖在线和离线场景。它解决了开发者需要统一接口调用不同语音识别服务的问题,通过简单的API即可实现从麦克风或音频文件到文本的转换。核心能力包括:支持Google Web Speech API、Sphinx、Wit.ai、Microsoft Bing Voice Recognition、Houndify、IBM Speech to Text等引擎;提供便捷的麦克风输入、音频文件处理功能;具备语音活动检测和自动调整环境噪音的功能;还支持识别不同语言和将音频保存为音频文件。该库设计简洁,易于上手,适合快速集成到Python应用中。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 8989
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类语音识别
开发团队Uberi
所属国家
定价模式free
价格说明开源库,完全免费,支持多种引擎和API,可本地部署。
访问状态
是否开源
开源协议BSD-3-Clause
主要语言Python
技术栈/模型audio,python,speech-recognition,speech-to-text
GitHub 星标★ 8989
30天Star增速
HF 下载量
上线时间2014-04-23 00:00:00
最近更新2026-09-21 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数4

使用教程

难度:入门 约 5 分钟 部署方式:库/依赖 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(README 通过 PyPI 徽章标注支持的 Python 版本,具体版本见 PyPI 页面)
  • pip 包管理工具,用于安装 PyPI 上的 SpeechRecognition 包
  • 使用在线识别引擎时需要可访问外网
  • 准备语音输入来源:麦克风或本地音频文件

安装与启动步骤

  1. 1确认 Python 环境

    先在终端确认本机已安装 Python 与 pip,版本要求以 PyPI 页面标注为准。

    python --version
    pip --version
  2. 2安装识别库

    项目已发布到 PyPI,包名为 SpeechRecognition;README 节选未给出安装命令,此处按 PyPI 包名安装,如失败请以官方 README 为准。

    pip install SpeechRecognition
  3. 3准备语音输入

    准备好麦克风,或准备一个本地音频文件作为识别输入;README 未给出具体录音或编解码依赖,需按官方说明自行补齐。

  4. 4编写识别脚本

    在 Python 代码中引入该库,调用所选识别引擎从麦克风或音频文件得到文本;各引擎的调用方式请查阅官方文档。

如何确认成功

该库为依赖包,无独立服务进程或端口。在 Python 中执行 import speech_recognition 不报错即表示安装成功。

常见问题

Q:这是可启动的服务还是代码库?

A:它是 Python 语音识别模块(库),安装后在代码中引入使用,没有独立服务进程、端口或网页界面。

Q:必须联网才能用吗?

A:项目同时涵盖在线与离线引擎:使用 Google Web Speech API 等在线引擎需联网,离线场景可选用本地引擎,具体以官方文档为准。

Q:需要申请 API Key 吗?

A:README 节选未列出各引擎的密钥配置项。若使用第三方云识别引擎,通常需在对应平台申请凭据,请以官方文档为准。

Q:为什么安装步骤写得比较简略?

A:README 节选只包含徽章信息和标题,缺少完整安装说明,因此仅能给出可推断的通用准备动作,建议以官方 README 与 PyPI 页面为准。

注意事项

  • 本教程依据 README 节选整理,节选中未包含完整安装与使用命令,实际命令请以官方 README 和 PyPI 页面为准。
  • 项目形态为 Python 库(库/依赖),无需 docker run 或启动服务,也没有端口需要验证。
  • 使用云识别引擎时产生的密钥请勿硬编码到代码或提交到仓库。
  • 麦克风输入通常需要额外的音频采集依赖,README 节选未提及,请按官方说明安装。

核心亮点

  • 统一封装多种主流语音识别引擎,切换成本低
  • 内置麦克风录音和噪声校准,开箱即用
  • 支持离线识别(Sphinx),保护隐私且无网络依赖

不足之处

  • 部分在线引擎需要API密钥,且依赖网络
  • 离线识别准确率相对较低,不适合复杂场景
  • 文档/社区待观察

适用场景

  • 快速构建语音控制命令的桌面应用
  • 为移动端或嵌入式设备提供离线语音输入
  • 批量将音频文件转录为文本用于分析

替代项目

Vosk、Whisper、SpeechRecognition(原库)

项目介绍

speech_recognition 是语音识别领域的开源项目,由 Uberi 开发,2014 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(8,989)位列前 6%,在语音识别分类的 212 个项目里位列前 8%。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-21。开源库,完全免费,支持多种引擎和API,可本地部署。

它主要面向的使用场景是:快速构建语音控制命令的桌面应用。同类可对比的替代方案包括 Vosk、Whisper、SpeechRecognition(原库)。

上一篇:SenseVoice

下一篇:annyang

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1616 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3755 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13