whisper-asr-webservice

一行命令部署Whisper语音转文字API,快速集成到你的应用

这是一个基于OpenAI Whisper的语音识别Web服务,将Whisper模型封装成易于调用的API接口。它解决了开发者需要快速集成语音转文字功能但不想深入模型细节的问题。核心能力包括:提供RESTful API,支持多种音频格式上传,自动检测语言并转录,支持模型热切换(如tiny/base/small/medium/large),可输出纯文本或带时间戳的JSON结果,并内置Docker部署方案,方便本地或云端快速启动。项目还支持通过参数调整翻译模式(转录为原文或翻译成英文),适合构建语音笔记、会议记录、字幕生成等应用。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3343
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类语音识别
开发团队ahmetoner
所属国家
定价模式free
价格说明开源项目,MIT许可证,可自行部署,完全免费。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型asr,automatic-speech-recognition,docker,openai-whisper,speech,speech-recognition,speech-to-text
GitHub 星标★ 3343
30天Star增速
HF 下载量
上线时间2022-09-22 00:00:00
最近更新2026-09-23 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数4

使用教程

难度:入门 约 10 分钟 部署方式:Docker 7 步

环境要求

  • 已安装 Docker(Docker Desktop 或 Docker Engine)
  • GPU 部署需 NVIDIA 驱动并支持 --gpus all
  • 本地源码运行需 Python 环境与 pip3
  • 宿主机 9000 端口未被占用

安装与启动步骤

  1. 1启动CPU容器

    用官方镜像后台启动服务,映射 9000 端口,指定基础模型与引擎;首次运行需下载模型,耐心等待。

    docker run -d -p 9000:9000 
      -e ASR_MODEL=base 
      -e ASR_ENGINE=openai_whisper 
      onerahmet/openai-whisper-asr-webservice:latest
  2. 2启动GPU容器

    有 NVIDIA 显卡时改用 latest-gpu 镜像并加 --gpus all,显存不足会让容器启动失败。

    docker run -d --gpus all -p 9000:9000 
      -e ASR_MODEL=base 
      -e ASR_ENGINE=openai_whisper 
      onerahmet/openai-whisper-asr-webservice:latest-gpu
  3. 3挂载模型缓存

    把缓存目录挂到宿主机,避免每次重建容器都重复下载模型,缩短启动时间。

    docker run -d -p 9000:9000 
      -v $PWD/cache:/root/.cache/ 
      onerahmet/openai-whisper-asr-webservice:latest
  4. 4访问Swagger验证

    浏览器打开服务地址,能看到 Swagger UI 接口文档即代表启动成功,可直接在页面上传音频试跑。

  5. 5安装poetry

    不用 Docker 而想本地跑源码时,先用 pip3 安装 v2.x 版本的 poetry 作为依赖管理工具。

    pip3 install poetry
  6. 6安装依赖

    按硬件选择 cpu 或 cuda 附加依赖安装;cuda 版本需要本机已装好 CUDA 环境。

    poetry install --extras cpu
  7. 7启动本地服务

    用 poetry 运行服务命令,绑定 0.0.0.0 与 9000 端口,效果与容器方式一致。

    poetry run whisper-asr-webservice --host 0.0.0.0 --port 9000

关键配置

配置项必填说明示例
ASR_MODEL是指定使用的 Whisper 模型,示例为基础版,越大越准但更慢更占资源base
ASR_ENGINE是指定推理引擎,README 示例使用 openai_whisperopenai_whisper
-v $PWD/cache:/root/.cache/否把容器内模型缓存挂到宿主机,避免重复下载模型$PWD/cache:/root/.cache/
--port否本地源码启动时服务监听端口,默认示例为 90009000
--host否本地源码启动时绑定的地址,0.0.0.0 表示允许外部访问0.0.0.0

如何确认成功

浏览器访问 http://localhost:9000 或 http://0.0.0.0:9000,能看到 Swagger UI 文档页即启动成功。

常见问题

Q:容器每次启动都要重新下载模型怎么办?

A:启动时加 -v $PWD/cache:/root/.cache/ 把缓存目录挂载到宿主机,之后重建容器会复用已下载的模型文件。

Q:GPU 版启动报错或显卡不识别?

A:确认宿主机已装 NVIDIA 驱动并支持 --gpus all,容器命令必须带该参数,且镜像使用 latest-gpu 标签。

Q:怎么换用其他模型?

A:修改 docker run 中的 ASR_MODEL 环境变量(README 示例为 base),然后重新创建容器即可生效。

Q:没有 Docker 可以跑吗?

A:可以。安装 poetry 后执行 poetry install --extras cpu(或 cuda),再用 poetry run whisper-asr-webservice 启动。

Q:服务启好后怎么调用?

A:直接打开浏览器访问 http://localhost:9000,在 Swagger UI 页面上传音频并试跑各接口。

注意事项

  • CPU 与 GPU 使用不同镜像标签:latest 与 latest-gpu,别混用
  • 首次运行需要下载模型,耗时较长,建议提前挂载缓存目录
  • GPU 部署依赖宿主机 NVIDIA 驱动与 --gpus all 参数支持
  • 本教程命令与端口均来自 README,未在 README 出现的参数请勿自行添加

核心亮点

  • 提供标准REST API,支持curl/Postman直接调用,无需懂模型细节
  • Docker镜像一键启动,支持CPU/GPU,降低部署门槛
  • 支持多种Whisper模型大小和语言,可灵活平衡精度与速度

不足之处

  • 并发处理能力有限,高负载场景需自行扩展
  • 文档/社区待观察

适用场景

  • 快速搭建语音转写API服务,供前端或移动端调用
  • 在本地或内网部署私有语音识别服务,避免数据外传
  • 作为微服务集成到会议记录、客服质检等业务系统

替代项目

faster-whisper-server、whisper.cpp、speaches

项目介绍

whisper-asr-webservice 是语音识别领域的开源项目,由 ahmetoner 开发,2022 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(3,343)位列前 30%,在语音识别分类中处于中上游。

近 42 天,它的 GitHub 星标从 3,317 增加到 3,343,净增 26。

项目仍在小幅维护中,最近一次代码更新于 2026-09-23。MIT许可证,可自行部署,完全免费。

它主要面向的使用场景是:快速搭建语音转写API服务,供前端或移动端调用。同类可对比的替代方案包括 faster-whisper-server、whisper.cpp、speaches。

上一篇:pocketsphinx

下一篇:willow

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1616 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3755 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13