speaches

一键部署,即刻拥有 OpenAI 兼容的语音转文字服务

speaches 是一个基于 faster-whisper 构建的语音识别服务,提供与 OpenAI API 兼容的接口,支持实时转录、文件转录和翻译功能。它解决了开发者需要快速集成语音转文字能力但不想从零搭建基础设施的问题。核心能力包括:通过 Docker 一键部署,提供 REST API 和 WebSocket 实时流式转录,支持多种音频格式,并针对 CPU/GPU 进行了性能优化。项目采用 Python 编写,利用 faster-whisper 的加速推理,在保证准确率的同时显著降低延迟。它还支持自定义模型和热词调整,方便针对特定领域优化。speaches 适合需要自托管语音识别服务的场景,如会议记录、客服质检、字幕生成等,尤其适合对数据隐私有要求或希望控制成本的企业用户。

开源 unknown 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3676
维护状态 活跃
是否开源 是
定价模式 unknown

项目数据

分类语音识别
开发团队speaches-ai
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型docker,docker-compose,faster-whisper,openai-api,openai-whisper,openai-whisper-translation,transcription,whisper,whisper-ai
GitHub 星标★ 3676
30天Star增速
HF 下载量
上线时间2024-05-18 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数11

使用教程

难度:入门 约 10 分钟 部署方式:Docker 3 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 能访问 GitHub 与官网 speaches.ai 的网络环境
  • 已安装 Git(用于获取仓库源码)
  • 已安装 Docker 或 Docker Compose(README 提到可通过 Docker 部署)
  • 具备可存放语音模型的磁盘空间与足够内存/显存(支持 CPU 与 GPU)

安装与启动步骤

  1. 1查阅官方文档

    README 本身未给出安装命令,安装与使用说明统一放在官网文档,先打开文档确认部署方式。

  2. 2克隆项目仓库

    从 GitHub 获取源码,方便查看仓库内的完整说明与部署相关文件。

    git clone https://github.com/speaches-ai/speaches.git
  3. 3进入项目目录

    切换到仓库目录,按仓库与官网文档中的指引选择 Docker 或本地方式启动服务。

    cd speaches

如何确认成功

用兼容 OpenAI API 的客户端指向服务地址发起一次调用,能返回转录或合成结果即为成功。

常见问题

Q:必须使用 OpenAI 官方的 SDK 吗?

A:不必须。项目兼容 OpenAI API,凡是能与 OpenAI API 配合的工具和 SDK 理论上都可以直接对接。

Q:模型需要提前下载好吗?

A:不需要。在请求中指定想用的模型即可自动加载,空闲一段时间后会自动卸载释放资源。

Q:支持实时流式转录吗?

A:支持。转录结果通过 SSE 随音频边转写边推送,不必等整段音频处理完才能看到结果。

Q:支持哪些功能?

A:支持语音转文字(转录)、翻译、文本转语音,以及音频进音频出的语音到语音交互。

Q:能在没有 GPU 的机器上跑吗?

A:可以。项目同时支持 GPU 与 CPU,具体选用哪种镜像或配置需以官网文档为准。

注意事项

  • README 未包含实际安装命令,部署步骤务必以官网 speaches.ai 文档为准,不要照搬第三方教程。
  • 语音识别能力由 faster-whisper 提供,语音合成使用 piper 与 Kokoro 模型。
  • 首次调用某个模型会触发加载,响应会比后续调用慢;长时间无请求后模型会被卸载。
  • 部署方式在 README 中被截断(Deployable via Docker Comp...),具体参数请查阅官方文档。

核心亮点

  • API 兼容 OpenAI,迁移成本低,可直接替换现有调用
  • 基于 faster-whisper,推理速度快,资源占用少
  • 支持 WebSocket 实时流式转录,适合实时交互场景

不足之处

  • 文档/社区待观察
  • 依赖外部模型下载,首次部署需联网获取模型

适用场景

  • 自托管语音转文字 API,替代云端服务
  • 实时会议/直播字幕生成
  • 音视频内容批量转写与翻译

替代项目

whisper.cpp、faster-whisper-server、LocalAI

项目介绍

speaches 是语音识别领域的开源项目,由 speaches-ai 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(3,676)位列前 30%,在语音识别分类中处于中上游。

近 42 天,它的 GitHub 星标从 3,583 增加到 3,676,净增 93。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。从国内网络环境看,可直接访问。

它主要面向的使用场景是:自托管语音转文字API,替代云端服务。同类可对比的替代方案包括 whisper.cpp、faster-whisper-server、LocalAI。

上一篇:SmartSub

下一篇:Hex

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1616 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3755 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13