transcribe.cpp

本地跑 16 种语音识别模型,离线转文字又快又省

transcribe.cpp 是一个基于 ggml 的语音识别推理库,支持 16 种以上主流 ASR 模型家族的本地部署。它解决了语音识别模型在不同硬件上高效运行的问题,通过 GGUF 格式统一模型表示,提供跨平台(CPU/GPU)的轻量级推理能力。核心能力包括:多模型支持(如 Whisper、Distil-Whisper 等)、低内存占用、无外部依赖的纯 C++ 实现,以及简单的命令行接口。项目面向开发者,方便集成到边缘设备或桌面应用中,实现离线、实时的语音转文字。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1982
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类语音识别
开发团队handy-computer
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言C++
技术栈/模型asr,ggml,gguf,speech-to-text
GitHub 星标★ 1982
30天Star增速
HF 下载量
上线时间2026-04-07 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数4

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:进阶 约 20 分钟 部署方式:命令行工具 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 输入音频必须是 16 kHz 单声道 WAV 格式
  • 本地需准备 GGUF 格式的语音识别模型(来自 huggingface.co/handy-computer)
  • 准备好 ffmpeg 或 sox,用于把其它格式音频转成 WAV
  • 项目为 C/C++ 实现,需自行编译后才能得到 build/bin/transcribe-cli

安装与启动步骤

  1. 1转换音频格式

    把 mp3 等格式统一转成 16 kHz 单声道 WAV,否则 CLI 无法读取输入。

    ffmpeg -i input.mp3 -ar 16000 -ac 1 output.wav
  2. 2获取 GGUF 模型

    从 HuggingFace 的 handy-computer 组织下载所需模型家族的 GGUF 文件,放本地目录备用,README 未给出下载命令。

  3. 3编译得到 CLI

    README 未提供构建命令,只说明可执行文件位于 build/bin/transcribe-cli,需按仓库说明自行编译。

  4. 4运行语音识别

    用 -m 指定 GGUF 模型路径,后面跟待识别 WAV 文件,例如 Parakeet TDT 0.6B v2。

    build/bin/transcribe-cli -m models/parakeet-tdt-0.6b-v2/parakeet-tdt-0.6b-v2-F32.gguf samples/jfk.wav

关键配置

配置项必填说明示例
-m是指定要加载的 GGUF 模型文件路径models/parakeet-tdt-0.6b-v2/parakeet-tdt-0.6b-v2-F32.gguf

如何确认成功

执行 build/bin/transcribe-cli 后终端输出该 WAV 的转写文本且无报错,即表示运行成功。

常见问题

Q:支持哪些模型?

A:支持 16 个模型家族、60 多种变体,含 Parakeet、Canary、Canary-Qwen、Whisper、GigaAM、Moonshine 及流式 Moonshine 等,均支持流式与批量。

Q:能直接识别 mp3 吗?

A:不能。输入必须是 16 kHz 单声道 WAV,需先用 ffmpeg 或 sox 转换,例如 ffmpeg -i input.mp3 -ar 16000 -ac 1 output.wav。

Q:模型从哪里下载?

A:官方发布在 HuggingFace 的 handy-computer 组织下,均为 GGUF 格式,并经过数值验证和 WER 测试。

Q:支持 GPU 加速吗?

A:支持 Metal、Vulkan、CUDA 后端做 GPU 推理,CPU 路径使用 tinyBLAS 加速。

注意事项

  • README 未给出安装与编译命令,构建步骤请以仓库实际文档为准,勿照搬示例路径。
  • 示例中的模型路径 models/parakeet-tdt-0.6b-v2/ 与样例音频 samples/jfk.wav 只是占位,需换成你本地的真实路径。
  • 模型必须使用 GGUF 格式,非 GGUF 权重无法直接被该 CLI 加载。

核心亮点

  • 支持 16+ 模型家族,覆盖 Whisper 全系列及变体,选择灵活
  • 基于 ggml 优化,CPU 上推理速度快,内存占用低,适合边缘部署
  • 纯 C++ 无重依赖,编译简单,易于嵌入其他项目

不足之处

  • 文档相对简略,高级用法需读源码
  • GPU 加速支持有限,主要优化集中在 CPU

适用场景

  • 在树莓派等低功耗设备上做离线语音助手
  • 桌面应用内嵌实时语音转写功能
  • 隐私敏感场景下本地批量音频转文字

替代项目

whisper.cpp、faster-whisper、whisper-jax

项目介绍

transcribe.cpp 是语音识别领域的开源项目,由 handy-computer 开发,是 2026 年新上线的项目。

在全站 13,635 个收录项目中,它的 GitHub 星标数(1,981)位列前 30%,在语音识别分类中处于中上游。

近 44 天,它的 GitHub 星标从 1,817 增加到 1,981,净增 164。

项目目前处于活跃维护状态,最近一次代码更新于 2026-10-03。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:在树莓派等低功耗设备上做离线语音助手。同类可对比的替代方案包括 whisper.cpp、faster-whisper、whisper-jax。

上一篇:AudioNotes

下一篇:amical

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1619 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3803 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11852 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5661 2026-08-13