sherpa-onnx

离线搞定语音识别与合成,支持多端多语言

sherpa-onnx 是一个基于下一代 Kaldi 和 ONNX Runtime 的语音处理工具包,专注于离线场景下的语音识别(ASR)、文本转语音(TTS)、说话人分离、语音增强、音源分离和语音活动检测(VAD)。它无需互联网连接即可运行,支持从嵌入式系统(如树莓派、RISC-V)到服务器(x86_64)的多种硬件平台,并兼容 Android、iOS、HarmonyOS 等操作系统。项目提供 12 种编程语言的 API,包括 C++、Python、C# 等,方便开发者集成。其核心优势在于将多种语音任务统一在 ONNX 模型下,通过高效的推理引擎实现低延迟、高精度的处理,尤其适合对隐私和实时性要求高的边缘设备。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 14910
维护状态 活跃
是否开源
定价模式 free

项目数据

分类音频音乐
开发团队k2-fsa
所属国家
定价模式free
价格说明完全开源免费,Apache-2.0 许可证,可本地部署,无付费版本。
访问状态
是否开源
开源协议Apache-2.0
主要语言C++
技术栈/模型aarch64,android,arm32,asr,cpp,csharp,dotnet,ios,lazarus,linux,macos,mfc,object-pascal,onnx,raspberry-pi,risc-v,speech-to-text,text-to-speech,vits,windows
GitHub 星标★ 14910
30天Star增速
HF 下载量
上线时间2022-09-01 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 操作系统:Android / iOS / Windows / macOS / Linux / HarmonyOS 之一
  • CPU 架构:x64、x86、arm64、arm32 或 riscv64(不同架构支持的系统组合不同,需先查支持矩阵)
  • 能访问 GitHub 仓库和官方文档站点以获取安装包与模型
  • 使用离线能力时需提前准备对应的 ONNX 模型文件

安装与启动步骤

  1. 1确认平台支持

    对照 README 的支持矩阵,确认你的系统与 CPU 架构组合是否被支持,例如 riscv64 目前仅覆盖部分平台。

  2. 2克隆官方仓库

    把源码仓库拉到本地,后续编译、示例和脚本都在这个目录里,注意磁盘留出足够空间。

    git clone https://github.com/k2-fsa/sherpa-onnx.git
  3. 3查阅官方安装文档

    README 未给出具体安装命令,请打开官网文档页,按你的平台和编程语言选择对应安装方式。

  4. 4准备 ONNX 模型

    本项目离线运行,需提前下载所用任务(ASR/TTS/VAD 等)对应的 ONNX 模型放到本地目录。

  5. 5选择语言 API 接入

    从 C++、Python、C# 等 12 种 API 中挑选你熟悉的语言,按官方示例把库接入自己的工程。

如何确认成功

按官方示例跑通一次语音识别或语音合成,能正常输出文本或音频即表示环境可用。

常见问题

Q:支持哪些操作系统和架构?

A:支持 Android、iOS、Windows、macOS、Linux、HarmonyOS;架构涵盖 x64、x86、arm64、arm32 和 riscv64,具体组合需对照 README 支持矩阵。

Q:运行时需要联网吗?

A:不需要,sherpa-onnx 面向离线场景,模型与推理都在本地完成,适合对隐私和实时性有要求的应用。

Q:可以实现哪些语音功能?

A:包含语音识别、语音合成、音源分离、说话人识别/分离/验证、语种识别、音频打标、VAD、关键词唤醒、标点恢复和语音增强。

Q:能用哪些编程语言调用?

A:官方提供 12 种编程语言的 API,包括 C++、Python、C# 等,可按自己的工程栈选择。

注意事项

  • 本教程依据 README 公开信息整理,README 未提供具体安装命令,实际安装请以官方文档为准。
  • 不同平台与架构的安装包和依赖差异较大,动手前务必先确认支持矩阵。
  • 离线使用需自行准备对应任务的 ONNX 模型文件。

核心亮点

  • 支持 12 种编程语言,集成灵活
  • 覆盖 ASR、TTS、VAD 等多种语音任务,一站式解决
  • 适配广泛硬件,从树莓派到服务器均可用

不足之处

  • 文档和社区生态相对薄弱,新手入门门槛较高
  • 部分高级功能(如说话人分离)的模型和示例不够丰富

适用场景

  • 嵌入式设备上的离线语音助手
  • 移动应用中的实时语音转文字
  • 服务器端的批量语音处理服务

替代项目

whisper.cpp、Vosk、PaddleSpeech

项目介绍

sherpa-onnx 是语音识别领域的开源项目,由 k2-fsa 开发,2022 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(14,910)位列前 4%,在语音识别分类的 212 个项目里位列前 4%。

近 44 天,它的 GitHub 星标从 14,058 增加到 14,910,净增 852。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。完全开源免费,Apache-2.0 许可证,可本地部署,无付费版本。

它主要面向的使用场景是:嵌入式设备上的离线语音助手。同类可对比的替代方案包括 whisper.cpp、Vosk、PaddleSpeech。

上一篇:argmax-oss-swift

下一篇:WhisperLive

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1616 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3755 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13