
onnx-asr
几行代码用 ONNX 跑语音识别,不装重型框架
onnx-asr 是一个轻量级 Python 语音识别包,核心思路是让开发者直接加载 ONNX 格式的 ASR 模型完成语音转文字,而不必依赖 PyTorch、TensorFlow 等重型深度学习框架。它解决的是传统 ASR 方案部署臃肿、推理依赖复杂的问题:很多项目只想在服务端或边缘设备上跑一个识别模型,却被迫安装整套训练框架。该包通过 ONNX Runtime 执行推理,支持 Whisper、Parakeet 等主流开源语音识别模型,提供简洁的 Python API,几行代码即可完成音频到文本的转换。它适合对安装体积、启动速度和推理效率有要求的场景,比如本地工具、小型服务、嵌入式或 CPU 推理环境。项目处于早期阶段,星标数不高,但方向明确,填补了 ONNX 生态中语音识别易用封装的空白。
项目数据
使用教程
核心亮点
- 基于 ONNX Runtime,推理依赖轻,安装体积远小于 PyTorch 方案
- API 简洁,加载模型和转写音频只需少量代码
- 支持 Whisper、Parakeet 等多种主流 ASR 模型,模型选择灵活
不足之处
- 项目早期,模型覆盖和功能完善度仍在演进
- 文档和社区规模较小,遇到问题可参考的资料有限
适用场景
- 在本地工具或桌面应用中集成离线语音转文字
- 在 CPU 服务器或边缘设备上部署轻量 ASR 服务
- 快速验证 Whisper/Parakeet 等 ONNX 模型的识别效果
替代项目
whisper.cpp、faster-whisper、vosk-api
项目介绍
上一篇:SayIt
同类项目推荐
obs-localvocal
开源
直播录屏时,本地AI实时生成字幕,保护隐私零延迟
OBS plugin for local speech recognition and captioning using AI
LiveCaptions-Translator
开源
实时捕获系统音频,一键翻译成你懂的语言
Lightweight and powerful real-time audio/speech translation tool based on Windows Li···
speechbrain
开源
一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务
A PyTorch-based Speech Toolkit
whisper-diarization
开源
给语音转写加上说话人标签,会议记录一目了然
Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper