web-voice-processor

浏览器麦克风音频一键转 16kHz PCM,直喂语音识别

web-voice-processor 是一个面向浏览器端的实时语音处理库,用 TypeScript 编写。它解决的核心问题是:网页应用想接入麦克风做语音识别或实时音频分析时,往往要自己处理 getUserMedia、AudioContext、采样率转换、PCM 编码等底层细节,代码繁琐且容易出错。该库把这些封装成简单的 API,自动从麦克风采集音频,实时降采样为 16kHz 单声道 16 位 PCM 数据,并以回调方式持续输出音频帧,方便直接喂给语音识别引擎或自定义处理逻辑。它体积轻量、无重依赖,适合与 Picovoice、Whisper 等语音转文字方案配合使用,让开发者专注于业务逻辑而非音频管线搭建。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 248
维护状态 活跃
是否开源
定价模式 free

项目数据

分类语音识别
开发团队Picovoice
所属国家
定价模式free
价格说明开源库,免费使用
访问状态
是否开源
开源协议Apache-2.0
主要语言TypeScript
技术栈/模型audio-processing,browser,downsampling,javascript,microphone,pcm,real-time,realtime,speech-recognition,speech-to-text,voice-commands,voice-processing,wake-word-detection,web-browser,webaudio-api,worker
GitHub 星标★ 248
30天Star增速
HF 下载量
上线时间2019-07-08 00:00:00
最近更新2026-09-14 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-15
浏览次数0

使用教程

核心亮点

  • 自动完成麦克风采集、重采样与 PCM 编码,省去手写 Web Audio 管线
  • 输出标准 16kHz 单声道 16 位 PCM,可直接对接主流语音识别引擎
  • TypeScript 编写,API 简洁,支持实时帧回调,轻量无重依赖

不足之处

  • 仅覆盖采集与降采样,不含识别模型,需自行搭配其他引擎
  • 项目星标较少,社区与文档规模有限,长期维护待观察

适用场景

  • 网页端实时语音转文字应用
  • 浏览器内语音指令/语音助手
  • 在线会议或直播的实时音频分析

替代项目

whisper.cpp、vosk-api

项目介绍

web-voice-processor 是语音识别领域的开源项目,由 Picovoice 开发,2019 年首次发布。

它收录于语音识别分类,该分类目前共有 165 个项目,GitHub 星标数为 248。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-14。开源库,免费使用。

它主要面向的使用场景是:网页端实时语音转文字应用。同类可对比的替代方案包括 whisper.cpp、vosk-api。

上一篇:openasr

下一篇:hex

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1614 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3733 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11826 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5651 2026-08-13