speechbrain
开源
一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务
SpeechBrain 是一个基于 PyTorch 的开源语音工具包,旨在为语音识别、说话人识别、语音增强、语音分···
汇聚全球AI语音识别与语音转文字项目,Whisper、ASR、实时字幕、会议转写工具一网打尽。
共收录 258 个开源项目
speechbrain
开源
一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务
SpeechBrain 是一个基于 PyTorch 的开源语音工具包,旨在为语音识别、说话人识别、语音增强、语音分···
TensorFlowASR
开源
用 TF2 快速训练和部署端到端语音识别模型
TensorFlowASR 是一个基于 TensorFlow 2 的开源端到端语音识别工具箱,目标是在 TensorFlow 生态中···
leopard
开源
本地离线把语音转成文字,不联网也能用
Leopard 是 Picovoice 推出的端侧语音转文字引擎,基于深度学习实现完全离线的自动语音识别。它解决···
athena
开源
用 C++ 打造端到端语音识别与合成引擎
Athena 是一个基于序列到序列(seq2seq)架构的开源语音处理引擎,专注于语音识别(ASR)和语音合成···
botium-speech-processing
开源
让语音应用自动化测试像聊天测试一样简单,打通STT/TTS全链路
Botium Speech Processing 是一个用于语音处理测试的开源工具集,隶属于 Botium 测试框架生态。它主···
yandex-speechkit-lib-python
开源
几行代码接入 Yandex 语音识别与合成,快速构建语音应用
这是一个用于调用 Yandex Speechkit API 的 Python SDK,帮助开发者快速集成 Yandex 云平台的语音识···
speech_to_text
开源
Flutter 里几行代码接入系统语音转文字
speech_to_text 是一个 Flutter 插件,把 iOS、Android、macOS 和 Web 等平台自带的语音识别能力封···
vosk-api
开源
离线语音识别,不用联网,隐私安全,本地秒转文字
vosk-api 是一个离线语音识别 API,支持 Android、iOS、Raspberry Pi 和服务器端,提供 Python、Ja···
esp-sr
开源
让 ESP32 离线听懂人话,不联网也能语音控制
esp-sr 是乐鑫为 ESP32 系列芯片打造的离线语音识别与语音交互框架,用 C 语言编写,运行在资源受限···
OBS-captions-plugin
开源
OBS 直播自动生成实时字幕,静音观众也能看懂
OBS-captions-plugin 是给 OBS Studio 用的实时字幕插件,通过 Google 语音识别把麦克风或桌面音频···
web-voice-processor
开源
浏览器麦克风音频一键转 16kHz PCM,直喂语音识别
web-voice-processor 是一个面向浏览器端的实时语音处理库,用 TypeScript 编写。它解决的核心问题···
OSSSpeechKit
开源
几行 Swift 代码,让 iOS 应用轻松拥有语音识别与合成能力。
OSSSpeechKit 是一个面向 iOS 开发者的原生语音工具包,基于 AVFoundation 和 Apple 的 Speech 框架···
Speech-and-Text
开源
一键集成多引擎,轻松实现语音转文字与文字转语音
这是一个用Python实现的语音与文本双向转换工具集,集成了多种主流语音识别引擎(PocketSphinx离线···
kaldi-active-grammar
开源
解码中随时切换语法,让语音命令和听写自由混用
kaldi-active-grammar 是一个基于 Kaldi 的 Python 语音识别封装,核心创新在于支持在解码过程中动···
TranscriberBot
开源
把 Telegram 语音秒变文字,会议记录不用愁
TranscriberBot 是一个基于 Python 的 Telegram 对话助手,专门用于将语音消息转录为文本。它解决了···
awesome-diarization
开源
一站式找全说话人日志论文、代码和数据集,快速上手
这是一个精选的说话人日志(Speaker Diarization)资源列表,汇集了相关的论文、库、数据集和其他资···
cheetah
开源
在设备上实时把语音转文字,离线低延迟还保护隐私
Cheetah是一个基于深度学习的端侧流式语音转文本引擎,专注于在设备本地实时处理语音识别任务。它解···
mrcp-plugin-with-freeswitch
开源
用手机打电话,AI自动听懂并回复,快速搭建语音呼叫中心。
这是一个将FreeSWITCH与UniMRCP Server集成,并接入讯飞开放平台(xfyun)插件的开源项目。它解决了···
SmartSpeaker
开源
用STM32+ESP8266自造一台能联网听话的智能音箱
SmartSpeaker 是一个用 C 语言编写的开源智能音箱项目,硬件基于 STM32F407 主控、WM8978 音频编解···
lingvo
开源
用 Google 的序列建模框架,快速搞定语音和翻译实验
Lingvo 是 Google 开源的深度学习框架,专注于序列建模任务,尤其擅长语音识别、机器翻译和语言模型···
web-speech-cognitive-services
开源
用Azure服务补齐浏览器语音API,统一标准接入
这是一个JavaScript库,为Web Speech API提供Polyfill实现,将微软Azure认知服务中的语音转文本和文···
Recorder
开源
一个库搞定 H5 多格式录音,还能语音转文字
Recorder 是一个基于 HTML5 的纯前端录音库,旨在解决浏览器和混合应用中录音格式不统一、兼容性差···
youtube-transcript-api
开源
不用 API 密钥,几行代码抓取 YouTube 字幕
youtube-transcript-api 是一个 Python 库,用于获取 YouTube 视频的字幕或转录文本。它解决了开发···
porcupine
开源
在设备本地秒级唤醒,无需联网,隐私安全
Porcupine 是一个基于深度学习的端侧唤醒词检测引擎,由 Picovoice 开发。它解决的是在设备本地实时···