语音识别

汇聚全球AI语音识别与语音转文字项目,Whisper、ASR、实时字幕、会议转写工具一网打尽。

共收录 214 个开源项目

transcribe-anything 开源

一条命令把本地或在线音视频转成文字和字幕

transcribe-anything 是一个基于 Whisper 的多后端语音转文字工具,目标是让本地音视频转写变得又快···

★ 1404 评分 2021-05-09
deepgram-js-sdk 开源

几行代码接入 Deepgram 语音识别与合成,实时语音应用快速落地。

Deepgram 官方 JavaScript SDK,用于在浏览器和 Node.js 环境中集成 Deepgram 的语音 AI 服务。它解···

★ 274 评分 2021-05-02
simple-obs-stt 开源

直播时自动生成实时字幕,直接叠加到 OBS 画面

simple-obs-stt 是一个为 OBS 直播和录播场景设计的实时字幕工具,它通过语音识别(STT)将麦克风或···

★ 106 评分 2021-04-25
klaam 开源

一站式搞定阿拉伯语语音识别、分类与合成

klaam 是一个专注于阿拉伯语语音处理的开源工具包,集语音识别、语音分类和文本转语音于一体。它解···

★ 434 评分 2021-03-31
wenet 开源

开箱即用的生产级语音识别,从训练到部署一步到位

WeNet 是一个面向生产环境的端到端语音识别工具包,旨在解决学术模型与工业部署之间的鸿沟。它基于···

★ 5242 评分 2020-11-17
MASR 开源

一个框架搞定流式+非流式语音识别,训练部署都省心

MASR是一个基于Pytorch的自动语音识别(ASR)框架,专注于流式与非流式识别,兼顾在线和离线场景。···

★ 728 评分 2020-07-29
FastSpeech2 开源

用 PyTorch 快速上手并行语音合成,告别慢速自回归

FastSpeech2 是一个基于 PyTorch 实现的端到端文本转语音(TTS)模型,源自微软提出的非自回归语音···

★ 52 评分 2020-07-20
spokestack-python 开源

在嵌入式设备上快速集成离线语音交互,无需云端依赖。

Spokestack-python 是一个为 Python 应用提供语音界面能力的开源库,尤其专注于嵌入式系统。它解决···

★ 141 评分 2020-07-17
speech-recognition-uk 开源

让乌克兰语应用轻松拥有语音识别和合成能力

这是一个面向乌克兰语的开源语音识别与合成工具包,旨在解决乌克兰语在主流语音技术中支持不足的问···

★ 440 评分 2020-07-06
jetson-voice 开源

在Jetson上快速实现语音识别与合成,边缘AI语音落地利器

jetson-voice 是一个专为 NVIDIA Jetson 平台设计的深度学习推理库,专注于语音相关任务,涵盖自动···

★ 229 评分 2020-05-08
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

SpeechBrain 是一个基于 PyTorch 的开源语音工具包,旨在为语音识别、说话人识别、语音增强、语音分···

★ 11841 评分 2020-04-28
leopard 开源

本地离线把语音转成文字,不联网也能用

Leopard 是 Picovoice 推出的端侧语音转文字引擎,基于深度学习实现完全离线的自动语音识别。它解决···

★ 485 评分 2020-01-14
athena 开源

用 C++ 打造端到端语音识别与合成引擎

Athena 是一个基于序列到序列(seq2seq)架构的开源语音处理引擎,专注于语音识别(ASR)和语音合成···

★ 967 评分 2019-12-22
botium-speech-processing 开源

让语音应用自动化测试像聊天测试一样简单,打通STT/TTS全链路

Botium Speech Processing 是一个用于语音处理测试的开源工具集,隶属于 Botium 测试框架生态。它主···

★ 943 评分 2019-12-03
yandex-speechkit-lib-python 开源

几行代码接入 Yandex 语音识别与合成,快速构建语音应用

这是一个用于调用 Yandex Speechkit API 的 Python SDK,帮助开发者快速集成 Yandex 云平台的语音识···

★ 54 评分 2019-10-29
vosk-api 开源

离线语音识别,不用联网,隐私安全,本地秒转文字

vosk-api 是一个离线语音识别 API,支持 Android、iOS、Raspberry Pi 和服务器端,提供 Python、Ja···

★ 15148 评分 2019-09-03
web-voice-processor 开源

浏览器麦克风音频一键转 16kHz PCM,直喂语音识别

web-voice-processor 是一个面向浏览器端的实时语音处理库,用 TypeScript 编写。它解决的核心问题···

★ 249 评分 2019-07-08
OSSSpeechKit 开源

几行 Swift 代码,让 iOS 应用轻松拥有语音识别与合成能力。

OSSSpeechKit 是一个面向 iOS 开发者的原生语音工具包,基于 AVFoundation 和 Apple 的 Speech 框架···

★ 184 评分 2019-06-06
Speech-and-Text 开源

一键集成多引擎,轻松实现语音转文字与文字转语音

这是一个用Python实现的语音与文本双向转换工具集,集成了多种主流语音识别引擎(PocketSphinx离线···

★ 341 评分 2019-04-15
kaldi-active-grammar 开源

解码中随时切换语法,让语音命令和听写自由混用

kaldi-active-grammar 是一个基于 Kaldi 的 Python 语音识别封装,核心创新在于支持在解码过程中动···

★ 349 评分 2019-03-24
TranscriberBot 开源

把 Telegram 语音秒变文字,会议记录不用愁

TranscriberBot 是一个基于 Python 的 Telegram 对话助手,专门用于将语音消息转录为文本。它解决了···

★ 294 评分 2019-03-01
awesome-diarization 开源

一站式找全说话人日志论文、代码和数据集,快速上手

这是一个精选的说话人日志(Speaker Diarization)资源列表,汇集了相关的论文、库、数据集和其他资···

★ 1904 评分 2019-01-19
cheetah 开源

在设备上实时把语音转文字,离线低延迟还保护隐私

Cheetah是一个基于深度学习的端侧流式语音转文本引擎,专注于在设备本地实时处理语音识别任务。它解···

★ 671 评分 2018-10-28
mrcp-plugin-with-freeswitch 开源

用手机打电话,AI自动听懂并回复,快速搭建语音呼叫中心。

这是一个将FreeSWITCH与UniMRCP Server集成,并接入讯飞开放平台(xfyun)插件的开源项目。它解决了···

★ 349 评分 2018-08-06