语音识别

汇聚全球AI语音识别与语音转文字项目,Whisper、ASR、实时字幕、会议转写工具一网打尽。

共收录 214 个开源项目

lingvo 开源

用 Google 的序列建模框架,快速搞定语音和翻译实验

Lingvo 是 Google 开源的深度学习框架,专注于序列建模任务,尤其擅长语音识别、机器翻译和语言模型···

★ 2864 评分 2018-07-24
web-speech-cognitive-services 开源

用Azure服务补齐浏览器语音API,统一标准接入

这是一个JavaScript库,为Web Speech API提供Polyfill实现,将微软Azure认知服务中的语音转文本和文···

★ 70 评分 2018-06-28
Recorder 开源

一个库搞定 H5 多格式录音,还能语音转文字

Recorder 是一个基于 HTML5 的纯前端录音库,旨在解决浏览器和混合应用中录音格式不统一、兼容性差···

★ 5639 评分 2018-05-16
youtube-transcript-api 开源

不用 API 密钥,几行代码抓取 YouTube 字幕

youtube-transcript-api 是一个 Python 库,用于获取 YouTube 视频的字幕或转录文本。它解决了开发···

★ 8376 评分 2018-04-20
porcupine 开源

在设备本地秒级唤醒,无需联网,隐私安全

Porcupine 是一个基于深度学习的端侧唤醒词检测引擎,由 Picovoice 开发。它解决的是在设备本地实时···

★ 4941 评分 2018-03-08
react-native-spokestack 开源

给 React Native 应用加上语音交互,一句话搞定识别、合成和理解

react-native-spokestack 是一个为 React Native 应用提供语音接口的官方 SDK,它封装了 Spokestac···

★ 60 评分 2018-03-07
spokestack-android 开源

给安卓应用加上完整语音对话能力,唤醒、识别、理解、合成一步到位。

Spokestack Android 是一个面向 Android 平台的可扩展移动语音框架,旨在帮助开发者快速为应用集成···

★ 74 评分 2018-03-01
espnet 开源

语音识别、合成、翻译一把抓,一个工具箱全搞定

端到端语音处理工具包,覆盖语音识别、语音合成、语音翻译、说话人识别等多项任务。提供统一训练框···

★ 9970 评分 2017-12-13
wav2letter 开源

用 C++ 打造高性能端到端语音识别,训练推理快人一步。

wav2letter 是 Facebook AI Research 开源的端到端自动语音识别工具包,基于 C++ 实现,专注于高效···

★ 6437 评分 2017-11-20
PaddleSpeech 开源

一站式语音工具箱,快速实现识别、合成与唤醒

PaddleSpeech 是百度开源的端到端语音工具包,基于飞桨深度学习框架,提供从语音识别、语音合成到说···

★ 12690 评分 2017-11-14
java-google-speech-api 开源

Java 一键接入谷歌语音识别、合成与翻译

java-google-speech-api 是一个早期的 Java 库,旨在封装 Google 的语音识别(Speech Recognition)···

★ 80 评分 2017-10-03
myG2P 开源

把缅甸语文字变音素,让语音识别和合成更准。

myG2P 是一个面向缅甸语(Burmese)的开源字素到音素(G2P)转换词典,专为语音识别(ASR)和语音合···

★ 61 评分 2017-05-30
awesome-speech-recognition-speech-sy··· 开源

按图索骥,快速入门语音识别与合成论文

这是一个收录语音识别与语音合成领域经典论文的精选列表,涵盖自动语音识别(ASR)、说话人验证、语···

★ 3131 评分 2017-04-28
TextNormalizationCoveringGrammars 开源

用覆盖文法搞定英文俄文文本规范化,让语音更自然

TextNormalizationCoveringGrammars 是一个专注于英文和俄文文本规范化的开源项目,主要服务于语音···

★ 61 评分 2017-02-27
py-nltools 开源

快速搭建口语NLP原型,轻量处理语音文本特征。

py-nltools 是一组用于口语自然语言处理的基础 Python 模块,旨在为语音相关的 NLP 任务提供轻量级···

★ 55 评分 2017-01-10
Android-MVVM-Architecture-Android-Vo··· 开源

给 Android 应用几分钟接入语音 AI 对话能力,开箱即用。

Voice AI SDK 是一个可复用的 Android 库,旨在帮助开发者快速为应用集成完整的语音驱动 AI 对话能···

★ 2580 评分 2016-12-25
android-speech 开源

几行代码搞定 Android 语音识别与合成

android-speech 是一个专为 Android 平台设计的语音识别与文本转语音(TTS)封装库,旨在简化原生 ···

★ 535 评分 2016-08-28
speech_recognition 开源

一行代码搞定语音转文字,支持多引擎在线离线

这是一个Python语音识别模块,支持多种引擎和API,涵盖在线和离线场景。它解决了开发者需要统一接口···

★ 8990 评分 2014-04-23
pocketsphinx 开源

离线轻量语音识别,嵌入式设备也能实时听懂人话

PocketSphinx 是一个轻量级的嵌入式语音识别库,基于 CMU Sphinx 项目发展而来,专为资源受限环境设···

★ 4343 评分 2014-04-07
google-speech-v2 开源

逆向 Google 语音接口,免费实现语音转文字

google-speech-v2 是一个针对 Google 语音转文字 API(v2 版本)的逆向工程项目。它通过分析 Googl···

★ 469 评分 2014-02-23
annyang 开源

几行代码给网站加上语音命令,让用户动嘴就能操作

annyang 是一个轻量级的 JavaScript 语音识别库,通过 Web Speech API 为网站添加语音控制能力。它···

★ 6817 评分 2013-08-23
K6nele 开源

装上它,任何安卓输入框都能语音打字

K6nele 是一个开源的 Android 语音转文字应用,它本身不提供识别引擎,而是作为系统级输入法或语音···

★ 290 评分 2011-12-21