lingvo
开源
用 Google 的序列建模框架,快速搞定语音和翻译实验
Lingvo 是 Google 开源的深度学习框架,专注于序列建模任务,尤其擅长语音识别、机器翻译和语言模型···
汇聚全球AI语音识别与语音转文字项目,Whisper、ASR、实时字幕、会议转写工具一网打尽。
共收录 214 个开源项目
lingvo
开源
用 Google 的序列建模框架,快速搞定语音和翻译实验
Lingvo 是 Google 开源的深度学习框架,专注于序列建模任务,尤其擅长语音识别、机器翻译和语言模型···
web-speech-cognitive-services
开源
用Azure服务补齐浏览器语音API,统一标准接入
这是一个JavaScript库,为Web Speech API提供Polyfill实现,将微软Azure认知服务中的语音转文本和文···
Recorder
开源
一个库搞定 H5 多格式录音,还能语音转文字
Recorder 是一个基于 HTML5 的纯前端录音库,旨在解决浏览器和混合应用中录音格式不统一、兼容性差···
youtube-transcript-api
开源
不用 API 密钥,几行代码抓取 YouTube 字幕
youtube-transcript-api 是一个 Python 库,用于获取 YouTube 视频的字幕或转录文本。它解决了开发···
porcupine
开源
在设备本地秒级唤醒,无需联网,隐私安全
Porcupine 是一个基于深度学习的端侧唤醒词检测引擎,由 Picovoice 开发。它解决的是在设备本地实时···
react-native-spokestack
开源
给 React Native 应用加上语音交互,一句话搞定识别、合成和理解
react-native-spokestack 是一个为 React Native 应用提供语音接口的官方 SDK,它封装了 Spokestac···
spokestack-android
开源
给安卓应用加上完整语音对话能力,唤醒、识别、理解、合成一步到位。
Spokestack Android 是一个面向 Android 平台的可扩展移动语音框架,旨在帮助开发者快速为应用集成···
espnet
开源
语音识别、合成、翻译一把抓,一个工具箱全搞定
端到端语音处理工具包,覆盖语音识别、语音合成、语音翻译、说话人识别等多项任务。提供统一训练框···
wav2letter
开源
用 C++ 打造高性能端到端语音识别,训练推理快人一步。
wav2letter 是 Facebook AI Research 开源的端到端自动语音识别工具包,基于 C++ 实现,专注于高效···
PaddleSpeech
开源
一站式语音工具箱,快速实现识别、合成与唤醒
PaddleSpeech 是百度开源的端到端语音工具包,基于飞桨深度学习框架,提供从语音识别、语音合成到说···
java-google-speech-api
开源
Java 一键接入谷歌语音识别、合成与翻译
java-google-speech-api 是一个早期的 Java 库,旨在封装 Google 的语音识别(Speech Recognition)···
myG2P
开源
把缅甸语文字变音素,让语音识别和合成更准。
myG2P 是一个面向缅甸语(Burmese)的开源字素到音素(G2P)转换词典,专为语音识别(ASR)和语音合···
awesome-speech-recognition-speech-sy···
开源
按图索骥,快速入门语音识别与合成论文
这是一个收录语音识别与语音合成领域经典论文的精选列表,涵盖自动语音识别(ASR)、说话人验证、语···
TextNormalizationCoveringGrammars
开源
用覆盖文法搞定英文俄文文本规范化,让语音更自然
TextNormalizationCoveringGrammars 是一个专注于英文和俄文文本规范化的开源项目,主要服务于语音···
py-nltools
开源
快速搭建口语NLP原型,轻量处理语音文本特征。
py-nltools 是一组用于口语自然语言处理的基础 Python 模块,旨在为语音相关的 NLP 任务提供轻量级···
Android-MVVM-Architecture-Android-Vo···
开源
给 Android 应用几分钟接入语音 AI 对话能力,开箱即用。
Voice AI SDK 是一个可复用的 Android 库,旨在帮助开发者快速为应用集成完整的语音驱动 AI 对话能···
android-speech
开源
几行代码搞定 Android 语音识别与合成
android-speech 是一个专为 Android 平台设计的语音识别与文本转语音(TTS)封装库,旨在简化原生 ···
speech_recognition
开源
一行代码搞定语音转文字,支持多引擎在线离线
这是一个Python语音识别模块,支持多种引擎和API,涵盖在线和离线场景。它解决了开发者需要统一接口···
pocketsphinx
开源
离线轻量语音识别,嵌入式设备也能实时听懂人话
PocketSphinx 是一个轻量级的嵌入式语音识别库,基于 CMU Sphinx 项目发展而来,专为资源受限环境设···
google-speech-v2
开源
逆向 Google 语音接口,免费实现语音转文字
google-speech-v2 是一个针对 Google 语音转文字 API(v2 版本)的逆向工程项目。它通过分析 Googl···
annyang
开源
几行代码给网站加上语音命令,让用户动嘴就能操作
annyang 是一个轻量级的 JavaScript 语音识别库,通过 Web Speech API 为网站添加语音控制能力。它···
K6nele
开源
装上它,任何安卓输入框都能语音打字
K6nele 是一个开源的 Android 语音转文字应用,它本身不提供识别引擎,而是作为系统级输入法或语音···