automatic-speech-recognition

本站收录 24 个带「automatic-speech-recognition」标签的 AI 开源项目

WhisperLiveKitWhisperLiveKit 是一个实时、本地的语音转文字工具包,基于 OpenAI Whisper 模型,提供流式语音识别(ASR)、说话人分离(speake★ 11,103wenetWeNet 是一个面向生产环境的端到端语音识别工具包,旨在解决学术模型与工业部署之间的鸿沟。它基于 PyTorch 构建,支持 Conformer、Transf★ 5,243whisper-asr-webservice这是一个基于OpenAI Whisper的语音识别Web服务,将Whisper模型封装成易于调用的API接口。它解决了开发者需要快速集成语音转文字功能但不想深入★ 3,347awesome-speech-recognition-speech-synthesis-papers这是一个收录语音识别与语音合成领域经典论文的精选列表,涵盖自动语音识别(ASR)、说话人验证、语音合成、文本转语音(TTS)、语言建模、歌声合成(SVS)和声音★ 3,132GPAGPA(General Purpose Audio)是一个基于Transformer的通用音频模型,由AutoArk团队开发,旨在用单一小型模型同时实现自动语音★ 3,107FluidAudioFluidAudio 是一个面向 iOS/macOS 开发者的 Swift 框架,旨在将前沿的 CoreML 音频模型无缝集成到原生应用中。它解决了开发者难以在★ 2,927MOSS-Transcribe-DiarizeMOSS-Transcribe-Diarize 是一个轻量级(0.9B 参数)的多语言长语音转写与说话人分离模型,支持 50 多种语言,并集成时间戳和声学事件识★ 2,096FireRedASRFireRedASR 是一个开源的工业级自动语音识别(ASR)模型,主要面向中文普通话、中文方言和英语的语音转文字场景。它解决了传统ASR模型在中文方言和复杂音★ 1,996TensorFlowASRTensorFlowASR 是一个基于 TensorFlow 2 的开源端到端语音识别工具箱,目标是在 TensorFlow 生态中提供接近当前最优(Almos★ 1,011awesome-large-audio-models这是一个收录大型语言模型(LLM)在音频AI领域应用资源的精选列表,旨在为研究人员和开发者提供一站式导航。项目系统梳理了音频理解、生成、多模态交互等方向的前沿模★ 742whisper_androidwhisper_android 是一个将 OpenAI Whisper 语音识别模型移植到 Android 平台的开源项目,基于 TensorFlow Lite★ 692cheetahCheetah是一个基于深度学习的端侧流式语音转文本引擎,专注于在设备本地实时处理语音识别任务。它解决的是传统云端语音识别依赖网络、延迟高、隐私风险大的问题,通★ 670leopardLeopard 是 Picovoice 推出的端侧语音转文字引擎,基于深度学习实现完全离线的自动语音识别。它解决的是云端 ASR 常见的隐私泄露、网络延迟和按量★ 485speech_datasetspeech_dataset 是一个面向语音识别(ASR)研究的中文语音数据集仓库,旨在为深度学习语音模型提供训练与评估所需的音频资源。项目整理了多种来源的语音★ 471parakeet-rsparakeet-rs 是一个用 Rust 编写的语音识别工具库,基于 NVIDIA Parakeet 系列模型(通过 ONNX 运行),提供极快的语音转文字能★ 404awesome-voice-typingawesome-voice-typing 是一个精选开源语音输入与语音转文字工具清单,覆盖 Linux、macOS、Windows、Android 和 iOS ★ 197spellbook-dockerspellbook-docker 是一个基于 Docker 的 AI 模型集成部署工具,旨在简化多种 AI 模型的本地运行与交互。它解决了 AI 爱好者与开发者★ 171whisplywhisply 是一个基于 OpenAI Whisper 的跨平台语音转写工具,同时提供命令行和图形界面。它解决的核心问题是:用户手头有大量音视频文件需要转成文★ 159TTSizerTTSizer 是一个自动生成高质量、按说话人区分的文本转语音(TTS)数据集的工具。它解决的是构建 TTS 模型时数据准备繁琐的痛点:以往需要手动转录音频、切★ 145orukeetorukeet 是一个多语言自动语音识别(ASR)开源项目,核心创新在于用「拟合后冻结的 Gabor 卷积核」替代传统可学习卷积,把声学前端固定下来,减少训练参★ 139best-rq-pytorchBEST-RQ 是一种自监督语音表示学习模型,由 Google 提出,核心思想是用随机投影量化器(Random Projection Quantizer)替代传★ 137ZeroSpeech-TTS-without-T这是一个基于PyTorch的ZeroSpeech 2019挑战赛实现,旨在解决无文本标注的语音合成(TTS-without-T)问题。传统TTS需要文本转录作为★ 112maiseMaise 是一个开源的 Android 语音引擎,专注于在设备端(边缘)提供强大且灵活的语音合成(TTS)能力。它基于 Kotlin 开发,利用 ONNX R★ 76SynParaSpeechSynParaSpeech 是 ICASSP 2026 论文的官方开源仓库,专注于自动合成副语言(paralinguistic)数据集,用于语音生成和理解任务。★ 72