speech-recognition
本站收录 230 个带「speech-recognition」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
transformersHugging Face 出品的模型定义框架,支持文本、视觉、音频与多模态模型,覆盖推理与训练全流程,是当前研究和生产中最主流的开源模型生态基石。★ 166,817
whisper.cppwhisper.cpp 是 OpenAI 的 Whisper 语音识别模型的高性能 C/C++ 移植版。它解决了 Whisper 原始 Python 实现依赖 ★ 54,014
whisperXWhisperX 是一个基于 OpenAI Whisper 的自动语音识别(ASR)工具,核心解决 Whisper 原始输出时间戳不精确、无法对齐到单词级别的问★ 24,303
FunASRFunASR 是阿里开源的多语言语音识别工具包,专为中文场景深度优化,同时支持英文、日文等。它解决了从训练到部署的全链路问题,包括语音识别(ASR)、端点检测(★ 20,549
leonLeon 是开源的 AI 个人助理,可部署在你自己的设备上,数据完全自主可控,支持语音交互与技能扩展,帮你处理日常任务,打造真正属于你的私人智能助手。★ 17,549
vosk-apivosk-api 是一个离线语音识别 API,支持 Android、iOS、Raspberry Pi 和服务器端,提供 Python、Java、C# 和 Nod★ 15,157
voice-provoice-pro 是一个面向创作者和开发者的 Gradio WebUI 工具,集成了多种前沿的语音技术。它解决了音频内容生产中语音合成、克隆、分离和翻译的碎片★ 12,962
deep-learning-drizzle这是一个深度学习相关学习资源的精选合集,汇集了全球顶尖大学和机构的免费视频讲座,覆盖深度学习、强化学习、机器学习、计算机视觉和自然语言处理等核心领域。项目以分类★ 12,956
PaddleSpeechPaddleSpeech 是百度开源的端到端语音工具包,基于飞桨深度学习框架,提供从语音识别、语音合成到说话人验证、语音翻译、关键词唤醒等全链路能力。它解决了语★ 12,689
speechbrainSpeechBrain 是一个基于 PyTorch 的开源语音工具包,旨在为语音识别、说话人识别、语音增强、语音分离、情感识别等多种语音任务提供统一、灵活且易用★ 11,848
WhisperLiveKitWhisperLiveKit 是一个实时、本地的语音转文字工具包,基于 OpenAI Whisper 模型,提供流式语音识别(ASR)、说话人分离(speake★ 11,103
openvinoOpenVINO 是英特尔开源的 AI 推理优化与部署工具包,旨在帮助开发者将训练好的深度学习模型(如 PyTorch、TensorFlow、ONNX 等格式)★ 10,935
espnet端到端语音处理工具包,覆盖语音识别、语音合成、语音翻译、说话人识别等多项任务。提供统一训练框架、丰富预训练模型与评测流程,是学术界与工业界语音技术研究的常用基础★ 9,974
SenseVoiceSenseVoice 是阿里开源的语音基础模型,主打多语言语音识别(ASR),支持中文、粤语、英文、日语和韩语。它不仅能转写文字,还集成了语种识别、情感识别和音★ 9,408
speech_recognition这是一个Python语音识别模块,支持多种引擎和API,涵盖在线和离线场景。它解决了开发者需要统一接口调用不同语音识别服务的问题,通过简单的API即可实现从麦克★ 8,993
mlx-audio基于 Apple MLX 框架构建的语音库,集文本转语音、语音转文本与语音转语音于一体,可在 Apple Silicon 设备上高效运行。充分利用苹果芯片算力,★ 7,962
annyangannyang 是一个轻量级的 JavaScript 语音识别库,通过 Web Speech API 为网站添加语音控制能力。它解决了网页端语音交互门槛高、实现★ 6,818
wav2letterwav2letter 是 Facebook AI Research 开源的端到端自动语音识别工具包,基于 C++ 实现,专注于高效、高性能的 ASR 研究与应用★ 6,437
argmax-oss-swift专为 Apple Silicon 打造的端侧语音 AI 框架,支持在设备本地运行语音识别与合成等模型,无需联网与云端依赖。基于 Swift 开发,性能高效、隐私★ 6,385
FunClipFunClip 是一个基于阿里达摩院 FunASR 语音识别模型的开源视频剪辑工具,主要解决视频中语音内容的快速定位与剪辑问题。它提供本地 Gradio 网页界★ 6,354
whisper-diarization这是一个基于OpenAI Whisper的自动语音识别与说话人分离工具,解决的是多说话人场景下语音转写时无法区分谁在说话的问题。它结合Whisper的强大多语种★ 5,659
wenetWeNet 是一个面向生产环境的端到端语音识别工具包,旨在解决学术模型与工业部署之间的鸿沟。它基于 PyTorch 构建,支持 Conformer、Transf★ 5,243
porcupinePorcupine 是一个基于深度学习的端侧唤醒词检测引擎,由 Picovoice 开发。它解决的是在设备本地实时识别特定唤醒词(如“Hey Porcupine★ 4,944
ml-roadml-road 是一个面向机器学习和智能体 AI 的学习资源与实践项目,旨在为开发者提供从基础到前沿的系统化学习路径。项目整合了深度学习、计算机视觉、自然语言处★ 4,942
pocketsphinxPocketSphinx 是一个轻量级的嵌入式语音识别库,基于 CMU Sphinx 项目发展而来,专为资源受限环境设计。它解决在移动设备、嵌入式系统或离线场景★ 4,345
whisper-asr-webservice这是一个基于OpenAI Whisper的语音识别Web服务,将Whisper模型封装成易于调用的API接口。它解决了开发者需要快速集成语音转文字功能但不想深入★ 3,347
awesome-speech-recognition-speech-synthesis-papers这是一个收录语音识别与语音合成领域经典论文的精选列表,涵盖自动语音识别(ASR)、说话人验证、语音合成、文本转语音(TTS)、语言建模、歌声合成(SVS)和声音★ 3,132
willowwillow 是一个开源的、本地化的、自托管的语音助手,旨在成为 Amazon Echo 和 Google Home 的替代品。它基于 ESP32 硬件和 ES★ 3,116
whishperwhishper 是一个基于 Whisper 模型的本地语音转文字工具,提供网页界面,让用户无需上传数据即可完成音频转录、翻译和字幕编辑。它解决了云端语音服务带★ 3,077
lingvoLingvo 是 Google 开源的深度学习框架,专注于序列建模任务,尤其擅长语音识别、机器翻译和语言模型。它基于 TensorFlow 构建,提供了一套模块★ 2,864
whisper-timestampedwhisper-timestamped 是一个基于 OpenAI Whisper 的语音识别增强工具,专门为多语言自动语音识别提供词级时间戳和置信度。它解决了标★ 2,850
qwen-audio-agentqwen-audio-agent 是一个面向 AI Agent 的实时语音运行时,基于 JavaScript 构建,旨在让智能体不仅会对话,还能在对话过程中持续★ 2,830
MOSS-Transcribe-DiarizeMOSS-Transcribe-Diarize 是一个轻量级(0.9B 参数)的多语言长语音转写与说话人分离模型,支持 50 多种语言,并集成时间戳和声学事件识★ 2,096
parlorparlor 是一个运行在 Apple 芯片设备上的实时多模态 AI 助手,功能类似 GPT-Live,但完全本地化。它解决了云端 AI 助手延迟高、隐私泄露和★ 2,069
FireRedASRFireRedASR 是一个开源的工业级自动语音识别(ASR)模型,主要面向中文普通话、中文方言和英语的语音转文字场景。它解决了传统ASR模型在中文方言和复杂音★ 1,996
awesome-diarization这是一个精选的说话人日志(Speaker Diarization)资源列表,汇集了相关的论文、库、数据集和其他资源。它解决的是说话人日志领域信息分散、入门门槛高★ 1,905
alan-sdk-iosAlan AI iOS SDK 是一个将语音对话能力嵌入 iOS 应用的开发工具包,旨在让开发者无需从零构建语音识别、自然语言处理和对话管理,即可快速为 App★ 1,878
alan-sdk-androidAlan AI 是一个面向 Android 应用的对话式 AI 平台,提供完整的语音助手解决方案。开发者通过 Alan Studio 可视化界面设计对话流程,无★ 1,806
alan-sdk-flutterAlan AI 是一个面向 Flutter 应用的对话式 AI 平台 SDK,旨在让开发者通过几行代码为应用集成语音助手和聊天机器人。它解决了应用内自然语言交互★ 1,756
dsnotedsnote 是一款面向 Linux 桌面(也支持 Sailfish OS)的离线语音笔记应用,主打在无网络环境下完成语音转文字、文字转语音和机器翻译。它解决的★ 1,675
alan-sdk-ionicAlan AI SDK for Ionic 是一个让 Ionic 应用快速获得对话式 AI 能力的官方 SDK。它解决了移动应用内构建复杂语音交互的难题,开发者★ 1,648
obs-localvocalobs-localvocal 是一个专为 OBS Studio 设计的本地语音识别与字幕插件,利用 OpenAI Whisper 等 AI 模型在本地实时将音频★ 1,619
amicaAmica 是一个开源的 3D 角色交互界面,旨在让用户通过语音与虚拟角色进行自然对话。它解决了传统聊天机器人缺乏沉浸感和多模态交互的问题,将语音识别、语音合成★ 1,602
voxtypevoxtype 是一款面向 Linux Wayland 桌面的离线语音转文字工具,用 Rust 编写。它解决的核心问题是:在 Wayland 合成器(如 Hyp★ 1,575
OpenSeq2SeqOpenSeq2Seq 是 NVIDIA 开源的序列到序列学习工具包,专注于语音识别、文本转语音和自然语言处理任务。它解决了研究人员在搭建和实验 seq2seq★ 1,559
Fun-ASRFun-ASR 是一个基于大语言模型的开源语音识别(ASR)模型家族,专注于中文、方言、口音及多语言场景。它提供多种运行时支持,包括 FunASR、vLLM、流★ 1,555
SALMONNSALMONN 是一个先进的多模态大语言模型(LLM)家族,由清华团队开发,旨在让机器能够同时理解和处理语音、音频、音乐、视频等多种模态信息。它解决了传统模型只★ 1,538
ComfyUI_Custom_Nodes_AlekPetComfyUI_Custom_Nodes_AlekPet 是一套为 ComfyUI 设计的自定义节点扩展包,旨在丰富 ComfyUI 的功能边界。它主要解决 C★ 1,531
CrisperWhisperCrisperWhisper 是一个基于 OpenAI Whisper 的语音识别增强工具,专注于解决标准 Whisper 输出中时间戳不精确和缺少语气词(如“★ 1,432
mlx-tunemlx-tune 是一个专为 Apple Silicon Mac 设计的 LLM 微调工具,基于 MLX 框架原生运行,让开发者无需云端 GPU 即可在本地完成★ 1,414