asr

本站收录 145 个带「asr」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

whisperXWhisperX 是一个基于 OpenAI Whisper 的自动语音识别(ASR)工具,核心解决 Whisper 原始输出时间戳不精确、无法对齐到单词级别的问★ 24,303FunASRFunASR 是阿里开源的多语言语音识别工具包,专为中文场景深度优化,同时支持英文、日文等。它解决了从训练到部署的全链路问题,包括语音识别(ASR)、端点检测(★ 20,549SpeechSpeech 是一个面向研究人员和开发者的可扩展生成式 AI 框架,专注于大型语言模型、多模态和语音 AI(自动语音识别与文本转语音)。它提供统一的模块化架构,★ 18,524vosk-apivosk-api 是一个离线语音识别 API,支持 Android、iOS、Raspberry Pi 和服务器端,提供 Python、Java、C# 和 Nod★ 15,157sherpa-onnxsherpa-onnx 是一个基于下一代 Kaldi 和 ONNX Runtime 的语音处理工具包,专注于离线场景下的语音识别(ASR)、文本转语音(TTS)★ 15,039PaddleSpeechPaddleSpeech 是百度开源的端到端语音工具包,基于飞桨深度学习框架,提供从语音识别、语音合成到说话人验证、语音翻译、关键词唤醒等全链路能力。它解决了语★ 12,689speechbrainSpeechBrain 是一个基于 PyTorch 的开源语音工具包,旨在为语音识别、说话人识别、语音增强、语音分离、情感识别等多种语音任务提供统一、灵活且易用★ 11,848SenseVoiceSenseVoice 是阿里开源的语音基础模型,主打多语言语音识别(ASR),支持中文、粤语、英文、日语和韩语。它不仅能转写文字,还集成了语种识别、情感识别和音★ 9,408youtube-transcript-apiyoutube-transcript-api 是一个 Python 库,用于获取 YouTube 视频的字幕或转录文本。它解决了开发者需要视频文字内容但不想申请★ 8,399wukong-robotwukong-robot 是一个基于 Python 的中文语音对话机器人/智能音箱开源项目。它解决了从零搭建一个具备语音交互能力的智能音箱的复杂问题,提供了完整★ 7,128FunClipFunClip 是一个基于阿里达摩院 FunASR 语音识别模型的开源视频剪辑工具,主要解决视频中语音内容的快速定位与剪辑问题。它提供本地 Gradio 网页界★ 6,354whisper-diarization这是一个基于OpenAI Whisper的自动语音识别与说话人分离工具,解决的是多说话人场景下语音转写时无法区分谁在说话的问题。它结合Whisper的强大多语种★ 5,659RecorderRecorder 是一个基于 HTML5 的纯前端录音库,旨在解决浏览器和混合应用中录音格式不统一、兼容性差的问题。它支持 mp3、wav、ogg、webm、a★ 5,638wenetWeNet 是一个面向生产环境的端到端语音识别工具包,旨在解决学术模型与工业部署之间的鸿沟。它基于 PyTorch 构建,支持 Conformer、Transf★ 5,243LLPlayerLLPlayer 是一款专为语言学习设计的开源媒体播放器,基于 C# 开发。它解决了语言学习者在使用普通播放器时无法高效对照原文和译文、难以获取生词释义、以及缺★ 4,315Streamer-SalesStreamer-Sales 是一个开源的卖货主播大模型,旨在根据商品特点自动生成激发用户购买意愿的解说内容。它解决了电商直播中内容创作成本高、个性化不足的问题★ 3,777openlessopenless 是一款开源的跨平台语音输入工具,支持 macOS 和 Windows。它解决了在任意应用中快速、高质量地进行语音转文字并自动润色的需求。用户只★ 3,670whisper-asr-webservice这是一个基于OpenAI Whisper的语音识别Web服务,将Whisper模型封装成易于调用的API接口。它解决了开发者需要快速集成语音转文字功能但不想深入★ 3,347audio.cppaudio.cpp 是一个基于 ggml 的纯 C++ 音频模型推理引擎,旨在为音频 AI 应用提供一体化、高性能的本地推理解决方案。它解决了传统音频 AI 工★ 3,180GPAGPA(General Purpose Audio)是一个基于Transformer的通用音频模型,由AutoArk团队开发,旨在用单一小型模型同时实现自动语音★ 3,107faster-whisper-GUIfaster-whisper-GUI 是一个基于 PySide6 的桌面图形界面工具,旨在为 faster-whisper 语音识别模型提供易用的操作界面。它解★ 3,004FluidAudioFluidAudio 是一个面向 iOS/macOS 开发者的 Swift 框架,旨在将前沿的 CoreML 音频模型无缝集成到原生应用中。它解决了开发者难以在★ 2,927lingvoLingvo 是 Google 开源的深度学习框架,专注于序列建模任务,尤其擅长语音识别、机器翻译和语言模型。它基于 TensorFlow 构建,提供了一套模块★ 2,864whisper-timestampedwhisper-timestamped 是一个基于 OpenAI Whisper 的语音识别增强工具,专门为多语言自动语音识别提供词级时间戳和置信度。它解决了标★ 2,850AudioNotesAudioNotes 是一个基于 Python 的语音转文字笔记工具,旨在快速从音视频文件中提取内容并整理成结构化的 Markdown 笔记。它解决了手动听写和★ 2,521FireRedASRFireRedASR 是一个开源的工业级自动语音识别(ASR)模型,主要面向中文普通话、中文方言和英语的语音转文字场景。它解决了传统ASR模型在中文方言和复杂音★ 1,996transcribe.cpptranscribe.cpp 是一个基于 ggml 的语音识别推理库,支持 16 种以上主流 ASR 模型家族的本地部署。它解决了语音识别模型在不同硬件上高效运★ 1,971TuyaOpenTuyaOpen 是涂鸦智能推出的新一代 AI+IoT 开源框架,面向 T2/T3/T5AI 系列芯片及 ESP32 等主流硬件平台,旨在解决智能硬件快速接入 ★ 1,872bailing百聆是一个类似GPT-4o的语音对话机器人,通过ASR(语音识别)+LLM(大语言模型)+TTS(语音合成)技术栈实现,集成DeepSeek R1等优秀大模型,★ 1,774dsnotedsnote 是一款面向 Linux 桌面(也支持 Sailfish OS)的离线语音笔记应用,主打在无网络环境下完成语音转文字、文字转语音和机器翻译。它解决的★ 1,675Fun-ASRFun-ASR 是一个基于大语言模型的开源语音识别(ASR)模型家族,专注于中文、方言、口音及多语言场景。它提供多种运行时支持,包括 FunASR、vLLM、流★ 1,555amicalamical 是一款本地优先的开源 AI 听写应用,旨在让用户摆脱键盘,通过语音实现 3 倍速的文字输入。它基于 Electron 和 Next.js 构建,支★ 1,540CrisperWhisperCrisperWhisper 是一个基于 OpenAI Whisper 的语音识别增强工具,专注于解决标准 Whisper 输出中时间戳不精确和缺少语气词(如“★ 1,432Speech-AI-ForgeSpeech-AI-Forge 是一个围绕 TTS(文本转语音)生成模型构建的开源项目,提供 API 服务器和基于 Gradio 的 WebUI。它整合了多种主★ 1,420SoniTranslateSoniTranslate 是一个开源的视频同步翻译与配音工具,专注于将视频中的语音自动翻译成其他语言,并生成与画面同步的配音。它解决了视频内容跨语言传播时人工★ 1,416voicemodevoicemode 是一个让开发者通过自然语音与 Claude Code 进行对话的开源工具。它解决了在编码过程中频繁切换键盘输入与思考的问题,允许开发者直接说★ 1,385VideoChatVideoChat 是一个基于 Python 的实时交互数字人开源项目,旨在解决传统数字人开发门槛高、交互延迟大的问题。它允许用户自定义数字人的形象和音色,并支★ 1,313sglang-omniSGLang-Omni 是一个基于 SGLang 的高性能多模态推理服务框架,专注于语音相关模型(TTS、ASR)及全模态(omni)模型的部署。它解决了传统语★ 1,302StreamSpeechStreamSpeech 是一个“一体化”的无缝语音模型,同时支持离线与同声传译场景下的语音识别(ASR)、语音翻译和语音合成。它解决了传统级联系统延迟高、错误★ 1,294jonexjonex 是一个面向 AI 应用的全栈知识引擎,核心定位是“多模态解析 + 本体驱动的知识组织”。它能把视频、音频、图片、文档等非结构化数据,通过内置的 AS★ 1,228speech-swiftspeech-swift 是一个专为 Apple Silicon 设备打造的 AI 语音工具包,基于 MLX 和 CoreML 框架,提供端侧语音识别(ASR)★ 1,203Mega-ASRMega-ASR 是一个面向真实世界场景的语音识别基础模型,旨在解决传统 ASR 在复杂声学环境下性能骤降的问题。它通过构建 7 种原子声学条件(如噪声、混响、★ 1,144murmuremurmure 是一个完全本地化、注重隐私的跨平台语音转文字工具,并集成 LLM 后处理能力。它解决的是语音数据上传云端带来的隐私泄露风险,以及通用语音识别结果★ 1,080violinviolin 是一个开源的视频翻译技能(Video Translation Skill),主要面向视频内容的跨语言本地化场景。它解决的问题是:传统视频翻译需要人★ 1,073sherpasherpa 是一个基于下一代 Kaldi 的语音识别服务端框架,用 C++ 实现,提供端到端的语音转文字能力。它解决了传统语音识别系统部署复杂、实时性差的问题★ 997athenaAthena 是一个基于序列到序列(seq2seq)架构的开源语音处理引擎,专注于语音识别(ASR)和语音合成(TTS)两大核心任务。它采用 C++ 实现,提供★ 967vocotype-cliVocoType 是一款本地端侧运行的隐私安全语音输入工具,通过全局快捷键即可将语音实时转成文字并自动输入到当前应用,无需手动复制粘贴。它基于 FunASR 等★ 948SmartJavaAISmartJavaAI 是一个基于 Java 的免费离线 AI 算法工具箱,旨在为 Java 开发者提供开箱即用的 AI 能力,解决 Java 生态中缺乏易用 ★ 919Easy-Voice-ToolkitEasy-Voice-Toolkit 是一个面向普通用户的 Python 语音工具箱,集成了语音识别(ASR)、语音转写、语音转换、语音去噪和说话人验证(VPR★ 873voxtvoxt 是一个面向 Mac 的本地优先语音输入工具,通过按住说话(hold-to-talk)的方式,将语音实时转换为文本,并自动进行清理、改写、翻译,还能根据★ 852