speech-to-text
本站收录 259 个带「speech-to-text」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
whisper.cppwhisper.cpp 是 OpenAI 的 Whisper 语音识别模型的高性能 C/C++ 移植版。它解决了 Whisper 原始 Python 实现依赖 ★ 54,014
VoiceStudioVoiceStudio 是一个开源的 AI 语音工作站,旨在成为 ElevenLabs 的替代方案。它集成了语音克隆、配音、听写、转录、有声书创作和语音工作流编★ 47,464
HandyHandy 是一款免费、开源、可扩展的离线语音转文字应用,基于 Rust 和 Tauri v2 构建,支持跨平台运行。它利用操作系统自带的语音识别引擎(如 Wi★ 32,424
meetilyMeetily 是一款基于 Rust 构建的隐私优先 AI 会议助手,专为 macOS 和 Windows 设计。它解决的核心问题是会议记录的低效与隐私泄露风险★ 31,241
llamafilellamafile 是一个将大语言模型(LLM)及其运行环境打包成单个可执行文件的开源工具,旨在解决 AI 模型分发和部署的复杂性问题。它基于 llama.cp★ 26,089
whisperXWhisperX 是一个基于 OpenAI Whisper 的自动语音识别(ASR)工具,核心解决 Whisper 原始输出时间戳不精确、无法对齐到单词级别的问★ 24,303
screenpipescreenpipe 是一个本地优先的屏幕录制与 AI 代理连接工具,由 YC 孵化的开源项目。它持续记录屏幕内容(24/7),并通过本地、私密、安全的方式将录★ 21,777
FunASRFunASR 是阿里开源的多语言语音识别工具包,专为中文场景深度优化,同时支持英文、日文等。它解决了从训练到部署的全链路问题,包括语音识别(ASR)、端点检测(★ 20,549
pyvideotranspyvideotrans 是一个开源的视频翻译与配音工具,能够将视频中的语音识别为文字,翻译成目标语言,并自动生成配音和字幕,最终嵌入视频中。它解决了视频内容跨★ 19,179
leonLeon 是开源的 AI 个人助理,可部署在你自己的设备上,数据完全自主可控,支持语音交互与技能扩展,帮你处理日常任务,打造真正属于你的私人智能助手。★ 17,549
vosk-apivosk-api 是一个离线语音识别 API,支持 Android、iOS、Raspberry Pi 和服务器端,提供 Python、Java、C# 和 Nod★ 15,157
sherpa-onnxsherpa-onnx 是一个基于下一代 Kaldi 和 ONNX Runtime 的语音处理工具包,专注于离线场景下的语音识别(ASR)、文本转语音(TTS)★ 15,039
speech-to-speechspeech-to-speech 是一个构建本地语音代理的开源项目,旨在利用开源模型实现端到端的语音交互。它解决了传统语音助手依赖云端服务、延迟高、隐私风险大等★ 13,350
voice-provoice-pro 是一个面向创作者和开发者的 Gradio WebUI 工具,集成了多种前沿的语音技术。它解决了音频内容生产中语音合成、克隆、分离和翻译的碎片★ 12,962
speechbrainSpeechBrain 是一个基于 PyTorch 的开源语音工具包,旨在为语音识别、说话人识别、语音增强、语音分离、情感识别等多种语音任务提供统一、灵活且易用★ 11,848
WhisperLiveKitWhisperLiveKit 是一个实时、本地的语音转文字工具包,基于 OpenAI Whisper 模型,提供流式语音识别(ASR)、说话人分离(speake★ 11,103
RealtimeSTTRealtimeSTT 是一个基于 Python 的实时语音转文字库,专注于低延迟和高效能。它解决了语音交互场景中常见的痛点:传统 STT 需要手动控制录音起止★ 10,158
SenseVoiceSenseVoice 是阿里开源的语音基础模型,主打多语言语音识别(ASR),支持中文、粤语、英文、日语和韩语。它不仅能转写文字,还集成了语种识别、情感识别和音★ 9,408
speech_recognition这是一个Python语音识别模块,支持多种引擎和API,涵盖在线和离线场景。它解决了开发者需要统一接口调用不同语音识别服务的问题,通过简单的API即可实现从麦克★ 8,993
openwhispropenwhispr 是一款开源的语音转文字听写应用,主打隐私优先和跨平台支持。它解决了用户在使用语音输入时对云端数据隐私的担忧,允许用户通过自带密钥(BYOK★ 8,837
mlx-audio基于 Apple MLX 框架构建的语音库,集文本转语音、语音转文本与语音转语音于一体,可在 Apple Silicon 设备上高效运行。充分利用苹果芯片算力,★ 7,962
ODSODS 是一个开源的本地 AI 服务器解决方案,旨在将个人电脑(PC、Mac 或 Linux)转变为功能全面的 AI 中心。它解决了用户对数据隐私、离线可用性和★ 6,900
annyangannyang 是一个轻量级的 JavaScript 语音识别库,通过 Web Speech API 为网站添加语音控制能力。它解决了网页端语音交互门槛高、实现★ 6,818
argmax-oss-swift专为 Apple Silicon 打造的端侧语音 AI 框架,支持在设备本地运行语音识别与合成等模型,无需联网与云端依赖。基于 Swift 开发,性能高效、隐私★ 6,385
FunClipFunClip 是一个基于阿里达摩院 FunASR 语音识别模型的开源视频剪辑工具,主要解决视频中语音内容的快速定位与剪辑问题。它提供本地 Gradio 网页界★ 6,354
silero-modelsSilero Models 是一个提供预训练语音模型的集合,专注于让文本转语音(TTS)和语音识别(STT)变得极其简单。它解决了开发者在使用语音技术时面临的模★ 6,123
dograhdograh 是一个开源的语音 AI 平台,旨在作为 Vapi 和 Retell 的自托管替代方案。它解决了企业在部署语音代理时对数据隐私和成本控制的担忧,支持★ 5,774
whisper-diarization这是一个基于OpenAI Whisper的自动语音识别与说话人分离工具,解决的是多说话人场景下语音转写时无法区分谁在说话的问题。它结合Whisper的强大多语种★ 5,659
YouDub-webuiYouDub-webui 是一个开源的 AI 视频本地化工具,旨在将 YouTube 或 Bilibili 视频自动翻译并配音成中文。它解决了视频内容跨语言传播★ 5,553
fastrtcfastrtc 是一个专注于实时通信的 Python 库,旨在简化 WebRTC 音频/视频流的接入,让开发者能快速构建支持语音对话、实时转录和文本转语音的 A★ 4,629
auto-subsauto-subs 是一个本地优先的自动字幕生成工具,专为视频剪辑师设计。它直接集成到 DaVinci Resolve、Premiere 和 After Eff★ 4,293
LiveCaptions-TranslatorLiveCaptions-Translator 是一款基于 Windows LiveCaptions 的轻量级实时音频/语音翻译工具。它利用 Windows 1★ 3,786
openlessopenless 是一款开源的跨平台语音输入工具,支持 macOS 和 Windows。它解决了在任意应用中快速、高质量地进行语音转文字并自动润色的需求。用户只★ 3,670
openscreenOpenScreen 是一款免费开源的屏幕录制与演示视频制作工具,旨在替代付费的 Screen Studio。它基于 Electron 和 Rust 构建,利用★ 3,358
whisper-asr-webservice这是一个基于OpenAI Whisper的语音识别Web服务,将Whisper模型封装成易于调用的API接口。它解决了开发者需要快速集成语音转文字功能但不想深入★ 3,347
audio.cppaudio.cpp 是一个基于 ggml 的纯 C++ 音频模型推理引擎,旨在为音频 AI 应用提供一体化、高性能的本地推理解决方案。它解决了传统音频 AI 工★ 3,180
BayLing-SpeechBayLing-Speech(即LLaMA-Omni)是一个基于Llama-3.1-8B-Instruct构建的端到端语音交互模型,旨在实现GPT-4o级别的语★ 3,146
willowwillow 是一个开源的、本地化的、自托管的语音助手,旨在成为 Amazon Echo 和 Google Home 的替代品。它基于 ESP32 硬件和 ES★ 3,116
whishperwhishper 是一个基于 Whisper 模型的本地语音转文字工具,提供网页界面,让用户无需上传数据即可完成音频转录、翻译和字幕编辑。它解决了云端语音服务带★ 3,077
FluidAudioFluidAudio 是一个面向 iOS/macOS 开发者的 Swift 框架,旨在将前沿的 CoreML 音频模型无缝集成到原生应用中。它解决了开发者难以在★ 2,927
lingvoLingvo 是 Google 开源的深度学习框架,专注于序列建模任务,尤其擅长语音识别、机器翻译和语言模型。它基于 TensorFlow 构建,提供了一套模块★ 2,864
whisper-timestampedwhisper-timestamped 是一个基于 OpenAI Whisper 的语音识别增强工具,专门为多语言自动语音识别提供词级时间戳和置信度。它解决了标★ 2,850
vexavexa 是一个开源的会议转录 API,专为 Google Meet、Microsoft Teams 和 Zoom 设计。它通过自动加入会议的机器人,实时捕获音★ 2,841
pluelypluely 是一个开源的 AI 实时助手,定位为 Cluely 的替代品,专为会议、面试和日常对话场景设计。它通过 Tauri 框架构建,安装包仅 10MB,★ 2,698
foundry-localfoundry-local 是一个面向本地设备的高性能 AI 推理基础设施,基于 C++ 构建,核心目标是让大语言模型和语音识别模型在本地硬件上高效运行。它利用★ 2,572
awesome-whisperawesome-whisper 是一个围绕 OpenAI 开源语音识别模型 Whisper 的资源聚合清单,本身不是可运行代码,而是把散落在社区里的模型变体、微★ 2,397
WhisperJAVWhisperJAV 是一个面向日语成人视频(JAV)场景的自动语音识别(ASR)与字幕生成工具。它解决了通用语音识别模型在噪声环境、多人对话、特殊语气词等场景★ 2,287
transcribe.cpptranscribe.cpp 是一个基于 ggml 的语音识别推理库,支持 16 种以上主流 ASR 模型家族的本地部署。它解决了语音识别模型在不同硬件上高效运★ 1,971
typewhisper-mactypewhisper-mac 是一款专为 macOS 设计的本地语音转文字工具,基于 Apple Silicon 芯片和 WhisperKit 框架,实现完全★ 1,811
NLP-Models-TensorflowNLP-Models-Tensorflow 是一个汇集多种自然语言处理(NLP)模型实现的 TensorFlow 项目,主要面向 TensorFlow 1.13★ 1,779