curses
开源
把语音和键盘输入实时变成字幕,推送到 OBS、VRChat 等平台。
curses 是一个基于 Tauri 和 TypeScript 构建的桌面应用,专注于为 OBS、VRChat、Twitch 聊天和 Di···
汇聚全球AI语音识别与语音转文字项目,Whisper、ASR、实时字幕、会议转写工具一网打尽。
共收录 214 个开源项目
curses
开源
把语音和键盘输入实时变成字幕,推送到 OBS、VRChat 等平台。
curses 是一个基于 Tauri 和 TypeScript 构建的桌面应用,专注于为 OBS、VRChat、Twitch 聊天和 Di···
whispering
开源
说话即出字幕,VRChat 和直播叠加一键同步
Whispering(又名 Whispering Tiger)是一个基于 Python 的实时语音转写与翻译工具,核心使用 Open···
WAAS
开源
上传音视频,排队自动转文字,还能调 API
WAAS(Whisper as a Service)把 OpenAI Whisper 语音识别模型封装成带队列的后端服务,同时提供 W···
LiveWhisper
开源
让 Whisper 实时出字,终端语音输入即说即显
LiveWhisper 是一个基于 OpenAI Whisper 的近乎实时语音转文字工具,通过 sounddevice 捕获麦克风音···
tg_bot_stt_tts
开源
让 Telegram 语音秒变文字,文字也能开口说话
这是一个基于 Python 的 Telegram 机器人,核心功能是语音消息的识别与生成,即语音转文字(STT)和···
whisper-website
开源
上传音频,浏览器里直接出字幕文件
whisper-website 是一个可自托管的轻量 Web 应用,把 OpenAI 的 Whisper 语音识别模型封装成浏览器···
whisper.cpp
开源
在 CPU 上极速运行 Whisper,离线语音转文字不求人
whisper.cpp 是 OpenAI 的 Whisper 语音识别模型的高性能 C/C++ 移植版。它解决了 Whisper 原始 Py···
whisper-auto-transcribe
开源
拖入音频,自动出文字,无需命令行
这是一个基于 OpenAI Whisper 的自动音频转写工具,旨在提供简单易用的语音转文本解决方案。它解决···
buzz
开源
离线拖拽音频,秒变文字和字幕,隐私不泄露
Buzz 是一款运行在个人电脑上的离线语音识别与翻译工具,基于 OpenAI 的 Whisper 模型。它能够将音···
whisper-asr-webservice
开源
一行命令部署Whisper语音转文字API,快速集成到你的应用
这是一个基于OpenAI Whisper的语音识别Web服务,将Whisper模型封装成易于调用的API接口。它解决了开···
whisper
开源
音频丢进去,多语言文字直接出来
Whisper 是 OpenAI 开源的通用语音识别模型,基于大规模弱监督数据训练,主打多语言、抗噪、无需微···
sherpa-onnx
开源
离线搞定语音识别与合成,支持多端多语言
sherpa-onnx 是一个基于下一代 Kaldi 和 ONNX Runtime 的语音处理工具包,专注于离线场景下的语音识···
mimiuchi
开源
在 VR 里动嘴就能打字,语音秒变文字发给任意应用
mimiuchi 是一个免费、可定制、支持 OSC 的语音转文字界面,旨在将语音识别结果实时转发到不同类型···
crx-live-translate
开源
给任意网页直播实时加双语字幕,免费看外语直播
crx-live-translate 是一款 Chrome/Edge 浏览器扩展,用于给任意网页中的直播音频或视频流实时生成···
AuxiliaryASR
开源
给语音合成和转换提供精准的文本-音频对齐工具
AuxiliaryASR 是一个面向语音转换和语音合成场景的辅助语音识别工具,核心解决文本与语音帧的自动对···
sherpa
开源
用下一代 Kaldi 快速搭建高性能语音转写服务
sherpa 是一个基于下一代 Kaldi 的语音识别服务端框架,用 C++ 实现,提供端到端的语音转文字能力。···
timething
开源
让文本转录自动匹配音频时间轴,精准定位每一句话。
Timething 是一个用于将文本转录与音频录音进行对齐的开源库。它解决的核心问题是,在语音识别或音···
deepgram-go-sdk
开源
Go 语言接入 Deepgram,快速实现语音转写与合成
deepgram-go-sdk 是 Deepgram 语音 AI 平台的官方 Go 语言开发工具包,用于将语音识别(ASR)、语音···
efficientspeech
开源
让语音合成在CPU上也能实时跑起来
EfficientSpeech 是一个基于 PyTorch 的轻量级语音合成(TTS)模型实现,相关论文发表于 ICASSP 20···
SpeechPrompt
开源
用提示学习统一搞定多种语音任务,无需重训模型
SpeechPrompt 是 Interspeech 2022 论文的官方实现,探索将提示学习(Prompt Tuning)应用于生成式···
deepgram-dotnet-sdk
开源
在 .NET 项目中快速接入 Deepgram 语音识别与合成,实现语音交互。
deepgram-dotnet-sdk 是 Deepgram 官方推出的 .NET 客户端库,用于在 C# 应用中集成 Deepgram 的语···
Maix-Speech
开源
在嵌入式设备上快速跑起语音识别和合成
Maix-Speech 是一个专为嵌入式设备设计的轻量级语音 AI 库,旨在解决资源受限设备上运行语音识别(···
cobra
开源
本地实时判断有没有人说话,省算力又护隐私
Cobra 是一个基于深度学习的设备端语音活动检测(VAD)工具,由 Picovoice 开源。它解决的核心问题···
deepgram-python-sdk
开源
Python 接入 Deepgram 语音 AI,几行代码实现语音转文字/文字转语音
Deepgram 的官方 Python SDK,用于快速集成 Deepgram 的语音 AI 服务。它解决了开发者在 Python 应···