语音识别

汇聚全球AI语音识别与语音转文字项目,Whisper、ASR、实时字幕、会议转写工具一网打尽。

共收录 214 个开源项目

curses 开源

把语音和键盘输入实时变成字幕,推送到 OBS、VRChat 等平台。

curses 是一个基于 Tauri 和 TypeScript 构建的桌面应用,专注于为 OBS、VRChat、Twitch 聊天和 Di···

★ 727 评分 2022-11-16
whispering 开源

说话即出字幕,VRChat 和直播叠加一键同步

Whispering(又名 Whispering Tiger)是一个基于 Python 的实时语音转写与翻译工具,核心使用 Open···

★ 548 评分 2022-10-14
WAAS 开源

上传音视频,排队自动转文字,还能调 API

WAAS(Whisper as a Service)把 OpenAI Whisper 语音识别模型封装成带队列的后端服务,同时提供 W···

★ 2075 评分 2022-10-13
LiveWhisper 开源

让 Whisper 实时出字,终端语音输入即说即显

LiveWhisper 是一个基于 OpenAI Whisper 的近乎实时语音转文字工具,通过 sounddevice 捕获麦克风音···

★ 362 评分 2022-10-06
tg_bot_stt_tts 开源

让 Telegram 语音秒变文字,文字也能开口说话

这是一个基于 Python 的 Telegram 机器人,核心功能是语音消息的识别与生成,即语音转文字(STT)和···

★ 68 评分 2022-10-04
whisper-website 开源

上传音频,浏览器里直接出字幕文件

whisper-website 是一个可自托管的轻量 Web 应用,把 OpenAI 的 Whisper 语音识别模型封装成浏览器···

★ 325 评分 2022-09-26
whisper.cpp 开源

在 CPU 上极速运行 Whisper,离线语音转文字不求人

whisper.cpp 是 OpenAI 的 Whisper 语音识别模型的高性能 C/C++ 移植版。它解决了 Whisper 原始 Py···

★ 53941 评分 2022-09-25
whisper-auto-transcribe 开源

拖入音频,自动出文字,无需命令行

这是一个基于 OpenAI Whisper 的自动音频转写工具,旨在提供简单易用的语音转文本解决方案。它解决···

★ 229 评分 2022-09-24
buzz 开源

离线拖拽音频,秒变文字和字幕,隐私不泄露

Buzz 是一款运行在个人电脑上的离线语音识别与翻译工具,基于 OpenAI 的 Whisper 模型。它能够将音···

★ 21692 评分 2022-09-24
whisper-asr-webservice 开源

一行命令部署Whisper语音转文字API,快速集成到你的应用

这是一个基于OpenAI Whisper的语音识别Web服务,将Whisper模型封装成易于调用的API接口。它解决了开···

★ 3345 评分 2022-09-22
whisper 开源

音频丢进去,多语言文字直接出来

Whisper 是 OpenAI 开源的通用语音识别模型,基于大规模弱监督数据训练,主打多语言、抗噪、无需微···

★ 109589 评分 2022-09-16
sherpa-onnx 开源

离线搞定语音识别与合成,支持多端多语言

sherpa-onnx 是一个基于下一代 Kaldi 和 ONNX Runtime 的语音处理工具包,专注于离线场景下的语音识···

★ 14974 评分 2022-09-01
mimiuchi 开源

在 VR 里动嘴就能打字,语音秒变文字发给任意应用

mimiuchi 是一个免费、可定制、支持 OSC 的语音转文字界面,旨在将语音识别结果实时转发到不同类型···

★ 63 评分 2022-09-01
crx-live-translate 开源

给任意网页直播实时加双语字幕,免费看外语直播

crx-live-translate 是一款 Chrome/Edge 浏览器扩展,用于给任意网页中的直播音频或视频流实时生成···

★ 125 评分 2022-07-31
AuxiliaryASR 开源

给语音合成和转换提供精准的文本-音频对齐工具

AuxiliaryASR 是一个面向语音转换和语音合成场景的辅助语音识别工具,核心解决文本与语音帧的自动对···

★ 130 评分 2022-06-08
sherpa 开源

用下一代 Kaldi 快速搭建高性能语音转写服务

sherpa 是一个基于下一代 Kaldi 的语音识别服务端框架,用 C++ 实现,提供端到端的语音转文字能力。···

★ 997 评分 2022-05-20
timething 开源

让文本转录自动匹配音频时间轴,精准定位每一句话。

Timething 是一个用于将文本转录与音频录音进行对齐的开源库。它解决的核心问题是,在语音识别或音···

★ 133 评分 2022-05-09
deepgram-go-sdk 开源

Go 语言接入 Deepgram,快速实现语音转写与合成

deepgram-go-sdk 是 Deepgram 语音 AI 平台的官方 Go 语言开发工具包,用于将语音识别(ASR)、语音···

★ 90 评分 2022-05-05
efficientspeech 开源

让语音合成在CPU上也能实时跑起来

EfficientSpeech 是一个基于 PyTorch 的轻量级语音合成(TTS)模型实现,相关论文发表于 ICASSP 20···

★ 183 评分 2022-04-19
SpeechPrompt 开源

用提示学习统一搞定多种语音任务,无需重训模型

SpeechPrompt 是 Interspeech 2022 论文的官方实现,探索将提示学习(Prompt Tuning)应用于生成式···

★ 102 评分 2022-04-01
deepgram-dotnet-sdk 开源

在 .NET 项目中快速接入 Deepgram 语音识别与合成,实现语音交互。

deepgram-dotnet-sdk 是 Deepgram 官方推出的 .NET 客户端库,用于在 C# 应用中集成 Deepgram 的语···

★ 55 评分 2021-11-20
Maix-Speech 开源

在嵌入式设备上快速跑起语音识别和合成

Maix-Speech 是一个专为嵌入式设备设计的轻量级语音 AI 库,旨在解决资源受限设备上运行语音识别(···

★ 364 评分 2021-10-15
cobra 开源

本地实时判断有没有人说话,省算力又护隐私

Cobra 是一个基于深度学习的设备端语音活动检测(VAD)工具,由 Picovoice 开源。它解决的核心问题···

★ 270 评分 2021-09-14
deepgram-python-sdk 开源

Python 接入 Deepgram 语音 AI,几行代码实现语音转文字/文字转语音

Deepgram 的官方 Python SDK,用于快速集成 Deepgram 的语音 AI 服务。它解决了开发者在 Python 应···

★ 463 评分 2021-05-12