transcribe-anything
开源
一条命令把本地或在线音视频转成文字和字幕
transcribe-anything 是一个基于 Whisper 的多后端语音转文字工具,目标是让本地音视频转写变得又快···
汇聚全球AI语音识别与语音转文字项目,Whisper、ASR、实时字幕、会议转写工具一网打尽。
共收录 214 个开源项目
transcribe-anything
开源
一条命令把本地或在线音视频转成文字和字幕
transcribe-anything 是一个基于 Whisper 的多后端语音转文字工具,目标是让本地音视频转写变得又快···
deepgram-js-sdk
开源
几行代码接入 Deepgram 语音识别与合成,实时语音应用快速落地。
Deepgram 官方 JavaScript SDK,用于在浏览器和 Node.js 环境中集成 Deepgram 的语音 AI 服务。它解···
simple-obs-stt
开源
直播时自动生成实时字幕,直接叠加到 OBS 画面
simple-obs-stt 是一个为 OBS 直播和录播场景设计的实时字幕工具,它通过语音识别(STT)将麦克风或···
klaam
开源
一站式搞定阿拉伯语语音识别、分类与合成
klaam 是一个专注于阿拉伯语语音处理的开源工具包,集语音识别、语音分类和文本转语音于一体。它解···
wenet
开源
开箱即用的生产级语音识别,从训练到部署一步到位
WeNet 是一个面向生产环境的端到端语音识别工具包,旨在解决学术模型与工业部署之间的鸿沟。它基于···
MASR
开源
一个框架搞定流式+非流式语音识别,训练部署都省心
MASR是一个基于Pytorch的自动语音识别(ASR)框架,专注于流式与非流式识别,兼顾在线和离线场景。···
FastSpeech2
开源
用 PyTorch 快速上手并行语音合成,告别慢速自回归
FastSpeech2 是一个基于 PyTorch 实现的端到端文本转语音(TTS)模型,源自微软提出的非自回归语音···
spokestack-python
开源
在嵌入式设备上快速集成离线语音交互,无需云端依赖。
Spokestack-python 是一个为 Python 应用提供语音界面能力的开源库,尤其专注于嵌入式系统。它解决···
speech-recognition-uk
开源
让乌克兰语应用轻松拥有语音识别和合成能力
这是一个面向乌克兰语的开源语音识别与合成工具包,旨在解决乌克兰语在主流语音技术中支持不足的问···
jetson-voice
开源
在Jetson上快速实现语音识别与合成,边缘AI语音落地利器
jetson-voice 是一个专为 NVIDIA Jetson 平台设计的深度学习推理库,专注于语音相关任务,涵盖自动···
speechbrain
开源
一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务
SpeechBrain 是一个基于 PyTorch 的开源语音工具包,旨在为语音识别、说话人识别、语音增强、语音分···
leopard
开源
本地离线把语音转成文字,不联网也能用
Leopard 是 Picovoice 推出的端侧语音转文字引擎,基于深度学习实现完全离线的自动语音识别。它解决···
athena
开源
用 C++ 打造端到端语音识别与合成引擎
Athena 是一个基于序列到序列(seq2seq)架构的开源语音处理引擎,专注于语音识别(ASR)和语音合成···
botium-speech-processing
开源
让语音应用自动化测试像聊天测试一样简单,打通STT/TTS全链路
Botium Speech Processing 是一个用于语音处理测试的开源工具集,隶属于 Botium 测试框架生态。它主···
yandex-speechkit-lib-python
开源
几行代码接入 Yandex 语音识别与合成,快速构建语音应用
这是一个用于调用 Yandex Speechkit API 的 Python SDK,帮助开发者快速集成 Yandex 云平台的语音识···
vosk-api
开源
离线语音识别,不用联网,隐私安全,本地秒转文字
vosk-api 是一个离线语音识别 API,支持 Android、iOS、Raspberry Pi 和服务器端,提供 Python、Ja···
web-voice-processor
开源
浏览器麦克风音频一键转 16kHz PCM,直喂语音识别
web-voice-processor 是一个面向浏览器端的实时语音处理库,用 TypeScript 编写。它解决的核心问题···
OSSSpeechKit
开源
几行 Swift 代码,让 iOS 应用轻松拥有语音识别与合成能力。
OSSSpeechKit 是一个面向 iOS 开发者的原生语音工具包,基于 AVFoundation 和 Apple 的 Speech 框架···
Speech-and-Text
开源
一键集成多引擎,轻松实现语音转文字与文字转语音
这是一个用Python实现的语音与文本双向转换工具集,集成了多种主流语音识别引擎(PocketSphinx离线···
kaldi-active-grammar
开源
解码中随时切换语法,让语音命令和听写自由混用
kaldi-active-grammar 是一个基于 Kaldi 的 Python 语音识别封装,核心创新在于支持在解码过程中动···
TranscriberBot
开源
把 Telegram 语音秒变文字,会议记录不用愁
TranscriberBot 是一个基于 Python 的 Telegram 对话助手,专门用于将语音消息转录为文本。它解决了···
awesome-diarization
开源
一站式找全说话人日志论文、代码和数据集,快速上手
这是一个精选的说话人日志(Speaker Diarization)资源列表,汇集了相关的论文、库、数据集和其他资···
cheetah
开源
在设备上实时把语音转文字,离线低延迟还保护隐私
Cheetah是一个基于深度学习的端侧流式语音转文本引擎,专注于在设备本地实时处理语音识别任务。它解···
mrcp-plugin-with-freeswitch
开源
用手机打电话,AI自动听懂并回复,快速搭建语音呼叫中心。
这是一个将FreeSWITCH与UniMRCP Server集成,并接入讯飞开放平台(xfyun)插件的开源项目。它解决了···