orukeet
开源
冻结 Gabor 核做多语言语音转文字,本地 GGUF 推理
orukeet 是一个多语言自动语音识别(ASR)开源项目,核心创新在于用「拟合后冻结的 Gabor 卷积核」···
汇聚全球AI语音识别与语音转文字项目,Whisper、ASR、实时字幕、会议转写工具一网打尽。
共收录 214 个开源项目
orukeet
开源
冻结 Gabor 核做多语言语音转文字,本地 GGUF 推理
orukeet 是一个多语言自动语音识别(ASR)开源项目,核心创新在于用「拟合后冻结的 Gabor 卷积核」···
hayamimi
开源
纯CPU实时多语言字幕,本地跑不用GPU和云
hayamimi(早耳)是一个纯 CPU 运行的实时多语言语音转文字工具,基于 sherpa-onnx 实现,无需 GPU···
hermes-speech
开源
给 Hermes 智能体装上耳朵和嘴,一句话接入多家语音模型
hermes-speech 是一个为 Hermes Agent 设计的语音插件,同时提供 TTS(文本转语音)和 STT(语音转···
Talkify
开源
按住说话,Mac 上离线秒变文字,免费又保隐私
Talkify 是一款面向 macOS 的本地优先语音听写工具,使用 Swift 与 SwiftUI/AppKit 开发,核心目标···
dikte
开源
按住说话,松手出字,Linux 桌面语音输入
dikte 是一个开源的语音转文字听写应用,使用 Python 编写,主要面向 Linux 桌面环境。它解决的核心···
yap
开源
按快捷键说话,文字直接落到任意 Mac 输入框
yap 是一款面向 macOS 的免费开源语音听写工具,目标是让用户在任意输入框中用说话代替打字。它常驻···
murmur
开源
按住说话,Mac 本地转文字,隐私不出门
murmur 是一款面向 macOS 的本地语音听写工具,基于 Swift 开发,核心思路是把语音转文字完全放在设···
SuperDictate
开源
Mac 上本地极速听写,语音不出设备
SuperDictate 是一款专为 Apple Silicon Mac 打造的本地语音听写工具,基于 Swift 开发并利用 Core···
hex
开源
按住快捷键说话,松手文字就出现在任意应用里
hex 是一款面向 macOS 的本地优先语音听写工具,用 Rust 编写,目标是把「按住快捷键说话、松开即粘···
NeMo-Speech.cpp
开源
用 C++ 跑 NeMo 语音模型,免 Python 低资源做识别与合成
NeMo-Speech.cpp 是一个基于 ggml 的轻量级 C++ 推理运行时,专门用于运行 NVIDIA NeMo 系列语音模···
qwen-scribe
开源
Mac 上离线语音转文字,说完即出字,音频不出本机
qwen-scribe 是一个面向 Apple Silicon Mac 的本地语音识别工具,基于 MLX 框架运行 Qwen3-ASR 模型···
megaphone
开源
Mac 上免费离线听写,语音秒变文字,隐私不外泄
megaphone 是一款专为 Mac 设计的免费、注重隐私的本地听写工具,基于 Apple 的 SpeechAnalyzer 和···
Audar-ASR-V1
开源
阿拉伯语语音识别领先者,方言也能精准转写
Audar-ASR-V1 是一个以阿拉伯语优先的生成式语音识别(ASR)开源项目,旨在解决阿拉伯语及其方言的···
openasr
开源
一条命令本地跑七种语音模型,转录不出机器
openasr 是一个用 Rust 编写的本地优先语音转文字工具,核心目标是让转录过程完全在用户自己的机器···
SpeakoFlow
开源
按一下键,对着屏幕说话,离线秒变文字和 AI 回复
SpeakoFlow 是一款免费开源的跨平台语音听写与 AI 助手,支持 Windows、macOS 和 Linux。它利用本地···
mila
开源
Mac 上离线转写音频,还能分清谁在说话
Mila 是一款原生 macOS 本地语音转写应用,底层基于 whisper.cpp 实现语音识别,并可选接入说话人分···
subarr
开源
给 *arr 字幕栈加语言校准和源排行榜,少下错字幕
subarr 是一个面向 *arr 家庭媒体自动化生态的协调、测量与质量层,定位为 subgen 的补充服务。它解···
yapsnap
开源
一条命令,把视频音频转成文字,不用显卡不用云
yapsnap 是一个纯 CPU 运行的语音转文字命令行工具,能把任意视频链接或本地音视频文件转成纯文本,···
Mega-ASR
开源
野外场景语音识别不掉链子,比SOTA最多强30%
Mega-ASR 是一个面向真实世界场景的语音识别基础模型,旨在解决传统 ASR 在复杂声学环境下性能骤降···
MOSS-Transcribe-Diarize
开源
0.9B 模型搞定 50+ 语言长音频转写、说话人分离和字幕生成
MOSS-Transcribe-Diarize 是一个轻量级(0.9B 参数)的多语言长语音转写与说话人分离模型,支持 50···
SayIt
开源
按快捷键说话,AI润色文字直接落到光标处
SayIt 是一款面向 Windows 的开源语音输入工具,定位为 Wispr Flow / Superwhisper 的替代品。按下···
openless
开源
按住说话,松开即得润色文字,全应用通用
openless 是一款开源的跨平台语音输入工具,支持 macOS 和 Windows。它解决了在任意应用中快速、高···
heard
开源
对着电脑说句话,AI 编程助手就能听懂并回你
heard 是一个为编码智能体(coding agents)打造的语音交互层,定位是「AI 编程助手的 Jarvis」。它···
docker-whisper
开源
一条命令自建 OpenAI 兼容语音转文字服务,带说话人分离
docker-whisper 是一个把 Whisper 语音识别服务打包成 Docker 镜像的开源项目,目标是让用户在自己···