语音识别

汇聚全球AI语音识别与语音转文字项目,Whisper、ASR、实时字幕、会议转写工具一网打尽。

共收录 214 个开源项目

orukeet 开源

冻结 Gabor 核做多语言语音转文字,本地 GGUF 推理

orukeet 是一个多语言自动语音识别(ASR)开源项目,核心创新在于用「拟合后冻结的 Gabor 卷积核」···

★ 130 评分 2026-09-09
hayamimi 开源

纯CPU实时多语言字幕,本地跑不用GPU和云

hayamimi(早耳)是一个纯 CPU 运行的实时多语言语音转文字工具,基于 sherpa-onnx 实现,无需 GPU···

★ 347 评分 2026-08-25
hermes-speech 开源

给 Hermes 智能体装上耳朵和嘴,一句话接入多家语音模型

hermes-speech 是一个为 Hermes Agent 设计的语音插件,同时提供 TTS(文本转语音)和 STT(语音转···

★ 195 评分 2026-08-12
Talkify 开源

按住说话,Mac 上离线秒变文字,免费又保隐私

Talkify 是一款面向 macOS 的本地优先语音听写工具,使用 Swift 与 SwiftUI/AppKit 开发,核心目标···

★ 555 评分 2026-08-05
dikte 开源

按住说话,松手出字,Linux 桌面语音输入

dikte 是一个开源的语音转文字听写应用,使用 Python 编写,主要面向 Linux 桌面环境。它解决的核心···

★ 164 评分 2026-07-25
yap 开源

按快捷键说话,文字直接落到任意 Mac 输入框

yap 是一款面向 macOS 的免费开源语音听写工具,目标是让用户在任意输入框中用说话代替打字。它常驻···

★ 428 评分 2026-07-23
murmur 开源

按住说话,Mac 本地转文字,隐私不出门

murmur 是一款面向 macOS 的本地语音听写工具,基于 Swift 开发,核心思路是把语音转文字完全放在设···

★ 123 评分 2026-07-20
SuperDictate 开源

Mac 上本地极速听写,语音不出设备

SuperDictate 是一款专为 Apple Silicon Mac 打造的本地语音听写工具,基于 Swift 开发并利用 Core···

★ 180 评分 2026-07-18
hex 开源

按住快捷键说话,松手文字就出现在任意应用里

hex 是一款面向 macOS 的本地优先语音听写工具,用 Rust 编写,目标是把「按住快捷键说话、松开即粘···

★ 248 评分 2026-07-17
NeMo-Speech.cpp 开源

用 C++ 跑 NeMo 语音模型,免 Python 低资源做识别与合成

NeMo-Speech.cpp 是一个基于 ggml 的轻量级 C++ 推理运行时,专门用于运行 NVIDIA NeMo 系列语音模···

★ 128 评分 2026-07-15
qwen-scribe 开源

Mac 上离线语音转文字,说完即出字,音频不出本机

qwen-scribe 是一个面向 Apple Silicon Mac 的本地语音识别工具,基于 MLX 框架运行 Qwen3-ASR 模型···

★ 216 评分 2026-07-15
megaphone 开源

Mac 上免费离线听写,语音秒变文字,隐私不外泄

megaphone 是一款专为 Mac 设计的免费、注重隐私的本地听写工具,基于 Apple 的 SpeechAnalyzer 和···

★ 168 评分 2026-07-13
Audar-ASR-V1 开源

阿拉伯语语音识别领先者,方言也能精准转写

Audar-ASR-V1 是一个以阿拉伯语优先的生成式语音识别(ASR)开源项目,旨在解决阿拉伯语及其方言的···

★ 504 评分 2026-07-06
openasr 开源

一条命令本地跑七种语音模型,转录不出机器

openasr 是一个用 Rust 编写的本地优先语音转文字工具,核心目标是让转录过程完全在用户自己的机器···

★ 278 评分 2026-07-02
SpeakoFlow 开源

按一下键,对着屏幕说话,离线秒变文字和 AI 回复

SpeakoFlow 是一款免费开源的跨平台语音听写与 AI 助手,支持 Windows、macOS 和 Linux。它利用本地···

★ 249 评分 2026-06-17
mila 开源

Mac 上离线转写音频,还能分清谁在说话

Mila 是一款原生 macOS 本地语音转写应用,底层基于 whisper.cpp 实现语音识别,并可选接入说话人分···

★ 232 评分 2026-06-11
subarr 开源

给 *arr 字幕栈加语言校准和源排行榜,少下错字幕

subarr 是一个面向 *arr 家庭媒体自动化生态的协调、测量与质量层,定位为 subgen 的补充服务。它解···

★ 144 评分 2026-05-27
yapsnap 开源

一条命令,把视频音频转成文字,不用显卡不用云

yapsnap 是一个纯 CPU 运行的语音转文字命令行工具,能把任意视频链接或本地音视频文件转成纯文本,···

★ 298 评分 2026-05-20
Mega-ASR 开源

野外场景语音识别不掉链子,比SOTA最多强30%

Mega-ASR 是一个面向真实世界场景的语音识别基础模型,旨在解决传统 ASR 在复杂声学环境下性能骤降···

★ 1144 评分 2026-05-16
MOSS-Transcribe-Diarize 开源

0.9B 模型搞定 50+ 语言长音频转写、说话人分离和字幕生成

MOSS-Transcribe-Diarize 是一个轻量级(0.9B 参数)的多语言长语音转写与说话人分离模型,支持 50···

★ 2079 评分 2026-05-13
SayIt 开源

按快捷键说话,AI润色文字直接落到光标处

SayIt 是一款面向 Windows 的开源语音输入工具,定位为 Wispr Flow / Superwhisper 的替代品。按下···

★ 421 评分 2026-05-09
openless 开源

按住说话,松开即得润色文字,全应用通用

openless 是一款开源的跨平台语音输入工具,支持 macOS 和 Windows。它解决了在任意应用中快速、高···

★ 3639 评分 2026-04-27
heard 开源

对着电脑说句话,AI 编程助手就能听懂并回你

heard 是一个为编码智能体(coding agents)打造的语音交互层,定位是「AI 编程助手的 Jarvis」。它···

★ 186 评分 2026-04-24
docker-whisper 开源

一条命令自建 OpenAI 兼容语音转文字服务,带说话人分离

docker-whisper 是一个把 Whisper 语音识别服务打包成 Docker 镜像的开源项目,目标是让用户在自己···

★ 108 评分 2026-04-08