语音识别

汇聚全球AI语音识别与语音转文字项目,Whisper、ASR、实时字幕、会议转写工具一网打尽。

共收录 214 个开源项目

vocalinux 开源

在 Linux 上说话就能打字,全程离线不联网

Vocalinux 是一款面向 Linux 桌面的免费开源离线语音听写工具,目标是在任何输入框中通过说话完成打···

★ 873 评分 2025-04-12
onnx-asr 开源

几行代码用 ONNX 跑语音识别,不装重型框架

onnx-asr 是一个轻量级 Python 语音识别包,核心思路是让开发者直接加载 ONNX 格式的 ASR 模型完成···

★ 378 评分 2025-04-10
OmniDictate 开源

本地实时语音打字,隐私安全,直接输入任何应用。

OmniDictate 是一款免费开源的 Windows 实时听写工具,完全本地运行,无需云端,保护隐私。它利用 ···

★ 153 评分 2025-03-30
MLC-SLM-Baseline 开源

多语言对话语音识别与说话人日志的官方基线,开箱即用

MLC-SLM-Baseline 是 INTERSPEECH 2025 多语言对话语音语言模型研讨会的官方基线系统,旨在为参与者···

★ 51 评分 2025-03-28
EasyMrcp 开源

用 Java 轻松接入多家语音识别与合成服务

EasyMrcp 是一个基于 Java 的语音识别(ASR)与语音合成(TTS)集成工具,旨在简化开发者对接多种语···

★ 62 评分 2025-03-20
Llama-AVSR 开源

用大语言模型提升音视频语音识别准确率,解决复杂场景听不清问题

Llama-AVSR 是一个基于大型语言模型的音视频语音识别开源项目,提供了 ICASSP 2025 和 ICASSP 2026···

★ 67 评分 2025-02-24
Handy 开源

完全离线、免费开源的语音转文字工具,保护隐私,即开即用。

Handy 是一款免费、开源、可扩展的离线语音转文字应用,基于 Rust 和 Tauri v2 构建,支持跨平台运···

★ 32231 评分 2025-02-13
phonikud 开源

给希伯来文本自动标音,让TTS发音更准

phonikud 是一个面向希伯来语的文本到音素(grapheme-to-phoneme, G2P)转换工具,相关论文已被 IN···

★ 115 评分 2025-02-07
OpenSuperWhisper 开源

在 Mac 上实现高精度离线语音听写,提升文字输入效率。

OpenSuperWhisper 是一款专为 macOS 打造的语音听写应用,旨在提供高效、准确的语音转文字服务。它···

★ 2954 评分 2025-02-06
Hex 开源

在 Mac 上本地快速把语音变成文字,保护隐私又高效。

Hex 是一款专为 macOS 打造的语音转文字工具,基于 Swift 和 SwiftUI 构建,核心目标是实现从语音到···

★ 2899 评分 2025-01-27
FireRedASR 开源

中文方言和歌唱都能准确识别的开源ASR模型

FireRedASR 是一个开源的工业级自动语音识别(ASR)模型,主要面向中文普通话、中文方言和英语的语···

★ 1993 评分 2025-01-24
sherpa-onnx-unity 开源

在Unity里离线搞定语音识别和合成,无需云服务

sherpa-onnx-unity 是 sherpa-onnx 的 Unity 集成项目,旨在将离线语音识别(ASR)和语音合成(TTS···

★ 84 评分 2025-01-21
whisperIME 开源

说话即打字,本地识别不上传,任意App都能用

whisperIME 是一个基于 Whisper 语音识别模型的 Android 输入法(IME)。它把语音转文字能力直接集···

★ 641 评分 2024-12-30
WhisperLiveKit 开源

本地实时语音转文字,兼容 OpenAI/Deepgram API,秒级部署

WhisperLiveKit 是一个实时、本地的语音转文字工具包,基于 OpenAI Whisper 模型,提供流式语音识别···

★ 11095 评分 2024-12-19
OpenWhisper 开源

本地跑 Whisper,语音秒变文字,隐私不出门

OpenWhisper 是一个本地优先的语音转文字工具,基于 Whisper 和 OpenAI API 实现听写与会议记录。它···

★ 188 评分 2024-11-25
moonshine 开源

超低延迟语音全家桶,让语音交互快人一步

Moonshine 是一个专为语音代理和语音界面设计的超低延迟语音工具包,集成了语音转文字(STT)、意图···

★ 11142 评分 2024-10-04
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

LiveCaptions-Translator 是一款基于 Windows LiveCaptions 的轻量级实时音频/语音翻译工具。它利用···

★ 3767 评分 2024-09-13
AudioNotes 开源

上传音视频,自动生成结构化 Markdown 笔记

AudioNotes 是一个基于 Python 的语音转文字笔记工具,旨在快速从音视频文件中提取内容并整理成结构···

★ 2518 评分 2024-07-19
SenseVoice 开源

一个模型搞定多语言识别、情感和事件检测,开箱即用

SenseVoice 是阿里开源的语音基础模型,主打多语言语音识别(ASR),支持中文、粤语、英文、日语和···

★ 9390 评分 2024-07-03
StreamSpeech 开源

一个模型搞定语音识别、翻译和合成,离线同声两相宜

StreamSpeech 是一个“一体化”的无缝语音模型,同时支持离线与同声传译场景下的语音识别(ASR)、···

★ 1292 评分 2024-06-04
DictateKeyboard 开源

装上键盘,说话就变文字,任意 App 都能用

DictateKeyboard 是一款基于 Whisper AI 的 Android 输入法键盘,目标是让用户在任意 App 里直接通···

★ 286 评分 2024-05-29
CrisperWhisper 开源

让 Whisper 转写更精确,词级时间戳和语气词全搞定

CrisperWhisper 是一个基于 OpenAI Whisper 的语音识别增强工具,专注于解决标准 Whisper 输出中时···

★ 1429 评分 2024-05-24
SmartSub 开源

本地离线搞定字幕生成、翻译、配音和烧录,一站式高效处理

SmartSub 是一款免费开源的桌面端一站式字幕工具,主要解决视频创作者和翻译者在字幕生成、翻译、配···

★ 5359 评分 2024-05-21
speaches 开源

一键部署,即刻拥有 OpenAI 兼容的语音转文字服务

speaches 是一个基于 faster-whisper 构建的语音识别服务,提供与 OpenAI API 兼容的接口,支持实时···

★ 3680 评分 2024-05-18