vocalinux
开源
在 Linux 上说话就能打字,全程离线不联网
Vocalinux 是一款面向 Linux 桌面的免费开源离线语音听写工具,目标是在任何输入框中通过说话完成打···
汇聚全球AI语音识别与语音转文字项目,Whisper、ASR、实时字幕、会议转写工具一网打尽。
共收录 214 个开源项目
vocalinux
开源
在 Linux 上说话就能打字,全程离线不联网
Vocalinux 是一款面向 Linux 桌面的免费开源离线语音听写工具,目标是在任何输入框中通过说话完成打···
onnx-asr
开源
几行代码用 ONNX 跑语音识别,不装重型框架
onnx-asr 是一个轻量级 Python 语音识别包,核心思路是让开发者直接加载 ONNX 格式的 ASR 模型完成···
OmniDictate
开源
本地实时语音打字,隐私安全,直接输入任何应用。
OmniDictate 是一款免费开源的 Windows 实时听写工具,完全本地运行,无需云端,保护隐私。它利用 ···
MLC-SLM-Baseline
开源
多语言对话语音识别与说话人日志的官方基线,开箱即用
MLC-SLM-Baseline 是 INTERSPEECH 2025 多语言对话语音语言模型研讨会的官方基线系统,旨在为参与者···
EasyMrcp
开源
用 Java 轻松接入多家语音识别与合成服务
EasyMrcp 是一个基于 Java 的语音识别(ASR)与语音合成(TTS)集成工具,旨在简化开发者对接多种语···
Llama-AVSR
开源
用大语言模型提升音视频语音识别准确率,解决复杂场景听不清问题
Llama-AVSR 是一个基于大型语言模型的音视频语音识别开源项目,提供了 ICASSP 2025 和 ICASSP 2026···
Handy
开源
完全离线、免费开源的语音转文字工具,保护隐私,即开即用。
Handy 是一款免费、开源、可扩展的离线语音转文字应用,基于 Rust 和 Tauri v2 构建,支持跨平台运···
phonikud
开源
给希伯来文本自动标音,让TTS发音更准
phonikud 是一个面向希伯来语的文本到音素(grapheme-to-phoneme, G2P)转换工具,相关论文已被 IN···
OpenSuperWhisper
开源
在 Mac 上实现高精度离线语音听写,提升文字输入效率。
OpenSuperWhisper 是一款专为 macOS 打造的语音听写应用,旨在提供高效、准确的语音转文字服务。它···
Hex
开源
在 Mac 上本地快速把语音变成文字,保护隐私又高效。
Hex 是一款专为 macOS 打造的语音转文字工具,基于 Swift 和 SwiftUI 构建,核心目标是实现从语音到···
FireRedASR
开源
中文方言和歌唱都能准确识别的开源ASR模型
FireRedASR 是一个开源的工业级自动语音识别(ASR)模型,主要面向中文普通话、中文方言和英语的语···
sherpa-onnx-unity
开源
在Unity里离线搞定语音识别和合成,无需云服务
sherpa-onnx-unity 是 sherpa-onnx 的 Unity 集成项目,旨在将离线语音识别(ASR)和语音合成(TTS···
whisperIME
开源
说话即打字,本地识别不上传,任意App都能用
whisperIME 是一个基于 Whisper 语音识别模型的 Android 输入法(IME)。它把语音转文字能力直接集···
WhisperLiveKit
开源
本地实时语音转文字,兼容 OpenAI/Deepgram API,秒级部署
WhisperLiveKit 是一个实时、本地的语音转文字工具包,基于 OpenAI Whisper 模型,提供流式语音识别···
OpenWhisper
开源
本地跑 Whisper,语音秒变文字,隐私不出门
OpenWhisper 是一个本地优先的语音转文字工具,基于 Whisper 和 OpenAI API 实现听写与会议记录。它···
moonshine
开源
超低延迟语音全家桶,让语音交互快人一步
Moonshine 是一个专为语音代理和语音界面设计的超低延迟语音工具包,集成了语音转文字(STT)、意图···
LiveCaptions-Translator
开源
实时捕获系统音频,一键翻译成你懂的语言
LiveCaptions-Translator 是一款基于 Windows LiveCaptions 的轻量级实时音频/语音翻译工具。它利用···
AudioNotes
开源
上传音视频,自动生成结构化 Markdown 笔记
AudioNotes 是一个基于 Python 的语音转文字笔记工具,旨在快速从音视频文件中提取内容并整理成结构···
SenseVoice
开源
一个模型搞定多语言识别、情感和事件检测,开箱即用
SenseVoice 是阿里开源的语音基础模型,主打多语言语音识别(ASR),支持中文、粤语、英文、日语和···
StreamSpeech
开源
一个模型搞定语音识别、翻译和合成,离线同声两相宜
StreamSpeech 是一个“一体化”的无缝语音模型,同时支持离线与同声传译场景下的语音识别(ASR)、···
DictateKeyboard
开源
装上键盘,说话就变文字,任意 App 都能用
DictateKeyboard 是一款基于 Whisper AI 的 Android 输入法键盘,目标是让用户在任意 App 里直接通···
CrisperWhisper
开源
让 Whisper 转写更精确,词级时间戳和语气词全搞定
CrisperWhisper 是一个基于 OpenAI Whisper 的语音识别增强工具,专注于解决标准 Whisper 输出中时···
SmartSub
开源
本地离线搞定字幕生成、翻译、配音和烧录,一站式高效处理
SmartSub 是一款免费开源的桌面端一站式字幕工具,主要解决视频创作者和翻译者在字幕生成、翻译、配···
speaches
开源
一键部署,即刻拥有 OpenAI 兼容的语音转文字服务
speaches 是一个基于 faster-whisper 构建的语音识别服务,提供与 OpenAI API 兼容的接口,支持实时···