stt
本站收录 72 个带「stt」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
khoj可自托管的 AI 第二大脑,支持联网搜索与本地文档问答,能构建自定义智能体、定时自动化任务并进行深度研究。可将 GPT、Claude、Gemini、Llama、★ 37,537
pyvideotranspyvideotrans 是一个开源的视频翻译与配音工具,能够将视频中的语音识别为文字,翻译成目标语言,并自动生成配音和字幕,最终嵌入视频中。它解决了视频内容跨★ 19,179
vosk-apivosk-api 是一个离线语音识别 API,支持 Android、iOS、Raspberry Pi 和服务器端,提供 Python、Java、C# 和 Nod★ 15,157
moonshineMoonshine 是一个专为语音代理和语音界面设计的超低延迟语音工具包,集成了语音转文字(STT)、意图识别和文字转语音(TTS)三大核心能力。它解决了传统语★ 11,157
Vision-AgentsVision-Agents 是 Stream 推出的开源框架,用于快速构建语音与视觉智能体。它解决了开发者需要集成多种模型和视频提供商、并实现低延迟实时交互的痛★ 8,147
whishperwhishper 是一个基于 Whisper 模型的本地语音转文字工具,提供网页界面,让用户无需上传数据即可完成音频转录、翻译和字幕编辑。它解决了云端语音服务带★ 3,077
ElatoAIElatoAI 是一个面向硬件开发者的实时语音 AI 框架,专注于在 Arduino ESP32 等低功耗微控制器上运行 100 多种语音模型。它解决了传统 A★ 2,024
ava-whatsapp-agent-courseAva 是一个基于 WhatsApp 的 AI 代理项目,旨在将 WhatsApp 转变为智能助手平台。它解决了用户在日常沟通中无法直接利用 AI 完成复杂任务★ 1,678
dsnotedsnote 是一款面向 Linux 桌面(也支持 Sailfish OS)的离线语音笔记应用,主打在无网络环境下完成语音转文字、文字转语音和机器翻译。它解决的★ 1,675
nobodywhoNobodyWho 是一个用 Rust 编写的本地 LLM 推理引擎,旨在让任何设备都能高效运行大语言模型。它解决了在资源受限设备(如手机、嵌入式设备)上部署 ★ 1,505
dicio-androidDicio 是一款开源的 Android 语音助手应用,完全本地化运行,无需云端服务。它解决了用户对隐私敏感、可高度定制的语音助手需求,核心能力包括离线语音识别★ 1,494
Speech-AI-ForgeSpeech-AI-Forge 是一个围绕 TTS(文本转语音)生成模型构建的开源项目,提供 API 服务器和基于 Gradio 的 WebUI。它整合了多种主★ 1,420
SoniTranslateSoniTranslate 是一个开源的视频同步翻译与配音工具,专注于将视频中的语音自动翻译成其他语言,并生成与画面同步的配音。它解决了视频内容跨语言传播时人工★ 1,416
open-speech-corpora这是一个收录可公开获取的语音语料库的清单项目,旨在为语音技术研究与开发提供资源导航。它系统整理了用于自动语音识别(ASR)、语音合成(TTS)、语音情感识别、语★ 1,404
xiaozhi-esp32-server-java小智ESP32的Java企业级管理平台,为基于ESP32的智能语音设备提供一站式后端服务。它解决了小智AI设备在设备管理、音色定制、角色切换和对话记录管理方面的★ 1,357
sokujisokuji 是一款面向双语会议场景的实时双向语音翻译工具,支持自动检测说话语言并双向翻译,可运行于云端或完全离线的本地设备。它提供桌面应用(Windows/m★ 1,356
my-translatormy-translator 是一款基于 Tauri 的桌面实时语音翻译工具,支持 macOS 和 Windows。它解决的是跨语言实时沟通中的延迟和隐私问题,无★ 1,291
voxtvoxt 是一个面向 Mac 的本地优先语音输入工具,通过按住说话(hold-to-talk)的方式,将语音实时转换为文本,并自动进行清理、改写、翻译,还能根据★ 852
TTS-Voice-WizardTTS-Voice-Wizard 是一个面向 VRChat 和 VTuber 的语音转文字再转语音(STTTS)工具。它解决的是虚拟形象无法实时显示说话内容、无★ 809
lobe-ttsLobe TTS 是一个基于 TypeScript 的高质量、可靠的语音合成(TTS)与语音识别(STT)库,专为服务端和浏览器环境设计。它解决了开发者在集成语★ 804
mlx-audio-swiftmlx-audio-swift 是一个专为 Apple Silicon 设计的模块化 Swift 音频处理 SDK,基于 MLX 框架构建。它解决了在苹果生态中★ 786
mlx-omni-servermlx-omni-server 是一个基于 Apple MLX 框架的本地推理服务器,专为 Apple Silicon(M 系列)芯片优化。它实现了与 Open★ 745
cheetahCheetah是一个基于深度学习的端侧流式语音转文本引擎,专注于在设备本地实时处理语音识别任务。它解决的是传统云端语音识别依赖网络、延迟高、隐私风险大的问题,通★ 670
opentypelessOpenTypeless 是一款用 Rust 编写的开源 AI 语音输入工具,支持 macOS、Windows 和 Linux。它解决的是系统自带听写功能不准确★ 575
StarmoonStarmoon 是一个开源的对话式 AI 设备与软件框架,旨在为陪伴、娱乐、教育、医疗、物联网和 DIY 机器人等场景提供语音交互能力。它结合了 Python★ 549
leopardLeopard 是 Picovoice 推出的端侧语音转文字引擎,基于深度学习实现完全离线的自动语音识别。它解决的是云端 ASR 常见的隐私泄露、网络延迟和按量★ 485
make-a-smart-speaker这是一个教你从零开始打造智能音箱的资源合集,主要解决DIY爱好者想自己动手做智能音箱却缺乏系统资料的问题。项目收集了硬件选型、语音识别、音频处理、云端接入等各个★ 480
talk-to-fengge这是一个基于实时语音技术的声音与性格克隆项目,旨在让用户与任何人的数字分身进行自然对话。它解决了传统语音助手缺乏个性化和真实感的问题,通过克隆目标人物的音色和说★ 468
skillsskills 是 ElevenLabs 官方维护的技能集合库,旨在为 AI 智能体开发提供即插即用的音频相关能力。它解决了开发者在构建语音交互应用时,需要从零实★ 462
JARVIS-ChatGPTJARVIS-ChatGPT 是一个基于 Python 的对话助手项目,旨在将《钢铁侠》中 J.A.R.V.I.S. 的合成语音体验带入现实。它主要解决如何让 ★ 461
RealtimeSTT_LLM_TTSRealtimeSTT_LLM_TTS 是一个基于 Python 的实时语音对话系统,它将语音识别(STT)、大语言模型(LLM)和语音合成(TTS)三大模块串★ 435
onnx-asronnx-asr 是一个轻量级 Python 语音识别包,核心思路是让开发者直接加载 ONNX 格式的 ASR 模型完成语音转文字,而不必依赖 PyTorch、★ 381
floe-guardfloe-guard 是一个为 AI 语音代理设计的开源成本计量与预算控制工具。它解决了语音代理在调用语音识别(STT)、语音合成(TTS)、大语言模型(LLM★ 360
LangHelperLangHelper 是一个基于 Rust 开发的语言学习应用,旨在通过整合 ChatGPT、TTS(文本转语音)和 STT(语音转文本)等 AI 模型,提供全★ 348
openliveopenlive 是一个开源的、设备端运行的语音与视觉交互层,专为 AI 代理设计。它解决了云端语音服务延迟高、成本高、隐私风险大的问题,让开发者可以自由接入任★ 316
sapphireSapphire 是一个自托管的 AI 对话助手,定位为“你回家的 AI 伴侣”,主打隐私保护和拟人化陪伴体验。它基于 Python 构建,采用 agentic★ 288
DeLiveDeLive 是一款本地优先的桌面端实时字幕与语音识别工作台,用 Electron + TypeScript 构建,核心解决会议、直播、听课等场景下系统音频难以★ 280
kittkitt 是一个基于 Go 语言构建的实时语音对话开源项目,它利用 LiveKit 框架让开发者能够快速实现与 ChatGPT 的实时语音交互。该项目解决了传统★ 273
streamcore-serverstreamcore-server 是一个用 Go 编写的开源实时语音智能体服务器,专注于构建低延迟的语音对话应用。它通过 WebRTC(WHIP)协议提供实时★ 228
wyoming_openaiwyoming_openai 是一个将 Wyoming 协议转换为 OpenAI 兼容接口的中间代理服务。它主要解决 Home Assistant 生态中的语音★ 218
vox-boxvox-box 是一个兼容 OpenAI API 的语音服务端,提供文本转语音(TTS)和语音转文本(STT)能力。它解决了语音应用开发中多模型集成和 API ★ 217
DictionDiction 是一个用 Go 编写的开源自托管语音转文字方案,定位为 WisprFlow 的替代品,主打 iOS 语音输入键盘。它解决的核心问题是:市面上的语★ 204
hermes-speechhermes-speech 是一个为 Hermes Agent 设计的语音插件,同时提供 TTS(文本转语音)和 STT(语音转文本)能力。它解决的核心问题是:★ 197
OpenGuiderOpenGuider 是一个运行在桌面端的 AI 陪伴助手,通过屏幕识别(OCR)和语音交互(STT/TTS)实时理解用户当前操作环境,并结合 AI 模型生成分★ 169
flowflowflowflow 是一款面向 iPhone 和 macOS 的语音笔记应用,完全使用 Rust 编写,基于 Dioxus 构建跨平台界面。它解决的是语音笔记的本★ 169
Kokoro-EngineKokoro-Engine 是一个跨平台的虚拟角色沉浸式交互引擎,用 Rust 编写,旨在让开发者快速构建桌面宠物、AI 主播(VTuber)或聊天机器人。它解★ 154
LM-Studio-Voice-Conversation这是一个基于LM Studio的本地语音对话应用,用Python编写。它解决的是在本地运行大语言模型时缺乏语音交互的问题,让你能通过说话与本地LLM对话。核心能★ 145
neurolinkneurolink 是一个 TypeScript 编写的统一 LLM 接口层,旨在让开发者通过单一 API 对接 24+ 家主流大模型提供商,切换供应商时无需重★ 144
home-assistant-assist-desktop这是一个将 Home Assistant 的 Assist 语音助手带到桌面端的跨平台应用,支持 Windows、macOS 和 Linux。它解决了用户在桌面★ 135
voiceblendervoiceblender 是一个可编程的语音 AI 平台,基于 Go 语言构建,专注于解决语音通话场景中 AI 能力的集成与编排问题。它通过 REST API、★ 122