voice-recognition
本站收录 35 个带「voice-recognition」标签的 AI 开源项目
vosk-apivosk-api 是一个离线语音识别 API,支持 Android、iOS、Raspberry Pi 和服务器端,提供 Python、Java、C# 和 Nod★ 15,157
PaddleSpeechPaddleSpeech 是百度开源的端到端语音工具包,基于飞桨深度学习框架,提供从语音识别、语音合成到说话人验证、语音翻译、关键词唤醒等全链路能力。它解决了语★ 12,689
speechbrainSpeechBrain 是一个基于 PyTorch 的开源语音工具包,旨在为语音识别、说话人识别、语音增强、语音分离、情感识别等多种语音任务提供统一、灵活且易用★ 11,848
moonshineMoonshine 是一个专为语音代理和语音界面设计的超低延迟语音工具包,集成了语音转文字(STT)、意图识别和文字转语音(TTS)三大核心能力。它解决了传统语★ 11,157
WhisperLiveWhisperLive 是一个基于 OpenAI Whisper 的近乎实时语音转写工具,旨在解决传统 Whisper 离线处理延迟高、无法用于直播或对话场景的★ 4,301
open-speech-corpora这是一个收录可公开获取的语音语料库的清单项目,旨在为语音技术研究与开发提供资源导航。它系统整理了用于自动语音识别(ASR)、语音合成(TTS)、语音情感识别、语★ 1,404
EDDiscoveryEDDiscovery 是专为《精英危险》玩家打造的一款辅助工具,集航行日志记录与 3D 星图于一体。它自动解析游戏生成的日志文件,将玩家的每一次跳跃、探索、贸★ 899
LiveTranslateLiveTranslate 是一款面向 Windows 平台的实时音频翻译工具,主要解决 VTuber、主播和外语内容观众在直播或观看视频时面临的跨语言沟通障碍★ 714
expo-speech-recognitionexpo-speech-recognition 是一个面向 React Native Expo 项目的语音识别库,用 TypeScript 编写,填补了 Exp★ 684
cheetahCheetah是一个基于深度学习的端侧流式语音转文本引擎,专注于在设备本地实时处理语音识别任务。它解决的是传统云端语音识别依赖网络、延迟高、隐私风险大的问题,通★ 670
leopardLeopard 是 Picovoice 推出的端侧语音转文字引擎,基于深度学习实现完全离线的自动语音识别。它解决的是云端 ASR 常见的隐私泄露、网络延迟和按量★ 485
customizable-gpt-chatbotVeldra 是一个自托管的本地优先 AI 智能体平台,用户可以用自然语言描述需求,系统自动编译出可运行的智能体,并配备工具、MCP、RAG 和团队协作能力。它★ 404
LiveWhisperLiveWhisper 是一个基于 OpenAI Whisper 的近乎实时语音转文字工具,通过 sounddevice 捕获麦克风音频并流式处理,无需修改 W★ 361
gpt-voice-conversation-chatbot这是一个基于Python构建的语音对话聊天机器人,让你能与ChatGPT/GPT-4进行自然、富有情感的口语或命令行交互。它解决了传统文本聊天缺乏情感表达和记忆★ 302
whisper_dictationwhisper_dictation 是一个开源的私人语音键盘和 AI 助手,旨在通过语音控制实现免提操作。它利用 Whisper 模型进行本地语音识别,支持语音★ 294
M.I.L.E.SM.I.L.E.S 是一个基于 GPT-4-Turbo 的桌面语音助手,旨在提供类似 JARVIS 的智能交互体验。它解决了传统语音助手功能单一、无法个性化定制★ 236
voqalvoqal 是一个面向开发者的语音原生 AI 代理,旨在让开发者通过自然语言语音指令来辅助编程工作。它解决了传统编程中需要手动输入代码或文本命令的低效问题,提供★ 193
PyAutoSRTPyAutoSRT 是一个基于 PySimpleGUI 的桌面工具,用于为任意视频或音频文件自动生成字幕并翻译。它通过调用免费的 Google 语音识别 API★ 190
angular-search-experienceangular-search-experience 是一个基于 Angular 构建的搜索体验演示项目,由 Algolia 官方团队维护。它展示了如何将 Alg★ 165
kobold_assistantkobold_assistant 是一个完全离线的 AI 语音助手项目,旨在提供类似 ChatGPT 语音对话的体验,但所有处理都在本地完成,无需联网,保护隐私★ 164
pyRobBotpyRobBot 是一个基于 OpenAI API 的 Python 对话助手,支持语音、图形界面(UI)和终端三种交互方式,并能联网获取最新信息。它解决了用户★ 145
spokestack-pythonSpokestack-python 是一个为 Python 应用提供语音界面能力的开源库,尤其专注于嵌入式系统。它解决了在资源受限的设备上集成语音交互的难题,提★ 141
crx-live-translatecrx-live-translate 是一款 Chrome/Edge 浏览器扩展,用于给任意网页中的直播音频或视频流实时生成字幕并翻译。它通过浏览器内置的语音识★ 125
YouTranslateYouTranslate 是一个基于 Python 的开源工具,用于将 YouTube 视频中的语音克隆并翻译成其他语言,从而生成配音后的新视频。它解决的是视频★ 110
vocamacvocamac 是一款面向 macOS 的开源离线语音转文字工具,主打隐私与本地化听写。用户按住一个全局快捷键说话,松开后识别文本自动出现在当前光标位置,无需切★ 105
AriaTypeAriaType 是一款基于 Rust 开发的桌面端语音驱动写作与输入工具,主打本地优先和隐私保护。它通过语音识别(STT)将用户的口述内容实时转换为文本,支持★ 93
Python-AssistantPython-Assistant 是一个基于 Python 3.9+ 的语音命令助手服务,能够识别人类语音、与用户对话并执行基础命令。它解决了用户需要通过语音交★ 91
achatbotachatbot 是一个开源的聊天机器人架构,专为语音、视觉及多模态助手设计,支持本地(CPU/GPU 受限)和远程(I/O 受限)运行。它整合了 ASR(语音★ 90
spokestack-androidSpokestack Android 是一个面向 Android 平台的可扩展移动语音框架,旨在帮助开发者快速为应用集成完整的语音交互能力。它涵盖唤醒词检测、自★ 74
brasilttsBrasil TTS 是一个面向巴西葡萄牙语用户的文本转语音(TTS)工具集,主要服务于视力障碍人群,帮助其通过语音读取屏幕内容。该项目将文本转换为自然流畅的巴★ 70
Symposium2023Symposium2023 是一个用 Pascal 语言编写的多功能 AI 演示项目,整合了语音识别、文本转语音、语言翻译、OAuth2 认证、图像生成、人脸检★ 66
react-native-spokestackreact-native-spokestack 是一个为 React Native 应用提供语音接口的官方 SDK,它封装了 Spokestack 的 iOS ★ 60
gpt_chatbot这是一个基于Python的语音聊天机器人,让你通过麦克风与GPT-4对话。它利用OpenAI的语音识别和文本转语音功能实现语音交互,并使用Pinecone向量数★ 56
fe-pilotfe-pilot 是一个面向 React 的 UI 组件库,专注于封装高级 Web 特性,让开发者能快速集成地理位置、通讯录、自动填充等原生能力。它解决了前端开★ 54
AmazonSpeechTranslatorAmazonSpeechTranslator 是一个基于 AWS 托管机器学习服务的 iOS 端到端语音翻译解决方案,集成了语音识别(Amazon Transc★ 52