vad

本站收录 11 个带「vad」标签的 AI 开源项目

faster-whisper-GUIfaster-whisper-GUI 是一个基于 PySide6 的桌面图形界面工具,旨在为 faster-whisper 语音识别模型提供易用的操作界面。它解★ 3,004FluidAudioFluidAudio 是一个面向 iOS/macOS 开发者的 Swift 框架,旨在将前沿的 CoreML 音频模型无缝集成到原生应用中。它解决了开发者难以在★ 2,927whisper.netWhisper.net 是 OpenAI Whisper 语音识别模型的 .NET 封装库,让 C# 开发者无需直接处理底层推理代码,就能在应用中集成语音转文字★ 946ICASSP-2023-24-Papers这是一个汇集ICASSP 2023和2024会议论文的仓库,旨在为声学、语音和信号处理领域的研究者提供一站式的论文集合。项目解决了学术会议论文分散、难以系统追踪★ 525audio.cpp-webuiaudio.cpp-webui 是一个基于 ggml 的纯 C++ 音频模型推理引擎,为 audio.cpp 提供全任务 WebUI。它支持语音合成(TTS)、★ 369WhisperHalluWhisperHallu 是一个实验性开源项目,专注于音频预处理,旨在减少 OpenAI Whisper 语音识别模型产生的幻觉文本(即模型在无语音片段中虚构输★ 351cobraCobra 是一个基于深度学习的设备端语音活动检测(VAD)工具,由 Picovoice 开源。它解决的核心问题是:在语音识别、语音唤醒或录音系统中,如何准确判★ 270On-Device-Speech-to-Speech-Conversational-AI这是一个纯CPU上运行的实时语音对话系统,实现与AI模型的双向语音交流。它采用连续流式架构,支持即时响应和自然的打断处理,让对话流畅自然。项目整合了语音识别(A★ 257ariaaria 是一个本地运行的、无审查的 AI 实体项目,基于 Python 构建,集成了大型语言模型(LLM)、语音合成(如 Kokoro TTS)和深度学习技术★ 133stt-serverstt-server 是一个用 Python 编写的实时语音转文字 WebSocket 服务,目标是把 ASR 能力以流式接口暴露给前端或后端应用。它通过可插拔★ 107spokestack-androidSpokestack Android 是一个面向 Android 平台的可扩展移动语音框架,旨在帮助开发者快速为应用集成完整的语音交互能力。它涵盖唤醒词检测、自★ 74