speech-enhancement

本站收录 10 个带「speech-enhancement」标签的 AI 开源项目

speechbrainSpeechBrain 是一个基于 PyTorch 的开源语音工具包,旨在为语音识别、说话人识别、语音增强、语音分离、情感识别等多种语音任务提供统一、灵活且易用★ 11,848espnet端到端语音处理工具包,覆盖语音识别、语音合成、语音翻译、说话人识别等多项任务。提供统一训练框架、丰富预训练模型与评测流程,是学术界与工业界语音技术研究的常用基础★ 9,974AuKAuK 是一个开源语音生成与编辑基础模型,目标是把语音合成、语音编辑、说话人提取、语音增强和音源分离等任务统一到一个模型框架中。它解决的是传统语音流水线中模型碎★ 1,413voicefixerVoiceFixer 是一个基于深度学习的通用语音修复工具,旨在恢复受损的语音信号,使其更清晰、更自然。它能够处理多种类型的语音退化,包括背景噪声、混响、削波(★ 1,381StreamSpeechStreamSpeech 是一个“一体化”的无缝语音模型,同时支持离线与同声传译场景下的语音识别(ASR)、语音翻译和语音合成。它解决了传统级联系统延迟高、错误★ 1,294speech-swiftspeech-swift 是一个专为 Apple Silicon 设备打造的 AI 语音工具包,基于 MLX 和 CoreML 框架,提供端侧语音识别(ASR)★ 1,203speech_datasetspeech_dataset 是一个面向语音识别(ASR)研究的中文语音数据集仓库,旨在为深度学习语音模型提供训练与评估所需的音频资源。项目整理了多种来源的语音★ 471voicefixer_mainVoiceFixer 是一个通用的语音修复工具,旨在解决语音信号中的各种退化问题,如背景噪声、混响和低质量录音。它基于深度学习模型,能够将受损的语音恢复为清晰、★ 290speech-androidspeech-android 是一个面向 Android 平台的端侧语音 SDK,基于 ONNX Runtime 并利用高通 NNAPI 加速,提供语音识别(A★ 163speech-corespeech-core 是一个面向端侧设备的实时语音智能体流水线,用 C++17 编写,基于 ONNX Runtime 和 LiteRT(TensorFlow ★ 90