speech-processing

本站收录 28 个带「speech-processing」标签的 AI 开源项目

speechbrainSpeechBrain 是一个基于 PyTorch 的开源语音工具包,旨在为语音识别、说话人识别、语音增强、语音分离、情感识别等多种语音任务提供统一、灵活且易用★ 11,848whisper-timestampedwhisper-timestamped 是一个基于 OpenAI Whisper 的语音识别增强工具,专门为多语言自动语音识别提供词级时间戳和置信度。它解决了标★ 2,850IMS-ToucanIMS-Toucan 是一个基于 PyTorch 的可控且快速的文本转语音(TTS)工具包,声称支持超过 7000 种语言。它旨在解决多语言语音合成中音色、情感★ 2,211deepvoice3_pytorchdeepvoice3_pytorch 是百度 Deep Voice 3 文本转语音(TTS)模型的 PyTorch 非官方实现。Deep Voice 3 是一种★ 1,977awesome-diarization这是一个精选的说话人日志(Speaker Diarization)资源列表,汇集了相关的论文、库、数据集和其他资源。它解决的是说话人日志领域信息分散、入门门槛高★ 1,905CrisperWhisperCrisperWhisper 是一个基于 OpenAI Whisper 的语音识别增强工具,专注于解决标准 Whisper 输出中时间戳不精确和缺少语气词(如“★ 1,432open-speech-corpora这是一个收录可公开获取的语音语料库的清单项目,旨在为语音技术研究与开发提供资源导航。它系统整理了用于自动语音识别(ASR)、语音合成(TTS)、语音情感识别、语★ 1,404voicefixerVoiceFixer 是一个基于深度学习的通用语音修复工具,旨在恢复受损的语音信号,使其更清晰、更自然。它能够处理多种类型的语音退化,包括背景噪声、混响、削波(★ 1,381StreamSpeechStreamSpeech 是一个“一体化”的无缝语音模型,同时支持离线与同声传译场景下的语音识别(ASR)、语音翻译和语音合成。它解决了传统级联系统延迟高、错误★ 1,294audio-development-toolsAudio Development Tools (ADT) 是一个面向音频技术研发的开源项目,旨在整合声音、语音和音乐领域的开发工具链。它解决音频开发者缺乏统一★ 469Neural-Voice-Cloning-With-Few-Samples这是一个基于论文《Neural Voice Cloning With Few Samples》的开源实现,旨在解决少样本语音克隆问题。它通过少量参考音频(甚至几★ 432nnmnkwiinnmnkwii 是一个用于构建语音合成系统的 Python 库,专注于快速原型设计和实验。它提供了一套简洁的 API,封装了语音处理中的常见操作,如频谱特征提★ 399VocGANVocGAN 是一个基于生成对抗网络(GAN)的高保真实时声码器,专为语音合成和文本转语音(TTS)系统设计。它解决的核心问题是传统声码器(如 WaveNet)★ 322voicefixer_mainVoiceFixer 是一个通用的语音修复工具,旨在解决语音信号中的各种退化问题,如背景噪声、混响和低质量录音。它基于深度学习模型,能够将受损的语音恢复为清晰、★ 290Awesome_MambaAwesome_Mamba 是一个关于状态空间模型(State Space Models, SSMs)在医学图像分析中应用的综合性综述项目,聚焦于计算高效时代的★ 270ttslearnttslearn 是一个面向 Python 学习者的语音合成(Text-to-Speech)教学库,由日本学者开发,配套书籍《Pythonで学ぶ音声合成》使用。★ 269Neural-Voice-Cloning-with-Few-Samples这是一个基于百度研究论文《Neural Voice Cloning with Few Samples》的Python实现,旨在用少量样本(甚至一句话)克隆目标说★ 254whisper-auto-transcribe这是一个基于 OpenAI Whisper 的自动音频转写工具,旨在提供简单易用的语音转文本解决方案。它解决了普通用户在使用 Whisper 时面临的命令行操作★ 229bournemouth-forced-aligner这是一个用于语音音频的强制对齐工具,能够自动提取音素级别的时间戳。它解决了语音处理中需要精确对齐音频与文本的问题,尤其适用于语音识别、语音合成和语言学研究。核心★ 167SoundStorm-pytorchSoundStorm-pytorch 是 Google SoundStorm 论文的非官方 PyTorch 实现,旨在解决传统自回归语音合成速度慢的问题。它通过★ 131DeSTA2DeSTA2 是 ICASSP 2025 论文的开源代码与模型,旨在解决语音语言模型(SLM)依赖大量人工标注的语音指令微调数据这一痛点。它提出一种无需语音指令★ 128SpeechPromptSpeechPrompt 是 Interspeech 2022 论文的官方实现,探索将提示学习(Prompt Tuning)应用于生成式口语语言模型,以统一方式★ 102Awesome-AVIAwesome-AVI 是一个关于音频-视觉智能(Audio-Visual Intelligence)的精选资源列表,旨在系统梳理该领域的前沿研究、工具和数据集★ 90viet-ttsVietTTS 是一个开源的越南语文本转语音(TTS)引擎,旨在为越南语社区提供高质量、易用的语音合成解决方案。它解决了越南语 TTS 资源稀缺、商业 API ★ 87Voice-Privacy-Challenge-2020Voice-Privacy-Challenge-2020 是语音隐私挑战赛的官方基线方案,旨在解决语音数据中的说话人身份泄露问题。它通过说话人匿名化技术,在保留★ 63ShelfShelf 是一个面向 AI 和数据科学领域的资源聚合型基础设施项目,定位为“一个宽阔的架子”,旨在系统化整理和展示 AI/数据科学生态中的各类工具、框架、模型★ 62react-native-spokestackreact-native-spokestack 是一个为 React Native 应用提供语音接口的官方 SDK,它封装了 Spokestack 的 iOS ★ 60ManaTTS-Persian-Speech-DatasetManaTTS 是当前最大的开源波斯语语音数据集,包含超过 114 小时的已转写音频,并附带完整的数据收集与处理流水线工具。该项目旨在解决波斯语语音合成(TTS★ 59