speaker-diarization

本站收录 24 个带「speaker-diarization」标签的 AI 开源项目

FunASRFunASR 是阿里开源的多语言语音识别工具包,专为中文场景深度优化,同时支持英文、日文等。它解决了从训练到部署的全链路问题,包括语音识别(ASR)、端点检测(★ 20,549speechbrainSpeechBrain 是一个基于 PyTorch 的开源语音工具包,旨在为语音识别、说话人识别、语音增强、语音分离、情感识别等多种语音任务提供统一、灵活且易用★ 11,848WhisperLiveKitWhisperLiveKit 是一个实时、本地的语音转文字工具包,基于 OpenAI Whisper 模型,提供流式语音识别(ASR)、说话人分离(speake★ 11,103espnet端到端语音处理工具包,覆盖语音识别、语音合成、语音翻译、说话人识别等多项任务。提供统一训练框架、丰富预训练模型与评测流程,是学术界与工业界语音技术研究的常用基础★ 9,974argmax-oss-swift专为 Apple Silicon 打造的端侧语音 AI 框架,支持在设备本地运行语音识别与合成等模型,无需联网与云端依赖。基于 Swift 开发,性能高效、隐私★ 6,385whisper-diarization这是一个基于OpenAI Whisper的自动语音识别与说话人分离工具,解决的是多说话人场景下语音转写时无法区分谁在说话的问题。它结合Whisper的强大多语种★ 5,659FluidAudioFluidAudio 是一个面向 iOS/macOS 开发者的 Swift 框架,旨在将前沿的 CoreML 音频模型无缝集成到原生应用中。它解决了开发者难以在★ 2,927whisper-timestampedwhisper-timestamped 是一个基于 OpenAI Whisper 的语音识别增强工具,专门为多语言自动语音识别提供词级时间戳和置信度。它解决了标★ 2,850MOSS-Transcribe-DiarizeMOSS-Transcribe-Diarize 是一个轻量级(0.9B 参数)的多语言长语音转写与说话人分离模型,支持 50 多种语言,并集成时间戳和声学事件识★ 2,096awesome-diarization这是一个精选的说话人日志(Speaker Diarization)资源列表,汇集了相关的论文、库、数据集和其他资源。它解决的是说话人日志领域信息分散、入门门槛高★ 1,905Fun-ASRFun-ASR 是一个基于大语言模型的开源语音识别(ASR)模型家族,专注于中文、方言、口音及多语言场景。它提供多种运行时支持,包括 FunASR、vLLM、流★ 1,555speech-swiftspeech-swift 是一个专为 Apple Silicon 设备打造的 AI 语音工具包,基于 MLX 和 CoreML 框架,提供端侧语音识别(ASR)★ 1,203parakeet-rsparakeet-rs 是一个用 Rust 编写的语音识别工具库,基于 NVIDIA Parakeet 系列模型(通过 ONNX 运行),提供极快的语音转文字能★ 404izwiizwi 是一个本地优先的语音 AI 运行时,用 Rust 编写,提供语音转文字、说话人分离、文字转语音和声音克隆能力,并兼容 OpenAI API 格式。它解★ 385audio.cpp-webuiaudio.cpp-webui 是一个基于 ggml 的纯 C++ 音频模型推理引擎,为 audio.cpp 提供全任务 WebUI。它支持语音合成(TTS)、★ 369humlahumla 是一款面向 Mac 的开源 AI 会议笔记工具。它无需机器人参会,直接录制麦克风与系统音频,支持在设备本地或通过 OpenAI、Deepgram、G★ 291chatbot-watson-android这是一个基于 IBM Watson 服务的 Android 聊天机器人示例应用,集成了 Watson Assistant(对话管理)、Speech-to-Tex★ 197meeting-transcribermeeting-transcriber 是一款面向 macOS 的本地会议转录工具,定位为 Otter、Granola、Fireflies 的开源替代品。它常驻★ 185amanuamanu 是一款面向 macOS 的本地优先会议记录工具,用 Swift 编写。它能自动检测并录制线上会议,随后完成语音转写,把零散的口头讨论沉淀为可检索的文★ 171dub-studiodub-studio 是一款面向 Windows 的免费离线 AI 视频配音工具,以单个原生 .exe 形式分发,无需安装 Python 环境。它解决视频本地化★ 136docker-whisperdocker-whisper 是一个把 Whisper 语音识别服务打包成 Docker 镜像的开源项目,目标是让用户在自己的服务器上快速搭建一套兼容 Open★ 108speech-corespeech-core 是一个面向端侧设备的实时语音智能体流水线,用 C++17 编写,基于 ONNX Runtime 和 LiteRT(TensorFlow ★ 90WatBotWatBot 是一个基于 IBM Watson 服务的 Android 聊天机器人示例项目。它利用 Watson Assistant V1 提供对话管理,通过 ★ 71MLC-SLM-BaselineMLC-SLM-Baseline 是 INTERSPEECH 2025 多语言对话语音语言模型研讨会的官方基线系统,旨在为参与者提供语音识别和说话人日志的参考实★ 51