awesome-diarization

一站式找全说话人日志论文、代码和数据集,快速上手

这是一个精选的说话人日志(Speaker Diarization)资源列表,汇集了相关的论文、库、数据集和其他资源。它解决的是说话人日志领域信息分散、入门门槛高的问题,为研究者和开发者提供了一站式的导航。核心能力包括:按主题分类整理最新论文(如端到端模型、聚类方法)、收录主流开源库(如pyannote.audio、NeMo)、提供常用数据集(如VoxConverse、DIHARD)和评估指标,并定期更新。项目采用awesome-list风格,结构清晰,便于快速查阅,是进入该领域的实用指南。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1903
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类语音识别
开发团队wq2012
所属国家
定价模式free
价格说明该项目为开源资源列表,完全免费,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言
技术栈/模型awesome,awesome-list,deep-learning,machine-learning,speaker-diarization,speech-processing,speech-recognition
GitHub 星标★ 1903
30天Star增速
HF 下载量
上线时间2019-01-19 00:00:00
最近更新2026-09-16 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数4

使用教程

难度:入门 约 5 分钟 部署方式:本地安装 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 可访问 GitHub 的网络环境
  • 已安装 git(用于克隆仓库)
  • 本地文本编辑器或 Markdown 阅读器
  • 现代浏览器(用于访问在线版官网)

安装与启动步骤

  1. 1克隆资源仓库

    把 awesome-diarization 仓库下载到本地,后续可离线查阅 README 中的论文、库和数据集清单。

    git clone https://github.com/wq2012/awesome-diarization.git
  2. 2进入仓库目录

    切换到仓库根目录,README.md 是全部资源清单的入口文件。

    cd awesome-diarization
  3. 3阅读资源清单

    README 按 Publications、Software、Datasets 等主题分区,先看 Table of contents 定位所需章节。

    cat README.md
  4. 4访问在线版官网

    README 提供了网页版地址,浏览器打开即可在线浏览同一份清单,适合不想克隆仓库的用户。

如何确认成功

本地能打开仓库根目录下的 README.md 并看到目录列表;浏览器能打开 https://wq2012.github.io/awesome-diarization 页面。

常见问题

Q:这个仓库需要 pip install 或 Docker 部署吗?

A:不需要。它是 awesome-list 资源清单,只包含文档和链接,没有可执行代码,按 README 克隆后直接阅读即可。

Q:想快速找到入门资料该看哪部分?

A:先看 README 的 Table of contents,再进入 Overview、Publications 和 Other learning materials(含在线课程、书籍、博客、视频教程)章节。

Q:如何查找开源库和数据集?

A:在 README 的 Software 章节查看 Framework、Clustering、Speaker embedding 等分类;数据集在 Datasets 章节。

Q:可以提交自己发现的资源吗?

A:可以。README 顶部有 Contributions welcome 徽章并链接到 CONTRIBUTING.md,按该文件的说明提交即可。

注意事项

  • 本仓库仅为资源导航列表,不提供训练或推理代码,无法直接运行说话人日志任务。
  • README 与在线版会持续更新,建议定期 git pull 获取最新链接。
  • 清单中的论文、库、数据集版权归各自作者所有,使用时请遵守对应许可。

核心亮点

  • 精选了从经典到前沿的论文,覆盖聚类、端到端等主流方法
  • 收录了pyannote.audio、NeMo等实用库,附有简要说明和链接
  • 整理了VoxConverse、DIHARD等常用数据集,方便对比实验

不足之处

  • 资源列表更新频率可能不及最新研究,需自行关注前沿
  • 文档/社区待观察,缺少使用教程或实践指南

适用场景

  • 入门学习说话人日志领域,快速了解技术脉络
  • 研究选型时,查找可复用的开源库和数据集
  • 论文写作时,引用相关工作和基准数据集

替代项目

awesome-speaker-recognition、pyannote.audio、NeMo speaker diarization

项目介绍

awesome-diarization 是语音识别领域的开源项目,由 wq2012 开发,2019 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,903)位列前 30%,在语音识别分类中处于中上游。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-16。该项目为开源资源列表,完全免费,无付费版本。

它主要面向的使用场景是:入门学习说话人日志领域,快速了解技术脉络。同类可对比的替代方案包括 awesome-speaker-recognition、pyannote.audio、NeMo speaker diarization。

上一篇:whishper

下一篇:Fun-ASR

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1616 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3755 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13