CrisperWhisper

让 Whisper 转写更精确,词级时间戳和语气词全搞定

CrisperWhisper 是一个基于 OpenAI Whisper 的语音识别增强工具,专注于解决标准 Whisper 输出中时间戳不精确和缺少语气词(如“嗯”“啊”)的问题。它通过改进词级时间戳对齐算法,让每个词的起止时间更准确,同时新增了填充词检测功能,能识别并标记口语中的停顿词、重复词和修正词,生成更接近人类逐字记录的转写文本。该工具提供简单的 Python API 和命令行接口,支持批量处理音频文件,并允许用户自定义填充词列表和输出格式。它特别适合需要精确时间码或完整口语内容的场景,如字幕制作、会议记录、访谈分析和语音数据标注。项目基于 Whisper 的模型架构,无需额外训练即可使用,但提供了微调接口以适配特定领域词汇。

开源 free 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1416
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类语音识别
开发团队nyrahealth
所属国家
定价模式free
价格说明开源项目,本地部署,完全免费,无付费版本。
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型asr,audio,detection,filler,full-duplex-audio,labeling,recognition,speech,speech-processing,speech-recognition,stutter-detection,stuttering,timestamps,transcription,turn-taking,verbatim,whisper
GitHub 星标★ 1416
30天Star增速
HF 下载量
上线时间2024-05-24 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数4

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 3 步

环境要求

  • 已安装 Python 3 与 pip(README 未给出具体版本要求)
  • 可访问 PyPI 安装 Python 包
  • 首次运行需联网从 Hugging Face 下载模型权重
  • 无需 GPU,CPU 环境亦可运行

安装与启动步骤

  1. 1准备 Python 环境

    确认本机已装好 Python 3 和 pip,建议在虚拟环境中安装,避免与系统环境冲突。README 未指定最低 Python 版本。

  2. 2安装 CrisperWhisper

    通过 pip 安装带 transformers 依赖的版本,README 说明该版本为纯 PyTorch 实现,可在 macOS、Windows 和 CPU 上运行。

    pip install "crisperwhisper[transformers]"
  3. 3加载模型

    在 Python 中导入 CrisperWhisperModel 并实例化,默认使用 nyralabs/CrisperWhisper2.0_large 权重,首次执行会自动下载。

    from crisperwhisper import CrisperWhisperModel
    
    model = CrisperWhisperModel()          # nyralabs/CrisperWhisper2.0_large

关键配置

配置项必填说明示例
model是要加载的模型权重标识,README 默认给出 large 版本nyralabs/CrisperWhisper2.0_large

如何确认成功

执行模型加载代码无报错,且首次运行时自动完成模型权重下载,即表示安装成功。

常见问题

Q:没有 GPU 能用吗?

A:可以。README 明确该版本为 Pure PyTorch,能在 torch 支持的任何环境运行,包括 macOS、Windows 和纯 CPU 环境。

Q:支持中文等多语言吗?

A:README 将其定位为 multilingual(多语言)模型,但未列出具体语言清单,建议查阅官方 DOCS.md 确认。

Q:能给出逐词时间戳吗?

A:可以。README 称其词级时间戳平均边界误差约 30 毫秒(朗读语音)和 41 毫秒(对话语音)。

Q:怎么处理“嗯”“啊”这类语气词?

A:README 提供两种输出:verbatim 模式保留原话并用方括号标记填充词,intended 模式输出清理后的书面化内容。

注意事项

  • README 节选未给出完整转写调用示例,实际转写用法请查阅项目 DOCS.md 与官网 nyra-labs.com。
  • 首次加载模型会从 Hugging Face 下载权重,需保证网络可访问 huggingface.co/nyralabs。
  • README 中仅提供 pip 安装方式,未提及 Docker、conda 等其他安装途径。

核心亮点

  • 词级时间戳精度显著优于原生 Whisper,误差从秒级降到毫秒级
  • 自动检测并标注“嗯”“啊”等填充词,适合逐字稿和语言学研究
  • 提供简单 API 和 CLI,几行代码即可集成到现有语音处理流程

不足之处

  • 依赖 Whisper 模型,首次运行需下载较大模型文件
  • 对长音频处理速度较慢,实时性不足
  • 文档/社区待观察

适用场景

  • 字幕制作:需要精确到词的时间码,方便对轴
  • 会议访谈记录:保留语气词,还原真实口语内容
  • 语音数据标注:为 NLP 模型提供带填充词标记的训练数据

替代项目

whisper-timestamped、faster-whisper、stable-ts

项目介绍

CrisperWhisper 是语音识别领域的开源项目,由 nyrahealth 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,416)位列前 30%,在语音识别分类中处于中上游。

近 42 天,它的 GitHub 星标从 1,285 增加到 1,416,净增 131。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。本地部署,完全免费,无付费版本。

它主要面向的使用场景是:字幕制作:需要精确到词的时间码,方便对轴。同类可对比的替代方案包括 whisper-timestamped、faster-whisper、stable-ts。

上一篇:amical

下一篇:murmure

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1616 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3755 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13