WhisperHallu

预处理音频,让 Whisper 转录不再胡说八道

WhisperHallu 是一个实验性开源项目,专注于音频预处理,旨在减少 OpenAI Whisper 语音识别模型产生的幻觉文本(即模型在无语音片段中虚构输出内容)。它通过一系列音频处理技术,如语音活动检测(VAD)、噪声去除、人声分离等,对输入音频文件进行清洗和优化,从而提升 Whisper 转录的准确性和可靠性。项目核心能力包括:自动检测并移除静音或非语音片段,降低背景噪声干扰,分离并增强人声信号,最终生成更干净的音频输入,显著减少幻觉文本的出现。它主要面向需要高精度转录的开发者、研究人员和内容创作者,提供了一套可配置的预处理流程,并支持与 Whisper 模型无缝集成。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 351
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队EtienneAb3d
所属国家
官网地址
定价模式free
价格说明开源项目,代码免费,需自行部署使用
访问状态
是否开源是
开源协议
主要语言Python
技术栈/模型asr,audio-processing,noise-removal,sound-processing,text-to-speech,vad,vocals,whisper
GitHub 星标★ 351
30天Star增速
HF 下载量
上线时间2023-02-14 00:00:00
最近更新2026-07-26 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 有效减少 Whisper 在静音段产生的幻觉文本,提升转录可信度
  • 集成 VAD、降噪和人声分离,一站式音频清洗方案
  • 代码实验性强,便于研究者二次开发和定制

不足之处

  • 项目处于实验阶段,API 和文档可能不够稳定
  • 依赖较多音频处理库,环境配置有一定门槛

适用场景

  • 会议录音转写,去除空白段和噪声干扰
  • 播客或视频字幕生成,提高转录准确性
  • 语音数据集清洗,为 ASR 模型训练准备干净数据

替代项目

WhisperX、faster-whisper、stable-ts

项目介绍

WhisperHallu 是语音识别领域的开源项目,由 EtienneAb3d 开发,2023 年首次发布。

它收录于语音识别分类,该分类目前共有 212 个项目,GitHub 星标数为 351。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-07-26。代码免费,需自行部署使用。

它主要面向的使用场景是:会议录音转写,去除空白段和噪声干扰。同类可对比的替代方案包括 WhisperX、faster-whisper、stable-ts。

上一篇:izwi

下一篇:Speech-and-Text

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1616 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3755 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13