SpeechPrompt

用提示学习统一搞定多种语音任务,无需重训模型

SpeechPrompt 是 Interspeech 2022 论文的官方实现,探索将提示学习(Prompt Tuning)应用于生成式口语语言模型,以统一方式处理多种语音处理任务。传统语音任务需要针对每个任务设计专门模型,而 SpeechPrompt 借鉴 NLP 中提示学习的思路,将语音信号视为离散单元序列,通过构造提示模板让预训练生成模型直接输出任务结果,从而无需为每个任务重新训练模型。项目核心能力包括:支持语音分类、情感识别、说话人验证等任务的统一建模,提供基于预训练模型的提示调优训练代码和推理脚本。它解决了语音领域任务碎片化、模型复用难的问题,展示了生成式模型在语音处理中的新范式。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 102
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队ga642381
所属国家
定价模式free
价格说明开源项目,无在线服务,需自行部署,完全免费。
访问状态
是否开源是
开源协议
主要语言Python
技术栈/模型deep-learning,large-language-models,nlp,prompt,prompting,pytorch,speech-processing
GitHub 星标★ 102
30天Star增速
HF 下载量
上线时间2022-04-01 00:00:00
最近更新2026-03-24 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

核心亮点

  • 创新性地将 NLP 提示学习引入语音处理,统一多任务建模
  • 基于预训练生成式口语模型,减少下游任务训练成本
  • 附有论文和代码,复现门槛低,适合学术研究

不足之处

  • 项目处于早期,文档和社区支持待观察
  • 仅支持有限的语音任务,实际应用范围有限

适用场景

  • 学术研究:探索语音提示学习新范式
  • 多任务语音处理:用单一模型完成分类、情感识别等
  • 低资源场景:减少针对每个任务的数据标注和训练

替代项目

SpeechBrain、ESPnet、HuggingFace Transformers

项目介绍

SpeechPrompt 是语音识别领域的开源项目,由 ga642381 开发,2022 年首次发布。

它收录于语音识别分类,该分类目前共有 212 个项目,GitHub 星标数为 102。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-03-24。无在线服务,需自行部署,完全免费。

它主要面向的使用场景是:学术研究:探索语音提示学习新范式。同类可对比的替代方案包括 SpeechBrain、ESPnet、HuggingFace Transformers。

上一篇:MLC-SLM-Baseline

下一篇:GigaAM

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1616 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3755 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13