StreamSpeech 是语音识别领域的开源项目,由 ictnlp 开发,2024 年首次发布。
在全站 13,090 个收录项目中,它的 GitHub 星标数(1,292)位列前 30%,在语音识别分类中处于中上游。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。MIT许可证,完全免费,需自行部署使用。
它主要面向的使用场景是:实时会议同声传译系统。同类可对比的替代方案包括 SeamlessM4T、Whisper、Fairseq。

一个模型搞定语音识别、翻译和合成,离线同声两相宜
StreamSpeech 是一个“一体化”的无缝语音模型,同时支持离线与同声传译场景下的语音识别(ASR)、语音翻译和语音合成。它解决了传统级联系统延迟高、错误累积和资源占用大的问题,通过单一模型直接完成从源语言语音到目标语言语音的转换。其核心能力包括:基于非自回归(NAR)的并行解码,大幅降低翻译延迟;支持离线(高精度)与同声(低延迟)两种模式切换;覆盖多语言语音识别、翻译和合成任务。项目基于 PyTorch 实现,提供了预训练模型和推理代码,适合研究者和开发者用于构建实时语音翻译应用。
⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。
1克隆代码仓库
从 GitHub 拉取 StreamSpeech 源码,后续安装与推理都在该目录内进行。
git clone https://github.com/ictnlp/StreamSpeech.git
cd StreamSpeech2阅读快速开始
打开 README 的 Quick Start 一节,按其给出的依赖与推理说明操作,先读再装。
3创建虚拟环境
用独立虚拟环境隔离 Python 依赖,避免与系统包冲突;Windows 请改用 venv 激活脚本。
python -m venv venv
source venv/bin/activate4安装依赖与模型
按仓库 README 与 Quick Start 给出的依赖清单安装,并下载其提供的预训练模型权重。
README 节选未给出验证命令;能按 Quick Start 跑通推理脚本并输出 ASR 或翻译结果,即视为环境就绪。
Q:README 里 Quick Start 没有内容怎么办?
A:本段节选只保留了标题,请直接打开 GitHub 仓库 README 的 Quick Start 一节,以及项目官网上的示例页面获取完整安装与推理说明。
Q:离线模式和同声传译模式如何切换?
A:README 与项目简介只说明两种模式均受支持,未给出具体切换方式,需查阅论文与仓库代码中的推理脚本参数。
Q:必须要 GPU 吗?
A:README 未明确说明硬件要求,但语音翻译模型推理通常建议使用 GPU;如仅有 CPU,请以仓库实际支持的推理方式为准。
SeamlessM4T、Whisper、Fairseq
StreamSpeech 是语音识别领域的开源项目,由 ictnlp 开发,2024 年首次发布。
在全站 13,090 个收录项目中,它的 GitHub 星标数(1,292)位列前 30%,在语音识别分类中处于中上游。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。MIT许可证,完全免费,需自行部署使用。
它主要面向的使用场景是:实时会议同声传译系统。同类可对比的替代方案包括 SeamlessM4T、Whisper、Fairseq。
上一篇:ComfyUI-Whisper
下一篇:speech-swift
obs-localvocal
开源
直播录屏时,本地AI实时生成字幕,保护隐私零延迟
OBS plugin for local speech recognition and captioning using AI
LiveCaptions-Translator
开源
实时捕获系统音频,一键翻译成你懂的语言
Lightweight and powerful real-time audio/speech translation tool based on Windows Li···
speechbrain
开源
一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务
A PyTorch-based Speech Toolkit
whisper-diarization
开源
给语音转写加上说话人标签,会议记录一目了然
Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper