StreamSpeech

一个模型搞定语音识别、翻译和合成,离线同声两相宜

StreamSpeech 是一个“一体化”的无缝语音模型,同时支持离线与同声传译场景下的语音识别(ASR)、语音翻译和语音合成。它解决了传统级联系统延迟高、错误累积和资源占用大的问题,通过单一模型直接完成从源语言语音到目标语言语音的转换。其核心能力包括:基于非自回归(NAR)的并行解码,大幅降低翻译延迟;支持离线(高精度)与同声(低延迟)两种模式切换;覆盖多语言语音识别、翻译和合成任务。项目基于 PyTorch 实现,提供了预训练模型和推理代码,适合研究者和开发者用于构建实时语音翻译应用。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1292
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队ictnlp
所属国家
定价模式free
价格说明开源模型,MIT许可证,完全免费,需自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型all-in-one,asr,audio-processing,machine-translation,non-autoregressive,seamless,simultaneous-translation,speech,speech-enhancement,speech-processing,speech-recognition,speech-synthesis,speech-to-text,speech-translation,streaming-audio,text-to-audio,text-to-speech,translation,tts,voice
GitHub 星标★ 1292
30天Star增速
HF 下载量
上线时间2024-06-04 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:进阶 约 20 分钟 部署方式:本地安装 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(项目为 Python 实现,建议 3.8 及以上)
  • PyTorch(项目基于 PyTorch 实现,需自行按 README 指定版本安装)
  • 足够的磁盘空间与内存,本地推理语音模型建议配备 GPU
  • 可访问 GitHub 与项目官网的网络环境

安装与启动步骤

  1. 1克隆代码仓库

    从 GitHub 拉取 StreamSpeech 源码,后续安装与推理都在该目录内进行。

    git clone https://github.com/ictnlp/StreamSpeech.git
    cd StreamSpeech
  2. 2阅读快速开始

    打开 README 的 Quick Start 一节,按其给出的依赖与推理说明操作,先读再装。

  3. 3创建虚拟环境

    用独立虚拟环境隔离 Python 依赖,避免与系统包冲突;Windows 请改用 venv 激活脚本。

    python -m venv venv
    source venv/bin/activate
  4. 4安装依赖与模型

    按仓库 README 与 Quick Start 给出的依赖清单安装,并下载其提供的预训练模型权重。

如何确认成功

README 节选未给出验证命令;能按 Quick Start 跑通推理脚本并输出 ASR 或翻译结果,即视为环境就绪。

常见问题

Q:README 里 Quick Start 没有内容怎么办?

A:本段节选只保留了标题,请直接打开 GitHub 仓库 README 的 Quick Start 一节,以及项目官网上的示例页面获取完整安装与推理说明。

Q:离线模式和同声传译模式如何切换?

A:README 与项目简介只说明两种模式均受支持,未给出具体切换方式,需查阅论文与仓库代码中的推理脚本参数。

Q:必须要 GPU 吗?

A:README 未明确说明硬件要求,但语音翻译模型推理通常建议使用 GPU;如仅有 CPU,请以仓库实际支持的推理方式为准。

注意事项

  • 本次提供的 README 节选未包含任何安装命令、依赖包名、端口或路径,因此步骤仅为基于仓库地址与 Python 项目的通用准备动作。
  • 严禁照着本文档凭空执行 pip install 未验证的包名或 docker 命令,一切以 GitHub 仓库 README 的实际内容为准。
  • StreamSpeech 为 ACL 2024 研究代码,使用前请阅读论文并遵守仓库的开源许可协议。

核心亮点

  • 真正一体化架构,避免级联误差,推理速度更快
  • 支持离线与同声模式切换,灵活适配不同场景
  • 非自回归解码,显著降低同声翻译延迟

不足之处

  • 模型训练需要大规模多语言语音数据,资源门槛较高
  • 文档/社区待观察

适用场景

  • 实时会议同声传译系统
  • 多语言语音助手
  • 视频字幕自动生成与翻译

替代项目

SeamlessM4T、Whisper、Fairseq

项目介绍

StreamSpeech 是语音识别领域的开源项目,由 ictnlp 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,292)位列前 30%,在语音识别分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。MIT许可证,完全免费,需自行部署使用。

它主要面向的使用场景是:实时会议同声传译系统。同类可对比的替代方案包括 SeamlessM4T、Whisper、Fairseq。

上一篇:ComfyUI-Whisper

下一篇:speech-swift

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1616 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3755 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13