PaddleSpeech

一站式语音工具箱,快速实现识别、合成与唤醒

PaddleSpeech 是百度开源的端到端语音工具包,基于飞桨深度学习框架,提供从语音识别、语音合成到说话人验证、语音翻译、关键词唤醒等全链路能力。它解决了语音技术落地中模型训练、部署和调优的复杂性问题,内置了多种 SOTA 模型,如流式 ASR(支持标点恢复)、流式 TTS(带文本前端)、自监督学习模型等,并支持中英文及代码切换场景。其核心能力包括:一键式命令行工具,简化数据准备、训练和推理流程;提供丰富的预训练模型,覆盖主流语音任务;支持流式与非流式推理,适合实时交互场景。项目在 NAACL2022 获得最佳演示奖,社区活跃,文档齐全,适合开发者快速构建语音应用或进行学术研究。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 12686
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队PaddlePaddle
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型asr,code-switch,conformer,kws,punctuation-restoration,self-supervised-learning,sound-classification,speech-alignment,speech-recognition,speech-synthesis,speech-translation,streaming-asr,streaming-tts,transformer,tts,vocoder,voice-cloning,voice-recognition,wav2vec2,whisper
GitHub 星标★ 12686
30天Star增速
HF 下载量
上线时间2017-11-14 00:00:00
最近更新2026-09-22 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 20 分钟 部署方式:库/依赖 8 步

环境要求

  • 强烈推荐在 Linux 系统上安装
  • Python >= 3.8
  • 已安装 pip,且能访问百度镜像源(mirror.baidu.com)
  • 测试音频需为 16k wav 格式

安装与启动步骤

  1. 1安装飞桨框架

    先安装 PaddlePaddle 作为底层依赖。2.4.1 只是示例版本,请根据你选的 PaddleSpeech 版本所需的最小依赖调整版本号。

    pip install paddlepaddle==2.4.1 -i https://mirror.baidu.com/pypi/simple
  2. 2安装语音工具包

    README 提供 pip 安装与源码编译两种方式,源码编译为官方推荐。这里用 pip 方式,先装 pytest-runner 再装 paddlespeech。

    pip install pytest-runner
    pip install paddlespeech
  3. 3下载测试音频

    下载官方提供的示例音频用于后续推理测试,如需测试自己的音频可替换 --input 参数。

    wget -c https://paddlespeech.cdn.bcebos.com/PaddleAudio/zh.wav
    wget -c https://paddlespeech.cdn.bcebos.com/PaddleAudio/en.wav
  4. 4启动语音服务

    在项目根目录用 demos 下的 application.yaml 启动语音服务端,默认监听 8090 端口,等待模型加载完成。

    paddlespeech_server start --config_file ./demos/speech_server/conf/application.yaml
  5. 5调用语音识别

    另开终端调用 ASR 服务,把音频路径换成你自己的 16k wav 文件,服务端会返回识别文本。

    paddlespeech_client asr --server_ip 127.0.0.1 --port 8090 --input input_16k.wav
  6. 6调用语音合成

    调用 TTS 服务,把文本合成语音并保存为 output.wav,可换成任意中英文文本。

    paddlespeech_client tts --server_ip 127.0.0.1 --port 8090 --input "您好,欢迎使用百度飞桨语音合成服务。" --output output.wav
  7. 7启动流式识别服务

    使用流式 ASR 的配置文件启动服务端,适合实时交互场景,客户端需用 asr_online 命令调用。

    paddlespeech_server start --config_file ./demos/streaming_asr_server/conf/application.yaml
  8. 8调用流式识别

    用 asr_online 调用流式服务;流式 TTS 需启动 tts_online_application.yaml 配置并访问 8092 端口。

    paddlespeech_client asr_online --server_ip 127.0.0.1 --port 8090 --input input_16k.wav

关键配置

配置项必填说明示例
config_file是服务端配置文件路径,决定加载哪些模型与服务参数./demos/speech_server/conf/application.yaml
server_ip是客户端连接的服务端 IP 地址127.0.0.1
port是服务端口,普通服务为 8090,流式 TTS 为 80928090
input是输入内容,语音任务填 16k wav 音频路径,合成任务填文本input_16k.wav
output否语音合成输出音频文件路径output.wav
protocol否流式 TTS 服务使用的通信协议http

如何确认成功

服务端启动无报错并持续运行;客户端能返回识别文本,或生成可播放的 output.wav 文件,即部署成功。

常见问题

Q:必须先装 PaddlePaddle 吗?

A:是的,README 要求先安装 paddlepaddle(示例版本 2.4.1),再执行 pip install pytest-runner 和 pip install paddlespeech。

Q:可以在 Windows 上安装吗?

A:README 强烈推荐 Linux,徽章显示支持 linux/win/mac,但未给出 Windows 的具体安装命令,建议优先使用 Linux。

Q:对输入音频有什么要求?

A:README 说明支持 16k wav 格式音频,可用 --input 换成自己的音频或文本进行测试。

Q:安装过程报错怎么办?

A:可查阅安装文档 ./docs/source/install.md,涵盖 conda 环境、librosa 依赖、gcc、kaldi 安装等问题,也可到 issue #2150 留言。

Q:不同服务的端口分别是多少?

A:普通 ASR/TTS/分类服务为 8090,流式 TTS 客户端示例使用 8092。

注意事项

  • README 强烈推荐在 Linux 系统、Python >= 3.8 环境下安装。
  • paddlepaddle==2.4.1 仅为示例,需按所选 PaddleSpeech 版本的最小依赖选择对应版本。
  • 源码编译是官方推荐的另一种安装方式;可编辑模式安装需加 --use-pep517 参数。
  • 服务端与客户端命令中的 config_file 为相对路径,需在包含 demos 目录的项目根目录下执行。

核心亮点

  • 覆盖语音全链路,ASR/TTS/说话人验证/翻译等开箱即用
  • 内置流式模型,适合实时交互场景
  • 基于飞桨,支持 Python 简单调用,文档示例丰富

不足之处

  • 依赖飞桨框架,与 PyTorch 生态集成不便
  • 部分模型对中文优化,英文支持相对弱
  • 文档/社区待观察

适用场景

  • 智能语音助手开发
  • 实时语音转写与字幕生成
  • 语音交互系统原型验证

替代项目

ESPnet、SpeechBrain、Kaldi

项目介绍

PaddleSpeech 是语音识别领域的开源项目,由 PaddlePaddle 开发,2017 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(12,686)位列前 4%,在语音识别分类的 212 个项目里位列前 5%。

近 41 天,它的 GitHub 星标从 12,666 增加到 12,686,净增 20。

项目仍在小幅维护中,最近一次代码更新于 2026-09-22。Apache-2.0许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:智能语音助手开发。同类可对比的替代方案包括 ESPnet、SpeechBrain、Kaldi。

上一篇:moonshine

下一篇:whispering-ui

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1616 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3755 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13