speech-to-speech

用开源模型在本地跑起语音助手,告别云端依赖

speech-to-speech 是一个构建本地语音代理的开源项目,旨在利用开源模型实现端到端的语音交互。它解决了传统语音助手依赖云端服务、延迟高、隐私风险大等问题,让开发者可以在本地设备上运行完整的语音对话流程。核心能力包括语音识别(STT)、自然语言理解与生成(LLM)、语音合成(TTS)以及语音翻译,支持多种开源模型如 Whisper、Llama 等。项目提供了简洁的 Python API,开发者可以快速搭建自定义语音代理,适用于智能家居、车载助手、离线语音客服等场景。其技术栈涵盖 AI、机器学习、语音处理,强调隐私保护与低延迟,是构建本地化、个性化语音交互应用的理想选择。

开源 free 智能体
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 13301
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类智能体
开发团队huggingface
所属国家
官网地址
定价模式free
价格说明开源项目,本地部署,完全免费,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型ai,assistant,language-model,machine-learning,python,speech,speech-synthesis,speech-to-text,speech-translation
GitHub 星标★ 13301
30天Star增速
HF 下载量
上线时间2024-08-07 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数6

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 6 步

环境要求

  • Python 3.10+,推荐 Python 3.11
  • 需在已激活的虚拟环境中安装并运行
  • Ubuntu 需先安装本地音频库 libportaudio2、libsndfile1
  • 首次运行需联网下载并预热模型
  • 资源参考:Apple Silicon 建议 16GB 以上统一内存;NVIDIA 建议 24GB 显存

安装与启动步骤

  1. 1创建虚拟环境

    在项目目录下用 Python 3.10+ 创建名为 .venv 的虚拟环境,环境需自行准备。

    python3 -m venv .venv
  2. 2激活虚拟环境

    激活后所有安装与运行都必须在同一环境内,其他终端运行前也要先激活。

    source .venv/bin/activate
  3. 3装系统音频库

    仅 Ubuntu/Linux 需要,用于本地音频输入输出;其他系统可跳过此步。

    sudo apt-get install libportaudio2 libsndfile1
  4. 4安装项目包

    从 PyPI 安装,默认已包含 STT、OpenAI 兼容 LLM 接口、TTS 与实时服务依赖。

    pip install speech-to-speech
  5. 5启动本地语音代理

    首次运行会先下载并预热模型,随后连接麦克风;允许麦克风权限后说话并停顿。

    speech-to-speech local
  6. 6Docker 方式启动

    另一种方案:先装 NVIDIA Container Toolkit,再启动 compose,含 llama.cpp 与实时服务器。

    docker compose up

如何确认成功

终端连接麦克风后,对其说话并停顿,能听到语音回复即成功;Ctrl+C 停止。Docker 方式会监听 8080 与 8765 端口。

常见问题

Q:首次运行为什么很慢?

A:第一次运行需要下载并预热模型,完成后再连接麦克风,属正常现象,之后启动会快很多。

Q:回复被扬声器回声打断怎么办?

A:在启动命令后加上 --local_audio_block_mic_during_playback,播放时会暂停录音,但也就无法中途打断助手。

Q:Linux 上 Qwen3-TTS 装不上或报错?

A:默认 Linux 版 wheel 面向 CUDA 12.8 与 glibc 2.39(Ubuntu 24.04),系统不一致需查看 README 的 CUDA 安装说明。

Q:必须用 API Key 吗?

A:不必须。全本地配置无需联网对话;只有使用托管 LLM 时才需要 API Key,且对话期间需保持联网。

注意事项

  • 每个运行 speech-to-speech 的终端都要先激活同一个虚拟环境。
  • 建议使用耳机,避免扬声器声音被麦克风拾取造成反馈。
  • 首次模型下载需要联网,全本地配置之后可离线使用。
  • 使用托管 LLM 时,转写文本、指令和对话历史会发送给服务商,麦克风音频仍留在本地。

核心亮点

  • 完全本地运行,保护隐私且无网络延迟
  • 集成多种开源模型,支持自定义语音代理
  • API 简洁,快速搭建端到端语音对话流程

不足之处

  • 本地运行对硬件性能要求较高
  • 文档/社区待观察

适用场景

  • 智能家居语音控制
  • 车载离线语音助手
  • 隐私敏感的语音交互应用

替代项目

Vosk、Coqui TTS、Whisper.cpp

项目介绍

speech-to-speech 是智能体领域的开源项目,由 huggingface 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(13,301)位列前 4%,在智能体分类的 2,517 个项目里位列前 5%。

近 41 天,它的 GitHub 星标从 12,420 增加到 13,301,净增 881。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。本地部署,完全免费,无付费版本。

它主要面向的使用场景是:智能家居语音控制。同类可对比的替代方案包括 Vosk、Coqui TTS、Whisper.cpp。

上一篇:stock-agent-ops

下一篇:azure-ai-travel-agents

同类项目推荐

xinchao-dynamic-mind 开源

给 AI 装上疲惫和欲望,让交互更真实

独立、可自托管的 AI 动态心智状态引擎:驱动力、念头池、疲惫、睡眠与意图。

★ 199 2026-08-09
deepseek-harness 开源

把 AI 能力拆成乐高积木,拼出你的专属智能体。

DeepSeek Harness: Everything is a Plugin.

★ 233327 2026-08-15
AutoGPT 开源

开箱即用的 AI 员工,交代任务就自己干完

AutoGPT is the vision of accessible AI for everyone, to use and to build on. Our mis···

★ 187492 2026-08-09
EvoAgentX 开源

让 AI 智能体自己迭代变强,越用越聪明

EvoAgentX: Building a Self-Evolving Ecosystem of AI Agents

★ 3351 2026-09-12