hermes-speech

给 Hermes 智能体装上耳朵和嘴,一句话接入多家语音模型

hermes-speech 是一个为 Hermes Agent 设计的语音插件,同时提供 TTS(文本转语音)和 STT(语音转文本)能力。它解决的核心问题是:让 Hermes Agent 这类智能体框架能够方便地接入多种语音模型与音色,而不必为每个供应商单独写适配代码。项目通过 AllModels 统一抽象,并已支持 Cartesia、ElevenLabs、Fish Audio、Soniox 以及 OpenAI 兼容接口等多家语音服务,用户可以在插件层切换模型和声音。作为 Hermes 的插件与技能,它把语音输入输出变成 Agent 可调用的标准能力,适合构建语音对话、语音播报、语音指令等交互形态。项目用 Python 实现,目前处于早期阶段,星标约 194,社区规模较小,但方向明确:为智能体补齐语音这条关键交互通道。

开源 unknown 语音识别
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 194
维护状态 活跃
是否开源
定价模式 unknown

项目数据

分类语音识别
开发团队allmodels-io
所属国家
定价模式unknown
价格说明开源插件,定价信息待确认
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型allmodels,cartesia,elevenlabs,fish-audio,hermes-agent,hermes-plugin,hermes-skill,openai-compatible,python,soniox,speech-recognition,speech-synthesis,speech-to-text,streaming-tts,stt,text-to-speech,transcription,tts,voice-ai,voice-assistant
GitHub 星标★ 194
30天Star增速
HF 下载量
上线时间2026-08-12 00:00:00
最近更新2026-09-21 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-24
浏览次数0

使用教程

核心亮点

  • 同时覆盖 TTS 与 STT,一个插件补齐语音输入输出两端
  • 通过 AllModels 统一抽象,已适配 Cartesia、ElevenLabs、Fish Audio、Soniox 及 OpenAI 兼容接口,切换供应商成本低
  • 以 Hermes 插件/技能形式集成,Agent 可直接调用,无需自行封装语音调用链路

不足之处

  • 项目处于早期,星标约 194,生态与文档完善度有待观察
  • 依赖多家第三方语音服务,实际使用需自行准备对应 API 密钥与额度

适用场景

  • 为 Hermes Agent 增加语音对话能力,实现语音提问与语音回答
  • 把 Agent 生成的文本结果用多种音色朗读出来,用于播报或陪伴场景
  • 接入 Soniox 等 STT 服务,将会议或语音指令转成文本交给 Agent 处理

替代项目

pipecat、LiveKit Agents、openai-realtime-api

项目介绍

hermes-speech 是语音识别领域的开源项目,由 allmodels-io 开发,是 2026 年新上线的项目。

它收录于语音识别分类,该分类目前共有 212 个项目,GitHub 星标数为 194。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-21。开源插件。

它主要面向的使用场景是:为HermesAgent增加语音对话能力,实现语音提问与语音回答。同类可对比的替代方案包括 pipecat、LiveKit Agents、openai-realtime-api。

上一篇:open-wispr

下一篇:awesome-voice-typing

同类项目推荐

obs-localvocal 开源

直播录屏时,本地AI实时生成字幕,保护隐私零延迟

OBS plugin for local speech recognition and captioning using AI

★ 1616 2026-09-10
LiveCaptions-Translator 开源

实时捕获系统音频,一键翻译成你懂的语言

Lightweight and powerful real-time audio/speech translation tool based on Windows Li···

★ 3755 2026-08-10
speechbrain 开源

一站式 PyTorch 语音工具箱,快速搞定识别、说话人验证等任务

A PyTorch-based Speech Toolkit

★ 11834 2026-08-26
whisper-diarization 开源

给语音转写加上说话人标签,会议记录一目了然

Automatic Speech Recognition with Speaker Diarization based on OpenAI Whisper

★ 5657 2026-08-13