vox-box 是音频音乐领域的开源项目,由 gpustack 开发,2024 年首次发布。
它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 217。
项目仍在小幅维护中,最近一次代码更新于 2026-08-25。Apache-2.0 许可证,可自行部署,完全免费。
它主要面向的使用场景是:快速为现有OpenAI应用添加语音交互能力。同类可对比的替代方案包括 OpenAI TTS/Whisper API、Coqui TTS、faster-whisper。

一键部署 OpenAI 兼容语音服务,自由切换 TTS/STT 引擎
vox-box 是一个兼容 OpenAI API 的语音服务端,提供文本转语音(TTS)和语音转文本(STT)能力。它解决了语音应用开发中多模型集成和 API 标准化的问题,支持 Whisper、FunASR、Bark、CosyVoice 等多种后端,开发者可以无缝切换或组合使用。核心能力包括:通过 OpenAI 格式的 API 接口调用语音功能,降低接入成本;支持流式输出和批量处理;提供简单的配置方式管理不同模型。项目基于 Python 构建,适合快速搭建语音服务,但当前处于早期阶段,功能完整性和稳定性有待完善。
OpenAI TTS/Whisper API、Coqui TTS、faster-whisper
vox-box 是音频音乐领域的开源项目,由 gpustack 开发,2024 年首次发布。
它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 217。
项目仍在小幅维护中,最近一次代码更新于 2026-08-25。Apache-2.0 许可证,可自行部署,完全免费。
它主要面向的使用场景是:快速为现有OpenAI应用添加语音交互能力。同类可对比的替代方案包括 OpenAI TTS/Whisper API、Coqui TTS、faster-whisper。
下一篇:UEAzSpeech
tango
开源
输入一句话,自动生成匹配的音频内容
A family of diffusion models for text-to-audio generation.
AuK
开源
一个模型搞定语音生成、编辑与分离
AuK: An Open-Source Foundational Model for Speech Generation and Editing
swift-tts
开源
Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine
A straightforward package containing version for Swift modern concurrency, Point-Fre···
ai-dj
开源
现场演出中实时用 AI 生成音乐,保持人类掌控
AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···