
supertonic
离线秒级生成多语言语音,隐私安全不卡顿
supertonic 是一个超快速、完全离线的多语言文本转语音(TTS)引擎,基于 ONNX Runtime 原生运行,无需云端依赖。它解决了传统 TTS 服务延迟高、隐私风险大、网络依赖强的问题,核心能力包括:支持多种语言(如英语、中文等)的高质量语音合成;提供极低的推理延迟,适合实时交互场景;模型轻量化,可部署在移动设备和边缘设备上;提供 Swift、Python、C++、Rust、Java、Go、Flutter、Node.js 等多种语言的 SDK,方便集成到不同技术栈的应用中。项目架构清晰,底层使用 ONNX 模型,兼容性强,易于自定义和扩展。
项目数据
使用教程
环境要求
- Python 3.11(示例要求在虚拟环境中使用)
- 已安装 git,能访问 GitHub 与 Hugging Face
- Go 示例需安装 ONNX Runtime C 库(macOS:brew install onnxruntime)
- Java 示例需 JDK 而非 JRE(macOS:brew install openjdk@17)
- C# 示例面向 .NET 9;iOS 示例需 macOS 与 Xcode、xcodegen
安装与启动步骤
-
1克隆源码仓库
从存档组织 supertone-oss-archive 克隆源码,该仓库已归档,仅供参考使用。
git clone https://github.com/supertone-oss-archive/supertonic.git cd supertonic -
2创建虚拟环境
README 要求使用 Python 3.11,在仓库目录下建立独立虚拟环境。
python3.11 -m venv .venv -
3激活虚拟环境
Linux/macOS 用 source 激活;Windows 在 PowerShell 中执行另一条命令。
source .venv/bin/activate -
4安装下载工具
安装 huggingface_hub,用于从存档命名空间下载模型权重文件。
python -m pip install huggingface_hub -
5下载模型权重
从 supertone-oss-archive 的 Hugging Face 命名空间下载 Supertonic 3 权重;节选未给出具体下载命令,请对照官方 Quick Start 执行。
-
6运行语言示例
运行前需先从仓库根目录下载好 assets/ 目录,语言示例读取本地文件;以 Node.js 为例。
cd nodejs npm install npm start
如何确认成功
README 未给出明确成功标志;示例运行结束后应输出合成语音结果,且能读取本地 assets/ 模型文件。
常见问题
Q:仓库已归档,还能正常使用吗?
A:可以。代码与模型权重仍按各自 LICENSE 提供,但不再有更新、bug 修复、安全补丁或官方支持。
Q:需要登录 Hugging Face 或使用 Supertone 服务吗?
A:不需要。模型从 supertone-oss-archive 命名空间直接下载,无需 Hugging Face 登录、托管 Demo 或原始 Supertone 服务。
Q:示例运行时报错找不到模型文件?
A:需先从仓库根目录下载完整的 assets/ 目录,各语言示例都读取这些本地文件。
Q:macOS 上 Go 或 Java 示例缺少依赖怎么办?
A:Go 需安装 ONNX Runtime C 库,执行 brew install onnxruntime;Java 需 JDK,执行 brew install openjdk@17。
注意事项
- 仓库已归档,官方不再处理 issue 与 pull request,也无安全补丁。
- 模型权重分为 Supertonic 1/2/3,均托管在 supertone-oss-archive 的 Hugging Face 命名空间。
- 存档不包含托管 Demo 和 Voice Builder 服务。
- README 节选未给出模型下载的具体命令行参数,务必以官方 Quick Start 原文为准。
核心亮点
- 原生 ONNX 推理,延迟极低,响应速度远超云端 TTS
- 完全离线运行,数据不出设备,隐私保护到位
- 覆盖 Swift、Python、C++ 等 10+ 语言 SDK,集成门槛低
不足之处
- 文档/社区待观察
- 模型体积和音质可能不如大型云端方案
适用场景
- 移动 App 的离线语音助手或无障碍播报
- IoT 设备本地语音交互,无需联网
- 跨平台桌面应用的多语言内容朗读
替代项目
Coqui TTS、Piper、Sherpa-ONNX
项目介绍
同类项目推荐
tango
开源
输入一句话,自动生成匹配的音频内容
A family of diffusion models for text-to-audio generation.
swift-tts
开源
Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine
A straightforward package containing version for Swift modern concurrency, Point-Fre···
ai-dj
开源
现场演出中实时用 AI 生成音乐,保持人类掌控
AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···
AuK
开源
一个模型搞定语音生成、编辑与分离
AuK: An Open-Source Foundational Model for Speech Generation and Editing