supertonic

手机上秒级生成多语言语音,离线也能用

supertonic 是一个极速的端侧多语言文本转语音(TTS)引擎,基于 ONNX Runtime 原生运行,支持 iOS、Flutter、Node.js、Python、Rust 等多种语言和平台。它解决了传统云端 TTS 依赖网络、延迟高、隐私风险大的问题,将语音合成能力完全本地化,实现毫秒级响应。核心能力包括多语言支持、轻量级模型、跨平台部署,以及通过 ONNX 优化带来的高性能推理。项目采用 Swift 为主力语言,同时提供多语言绑定,适合移动端和嵌入式场景。无论是离线导航、无障碍阅读,还是智能语音助手,supertonic 都能提供流畅自然的语音输出,且无需上传数据,保障用户隐私。

开源 unknown 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 13789
维护状态 较活跃
是否开源 是
定价模式 unknown

项目数据

分类音频音乐
开发团队supertone-oss-archive
所属国家
官网地址
定价模式unknown
价格说明提供在线Demo,但定价信息未明确,需进一步确认。
访问状态
是否开源是
开源协议MIT
主要语言Swift
技术栈/模型cpp,csharp,flutter,go,ios,java,lightweight,multilingual,nodejs,on-device,onnx,onnxruntime,python,rust,speech-synthesis,swift,text-to-speech,tts,web,webgpu
GitHub 星标★ 13789
30天Star增速
HF 下载量
上线时间2025-11-18 00:00:00
最近更新2026-09-22 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数7

使用教程

难度:进阶 约 20 分钟 部署方式:库/依赖 7 步

环境要求

  • Python 3.11(需在虚拟环境中使用)
  • 可访问 GitHub 与 Hugging Face 的网络
  • 按所选语言准备原生运行时:Go 需 ONNX Runtime C 库、Java 需 JDK 17、C# 需 .NET 9
  • Node.js / Rust / Swift / Xcode 等对应语言工具链(仅运行相应用例时需要)

安装与启动步骤

  1. 1克隆归档仓库

    原仓库已归档,必须从 supertone-oss-archive 组织克隆,README 给出的地址如下,克隆后进入项目目录。

    git clone https://github.com/supertone-oss-archive/supertonic.git
    cd supertonic
  2. 2创建 Python 虚拟环境

    README 要求使用 Python 3.11,先创建虚拟环境 .venv,避免污染系统环境。

    python3.11 -m venv .venv
  3. 3激活虚拟环境

    macOS/Linux 用 source 激活;Windows 在 PowerShell 中改用 .venvScriptsActivate.ps1。

    source .venv/bin/activate
  4. 4安装模型下载工具

    README 指定使用 huggingface_hub 从归档命名空间下载模型文件。

    python -m pip install huggingface_hub
  5. 5下载模型权重到 assets

    README 未给出具体下载命令,仅说明需显式从 Hugging Face 归档命名空间(supertone-oss-archive 下的 supertonic-3/2/1)下载模型,并放到仓库根目录的 assets/ 下。

  6. 6运行语言示例

    README 提供了 Node.js、Browser、Java、C++、C#、Go、Swift、Rust、iOS 各自的运行命令,按需进入对应目录执行;语言示例读取本地的 assets/ 文件。

    cd nodejs
    npm install
    npm start
  7. 7安装原生依赖(可选)

    Go 需先装 ONNX Runtime C 库(macOS:brew install onnxruntime);Java 需 JDK 而非 JRE(macOS:brew install openjdk@17)。

    brew install onnxruntime
    brew install openjdk@17

如何确认成功

对应语言示例命令执行完毕且无报错,即表示本地推理链路(含 assets/ 模型文件)可用;README 未描述具体的启动成功日志。

常见问题

Q:仓库还能正常使用和维护吗?

A:仓库已归档,开发与支持已结束,不再提供更新、Bug 修复、安全补丁或技术支持,issue 与 PR 也不再被关注,代码按 LICENSE 条款“按原样”提供。

Q:模型权重从哪里下载?

A:使用 supertone-oss-archive 的 Hugging Face 命名空间:supertone-3、supertone-2、supertone-1 三个权重仓库,无需登录或使用原 Supertone 服务。

Q:需要 GPU 吗?

A:不需要。README 说明 Supertonic 3 在 CPU 上即可快速运行,开放权重的固定音色模式不依赖 GPU,便于本地、浏览器和边缘部署。

Q:Go 或 Java 示例报错怎么办?

A:先装原生运行时:Go 需要 ONNX Runtime C 库(macOS 用 brew install onnxruntime),Java 需要 JDK 而不是 JRE(macOS 用 brew install openjdk@17)。

Q:Windows 上怎么激活虚拟环境?

A:在 PowerShell 中执行 .venvScriptsActivate.ps1,而不是 README 中给的 source .venv/bin/activate。

注意事项

  • 该仓库已归档,仅作参考用途,不建议用于依赖长期维护的生产环境。
  • 不提供托管 Demo 与 Voice Builder 服务,示例必须显式下载模型文件后本地运行。
  • 本教程使用 Supertonic 3,README 的所有命令均以该版本为例。
  • 代码与模型权重各自遵循不同的 LICENSE,使用前请分别确认。

核心亮点

  • 基于 ONNX Runtime,推理速度快,端侧延迟低
  • 支持多语言和多种编程语言绑定,集成灵活
  • 完全本地运行,保护隐私且无需网络连接

不足之处

  • 文档/社区待观察
  • 模型体积和音质可能不如云端大模型

适用场景

  • 移动端离线语音助手
  • 无障碍阅读(为视障用户朗读文本)
  • 车载或嵌入式设备语音播报

替代项目

Coqui TTS、Mozilla TTS、Sherpa-ONNX

项目介绍

supertonic 是音频音乐领域的开源项目,由 supertone-oss-archive 开发,2025 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(13,789)位列前 4%,在音频音乐分类的 738 个项目里位列前 2%。

近 41 天,它的 GitHub 星标从 13,664 增加到 13,789,净增 125。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-22。提供在线Demo,但定价信息未明确,需进一步确认。从国内网络环境看,可用性暂无实测数据。

它主要面向的使用场景是:移动端离线语音助手。同类可对比的替代方案包括 Coqui TTS、Mozilla TTS、Sherpa-ONNX。

上一篇:index-tts

下一篇:voice-pro

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09