kokoro-onnx

轻量级 ONNX 加速,让 TTS 在 CPU 上实时发声

kokoro-onnx 是一个基于 ONNX Runtime 的轻量级文本转语音(TTS)工具,旨在将 Kokoro 模型高效地部署到生产环境。它解决了传统 TTS 模型依赖重型深度学习框架、部署复杂、推理速度慢的问题,通过将模型转换为 ONNX 格式,实现了跨平台、高性能的语音合成。核心能力包括:支持多种语言(如英语、日语、中文等)、提供简单的 Python API 和命令行接口、支持流式输出、可自定义说话人音色,并且模型文件小、推理速度快,适合在 CPU 上实时运行。该项目特别适合需要离线或边缘设备上运行 TTS 的场景。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2739
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类音频音乐
开发团队thewh1teagle
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型kokoro,onnxruntime,python,tts
GitHub 星标★ 2739
30天Star增速
HF 下载量
上线时间2025-01-03 00:00:00
最近更新2026-09-23 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数7

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 6 步

环境要求

  • Python 3.12(README 的 uv 示例使用 -p 3.12)
  • 推荐先安装 uv 用于隔离环境,也可直接用 pip
  • 需下载模型文件 kokoro-v1.0.onnx 与 voices-v1.0.bin
  • 模型体积约 300MB(量化版约 80MB),需预留磁盘空间

安装与启动步骤

  1. 1安装 kokoro-onnx

    最简方式是用 pip 直接安装并升级到最新版;也可跳过此步改用后面的 uv 流程。

    pip install -U kokoro-onnx
  2. 2安装 uv(推荐)

    uv 用于创建隔离的 Python 环境,官方推荐方式;已有 uv 可跳过。

    pip install uv
  3. 3新建项目并加依赖

    先新建一个项目文件夹,在该文件夹内初始化 Python 3.12 环境并添加依赖。

    uv init -p 3.12
    uv add kokoro-onnx soundfile
  4. 4写好示例脚本

    把仓库 examples/save.py 的内容完整粘贴到项目里的 hello.py,可按需修改其中的文本。

  5. 5下载模型与音色

    从 README 给出的 Release 链接下载 ONNX 模型和音色文件,放到与 hello.py 同一目录。

    curl -LO https://github.com/thewh1teagle/kokoro-onnx/releases/download/model-files-v1.1/kokoro-v1.0.onnx
    curl -LO https://github.com/thewh1teagle/kokoro-onnx/releases/download/model-files-v1.1/voices-v1.0.bin
  6. 6运行生成语音

    在项目目录执行脚本,程序读取同目录的模型与音色文件并合成语音。

    uv run hello.py

关键配置

配置项必填说明示例
kokoro-v1.0.onnxONNX 格式的 TTS 模型文件,必须与运行脚本放在同一目录kokoro-v1.0.onnx
voices-v1.0.bin说话人音色文件,必须与模型、脚本放在同一目录voices-v1.0.bin

如何确认成功

运行结束后,脚本同目录下会生成 audio.wav 音频文件,即为成功。

常见问题

Q:模型文件和脚本要放在哪里?

A:README 要求把 kokoro-v1.0.onnx 和 voices-v1.0.bin 下载后与 hello.py 放在同一个目录下。

Q:必须用 uv 吗?

A:不是。README 也给出 pip install -U kokoro-onnx,只是推荐用 uv 做隔离的 Python 3.12 环境。

Q:没有 GPU 能跑吗?

A:可以。README 强调模型轻量,在 macOS M1 上接近实时的性能,未要求 GPU。

Q:支持哪些语言和音色?

A:项目支持多语言并提供多种音色,最新的音色与语言列表见 Kokoro-82M 的 VOICES.md。

注意事项

  • 推荐用 uv 创建隔离环境,避免污染系统 Python
  • 音频输出默认写到 audio.wav,可在示例脚本中修改文本重新运行
  • 模型约 300MB,量化版本约 80MB,磁盘紧张时可选量化模型
  • 音色与语言的完整列表需查阅 Kokoro-82M 的 VOICES.md

核心亮点

  • 基于 ONNX Runtime,CPU 推理速度快,延迟低,适合实时合成
  • 模型体积小,支持多语言和多种音色,易于集成到现有 Python 项目
  • 提供简洁的 API 和 CLI,支持流式输出,上手门槛低

不足之处

  • 文档/社区待观察
  • 音质相比大型商用 TTS 可能略有不足,自定义音色能力有限

适用场景

  • 边缘设备或本地离线语音助手
  • 需要快速生成语音的自动化脚本或服务
  • 嵌入式或移动端应用中的语音播报

替代项目

Coqui TTS、Piper、MeloTTS

项目介绍

kokoro-onnx 是音频音乐领域的开源项目,由 thewh1teagle 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(2,739)位列前 30%,在音频音乐分类的 738 个项目里位列前 8%。

近 45 天,它的 GitHub 星标从 2,663 增加到 2,739,净增 76。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-23。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:边缘设备或本地离线语音助手。同类可对比的替代方案包括 Coqui TTS、Piper、MeloTTS。

上一篇:Unitale

下一篇:TTS-Mod-Vault

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 245 2026-08-09