kokoro-tts

命令行一键把电子书和PDF变成有声书

kokoro-tts 是一个基于 Kokoro 模型的命令行文本转语音工具,主要解决用户快速将文本、电子书(EPUB)和 PDF 文档转换为高质量语音的需求。它支持多语言、多音色,并能对音色进行混合,以生成更自然的语音输出。核心能力包括:通过简单的命令行操作,将 EPUB 和 PDF 直接转为有声书(audiobook)或播客(podcast)格式;支持自定义语音参数,如语速、音调等;提供批量处理功能,适合处理大量文档。该工具以 Python 编写,易于安装和集成到自动化流程中,适合个人创作者、播客制作者和有阅读障碍的用户。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1892
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队nazdridoy
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型audiobook,epub,kokoro,kokoro-tts,pdf,podcast,python,tts
GitHub 星标★ 1892
30天Star增速
HF 下载量
上线时间2025-01-14 00:00:00
最近更新2026-09-23 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:入门 约 10 分钟 部署方式:命令行工具 7 步

环境要求

  • Python 3.11-3.12(不支持 Python 3.13 及以上)
  • pip 或 uv(README 推荐 uv)
  • 如需从源码安装,需已安装 git
  • 可选:GPU 环境以获得加速(README 提到支持 GPU)

安装与启动步骤

  1. 1确认 Python 版本

    先检查本机 Python 版本,必须为 3.11 或 3.12,3.13+ 当前不被支持。

    python --version
  2. 2从 PyPI 安装

    README 推荐的方式,使用 uv 或 pip 全局安装 kokoro-tts,二选一执行即可。

    uv tool install kokoro-tts
    pip install kokoro-tts
  3. 3验证命令可用

    安装后运行帮助命令,能正常打印用法说明即安装成功。

    kokoro-tts --help
  4. 4源码克隆安装

    不想用 PyPI 时,克隆仓库后进入目录,用 uv 创建虚拟环境并以可编辑模式安装。

    git clone https://github.com/nazdridoy/kokoro-tts.git
    cd kokoro-tts
    uv venv
    uv pip install -e .
  5. 5pip 方式本地安装

    没有 uv 时,用 Python 自带 venv 建环境并安装;Windows 激活命令见 README 注释。

    python -m venv .venv
    source .venv/bin/activate
    pip install -e .
  6. 6不安装直接运行

    只装依赖不安装包,然后用 uv run -m kokoro_tts 或 python -m kokoro_tts 运行。

    python -m venv .venv
    source .venv/bin/activate
    pip install -r requirements.txt
  7. 7文本转语音

    把文本文件转为音频,可指定语速、语言和音色。本地安装方式需用 uv run kokoro-tts 或先激活虚拟环境。

    kokoro-tts input.txt output.wav --speed 1.2 --lang en-us --voice af_sarah

关键配置

配置项必填说明示例
--speed否调节语音语速,数值越大越快1.2
--lang否指定语音语言代码en-us
--voice否指定发音音色,支持音色混合af_sarah

如何确认成功

运行 kokoro-tts --help 能正常输出帮助信息,即表示安装成功。

常见问题

Q:Python 3.13 可以安装吗?

A:不可以。README 明确说明当前仅支持 Python 3.11-3.12,3.13+ 暂不支持,请切换到 3.11 或 3.12 环境。

Q:本地安装后提示找不到 kokoro-tts 命令?

A:README 说明本地安装(Method 3)需使用 uv run kokoro-tts,或先激活虚拟环境后再运行;未安装方式(Method 4)用 uv run -m kokoro_tts 或 python -m kokoro_tts。

Q:支持哪些输入格式?

A:支持 TXT、EPUB、PDF 文件,也支持标准输入和管道输入;可输出 WAV 与 MP3,并可按章节拆分或合并。

Q:uv 和 pip 选哪个?

A:README 推荐使用 uv,安装更快;若本机没有 uv,用 pip 或 python -m venv 加 pip 的方式同样可以完成安装。

注意事项

  • README 中 Method 2(从 Git 安装)的命令正文被截断,此处未还原,请以官方仓库最新说明为准。
  • 完整命令行参数(如音色混合、章节拆分、MP3 输出等)未在节选中列出,请用 kokoro-tts --help 查看实际参数。
  • Windows 激活虚拟环境请用 .venvScriptsctivate,而非 source 命令。
  • 运行时可能需要下载模型权重,首次执行会耗时并有网络要求。

核心亮点

  • 直接支持 EPUB 和 PDF 输入,免去文本预处理步骤
  • 音色混合功能可生成独特声音,提升听感
  • 多语言支持,适合国际化内容创作

不足之处

  • 依赖 Kokoro 模型,模型体积较大,首次下载耗时
  • 命令行界面,对非技术用户不友好
  • 文档/社区待观察

适用场景

  • 将长篇小说或教材转为有声书,方便通勤时听
  • 把 PDF 论文或报告转成语音,辅助视力障碍者阅读
  • 快速生成多语言播客内容,节省录音成本

替代项目

edge-tts、piper-tts、Coqui TTS

项目介绍

kokoro-tts 是音频音乐领域的开源项目,由 nazdridoy 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,892)位列前 30%,在音频音乐分类的 738 个项目里位列前 11%。

近 45 天,它的 GitHub 星标从 1,772 增加到 1,892,净增 120。

项目仍在小幅维护中,最近一次代码更新于 2026-09-23。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:将长篇小说或教材转为有声书,方便通勤时听。同类可对比的替代方案包括 edge-tts、piper-tts、Coqui TTS。

上一篇:GLM-TTS

下一篇:ultimate-rvc

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09