audiblez

把电子书一键变成有声书,通勤路上用耳朵读书

audiblez 是一个将电子书转换为有声书的开源工具,主要解决用户希望“听书”而非“看书”的需求。它支持 EPUB 格式的电子书输入,利用 Kokoro 等 TTS(文本转语音)引擎生成自然流畅的语音,并输出为音频文件。项目采用 Python 编写,核心能力包括自动解析电子书内容、分章节处理、调用 TTS 引擎合成语音,以及生成最终的有声书文件。用户可以通过简单的命令行操作,将整本电子书转换为可离线收听的音频,适合通勤、运动等场景。该项目目前处于成长阶段,GitHub 星标已超 8000,社区活跃度较高。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 8650
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队santinic
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型audiobooks,epub,kokoro,python,tts
GitHub 星标★ 8650
30天Star增速
HF 下载量
上线时间2025-01-14 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:入门 约 10 分钟 部署方式:命令行工具 6 步

环境要求

  • Python 3 环境
  • 系统需安装 ffmpeg(用于合成 .m4b 文件)
  • 系统需安装 espeak-ng(语音合成依赖)
  • 运行 GUI 需额外安装 pillow、wxpython,Ubuntu/Debian 还需 libgtk-3-dev

安装与启动步骤

  1. 1安装系统依赖

    先装 ffmpeg 和 espeak-ng,ffmpeg 缺失时不会生成最终 .m4b 文件。Ubuntu/Debian 用 apt,Mac 用 brew,二选一执行。

    sudo apt install ffmpeg espeak-ng
  2. 2Mac 安装依赖

    Mac 用户改用 Homebrew 安装 ffmpeg 与 espeak-ng,然后同样用 pip 安装 audiblez。

    brew install ffmpeg espeak-ng
  3. 3安装 audiblez

    有 Python 3 即可用 pip 安装,安装完成后命令行会出现 audiblez 命令。

    pip install audiblez
  4. 4转换电子书为有声书

    把 epub 路径换成你的书,-v 指定语音音色。过程会先生成按章节的 wav,最后合成 m4b。

    audiblez book.epub -v af_sky
  5. 5GPU 加速转换

    默认走 CPU,加 --cuda 让 Torch 尝试使用 CUDA 设备,速度显著提升;需自行按 PyTorch 官网安装对应版本。

    audiblez book.epub -v af_sky --cuda
  6. 6安装并启动 GUI

    需要图形界面时额外安装 pillow 与 wxpython,Ubuntu/Debian 还要装 libgtk-3-dev,之后运行 audiblez-ui。

    pip install audiblez pillow wxpython
    audiblez-ui

关键配置

配置项必填说明示例
-v是指定语音音色,决定朗读声音af_sky
--cuda否启用 CUDA GPU 加速,默认使用 CPU--cuda

如何确认成功

运行结束后当前目录生成 book.m4b,可用 VLC 或任意有声书播放器播放,即表示成功。

常见问题

Q:为什么只生成了 wav,没有 .m4b 文件?

A:只有在系统已安装 ffmpeg 时才会在最后合成 .m4b。请先按对应平台安装 ffmpeg 再重新运行。

Q:Windows 上怎么安装?

A:建议建目录后用 venv 隔离:mkdir audiblez、cd audiblez、python -m venv venv、. envScriptsActivate.ps1、pip install audiblez pillow wxpython,然后运行 audiblez 或 audiblez-ui。

Q:转换速度有多快?

A:Colab T4 GPU(CUDA)约 600 字符/秒,约 5 分钟可转完 16 万字符的书;M2 MacBook Pro 的 CPU 约 60 字符/秒,需约 1 小时。

Q:支持哪些语言和平台?

A:支持美/英/西/法/印/意/日/葡/中九种语言;目前不支持 Apple Silicon 的 MLX 加速,因为尚无对应 Kokoro 实现。

注意事项

  • 转换过程会先在当前目录生成 book_chapter_1.wav 等分章节文件,请预留足够磁盘空间。
  • GUI 依赖仅在需要图形界面时安装,纯命令行用法不需要 wxpython 和 libgtk-3-dev。
  • Windows 使用 CUDA 需按 PyTorch 官网说明单独安装对应版本的 Pytorch。
  • 若使用 venv,请先激活虚拟环境再执行 pip install 和 audiblez 命令。

核心亮点

  • 支持 EPUB 格式,直接转换常见电子书,无需复杂预处理
  • 集成 Kokoro TTS,语音自然度优于老旧机械音
  • 命令行操作简单,自动化程度高,适合批量转换

不足之处

  • 仅支持 EPUB,其他格式(如 PDF、MOBI)需先转换
  • 依赖外部 TTS 服务或模型,离线使用需额外配置
  • 文档/社区待观察

适用场景

  • 通勤或运动时听书,替代眼睛阅读
  • 为视力障碍用户提供电子书音频版本
  • 批量转换个人藏书,建立个人有声书库

替代项目

Coqui TTS、Edge TTS、Balabolka

项目介绍

audiblez 是音频音乐领域的开源项目,由 santinic 开发,2025 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(8,650)位列前 6%,在音频音乐分类的 738 个项目里位列前 4%。

近 41 天,它的 GitHub 星标从 8,400 增加到 8,650,净增 250。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:通勤或运动时听书,替代眼睛阅读。同类可对比的替代方案包括 Coqui TTS、Edge TTS、Balabolka。

上一篇:Real-Time-Voice-Cloning

下一篇:VibeVoiceFusion

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09