ebook2audiobook

一键把电子书变成有声书,支持千种语言和声音克隆

ebook2audiobook 是一个将电子书自动转换为有声书的开源工具,支持 EPUB、PDF 等格式,内置 1158 多种语言和声音克隆功能。它解决了传统有声书制作成本高、周期长的问题,让用户能快速生成自然流畅的听书内容。核心能力包括:文本提取与清洗、多语言 TTS 合成、声音克隆(模仿特定音色)、章节分割与音频拼接,并提供 Gradio 网页界面和 Docker 部署方式,方便非技术用户使用。项目基于 Python 开发,兼容 Linux、macOS 和 Windows,支持在 Colab 或 Kaggle 上运行,适合个人听书、语言学习、内容创作者等场景。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 20212
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队DrewThomasson
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费自部署使用,无在线服务。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型audiobook,audiobooks,chinese,colab-notebook,docker,english,epub,gradio,kaggle,linux,mac,multilingual,tts,voice-cloning,windows,xtts
GitHub 星标★ 20212
30天Star增速
HF 下载量
上线时间2024-01-22 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:入门 约 20 分钟 部署方式:Docker 7 步

环境要求

  • 安装 Docker(GPU 加速需 NVIDIA 驱动并支持 --gpus all)
  • 操作系统为 Linux / macOS / Windows
  • 准备非 DRM 的合法电子书文件(EPUB、PDF 等)
  • 首次运行需下载模型,预留足够磁盘空间与时间

安装与启动步骤

  1. 1克隆项目仓库

    把项目下载到本地,并进入项目根目录,后续所有脚本都在此目录执行。

    git clone https://github.com/DrewThomasson/ebook2audiobook.git
    cd ebook2audiobook
  2. 2构建容器镜像

    用项目自带脚本构建镜像。Windows 把命令换成 ebook2audiobook.cmd,Compose 方式加 --docker_mode compose。

    ./ebook2audiobook.command --script_mode build_docker
  3. 3启动 GUI 容器

    挂载电子书、音频、模型、声音和临时目录,映射 7860 端口,启动 CPU 版 Gradio 界面。

    docker run -v "./ebooks:/app/ebooks" -v "./audiobooks:/app/audiobooks" -v "./models:/app/models" -v "./voices:/app/voices" -v "./tmp:/app/tmp" --rm -it -p 7860:7860 athomasson2/ebook2audiobook:cpu
  4. 4GPU 加速启动

    有 NVIDIA 显卡时加 --gpus all,镜像标签按驱动选择 cu118/cu122/cu124/cu126 等。

    docker run -v "./ebooks:/app/ebooks" -v "./audiobooks:/app/audiobooks" -v "./models:/app/models" -v "./voices:/app/voices" -v "./tmp:/app/tmp" --gpus all --rm -it -p 7860:7860 athomasson2/ebook2audiobook:cu126
  5. 5Compose 方式启动

    用 docker compose 拉起 GUI,DEVICE_TAG 指定设备标签,需在项目目录内执行。

    DEVICE_TAG=cu128 docker compose --profile gpu up --no-log-prefix
  6. 6无头模式转换

    不打开网页,直接指定容器内电子书路径批量转换,音频写入挂载的 audiobooks 目录。

    docker run -v "./ebooks:/app/ebooks" -v "./audiobooks:/app/audiobooks" -v "./models:/app/models" -v "./voices:/app/voices" -v "./tmp:/app/tmp" --rm -it -p 7860:7860 ebook2audiobook:cpu --headless --ebook "/app/ebooks/myfile.pdf" --language eng
  7. 7本地命令行运行

    Linux/macOS 用 .command 脚本、Windows 用 .cmd 脚本直接调用,参数含义与容器内一致。

    ./ebook2audiobook.command --headless --ebook ./ebooks/myfile.epub --voice ./voices/myvoice.mp3 --language eng

关键配置

配置项必填说明示例
--ebook是电子书文件路径,本地脚本用相对路径,容器内用 /app 下路径/app/ebooks/myfile.pdf
--voice否声音克隆参考音频路径,不填则使用默认音色/app/voices/myvoice.mp3
--language否语言代码,支持 ISO-639-3 三字母及 ISO-639-1 两字母,默认 engeng
--headless否启用无界面命令行模式,直接转换并输出音频文件--headless
--script_mode否脚本运行模式,build_docker 表示构建容器镜像build_docker
DEVICE_TAG否compose 启动时选择设备镜像标签,如 cu128、cpu、rocmcu128

如何确认成功

浏览器打开 http://localhost:7860 能看到 Gradio 网页界面即为启动成功;无头模式的音频文件会出现在挂载的 audiobooks 目录。

常见问题

Q:没有 NVIDIA 显卡能跑吗?

A:可以,使用 athomasson2/ebook2audiobook:cpu 镜像即可。README 说明 Docker 中不暴露 MPS,Apple 芯片也只能用 CPU。

Q:--language 应该怎么填?

A:填 ISO-639-3 三字母代码,如 eng(英语)、ita(意大利语)、deu(德语),也支持 ISO-639-1 两字母;不填默认 eng。

Q:--voice 是必填的吗?

A:不是,该参数为可选。不提供声音克隆文件时,会使用项目自带的默认音色生成音频。

Q:CUDA 镜像标签怎么选?

A:镜像标签形式为 cu118、cu122、cu124、cu126 等,需要与本机 NVIDIA 驱动和 CUDA 环境匹配,否则容器无法使用 GPU。

Q:用 docker compose 还是手动 docker run?

A:两者都可以。compose 方式用 DEVICE_TAG 选择设备并加 --profile gpu,手动方式则自行挂载目录并加 --gpus all。

注意事项

  • 本工具仅用于非 DRM、合法获得的电子书,请勿用于侵权用途。
  • Docker 环境不支持 MPS,macOS 只能使用 CPU 镜像。
  • 首次运行会下载 TTS 模型,耗时较长且占用较多磁盘空间。
  • 运行时务必在项目目录下执行,否则 ./ebooks、./audiobooks 等挂载目录可能不存在。

核心亮点

  • 支持 1158+ 种语言,覆盖全球主要语种,包括中文、英文等
  • 集成声音克隆,可生成特定人声的听书音频
  • 提供 Gradio 界面和 Docker 部署,上手简单,支持本地或云端运行

不足之处

  • 长文本合成时可能产生音频不一致或停顿问题
  • 声音克隆效果依赖输入样本质量,低质量样本效果一般
  • 文档/社区待观察

适用场景

  • 个人将电子书转为有声书,通勤或睡前听书
  • 语言学习者生成多语言朗读材料,辅助听力练习
  • 内容创作者快速生成有声内容,用于播客或视频

替代项目

Coqui TTS、Piper、AudioBookConverter

项目介绍

ebook2audiobook 是音频音乐领域的开源项目,由 DrewThomasson 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(20,212)位列前 3%,在音频音乐分类的 738 个项目里位列前 2%。

近 41 天,它的 GitHub 星标从 19,671 增加到 20,212,净增 541。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。Apache-2.0许可证,可免费自部署使用,无在线服务。

它主要面向的使用场景是:个人将电子书转为有声书,通勤或睡前听书。同类可对比的替代方案包括 Coqui TTS、Piper、AudioBookConverter。

上一篇:LA-Studio

下一篇:Bert-VITS2

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09