alexandria-audiobook

一句话把小说变成多角色有声书,克隆声音、逐行控风格

Alexandria 是一个基于 AI 的多角色有声书生成器,解决传统 TTS 只能单一音色、缺乏情感和角色区分的问题。它利用 LLM 对书籍文本进行脚本标注,自动识别对话、旁白和角色,并通过 Qwen3-TTS 结合 LoRA 微调实现声音克隆和音色设计。用户可以为每个角色设定独特的音色、语速和情感风格,甚至支持逐行控制。项目提供 FastAPI 后端和 Pinokio 一键安装,输出格式包括 MP3、带章节的 M4B 以及 Audacity 多轨工程,方便后期编辑。核心能力涵盖多角色语音合成、声音克隆、LoRA 训练、细粒度风格控制,并集成 Audiobookshelf 等生态,适合制作有声书、播客或戏剧化内容。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1028
维护状态 维护中
是否开源
定价模式 free

项目数据

分类音频音乐
开发团队Finrandojin
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型ai,audiobook,audiobook-generator,audiobookshelf,chapter-markers,dialogue-generation,fastapi,lora,m4b,multi-voice,pinokio,python,qwen3-tts,speech-synthesis,text-to-speech,tts,voice-cloning,voice-design,voice-generation
GitHub 星标★ 1028
30天Star增速
HF 下载量
上线时间2026-02-03 00:00:00
最近更新2026-09-23 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 30 分钟 部署方式:Docker 6 步

环境要求

  • Docker(含 docker compose)
  • NVIDIA GPU 与 NVIDIA Container Toolkit
  • 已启动的 LLM 服务:LM Studio(http://localhost:1234/v1)、Ollama(http://localhost:11434/v1
  • 首次使用会下载 TTS 模型,需要留出磁盘空间与网络带宽

安装与启动步骤

  1. 1克隆项目仓库

    把 Alexandria 源码拉到本地,随后进入项目目录,所有后续命令都在该目录内执行。

    git clone https://github.com/Finrandojin/alexandria-audiobook.git
    cd alexandria-audiobook
  2. 2准备 LLM 服务

    Alexandria 自身不含 LLM,必须先用本地或云端 LLM 服务;用 Ollama 时可直接拉取 qwen3 模型并启动服务。

    ollama run qwen3
  3. 3启动 Docker 容器

    用 compose 构建并启动服务;需已装好 NVIDIA Container Toolkit,否则 GPU 不可用。

    docker compose up --build
  4. 4打开 Web 界面

    容器启动完成后,在浏览器访问本地面板,即可进入 Setup 标签页配置 LLM 与 TTS 连接。

  5. 5配置 LLM 与 TTS

    在 Setup 标签页填写 LLM 服务地址,选择 TTS 模式(local 内置引擎或 external Gradio 服务)和设备。

  6. 6生成脚本并导出

    按 5 步核心流水线先生成脚本,再渲染语音,最后导出 MP3、M4B 或 Audacity 多轨工程。

关键配置

配置项必填说明示例
LLM 服务地址Alexandria 通过该 API 连接 LLM 做脚本标注http://localhost:1234/v1
TTS Modelocal 使用内置引擎,external 连接外部 Gradio 服务local
Device推理设备,auto 为推荐值,也可指定 cuda / cpu / mpsauto
Language语音合成语言,默认 English,可选 Chinese 或 Auto 自动检测Auto
Parallel Workers批渲染并发数,数值越高占用显存越多4
Batch Seed固定随机种子以保证批量输出可复现,留空则随机12345

如何确认成功

浏览器打开 http://localhost:4200 能正常显示 Web 界面,并在 Setup 页成功连接 LLM 与 TTS。

常见问题

Q:点击“Generate Script”时报错怎么办?

A:多半是 LLM 服务没启动或地址填错。先用表格中的默认 URL 确认 LM Studio / Ollama / OpenAI 可访问,再在 Pinokio 或 Docker 终端查看详细错误。

Q:没有 NVIDIA GPU 能跑吗?

A:可以改用 README 中的 Option B:在 Google Colab 免费 T4 GPU 上运行,无需本地安装,但需要一个免费 ngrok 账号做 Web UI 隧道。

Q:首次生成很慢是正常的吗?

A:正常。TTS 模型会在首次使用时下载并缓存在 Docker 卷中,之后启动会快很多;开启 Compile Codec 还会增加约 30-60 秒预热。

Q:上传的文件和训练的 LoRA 会丢吗?

A:不会。上传数据、音色配置、训练好的 LoRA 适配器和音频输出通过 bind mounts 持久化到项目目录。

注意事项

  • Docker 部署必须安装 NVIDIA Container Toolkit,否则容器无法使用 GPU。
  • 用户数据通过 bind mount 保存在项目目录,迁移或备份时记得连同该目录一起处理。
  • README 建议提问前先通读 README 与官方 Wiki,多数常见问题已有答案。
  • README 未给出 Pinokio 与 Colab 的详细步骤,可按仓库内对应说明文件操作。

核心亮点

  • 支持逐行指定角色和情感,生成效果接近真人配音
  • 内置 LoRA 训练,可用少量样本克隆个人音色
  • 输出格式丰富,直接生成带章节的 M4B 和 Audacity 多轨工程

不足之处

  • 早期项目,文档和社区支持待观察
  • 依赖 Qwen3-TTS,对中文以外的语言支持可能有限

适用场景

  • 将长篇小说快速转化为多角色有声书
  • 播客或戏剧内容制作,需要多音色配音
  • 个人创作者克隆自己的声音生成个性化音频

替代项目

Coqui TTS、ElevenLabs、Mimic3

项目介绍

alexandria-audiobook 是音频音乐领域的开源项目,由 Finrandojin 开发,是 2026 年新上线的项目。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,028)位列前 30%,在音频音乐分类中处于中上游。

近 45 天,它的 GitHub 星标从 858 增加到 1,028,净增 170。

项目仍在小幅维护中,最近一次代码更新于 2026-09-23。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:将长篇小说快速转化为多角色有声书。同类可对比的替代方案包括 Coqui TTS、ElevenLabs、Mimic3。

上一篇:bark.cpp

下一篇:Multilingual_Text_to_Speech

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 245 2026-08-09