Kokoro-FastAPI

一键部署本地TTS,跨平台多语言语音合成,兼容OpenAI接口

Kokoro-FastAPI 是一个将 Kokoro-82M 文本转语音模型封装成 Dockerized FastAPI 服务的开源项目,旨在为开发者提供跨平台(CPU、AMD、NVIDIA GPU)的 TTS 解决方案。它解决了本地部署 TTS 模型时环境配置复杂、硬件兼容性差的问题,通过 Docker 容器化实现一键部署。核心能力包括:支持多语言语音合成、语音混合(voice-mixing)、自动拼接长文本(auto-stitching)、生成带字幕的时间戳(captioned timestamps),并提供 OpenAI 兼容的 API 接口,可无缝集成到 OpenWebUI、SillyTavern 等应用中。项目基于 PyTorch,强调易用性和可扩展性,适合需要高质量语音合成的开发者和内容创作者。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 5472
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队remsky
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0 许可证,可自行部署使用,完全免费。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型fastapi,kokoro,kokoro-82m,kokoro-tts,multi-speaker-tts,mutilingual-audio,openai-compatible-api,openwebui,pytorch,read-along,sillytavern,ssml,text-to-speech,tts,tts-api,tts-captions,tts-generation,voice-clone-tool
GitHub 星标★ 5472
30天Star增速
HF 下载量
上线时间2024-12-30 00:00:00
最近更新2026-09-22 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:入门 约 10 分钟 部署方式:Docker 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Docker 环境(CPU 或 NVIDIA CUDA 镜像支持 linux/amd64 与 linux/arm64)
  • AMD GPU 需 ROCm 环境,仅 linux/amd64,且为实验性支持
  • Apple Silicon(MPS)需通过 UV 直接运行,不使用 Docker 镜像
  • 可访问 GitHub 与 Hugging Face(模型为 Kokoro-82M)

安装与启动步骤

  1. 1克隆项目仓库

    从 GitHub 拉取源码,后续 Docker 构建或 UV 运行都基于该目录,请确认磁盘空间充足。

    git clone https://github.com/remsky/Kokoro-FastAPI.git
    cd Kokoro-FastAPI
  2. 2按硬件选择镜像

    CPU 与 NVIDIA GPU 使用官方预构建镜像(含 amd64、arm64);AMD GPU 用 ROCm 镜像,仅 amd64 且为实验性。

  3. 3启动 Docker 服务

    README 只说明提供预构建多平台镜像,未给出具体 docker run 命令与端口,请以仓库 README 现有说明为准,不要自行猜测参数。

  4. 4Apple Silicon 运行

    M 系列芯片可直接用 UV 运行项目,无需 Docker 镜像,具体命令见仓库说明。

  5. 5接入 OpenAI 接口

    服务提供 OpenAI 兼容的 Speech 接口,可将地址填入 OpenWebUI、Home Assistant 等已兼容该项目的前端使用。

如何确认成功

按仓库说明启动后,用 OpenAI 兼容客户端或前端请求 Speech 接口能返回音频即视为成功。

常见问题

Q:AMD 显卡能直接用吗?

A:可以尝试,但 ROCm 镜像是实验性的,且只提供 linux/amd64 版本,稳定性和兼容性不如 CPU / NVIDIA 镜像。

Q:Mac(Apple Silicon)怎么部署?

A:不需要 Docker 镜像,README 说明可通过 UV 直接运行,使用 MPS 加速。

Q:支持哪些语言?

A:英语(美式/英式)、西班牙语、法语、印地语、意大利语、日语、巴西葡萄牙语和中文普通话。

Q:能接入 OpenWebUI 吗?

A:可以。它提供 OpenAI 兼容的 Speech 接口,README 列出 OpenWebUI、Home Assistant 等社区项目可将其作为后端。

注意事项

  • 本教程依据 README 节选整理,README 未给出 docker run、端口与配置项细节,务必以仓库最新 README 为准。
  • AMD ROCm 支持标注为 experimental,生产环境建议优先选择 CPU 或 NVIDIA CUDA 镜像。
  • 项目附带可选 WebUI,并支持语音混合、多说话人、时间戳字幕与音素接口等能力。
  • 该服务为 Kokoro-82M 模型封装,生成速度快,可短时间内产出大量语音。

核心亮点

  • Docker化部署,简化环境配置,支持CPU/AMD/NVIDIA GPU,硬件兼容性强
  • 提供OpenAI兼容API,轻松集成到OpenWebUI、SillyTavern等现有工具
  • 支持语音混合、长文本自动拼接、字幕时间戳,功能丰富实用

不足之处

  • 文档/社区待观察
  • 模型大小和推理速度可能受限于硬件,需自行优化

适用场景

  • 本地部署TTS服务,为应用提供语音合成能力
  • 集成到聊天机器人或AI助手,实现语音回复
  • 内容创作中批量生成多语言语音,带字幕时间戳便于后期编辑

替代项目

Coqui TTS、Mimic3、Piper

项目介绍

Kokoro-FastAPI 是音频音乐领域的开源项目,由 remsky 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(5,472)位列前 8%,在音频音乐分类的 738 个项目里位列前 6%。

近 41 天,它的 GitHub 星标从 5,316 增加到 5,472,净增 156。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-22。Apache-2.0 许可证,可自行部署使用,完全免费。

它主要面向的使用场景是:本地部署TTS服务,为应用提供语音合成能力。同类可对比的替代方案包括 Coqui TTS、Mimic3、Piper。

上一篇:abogen

下一篇:DiffSinger

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09