kokoro-web

免费自托管AI语音合成,OpenAI接口一键接入

Kokoro Web 是一个基于 Kokoro-82M 模型的开源 AI 文本转语音(TTS)项目,提供在线演示和自托管两种使用方式。它解决了开发者快速集成高质量 TTS 能力的需求,核心能力包括:支持 30 多种语言和 100 多种声音,提供 OpenAI 兼容的 API 接口,可无缝替换现有语音服务。项目采用 TypeScript 编写,前端简洁易用,后端基于 FastAPI,支持 GPU 和 CPU 推理,并允许用户上传自定义声音样本进行克隆。无论是个人开发者还是企业团队,都能通过简单的部署步骤,在本地或服务器上运行,实现低延迟、高自然度的语音合成。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 740
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队eduardolat
所属国家
定价模式free
价格说明完全免费,支持在线使用或自托管,兼容OpenAI API。
访问状态
是否开源是
开源协议MIT
主要语言TypeScript
技术栈/模型ai,kokoro,kokoro-82m,kokoro-tts,machine-learning,text-to-speech,tts,voice,voice-generation
GitHub 星标★ 740
30天Star增速
HF 下载量
上线时间2025-02-09 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

核心亮点

  • OpenAI 兼容 API,可无缝替换现有 TTS 服务,迁移成本低
  • 支持 30+ 语言和 100+ 声音,覆盖全球主流语种
  • 支持声音克隆,上传样本即可生成个性化音色

不足之处

  • 文档/社区待观察
  • 模型体积较大,CPU 推理延迟较高,需 GPU 获得最佳性能

适用场景

  • 为应用或网站快速集成多语言语音播报功能
  • 在本地或私有云部署,替代商业 TTS 服务以降低成本
  • 生成有声书、播客或视频配音,支持自定义音色

替代项目

Coqui TTS、Piper、MeloTTS

项目介绍

kokoro-web 是音频音乐领域的开源项目,由 eduardolat 开发,2025 年首次发布。

它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 740。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。完全免费,支持在线使用或自托管,兼容OpenAI API。从国内网络环境看,可直接访问。

它主要面向的使用场景是:为应用或网站快速集成多语言语音播报功能。同类可对比的替代方案包括 Coqui TTS、Piper、MeloTTS。

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09