HeadTTS

浏览器里跑TTS,带时间戳和口型,直接做唇形同步

HeadTTS 是一个基于 Kokoro 的免费神经文本转语音(TTS)工具,专为唇形同步(lip-sync)场景设计。它解决了传统 TTS 无法提供精确时间戳和口型同步数据的问题,能够生成包含单词级时间戳和 visemes(口型单元)的语音,方便与 TalkingHead 等动画系统集成。核心能力包括:在浏览器中通过 WebGPU/WASM 实现完全本地化的推理,无需服务器;同时支持在 Node.js 环境中以 WebSocket/REST 服务方式运行,兼容 CPU 和 WebGPU。项目采用 JavaScript 编写,易于前端集成,适合实时交互应用。作为早期项目,它提供了开箱即用的 API 和示例,降低了开发者构建数字人、虚拟主播等应用的复杂度。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 177
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队met4citizen
所属国家
定价模式free
价格说明完全免费,支持浏览器内运行(WebGPU/WASM)或本地部署,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言JavaScript
技术栈/模型kokoro,lip-sync,talkinghead,text-to-speech,timestamps,visemes
GitHub 星标★ 177
30天Star增速
HF 下载量
上线时间2025-04-21 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

核心亮点

  • 完全本地推理,支持 WebGPU/WASM,隐私好且无服务器成本
  • 输出单词级时间戳和 visemes,直接对接唇形同步流程
  • 双模式运行:浏览器内嵌或 Node.js 服务,适配不同场景

不足之处

  • 早期项目,API 和功能稳定性待验证
  • 文档/社区待观察

适用场景

  • 数字人/虚拟主播的实时口型驱动
  • 浏览器端无障碍阅读或语音交互
  • 视频制作中自动生成配音与口型动画

替代项目

Coqui TTS、Mimic 3、Kokoro TTS

项目介绍

HeadTTS 是音频音乐领域的开源项目,由 met4citizen 开发,2025 年首次发布。

它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 176。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-21。完全免费,支持浏览器内运行(WebGPU/WASM)或本地部署,无付费版本。从国内网络环境看,可直接访问。

它主要面向的使用场景是:数字人/虚拟主播的实时口型驱动。同类可对比的替代方案包括 Coqui TTS、Mimic 3、Kokoro TTS。

上一篇:MSMC-TTS

下一篇:Neural-HMM

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09