index-tts

上传几秒语音,立刻克隆你的声音,随便说哪种语言都行

index-tts 是一个面向工业级应用的零样本文本转语音(TTS)系统,核心能力是仅凭几秒参考音频即可克隆说话人音色,并用于跨语言语音合成。它解决了传统语音合成需要大量目标说话人数据、训练成本高、定制门槛高的问题,让开发者能快速接入个性化语音生成。系统在可控性和效率上做了针对性设计,支持精细调节合成语音的情感、风格等属性,同时结合 BigVGAN 等高质量声码器,在保证音质的前提下提升生成速度,适合实时/准实时的交互场景。项目以 Python 为主,技术栈围绕 zero-shot TTS 和 voice-clone,覆盖跨语言推理,常见于有声内容制作、虚拟角色配音、无障碍辅助等场景。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 24134
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队index-tts
所属国家
官网地址
定价模式free
价格说明开源项目,本地部署,完全免费。
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型bigvgan,cross-lingual,indextts,text-to-speech,tts,voice-clone,zero-shot-tts
GitHub 星标★ 24134
30天Star增速
HF 下载量
上线时间2025-02-06 00:00:00
最近更新2026-09-22 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数11

使用教程

难度:进阶 约 20 分钟 部署方式:本地安装 6 步

环境要求

  • 需先安装 uv 包管理器,README 明确要求用它管理依赖环境
  • uv sync 会自动创建 .venv 项目目录,并安装正确版本的 Python 与全部依赖
  • 若安装过程出现 CUDA 报错,需系统已安装 NVIDIA CUDA Toolkit 12.8 或更新版本
  • Windows 上 DeepSpeed 可能难以安装,可去掉 --all-extras 并手动选择扩展

安装与启动步骤

  1. 1准备项目源码

    README 节选从“2. Install Dependencies”开始,未给出获取源码的命令;请先从 GitHub 仓库 index-tts/index-tts 取得代码并进入项目目录,此步不臆造命令。

  2. 2安装 uv

    uv 是项目依赖管理的必需工具,README 要求先安装它,否则无法可靠安装依赖。

    pip install -U uv
  3. 3同步全部依赖

    在项目根目录执行,会自动创建 .venv 并安装正确版本的 Python 和所有依赖,包含全部额外功能。

    uv sync --all-extras
  4. 4国内镜像加速

    如果依赖下载缓慢,可改用国内镜像源,README 给出阿里云与清华两种可选地址,二者选其一执行。

    uv sync --all-extras --default-index "https://mirrors.aliyun.com/pypi/simple"
  5. 5按需定制扩展

    不想装全部扩展时,去掉 --all-extras,手动加 --extra webui(推荐)和 --extra deepspeed(可能加速推理)。

    uv sync --extra webui --extra deepspeed
  6. 6检查 CUDA 环境

    若安装时报 CUDA 错误,需确认系统已装 NVIDIA CUDA Toolkit 12.8 或更新版本,装好后重新同步依赖。

如何确认成功

README 未给出启动或验证命令;执行 uv sync 全程无报错、项目目录下生成 .venv 即视为依赖安装成功。

常见问题

Q:依赖下载很慢怎么办?

A:使用国内镜像源,例如 uv sync --all-extras --default-index "https://mirrors.aliyun.com/pypi/simple",也可换成清华镜像地址。

Q:Windows 上装不上 DeepSpeed 怎么办?

A:去掉 --all-extras,改为手动添加所需扩展,例如只加 --extra webui,即可跳过 DeepSpeed。

Q:安装时提示 CUDA 错误怎么办?

A:README 指出需确保系统已安装 NVIDIA CUDA Toolkit 12.8 或更新版本,版本过低会报错。

Q:只想用 WebUI,需要装全部扩展吗?

A:不需要。去掉 --all-extras,只执行 uv sync --extra webui 即可,README 将 WebUI 标注为推荐扩展。

注意事项

  • README 节选只包含依赖安装说明,未给出模型权重下载与推理/启动命令,需另行查阅仓库完整文档。
  • 最新版本为 IndexTTS-2.5,支持中文、英文、日文、西班牙文和阿拉伯文,并支持情感、语速和发音控制。
  • 模型权重可从 ModelScope(IndexTeam/IndexTTS-2.5)或 HuggingFace 获取,README 同时提供了在线 Demo 与 Studio 体验入口。
  • --all-extras 会装入所有额外功能,按需可只选 --extra webui 或 --extra deepspeed。

核心亮点

  • 零样本声音克隆,只需3~5秒参考语音即可合成目标说话人声音
  • 支持跨语言合成,用原始音色生成多种语言内容,降低本地化配音成本
  • 基于BigVGAN声码器与可控设计,音质和推理效率兼顾,适合工业级部署

不足之处

  • 文档完善度和社区规模相对有限,上手可能需要参考源码和示例
  • 对参考音频的纯净度与时长有一定要求,复杂背景音下克隆效果可能下降

适用场景

  • 给短视频/播客快速生成稳定音色的旁白
  • 为游戏或动画角色生成个性化配音台词
  • 在无障碍阅读工具中合成用户偏好的语音

替代项目

Coqui TTS、Tortoise TTS

项目介绍

index-tts 是音频音乐领域的开源项目,由 index-tts 开发,2025 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(24,134)位列前 2%,在音频音乐分类的 738 个项目里位列前 2%。

近 41 天,它的 GitHub 星标从 22,729 增加到 24,134,净增 1,405。

项目仍在小幅维护中,最近一次代码更新于 2026-09-22。本地部署,完全免费。

它主要面向的使用场景是:给短视频/播客快速生成稳定音色的旁白。同类可对比的替代方案包括 Coqui TTS、Tortoise TTS。

上一篇:audio-diffusion

下一篇:supertonic

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09