dia

一句话说出超逼真对话,情绪到位,不用反复重录

一款能够一次性生成超逼真对话的 TTS 模型,无需多次迭代即可输出自然流畅、情感丰富的多角色对话语音。非常适合有声剧、播客、游戏配音与对话系统等需要高质量多角色语音的生产场景。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 19400
维护状态 低维护
是否开源
定价模式 free

项目数据

分类音频音乐
开发团队nari-labs
所属国家
官网地址
定价模式free
价格说明开源模型,Apache-2.0许可证,可免费本地部署使用,无在线服务。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型ai,open-weight,text-to-speech
GitHub 星标★ 19400
30天Star增速
HF 下载量
上线时间2025-04-19 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:进阶 约 20 分钟 部署方式:本地安装 7 步

环境要求

  • Python 环境(可运行 pip / python)
  • 具备 CUDA 的 GPU(示例代码使用 torch_device = "cuda")
  • git(用于克隆仓库与从 GitHub 安装)
  • 可选:uv(README 提供 uv 运行方式)
  • Hugging Face Transformers(如需用 Transformers 方式运行,require 从 GitHub 安装)

安装与启动步骤

  1. 1克隆项目仓库

    把 dia 源码拉到本地,后续可编辑安装需要进入该目录操作。

    git clone https://github.com/nari-labs/dia.git
  2. 2本地可编辑安装

    在仓库目录内执行可编辑安装,README 中 Install via pip 的第一种方式。

    cd dia
    pip install -e .
  3. 3或不克隆直接安装

    README 给出的另一种方式:直接从 GitHub 安装,不克隆仓库。

    pip install git+https://github.com/nari-labs/dia.git
  4. 4运行示例脚本

    README 安装完成后建议运行示例,验证模型能生成语音。

    python example/simple.py
  5. 5启动应用

    使用 uv 运行 app.py,需先安装 uv。

    uv run app.py
  6. 6使用命令行工具

    通过 cli.py 使用命令行方式,README 先以 --help 查看用法。

    python cli.py --help
  7. 7Hugging Face 方式

    README UPDATE 说明可用 Transformers 运行,需从 GitHub 安装 transformers。

    uv pip install git+https://github.com/huggingface/transformers.git

关键配置

配置项必填说明示例
model_checkpointHugging Face 上的模型权重仓库名nari-labs/Dia-1.6B-0626
max_new_tokens生成的最大新 token 数3072
guidance_scale引导强度,影响生成贴合度3.0
temperature采样温度,控制随机性1.8
top_p核采样阈值0.90
top_ktop-k 采样保留的候选数45

如何确认成功

运行示例或 app.py 后能正常生成语音;用 Transformers 脚本会保存 example.mp3,能播放即成功。

常见问题

Q:每次运行生成的音色都不一样怎么办?

A:README 说明模型未针对特定声音微调,所以每次音色不同。可通过添加音频提示(audio prompt)或固定随机种子来保持说话人一致。

Q:使用 5000 系列 GPU 报错怎么办?

A:README 提示 5000 系列 GPU 应使用 torch 2.8 nightly,详见项目 issue #26。

Q:如何用 Hugging Face Transformers 运行?

A:先安装 GitHub 版 transformers(uv pip install git+https://github.com/huggingface/transformers.git),再用 DiaForConditionalGeneration 和 AutoProcessor 加载 nari-labs/Dia-1.6B-0626。

Q:没安装 uv 怎么办?

A:可以改用 pip 方式安装和运行,例如 pip install -e . 后运行 python example/simple.py 或 python cli.py --help。

注意事项

  • 脚本中用 [S1]、[S2] 标记不同说话人,可按此格式编写对话文本。
  • 模型未针对特定声音微调,每次运行音色可能不同。
  • 5000 系列 GPU 需使用 torch 2.8 nightly。
  • README 未给出显存、CUDA 版本等具体硬件要求,请按实际环境确认。

核心亮点

  • 单次前向生成超逼真对话音频,无需多阶段拼接,技术架构领先
  • 开源开放权重模型,社区可自由下载使用和二次开发,生态潜力大
  • 在TTS领域快速获得近2万星标,验证了技术路线和效果得到广泛认可

不足之处

  • 文档/社区待观察

适用场景

  • 影视/游戏角色对话配音制作,快速生成高质量对白
  • 有声书/播客等长音频内容中多角色对话场景的自动化合成
  • 语音交互原型验证与虚拟助手对话回复的快速生成

替代项目

ChatTTS、GPT-SoVITS、CosyVoice

项目介绍

dia 是音频音乐领域的开源项目,由 nari-labs 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(19,400)位列前 3%,在音频音乐分类的 738 个项目里位列前 2%。

近 44 天,它的 GitHub 星标从 19,367 增加到 19,400,净增 33。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。Apache-2.0许可证,可免费本地部署使用,无在线服务。

它主要面向的使用场景是:影视/游戏角色对话配音制作,快速生成高质量对白。同类可对比的替代方案包括 ChatTTS、GPT-SoVITS、CosyVoice。

上一篇:VoxCPM

下一篇:piper

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 245 2026-08-09