tango

输入一句话,自动生成匹配的音频内容

tango 是一个用于文本生成音频的扩散模型家族,旨在解决从文字描述直接合成高质量音频的问题。它基于文本提示生成对应的音频内容,如音效、环境声等,核心能力包括文本到音频的生成、多模型变体支持以及可扩展的训练与推理流程。项目采用 Python 实现,依赖深度学习框架,提供了预训练模型和生成示例,便于研究者和开发者快速上手。通过扩散模型架构,tango 能够捕捉文本语义与音频特征之间的映射关系,生成与描述匹配的音频输出。该项目适合音频内容创作、辅助设计、人机交互等场景,为文本驱动的音频合成提供了开源解决方案。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1239
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队declare-lab
所属国家
定价模式free
价格说明开源模型,本地部署,完全免费。
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型audio-generation,diffusion,diffusion-models,language-models,large-language-models,text-to-audio
GitHub 星标★ 1239
30天Star增速
HF 下载量
上线时间2023-04-10 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数22

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(README 示例为 Python 脚本)
  • 示例代码依赖 tango、soundfile、IPython 三个库
  • 首次运行需联网下载模型权重,之后从本地缓存加载

安装与启动步骤

  1. 1准备Python环境

    README 未给出安装命令,需自行安装 tango 包及其依赖(示例中用到 soundfile、IPython),并确保网络可访问模型仓库。

  2. 2编写生成脚本

    新建脚本,加载 declare-lab/tango2 模型,用文本提示生成音频并以 16000 采样率写出 wav 文件。

    import IPython
    import soundfile as sf
    from tango import Tango
    
    tango = Tango("declare-lab/tango2")
    
    prompt = "An audience cheering and clapping"
    audio = tango.generate(prompt)
    sf.write(f"{prompt}.wav", audio, samplerate=16000)
    IPython.display.Audio(data=audio, rate=16000)
  3. 3运行脚本

    执行脚本,首次运行会自动下载模型并保存到缓存,之后的运行直接读取缓存,不再重复下载。

    python tango_demo.py
  4. 4提升生成音质

    generate 默认采样 100 步,官方建议改用 200 步以获得更好音质,代价是运行时间增加。

    prompt = "Rolling thunder with lightning strikes"
    audio = tango.generate(prompt, steps=200)
    IPython.display.Audio(data=audio, rate=16000)
  5. 5批量生成音频

    用 generate_for_batch 传入提示列表,samples=2 表示每条提示各生成两个音频样本。

    prompts = [
        "A car engine revving",
        "A dog barks and rustles with some clicking",
        "Water flowing and trickling"
    ]
    audios = tango.generate_for_batch(prompts, samples=2)

关键配置

配置项必填说明示例
模型路径是Tango() 初始化时传入的模型标识,示例用 Tango2declare-lab/tango2
prompt是文本提示词,描述要生成的音效或环境声An audience cheering and clapping
steps否扩散采样步数,默认 100,官方建议 200 提升音质200
samplerate否写出音频文件时使用的采样率16000
samples否generate_for_batch 中每条提示生成的样本数量2

如何确认成功

脚本运行结束后目录下生成以提示词命名的 .wav 文件,并可通过 IPython.display.Audio 播放出对应音频。

常见问题

Q:模型每次运行都要重新下载吗?

A:不需要。首次运行会自动下载并保存到缓存,后续运行直接从缓存加载模型。

Q:生成的音频质量不理想怎么办?

A:把 generate 的 steps 从默认 100 提高到 200,官方说明可生成质量更好的音频,但运行时间会更长。

Q:想一次生成多条音频怎么做?

A:使用 generate_for_batch,传入提示词列表并设置 samples 参数,即可为每条提示生成多个样本。

Q:生成音频的采样率是多少?

A:README 示例统一按 16000 采样率写出和播放音频。

注意事项

  • README 未提供 pip 安装命令,具体安装方式请以官方仓库说明为准。
  • 首次运行需要联网下载模型权重,请保证网络畅通。
  • steps 越大音质越好但耗时越长,按需在质量与速度之间取舍。
  • 官方已推出更新的 TangoFlux 等模型,可关注仓库获取最新方案。

核心亮点

  • 提供多个预训练模型,支持不同音频风格和复杂度
  • 基于扩散模型,生成音频质量较高,文本对齐度好
  • 代码开源,包含训练和推理脚本,易于二次开发

不足之处

  • 生成音频长度可能受限,长音频支持待验证
  • 文档和社区生态相对薄弱,示例不够丰富

适用场景

  • 音效制作:为视频、游戏自动生成环境音效
  • 辅助创作:帮助音乐人快速生成音频原型
  • 无障碍交互:为视觉障碍用户提供文本转声音反馈

替代项目

AudioLDM、Make-An-Audio、DiffSound

项目介绍

tango 是音频音乐领域的开源项目,由 declare-lab 开发,2023 年首次发布。

在全站 13,109 个收录项目中,它的 GitHub 星标数(1,239)位列前 30%,在音频音乐分类的 738 个项目里位列前 15%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。本地部署,完全免费。

它主要面向的使用场景是:音效制作:为视频、游戏自动生成环境音效。同类可对比的替代方案包括 AudioLDM、Make-An-Audio、DiffSound。

上一篇:MOSS-Speech

下一篇:mustango

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09