AudioToken

上传一段音频,AI 直接生成匹配图像

AudioToken 是一个基于扩散模型的音频到图像生成工具,源自 InterSpeech 2023 论文。它解决了仅凭文本描述难以准确捕捉音频中情感、节奏等抽象信息的问题,通过将音频特征适配到文本条件扩散模型中,实现从音频直接生成匹配的图像。核心能力包括:利用预训练的 Stable Diffusion 模型,通过轻量级适配层将音频编码为条件向量,支持多种音频输入(如音乐、语音),并生成与音频内容语义相关的图像。项目提供官方 PyTorch 实现,包含训练和推理代码,适合多模态生成研究。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 90
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队guyyariv
所属国家
定价模式free
价格说明开源项目,MIT许可证,可免费使用和修改,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型ai-art,audio-to-image,audio2image,deep-learning,diffusion-models,image-generation,multi-modal,stable-diffusion,text2image
GitHub 星标★ 90
30天Star增速
HF 下载量
上线时间2023-05-22 00:00:00
最近更新2026-07-29 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

核心亮点

  • 首个将音频条件注入 Stable Diffusion 的官方实现,方法新颖
  • 基于预训练模型,适配成本低,训练资源要求相对友好
  • 代码结构清晰,包含推理示例,易于复现论文结果

不足之处

  • 文档/社区待观察
  • 项目早期,星标少,生态和教程有限

适用场景

  • 音乐可视化:根据歌曲生成专辑封面或视觉艺术
  • 辅助创作:为播客、有声书生成配图
  • 多模态研究:探索音频与图像跨模态生成

替代项目

Wav2CLIP、AudioLDM、Diffusion Art

项目介绍

AudioToken 是图像领域的开源项目,由 guyyariv 开发,2023 年首次发布。

它收录于图像分类,该分类目前共有 837 个项目,GitHub 星标数为 90。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-07-29。MIT许可证,可免费使用和修改,无付费版本。

它主要面向的使用场景是:音乐可视化:根据歌曲生成专辑封面或视觉艺术。同类可对比的替代方案包括 Wav2CLIP、AudioLDM、Diffusion Art。

上一篇:Text2Earth

下一篇:DyPE

同类项目推荐

satori 开源

网页代码一键变高清图,放大不糊,不用截图

Enlightened library to convert HTML and CSS to SVG

★ 13967 2026-08-09
C2GAN 开源

用关键点精准控制图像生成,让AI画出你想要的结构

[ACM MM 2019 Oral] Cycle In Cycle Generative Adversarial Networks for Keypoint-Guide···

★ 70 2026-08-09
ComfyUI 开源

像搭积木一样连节点,生图流程自己搭

The most powerful and modular diffusion model GUI, api and backend with a graph/node···

★ 134493 2026-08-09