AnyGPT

让一个模型搞定文本、图像、语音、音乐的任意互转

AnyGPT 是一个基于离散序列建模的统一多模态大语言模型,旨在实现任意模态之间的相互转换与理解。它解决了传统多模态模型通常只支持文本与其他单一模态(如图像或语音)交互的局限,通过将图像、语音、音乐等模态统一编码为离散符号序列,使模型能够像处理文本一样处理多种输入输出。其核心能力包括文本、图像、语音、音乐的任意组合输入与生成,例如语音到文本、文本到图像、音乐生成等跨模态任务。项目提供了完整的训练和推理代码,并支持基于 LLaMA 的模型架构,便于研究者复现和扩展。AnyGPT 特别适合需要统一多模态交互的对话系统、内容创作工具等场景,为构建更自然的人机交互体验提供了新的技术路径。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 882
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类开源模型
开发团队OpenMOSS
所属国家
定价模式free
价格说明开源项目,免费使用,定价信息待确认
访问状态
是否开源
开源协议
主要语言Python
技术栈/模型any-to-any,image-generation,large-language-models,multimodal,music-generation,speech
GitHub 星标★ 882
30天Star增速
HF 下载量
上线时间2024-02-18 00:00:00
最近更新2026-09-17 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-07
浏览次数6

使用教程

核心亮点

  • 真正实现 any-to-any 多模态转换,覆盖文本、图像、语音、音乐四大类,突破传统只支持文本+单模态的限制
  • 基于离散序列建模,将不同模态统一为 token 序列,架构简洁且易于扩展新模态
  • 提供完整训练与推理代码,基于 LLaMA 开源权重,便于研究复现和二次开发

不足之处

  • 项目处于早期,GitHub 星标仅 882,社区生态和文档尚不完善
  • 多模态离散化可能损失细节,生成质量相比专用模型(如专用图像生成)可能不足

适用场景

  • 构建统一多模态对话助手,支持语音输入、图像输出等自然交互
  • 开发跨模态内容生成工具,如根据语音描述生成图像或音乐
  • 研究多模态大模型的统一架构与离散表示方法

替代项目

Next-GPT、CogVLM、LLaVA

项目介绍

AnyGPT 是开源模型领域的开源项目,由 OpenMOSS 开发,2024 年首次发布。

在全站 12,822 个收录项目中,它的 GitHub 星标数(882)位列前 30%。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-17。免费使用。

它主要面向的使用场景是:构建统一多模态对话助手,支持语音输入、图像输出等自然交互。同类可对比的替代方案包括 Next-GPT、CogVLM、LLaVA。

上一篇:translations

下一篇:aarambh-studio

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1870 2026-08-10