AnyGPT 是开源模型领域的开源项目,由 OpenMOSS 开发,2024 年首次发布。
在全站 12,822 个收录项目中,它的 GitHub 星标数(882)位列前 30%。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-17。免费使用。
它主要面向的使用场景是:构建统一多模态对话助手,支持语音输入、图像输出等自然交互。同类可对比的替代方案包括 Next-GPT、CogVLM、LLaVA。

让一个模型搞定文本、图像、语音、音乐的任意互转
AnyGPT 是一个基于离散序列建模的统一多模态大语言模型,旨在实现任意模态之间的相互转换与理解。它解决了传统多模态模型通常只支持文本与其他单一模态(如图像或语音)交互的局限,通过将图像、语音、音乐等模态统一编码为离散符号序列,使模型能够像处理文本一样处理多种输入输出。其核心能力包括文本、图像、语音、音乐的任意组合输入与生成,例如语音到文本、文本到图像、音乐生成等跨模态任务。项目提供了完整的训练和推理代码,并支持基于 LLaMA 的模型架构,便于研究者复现和扩展。AnyGPT 特别适合需要统一多模态交互的对话系统、内容创作工具等场景,为构建更自然的人机交互体验提供了新的技术路径。
Next-GPT、CogVLM、LLaVA
AnyGPT 是开源模型领域的开源项目,由 OpenMOSS 开发,2024 年首次发布。
在全站 12,822 个收录项目中,它的 GitHub 星标数(882)位列前 30%。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-17。免费使用。
它主要面向的使用场景是:构建统一多模态对话助手,支持语音输入、图像输出等自然交互。同类可对比的替代方案包括 Next-GPT、CogVLM、LLaVA。
上一篇:translations
下一篇:aarambh-studio
awesome-claude-fable-5-prompt-va···
开源
一站式掌握 Claude Fable 5 玩法,快速选型不踩坑
Ultimate Claude Fable 5 Guide 2026: Use Cases, Integrations & Benchmarks
Machine-Learning
开源
跟着博客笔记,边看边跑机器学习代码
All content related to machine learning from my blog
Diffusion-Models-Papers-Survey-T···
开源
学视频生成怕绕路?这份资料库帮你理清
Diffusion model papers, survey, and taxonomy
CoreML-Models
开源
下载即用的苹果端 AI 模型库,免去转换烦恼
Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···