NExT-GPT

一个模型搞定文本、图像、音频、视频的任意输入输出

NExT-GPT是新加坡国立大学团队在ICML 2024发表的任意模态大语言模型,支持文本、图像、音频和视频的任意输入与输出组合。它采用LLM作为核心大脑,通过对齐模块将不同模态的编码器与解码器连接,实现了真正的多模态理解与生成。项目解决了传统多模态模型仅支持部分模态输入或输出的局限,提供了统一的端到端框架。核心能力包括多模态对话、跨模态内容生成(如根据视频生成文本描述或音频)以及多模态推理。代码和模型均已开源,方便研究者复现和二次开发。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3637
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队NExT-GPT
所属国家
定价模式free
价格说明开源模型,代码与模型权重公开,可自行部署,完全免费。
访问状态
是否开源是
开源协议BSD-3-Clause
主要语言Python
技术栈/模型chatgpt,foundation-models,gpt-4,instruction-tuning,large-language-models,llm,mllm,multi-modal-chatgpt,multimodal,visual-language-learning
GitHub 星标★ 3637
30天Star增速
HF 下载量
上线时间2023-08-30 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:高级 约 30 分钟 部署方式:本地安装 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 运行环境(项目为 Python 实现)
  • 已克隆 NExT-GPT 代码仓库
  • 已下载官方发布的模型权重(7b_tiva_v0)
  • 具备运行多模态大模型的本地算力环境

安装与启动步骤

  1. 1克隆项目仓库

    把 NExT-GPT 仓库拉到本地,后续命令都在仓库根目录执行。

    git clone https://github.com/NExT-GPT/NExT-GPT.git
  2. 2下载模型权重

    从 HuggingFace 获取官方发布的 7b_tiva_v0 检查点,供预测时加载。

    git clone https://huggingface.co/ChocoWu/nextgpt_7b_tiva_v0
  3. 3确认代码版本

    旧代码库已收纳进 NExT-GPT-Lagacy 目录,训练与调优请以新版代码库为准。

  4. 4运行预测

    检查点加载完成后执行预测脚本,体验任意模态组合的输入与输出。

    python predict.py

如何确认成功

执行 python predict.py 后能正常加载权重并输出预测结果、无报错,即表示运行成功。

常见问题

Q:模型权重从哪里下载?

A:README 给出官方检查点地址为 HuggingFace 上的 ChocoWu/nextgpt_7b_tiva_v0,可直接克隆下载。

Q:训练和微调代码在哪里?

A:旧代码库已被收纳到仓库的 NExT-GPT-Lagacy 目录,README 说明所有训练与调优流程请参考新的代码库。

Q:这个模型支持哪些模态?

A:支持文本、图像、视频、音频的任意输入输出组合,是端到端的任意模态多模态大模型。

Q:需要自己写调用代码吗?

A:不需要,README 提供的预测入口是 python predict.py,完成检查点加载后直接运行即可。

注意事项

  • README 节选未给出完整的依赖安装与环境配置说明,请以仓库内其他文件为准。
  • 模型规模为 7B,实际运行对显存和算力有较高要求,建议提前准备环境。
  • 本项目为 ICML 2024 论文开源实现,二次开发前建议先阅读论文与项目主页。

核心亮点

  • 真正实现任意模态到任意模态的转换,覆盖文本、图像、音频、视频的输入输出组合,远超常见多模态模型
  • 基于LLM的简洁架构,通过轻量对齐模块连接模态编码器和解码器,训练成本低且易于扩展
  • 提供完整开源代码和预训练模型,并附有ICML论文详细说明,便于复现和学术研究

不足之处

  • 生成质量相比专用单模态模型(如纯文本LLM或图像生成模型)可能仍有差距
  • 文档/社区待观察

适用场景

  • 多模态内容创作:根据视频自动生成描述、配音或配乐
  • 智能助手:用户通过语音+图像提问,获得文本+音频回复
  • 跨模态检索与摘要:从长视频中提取关键信息并生成图文摘要

替代项目

CogVLM、LLaVA、MiniGPT-4

项目介绍

NExT-GPT 是开源模型领域的开源项目,由 NExT-GPT 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(3,637)位列前 30%,在开源模型分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。代码与模型权重公开,可自行部署,完全免费。

它主要面向的使用场景是:多模态内容创作:根据视频自动生成描述、配音或配乐。同类可对比的替代方案包括 CogVLM、LLaVA、MiniGPT-4。

上一篇:awesome-harness-engineering

下一篇:torchchat

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
awesome-ltx2 开源

找齐 LTX-2 模型、工作流和 LoRA,一键上手视频生成。

All available LTX-2 models, encoders, workflows, LoRAs for ComfyUI

★ 593 2026-08-10