minimind-v

2小时从零训练你自己的视觉多模态小模型

MiniMind-V 是一个从零开始训练视觉多模态大模型(VLM)的开源项目,目标是在极低资源条件下(如单张消费级显卡)用约2小时训练出一个仅65M参数的小型视觉语言模型。它解决了个人开发者或小型团队难以负担大模型训练成本的问题,提供了一套完整、可复现的训练流程,包括数据准备、模型架构、训练脚本和推理示例。核心能力涵盖图像描述、视觉问答等基础多模态任务,并支持通过LoRA等微调方式快速适配下游场景。项目代码基于Python和PyTorch,结构清晰,适合学习VLM原理和进行教学实验。

开源 free 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 8671
维护状态 活跃
是否开源
定价模式 free

项目数据

分类对话助手
开发团队jingyaogong
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和修改,无付费版本。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型artificial-intelligence,chatgpt,vision-language-model
GitHub 星标★ 8671
30天Star增速
HF 下载量
上线时间2024-09-11 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:进阶 约 10 分钟 部署方式:本地安装 7 步

环境要求

  • Python 3.10(作者实测环境)
  • NVIDIA GPU(作者使用 RTX 3090 24GB,SFT 1 epoch 约 2 小时)
  • CUDA 12.2(作者实测环境,Ubuntu 20.04)
  • requirements.txt 中的 Python 依赖

安装与启动步骤

  1. 1克隆项目仓库

    从 GitHub 拉取 minimind-v 源码到本地,后续所有命令都在该目录内执行。

    git clone https://github.com/jingyaogong/minimind-v.git
  2. 2进入项目目录

    切换到刚克隆下来的项目根目录,确认能看到 requirements.txt 等文件。

    cd minimind-v
  3. 3确认软硬件环境

    README 实测为 Ubuntu 20.04 + CUDA 12.2 + Python 3.10 + RTX 3090(24GB)。环境不符时可能无法训练。

  4. 4安装项目依赖

    按 README 给出的命令安装依赖,并使用清华 PyPI 镜像加速下载。建议在虚拟环境中执行。

    pip install -r requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simple
  5. 5在线体验(可选)

    不想本地部署时,可直接打开官方 ModelScope 在线体验页试用 MiniMind-V 的识图与对话能力。

  6. 6启动 WebUI(可选)

    README 有“启动 WebUI(可选)”小节,但节选内容未给出具体启动命令,请以仓库最新文档为准。

  7. 7运行/续训 SFT 示例

    README 给出的训练中断续训命令,--from_resume 1 表示从检查点继续,--epochs 4 指定训练轮数。

    python train_sft_vlm.py --epochs 4 --from_resume 1

关键配置

配置项必填说明示例
--from_weight指定基础权重名称,如 llm、pretrain_vlm、none 等pretrain_vlm
--save_weight保存权重时使用的前缀名my_vlm
--from_resume是否续训,0 从头开始,1 从检查点继续1
--freeze_llm冻结策略:0 全参可训,1 proj+LLM 首尾层,2 仅训 proj1
--epochs训练轮数,README 示例中为 44

如何确认成功

README 未给出明确启动验证命令;可先访问 ModelScope 在线体验页确认效果,再本地跑推理或训练脚本观察日志。

常见问题

Q:需要什么级别的显卡才能跑?

A:README 实测使用 RTX 3090(24GB),SFT 阶段跑完 1 epoch 约 2 小时;模型最小仅 65M 参数,官方强调个人 GPU 也可快速推理甚至训练。

Q:训练中断了怎么继续?

A:用相同命令并加上 --from_resume 1 续训,例如 python train_sft_vlm.py --epochs 4 --from_resume 1。

Q:依赖下载太慢怎么办?

A:README 的安装命令已指定清华镜像源 -i https://pypi.tuna.tsinghua.edu.cn/simple,可直接复用。

Q:不想训练能直接用吗?

A:可以,README 提供了 ModelScope 在线体验地址,无需本地部署即可体验识图和对话。

注意事项

  • 项目基于 Apache 2.0 协议开源,完全免费使用。
  • “2 小时”指 SFT 阶段在单张 NVIDIA 3090 上跑完 1 epoch 的实测耗时,“3 块钱”指对应时段的 GPU 租用成本。
  • README 节选未包含数据集下载、权重获取和 WebUI 启动的具体命令,请以仓库最新文档为准。
  • MiniMind-V 是纯语言模型 MiniMind 的视觉能力拓展,多模态 Omni 版本见 MiniMind-O 仓库。

核心亮点

  • 训练成本极低:仅需2小时和单张消费级GPU,即可完成65M参数VLM训练,大幅降低入门门槛
  • 全流程开源:从数据构建到训练推理的完整代码和教程,便于复现和二次开发
  • 模型轻量:65M参数适合边缘设备部署,推理速度快,资源占用小

不足之处

  • 模型能力有限:65M参数规模远小于主流VLM,复杂视觉推理和知识问答效果受限
  • 文档/社区待观察:项目处于成长早期,教程和社区支持可能不够完善

适用场景

  • 教学与科研:用于高校或培训机构讲解多模态模型原理和训练流程
  • 个人开发者快速原型:在有限算力下验证视觉语言结合的想法
  • 边缘端轻量应用:部署在手机或嵌入式设备上实现基础图像理解

替代项目

LLaVA、MiniGPT-4、TinyLLaVA

项目介绍

minimind-v 是开源模型领域的开源项目,由 jingyaogong 开发,2024 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(8,671)位列前 6%,在开源模型分类的 422 个项目里位列前 8%。

近 44 天,它的 GitHub 星标从 8,441 增加到 8,671,净增 230。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。Apache-2.0许可证,可免费使用和修改,无付费版本。

它主要面向的使用场景是:教学与科研:用于高校或培训机构讲解多模态模型原理和训练流程。同类可对比的替代方案包括 LLaVA、MiniGPT-4、TinyLLaVA。

上一篇:best-of-ml-python

下一篇:FinGPT

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1873 2026-08-10