minimind-o

从零训练0.1B全模态模型,单卡搞定能听会说能看

MiniMind-O 是一个从零开始训练的 0.1B 参数全模态(Omni)模型,旨在让开发者以极低资源复现类似 GPT-4o 的听、说、看能力。项目解决了小模型在多模态融合上的难题,提供了完整的数据处理、训练、推理和部署流程。核心能力包括语音识别与合成、图像理解、文本对话,并支持流式交互。通过精简的架构和高效的训练策略,项目在单张消费级显卡上即可完成训练,大幅降低了多模态 AI 的入门门槛。代码结构清晰,文档详尽,适合研究学习和小规模应用。

开源 free 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2574
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类对话助手
开发团队jingyaogong
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和修改,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型artificial-intelligence,chatgpt,omni
GitHub 星标★ 2574
30天Star增速
HF 下载量
上线时间2026-05-01 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:进阶 约 20 分钟 部署方式:本地安装 3 步

环境要求

  • Python 3.10
  • CUDA 12.2 环境(训练建议 NVIDIA GPU,如 RTX 3090 24GB)
  • 操作系统 Ubuntu 20.04(官方验证环境)
  • 已安装 pip 并能访问 PyPI(README 使用清华镜像源)

安装与启动步骤

  1. 1获取项目代码

    从 GitHub 克隆仓库到本地。README 未给出克隆命令,此处按项目地址给出通用写法,如已有源码可跳过。

    git clone https://github.com/jingyaogong/minimind-o.git
  2. 2进入项目目录

    切换到克隆下来的项目根目录,后续安装与运行都在该目录下进行。

    cd minimind-o
  3. 3安装依赖

    使用 README 给出的命令安装 requirements.txt 中的全部依赖,并用清华镜像源加速下载。

    pip install -r requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simple

如何确认成功

pip 命令执行完毕且无报错、依赖包显示安装成功,即表示运行环境准备完成。

常见问题

Q:没有独立显卡能运行吗?

A:可以。README 说明该模型仅约 0.1B 参数,CPU 即可快速推理;但完整训练仍建议使用 GPU,如单张 RTX 3090。

Q:依赖下载很慢怎么办?

A:README 安装命令已带清华镜像源参数 -i https://pypi.tuna.tsinghua.edu.cn/simple,直接照抄执行即可,不要删掉该参数。

Q:完整训练大概要多久?

A:README 实测:mini 数据集在单张 NVIDIA RTX 3090 上跑完 SFT 约 2 小时,适合作为完整链路的入门验证。

Q:WebUI 怎么启动?

A:README 有“启动 WebUI(可选)”小节,但本次节选未包含其中的具体命令,请到仓库原文查看后再执行。

注意事项

  • README 的“快速开始”只给出了依赖安装命令,权重下载与启动的完整命令未在节选中出现,请以仓库原文为准。
  • 官方分享的参考配置为 Ubuntu 20.04 + CUDA 12.2 + Python 3.10 + RTX 3090(24GB),非该配置时可能出现兼容问题。
  • 项目提供 mini 与 full 两套训练数据,mini 数据集便于快速跑通链路,full 数据集与发布权重对应。
  • 核心算法使用 PyTorch 原生实现、不依赖第三方高层抽象,安装依赖后即可按仓库脚本自行阅读与修改。

核心亮点

  • 极低资源门槛:0.1B参数,单张消费级显卡可训练,适合个人开发者
  • 全模态覆盖:集成语音、图像、文本,接近GPT-4o体验
  • 完整训练流程:从数据准备到推理部署,代码和文档齐全,易复现

不足之处

  • 0.1B参数导致复杂任务能力有限,效果与大型模型差距明显
  • 文档/社区待观察

适用场景

  • 多模态AI教学与实验,快速理解Omni模型原理
  • 轻量级语音助手或交互式应用开发
  • 边缘设备或低算力环境下的多模态原型验证

替代项目

TinyLlama、Qwen2-VL、LLaVA

项目介绍

minimind-o 是模型训练领域的开源项目,由 jingyaogong 开发,是 2026 年新上线的项目。

在全站 13,014 个收录项目中,它的 GitHub 星标数(2,574)位列前 30%,在模型训练分类中处于中上游。

近 45 天,它的 GitHub 星标从 2,297 增加到 2,574,净增 277。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。Apache-2.0许可证,可免费使用和修改,无付费版本。

它主要面向的使用场景是:多模态AI教学与实验,快速理解Omni模型原理。同类可对比的替代方案包括 TinyLlama、Qwen2-VL、LLaVA。

上一篇:LMFlow

下一篇:zeta

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13