lmms-finetune

极简代码库,快速微调主流多模态大模型

lmms-finetune 是一个极简的多模态大模型微调代码库,旨在降低 LMM(Large Multimodal Model)微调的门槛。它支持多种主流模型,包括 LLaVA 系列(1.5/1.6、Interleave、Next-Video、OneVision)、Llama 3.2 Vision、Qwen-VL、Qwen2-VL、Phi-3 等,覆盖图像、视频和多模态交错场景。项目解决了多模态微调中代码复杂、依赖繁琐、难以快速上手的问题,提供了统一的训练脚本和数据处理流程,让研究者或开发者能快速在自己的数据上微调模型。核心能力包括:支持单卡/多卡训练、灵活的模型配置、与 Hugging Face 生态兼容、提供示例脚本和文档。作为一个早期项目(GitHub 星标 373),它强调代码的简洁性和可扩展性,适合学术研究和工业原型验证。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 375
维护状态 低维护
是否开源
定价模式 free

项目数据

分类开源模型
开发团队zjysteven
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0许可证,完全免费,可自行部署使用。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型finetuning,foundation-models,instruction-tuning,large-language-model,large-multimodal-models,llava,llava-next,multimodal,multimodal-large-language-models,qwen-vl,vision-language,visual-instruction-tuning
GitHub 星标★ 375
30天Star增速
HF 下载量
上线时间2024-07-20 00:00:00
最近更新2026-09-15 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

核心亮点

  • 支持 LLaVA、Qwen-VL、Phi-3 等 7+ 主流多模态模型,覆盖面广
  • 代码结构极简,依赖少,易于二次开发和定制
  • 提供统一训练脚本,支持图像/视频/交错数据,降低上手门槛

不足之处

  • 文档和社区资源较少,早期项目示例不够丰富
  • 对多卡分布式训练的支持可能不如成熟框架(如 DeepSpeed)完善

适用场景

  • 学术研究:快速验证多模态微调新想法
  • 垂直领域应用:微调模型以适应特定图像/视频任务
  • 教学演示:用最小代码理解多模态微调流程

替代项目

LLaVA-NeXT、Qwen2-VL-Finetune、xtuner

项目介绍

lmms-finetune 是模型训练领域的开源项目,由 zjysteven 开发,2024 年首次发布。

它收录于模型训练分类,该分类目前共有 518 个项目,GitHub 星标数为 375。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-15。Apache-2.0许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:学术研究:快速验证多模态微调新想法。同类可对比的替代方案包括 LLaVA-NeXT、Qwen2-VL-Finetune、xtuner。

上一篇:TOTEM

下一篇:deep-delta-learning

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13