Adam-mini

用更少学习率,训更快更大模型,省显存提性能。

Adam-mini 是一个优化器算法项目,旨在通过减少学习率数量来提升模型训练效率。它基于论文《Adam-mini: Use Fewer Learning Rates To Gain More》实现,核心思想是仅使用少量学习率(如每个参数块一个)来近似完整 Adam 优化器的行为,从而大幅降低内存占用和计算开销。项目解决了大模型训练中 Adam 优化器内存消耗高、调参复杂的问题,在保持甚至提升模型收敛速度和最终性能的同时,显著减少显存需求。其核心能力包括:提供易于集成的 PyTorch 实现,支持多种模型架构(如 Transformer),并在预训练、微调等场景下表现出色。该项目适合研究者和工程师在资源受限环境下训练大模型,或作为优化器改进的参考实现。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 460
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队zyushun
所属国家
官网地址
定价模式free
价格说明开源项目,代码公开,可自行部署使用,完全免费。
访问状态
是否开源是
开源协议
主要语言Python
技术栈/模型deep-learning,large-language-models,optimizer
GitHub 星标★ 460
30天Star增速
HF 下载量
上线时间2024-06-22 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

核心亮点

  • 内存占用显著降低:相比 Adam 减少约 50% 的优化器状态内存,适合大模型训练
  • 训练速度提升:在保持精度的同时,收敛速度更快,实验显示可加速 1.5-2 倍
  • 代码简洁易用:PyTorch 实现,接口与 Adam 类似,可直接替换现有优化器

不足之处

  • 文档/社区待观察:项目早期,文档和示例较少,社区支持有限
  • 仅支持特定模型架构:主要针对 Transformer 优化,其他架构需自行适配

适用场景

  • 大语言模型预训练:在有限 GPU 资源下训练更大模型
  • 模型微调:降低显存占用,支持更大 batch size
  • 优化器研究:作为改进 Adam 的参考实现,探索学习率分配策略

替代项目

Lion、Sophia、Adafactor

项目介绍

Adam-mini 是模型训练领域的开源项目,由 zyushun 开发,2024 年首次发布。

它收录于模型训练分类,该分类目前共有 518 个项目,GitHub 星标数为 460。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。代码公开,可自行部署使用,完全免费。

它主要面向的使用场景是:大语言模型预训练:在有限GPU资源下训练更大模型。同类可对比的替代方案包括 Lion、Sophia、Adafactor。

上一篇:ParScale

下一篇:GEM

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13