mergekit

拖拽式合并大模型,轻松融合多个模型能力

mergekit 是一个用于合并预训练大语言模型(LLM)的工具集。它解决了模型合并过程中繁琐的工程问题,让开发者能够轻松地将多个模型的能力融合到一个模型中。其核心能力包括支持多种合并算法(如线性插值、SLERP、TIES、DARE 等),提供统一的命令行接口和 Python API,并针对大模型优化了内存使用,使得在普通消费级硬件上也能合并 70B 级别的模型。通过 mergekit,用户可以快速实现模型能力的组合,例如将指令微调模型与基础模型合并,或融合多个领域专家模型,从而无需从头训练即可获得增强的模型性能。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 7366
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类开源模型
开发团队arcee-ai
所属国家
官网地址
定价模式free
价格说明开源工具,本地部署,完全免费
访问状态
是否开源
开源协议LGPL-3.0
主要语言Python
技术栈/模型llama,llm,model-merging
GitHub 星标★ 7366
30天Star增速
HF 下载量
上线时间2023-08-21 00:00:00
最近更新2026-09-22 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:进阶 约 15 分钟 部署方式:命令行工具 7 步

环境要求

  • Python 环境(可运行 pip)
  • pip 版本需大于 21.3,否则 editable 安装会报错
  • 磁盘空间足以存放待合并模型及输出模型
  • 可选:NVIDIA GPU 与至少 8 GB 显存用于加速,合并也可完全在 CPU 上运行

安装与启动步骤

  1. 1克隆仓库

    从 GitHub 拉取 mergekit 源码到本地当前目录。

    git clone https://github.com/arcee-ai/mergekit.git
  2. 2进入目录

    切换到刚克隆下来的 mergekit 目录内再执行后续安装。

    cd mergekit
  3. 3安装包

    以 editable 模式安装,并把 mergekit 的命令行脚本加入环境。

    pip install -e .
  4. 4升级 pip

    仅当安装报 setup.py/setup.cfg 找不到时执行,把 pip 升到 21.3 以上。

    python3 -m pip install --upgrade pip
  5. 5编写合并配置

    按 README 字段写 YAML:merge_method、models 或 slices、base_model、parameters 等。

  6. 6执行合并

    传入配置文件和输出目录,按需加 --cuda、--lazy-unpickle 等参数。

    mergekit-yaml path/to/your/config.yml ./output-model-directory
  7. 7查看全部参数

    不确定可用选项时,用 --help 查看 mergekit-yaml 支持的全部参数。

    mergekit-yaml --help

关键配置

配置项必填说明示例
merge_method指定使用的合并算法,如 linear、SLERP、TIES、DARE 等。linear
models列出参与合并的完整模型;与 slices 互斥。path/to/model_a
slices定义取自不同模型的层切片;与 models 互斥。path/to/model_a
base_model某些合并方法所需的基础模型。path/to/model
parameters存放权重、密度等参数,可在不同层级指定。weight: 0.5
tokenizer配置输出词表与嵌入对齐,source 可取 union/base/模型路径。source: union

如何确认成功

命令执行完成后,合并结果已写入 ./output-model-directory,目录中出现合并后的模型权重与配置文件。

常见问题

Q:pip install -e . 报错找不到 setup.py 或 setup.cfg 怎么办?

A:按 README 提示升级 pip 到 21.3 以上:python3 -m pip install --upgrade pip,然后重新执行 pip install -e .。

Q:没有 GPU 能合并模型吗?

A:可以。README 说明合并可完全在 CPU 上运行,也可用最少 8 GB 显存加速。

Q:tokenizer 和 tokenizer_source 可以同时写吗?

A:不可以,两者互斥,只能二选一。tokenizer 是推荐的新写法,tokenizer_source 仅作向后兼容。

Q:models 和 slices 能同时配置吗?

A:不能,这两个字段互斥:要么用 models 指定完整模型,要么用 slices 指定层切片。

注意事项

  • 合并过程采用 out-of-core 方式,资源受限环境也能完成复杂合并。
  • --unsafe-truncate-embeddings 默认关闭且独立于 --allow-crimes,它会按最小词表截断而不检查 token ID 含义,需自行确保 token 对齐。
  • 当输入模型词表大小不同时,必须通过 tokenizer 或 tokenizer_source 对齐,否则无法合并。

核心亮点

  • 支持多种主流合并算法(SLERP、TIES、DARE等),灵活适配不同场景
  • 内存优化出色,消费级GPU也能合并超大模型
  • 提供简洁的CLI和Python API,上手门槛低

不足之处

  • 合并后模型效果存在不确定性,需要大量实验调参
  • 文档偏技术性,对新手不够友好

适用场景

  • 将多个领域微调模型合并为全能模型
  • 融合指令跟随模型与基础模型提升通用性
  • 在有限算力下快速构建定制化模型

替代项目

Model Merging (Hugging Face)、SLERP (SuperMerger)、LM-Cocktail

项目介绍

mergekit 是模型训练领域的开源项目,由 arcee-ai 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(7,366)位列前 7%,在模型训练分类的 518 个项目里位列前 7%。

近 41 天,它的 GitHub 星标从 7,290 增加到 7,366,净增 76。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-22。开源工具,本地部署,完全免费。

它主要面向的使用场景是:将多个领域微调模型合并为全能模型。同类可对比的替代方案包括 Model Merging (Hugging Face)、SLERP (SuperMerger)、LM-Cocktail。

上一篇:optimate

下一篇:Firefly

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13