Rethinking-OPD

拆解大模型在线蒸馏为何翻车,给出可复现配方

Rethinking-OPD 是一个围绕大语言模型在线策略蒸馏(On-Policy Distillation, OPD)展开的研究型开源项目,配套论文《Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe》。它要解决的问题是:现有 OPD 方法虽然被广泛用于把强教师模型的能力迁移到小模型,但训练中常出现不稳定、效果不如预期甚至退化,社区缺乏对背后机制的清晰解释。项目从现象学、机制和配方三个层面系统剖析 OPD,提供可复现的训练与评测代码,帮助研究者定位蒸馏失效的原因,并给出更稳健的蒸馏配置建议。核心能力包括:在线策略蒸馏实验框架、现象与机制分析工具、以及可复用的训练配方。适合做模型压缩、能力迁移和蒸馏算法改进的研究者与工程师参考。

开源 free 模型训练
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1017
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类模型训练
开发团队Thinking-Space
所属国家
官网地址
定价模式free
价格说明开源研究代码,免费使用
访问状态
是否开源
开源协议
主要语言Python
技术栈/模型llms,mechanism,on-policy-distillation
GitHub 星标★ 1017
30天Star增速
HF 下载量
上线时间2026-04-12 00:00:00
最近更新2026-09-17 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-15
浏览次数0

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 6 步

环境要求

  • 已安装 conda,用于创建隔离环境
  • verl 环境使用 Python 3.12
  • LlamaFactory 环境使用 Python 3.11
  • 需要事先准备 verl v0.7.0 与 LlamaFactory v0.9.5 的源码目录

安装与启动步骤

  1. 1创建 verl 环境

    用 conda 新建名为 verl 的 Python 3.12 环境,用于 OPD 与 RL 相关训练。

    conda create -n verl python==3.12
  2. 2激活 verl 环境

    切换到刚创建的环境,后续安装命令都要在该环境内执行。

    conda activate verl
  3. 3安装训练依赖

    进入 verl 源码目录,以 USE_MEGATRON=0 关闭 Megatron 后端,运行官方脚本安装 vLLM/SGLang/MCore 依赖。

    cd verl/
    USE_MEGATRON=0 bash scripts/install_vllm_sglang_mcore.sh
  4. 4安装 math-verify

    在 verl 环境中补充安装数学答案校验依赖 math-verify。

    pip install math-verify
  5. 5创建 SFT 环境

    SFT 训练使用 Python 3.11,需另建一个名为 sft 的环境,与 verl 环境分开。

    conda create -n sft python==3.11
  6. 6安装 LlamaFactory

    进入 LlamaFactory 源码目录,以可编辑模式安装本体,并装 metrics 额外依赖。

    cd LlamaFactory/
    pip install -e .
    pip install -r requirements/metrics.txt

如何确认成功

README 未给出验证方式;可执行 conda activate verl 后用 pip list 确认依赖已装入。

常见问题

Q:为什么环境要建两个?

A:README 中 OPD/RL 基于 verl 用 Python 3.12,SFT 基于 LlamaFactory 用 Python 3.11,两者版本不同,建议各建独立 conda 环境避免冲突。

Q:README 没有给 git clone 命令怎么办?

A:需自行从 verl 与 LLaMA-Factory 官方仓库获取 v0.7.0、v0.9.5 版本源码,准备好 verl/ 与 LlamaFactory/ 两个目录后再执行安装。

Q:安装脚本执行失败怎么办?

A:先确认当前位于 verl/ 目录下,且命令中保留了 USE_MEGATRON=0 前缀,它决定是否启用 Megatron 后端。

注意事项

  • README 未提供代码下载命令,需自行准备 verl v0.7.0 与 LlamaFactory v0.9.5 源码目录。
  • USE_MEGATRON=0 表示不使用 Megatron 后端,该安装脚本必须在 verl/ 目录内执行。
  • OPD/RL 环境(Python 3.12)与 SFT 环境(Python 3.11)不可混用。
  • README 未给出训练、评测入口与配置文件说明,具体运行方式请结合仓库与论文进一步确认。

核心亮点

  • 从现象、机制到配方三层递进分析,不止给结论还给出可复现实验代码
  • 聚焦在线策略蒸馏这一实际训练痛点,对蒸馏不稳定问题有针对性诊断
  • 基于真实大模型蒸馏实验,结论对模型压缩与能力迁移有直接参考价值

不足之处

  • 偏研究性质,工程化封装和开箱即用程度有限
  • 文档与社区生态仍在早期,长期维护情况待观察

适用场景

  • 研究大模型蒸馏算法、想理解 OPD 失效机制
  • 需要把强教师模型能力迁移到小模型时参考训练配方
  • 复现论文实验或在此基础上改进蒸馏方法

替代项目

MiniLLM、DistiLLM、GKD

项目介绍

Rethinking-OPD 是模型训练领域的开源项目,由 Thinking-Space 开发,是 2026 年新上线的项目。

在全站 12,822 个收录项目中,它的 GitHub 星标数(1,017)位列前 30%,在模型训练分类中处于中上游。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-17。开源研究代码,免费使用。

它主要面向的使用场景是:研究大模型蒸馏算法、想理解OPD失效机制。同类可对比的替代方案包括 MiniLLM、DistiLLM、GKD。

上一篇:LLaMEA

下一篇:d1

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 61694 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1284 2026-08-13