Rethinking-OPD 是模型训练领域的开源项目,由 Thinking-Space 开发,是 2026 年新上线的项目。
在全站 12,822 个收录项目中,它的 GitHub 星标数(1,017)位列前 30%,在模型训练分类中处于中上游。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-17。开源研究代码,免费使用。
它主要面向的使用场景是:研究大模型蒸馏算法、想理解OPD失效机制。同类可对比的替代方案包括 MiniLLM、DistiLLM、GKD。

拆解大模型在线蒸馏为何翻车,给出可复现配方
Rethinking-OPD 是一个围绕大语言模型在线策略蒸馏(On-Policy Distillation, OPD)展开的研究型开源项目,配套论文《Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe》。它要解决的问题是:现有 OPD 方法虽然被广泛用于把强教师模型的能力迁移到小模型,但训练中常出现不稳定、效果不如预期甚至退化,社区缺乏对背后机制的清晰解释。项目从现象学、机制和配方三个层面系统剖析 OPD,提供可复现的训练与评测代码,帮助研究者定位蒸馏失效的原因,并给出更稳健的蒸馏配置建议。核心能力包括:在线策略蒸馏实验框架、现象与机制分析工具、以及可复用的训练配方。适合做模型压缩、能力迁移和蒸馏算法改进的研究者与工程师参考。
1创建 verl 环境
用 conda 新建名为 verl 的 Python 3.12 环境,用于 OPD 与 RL 相关训练。
conda create -n verl python==3.122激活 verl 环境
切换到刚创建的环境,后续安装命令都要在该环境内执行。
conda activate verl3安装训练依赖
进入 verl 源码目录,以 USE_MEGATRON=0 关闭 Megatron 后端,运行官方脚本安装 vLLM/SGLang/MCore 依赖。
cd verl/
USE_MEGATRON=0 bash scripts/install_vllm_sglang_mcore.sh4安装 math-verify
在 verl 环境中补充安装数学答案校验依赖 math-verify。
pip install math-verify5创建 SFT 环境
SFT 训练使用 Python 3.11,需另建一个名为 sft 的环境,与 verl 环境分开。
conda create -n sft python==3.116安装 LlamaFactory
进入 LlamaFactory 源码目录,以可编辑模式安装本体,并装 metrics 额外依赖。
cd LlamaFactory/
pip install -e .
pip install -r requirements/metrics.txtREADME 未给出验证方式;可执行 conda activate verl 后用 pip list 确认依赖已装入。
Q:为什么环境要建两个?
A:README 中 OPD/RL 基于 verl 用 Python 3.12,SFT 基于 LlamaFactory 用 Python 3.11,两者版本不同,建议各建独立 conda 环境避免冲突。
Q:README 没有给 git clone 命令怎么办?
A:需自行从 verl 与 LLaMA-Factory 官方仓库获取 v0.7.0、v0.9.5 版本源码,准备好 verl/ 与 LlamaFactory/ 两个目录后再执行安装。
Q:安装脚本执行失败怎么办?
A:先确认当前位于 verl/ 目录下,且命令中保留了 USE_MEGATRON=0 前缀,它决定是否启用 Megatron 后端。
MiniLLM、DistiLLM、GKD
Rethinking-OPD 是模型训练领域的开源项目,由 Thinking-Space 开发,是 2026 年新上线的项目。
在全站 12,822 个收录项目中,它的 GitHub 星标数(1,017)位列前 30%,在模型训练分类中处于中上游。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-17。开源研究代码,免费使用。
它主要面向的使用场景是:研究大模型蒸馏算法、想理解OPD失效机制。同类可对比的替代方案包括 MiniLLM、DistiLLM、GKD。
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···