on-policy-distillation

本站收录 10 个带「on-policy-distillation」标签的 AI 开源项目

Rethinking-OPDRethinking-OPD 是一个围绕大语言模型在线策略蒸馏(On-Policy Distillation, OPD)展开的研究型开源项目,配套论文《Reth★ 1,032AwesomeOPDAwesomeOPD 是一个关于在线策略蒸馏(On-Policy Distillation)的精选资源列表,专注于大语言模型(LLM)领域的知识蒸馏技术。该项目★ 873awesome-on-policy-distillation这是一个围绕大语言模型在线策略蒸馏(On-Policy Distillation,OPD)的资源合集,系统整理了论文、技术报告、框架和工具。它解决的核心问题是:★ 866DiffusionOPSDDiffusionOPSD 是一个针对扩散模型的在线策略自蒸馏(On-Policy Self-Distillation)训练框架,旨在解决扩散模型在生成质量和训★ 642Awesome-LLM-On-Policy-Distillation这是一个关于大语言模型在线策略蒸馏(On-Policy Distillation)的精选资源清单,汇集了相关论文、代码和工具。在线策略蒸馏是知识蒸馏的一种重要形★ 569DanceOPDDanceOPD 是一个基于策略内生成场蒸馏(On-Policy Generative Field Distillation)的图像生成与编辑工具。它解决的是传★ 372mini-verlmini-verl 是字节跳动 verl 强化学习训练框架的轻量单卡版本,目标是在一张消费级 NVIDIA GPU(如 RTX 3090/4090)上跑通大模型★ 304KDFlowKDFlow 是一个面向大语言模型的知识蒸馏框架,目标是把教师模型的能力高效迁移到更小的学生模型上。它把蒸馏流程模块化,用户只需配置教师、学生、数据与损失策略即★ 253OnlineSPECOnlineSPEC 是一个面向大语言模型推理加速的开源项目,核心思想是将投机解码(Speculative Decoding)与在线学习(Online Lear★ 126RLCSDRLCSD 是论文《RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distilla★ 113