KDFlow

一套配置跑通多种LLM蒸馏,小模型也能继承大模型能力

KDFlow 是一个面向大语言模型的知识蒸馏框架,目标是把教师模型的能力高效迁移到更小的学生模型上。它把蒸馏流程模块化,用户只需配置教师、学生、数据与损失策略即可跑通训练,降低了自行拼装蒸馏管线的门槛。核心能力覆盖多种蒸馏范式:离线策略(off-policy)用教师生成的固定数据训练;在线策略(OPD)让学生边采样边接受教师指导,缓解训练与推理分布不一致;跨分词器(cross-tokenizer)蒸馏解决师生词表不同导致的 token 对齐难题;还支持多模态蒸馏与在线自蒸馏。框架基于 Python 实现,适合研究者在有限算力下复现和对比不同蒸馏方案,也方便工程团队把大模型能力压缩到可部署的小模型。

开源 free 模型训练
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 253
维护状态 较活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类模型训练
开发团队songmzhang
所属国家
官网地址
定价模式free
价格说明开源免费,基于Python,需自行部署
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型cross-tokenizer-distillation,distillation,knowledge-distillation,large-languge-models,on-policy-distillation
GitHub 星标★ 253
30天Star增速
HF 下载量
上线时间2026-02-27 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-07
浏览次数0

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

核心亮点

  • 同时覆盖off-policy、on-policy、跨分词器、多模态与自蒸馏,范式齐全,不用为每种方法重写训练代码
  • 跨分词器蒸馏直接处理师生词表不一致问题,这是很多蒸馏框架缺失的实用能力
  • 模块化设计,教师/学生/数据/损失可替换,便于做消融实验和快速验证新想法

不足之处

  • 项目处于早期,星标仅253,文档完整度与示例丰富度可能不足
  • 生态和社区规模较小,遇到问题可参考的issue与第三方教程有限

适用场景

  • 把百亿参数大模型的能力蒸馏到几亿参数小模型,用于低成本部署
  • 研究在线策略蒸馏与离线蒸馏的效果差异,做对比实验
  • 师生模型使用不同分词器时,仍想完成知识迁移的场景

替代项目

MiniLLM、DistiLLM、LLM-KD

项目介绍

KDFlow 是模型训练领域的开源项目,由 songmzhang 开发,是 2026 年新上线的项目。

它收录于模型训练分类,该分类目前共有 543 个项目,GitHub 星标数为 253。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-27。开源免费,基于Python,需自行部署。

它主要面向的使用场景是:把百亿参数大模型的能力蒸馏到几亿参数小模型,用于低成本部署。同类可对比的替代方案包括 MiniLLM、DistiLLM、LLM-KD。

上一篇:LoongSage

下一篇:没有了!

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 63243 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1308 2026-08-13