
SpecForge
训练投机解码模型,一键部署到 SGLang 提速
SpecForge 是一个面向大模型推理加速的开源训练框架,专门用于训练投机解码(speculative decoding)模型,并支持将训练结果平滑部署到 SGLang 推理引擎。投机解码通过让一个小型草稿模型预测多个候选 token,再由大模型并行验证,从而在不损失生成质量的前提下显著提升推理吞吐。SpecForge 解决了以往投机解码模型训练流程繁琐、与推理框架割裂的问题,内置 EAGLE、EAGLE3 等主流算法实现,基于 PyTorch 与 FSDP 支持多卡分布式训练,覆盖数据准备、训练、评测到导出部署的完整链路。用户可以用统一配置快速复现实验,训练完成后直接导出为 SGLang 可加载的权重,减少手工适配成本。项目处于成长阶段,社区活跃度上升,适合需要自建推理加速能力的团队与研究者在自有模型上落地投机解码。
项目数据
使用教程
⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。
环境要求
- Python 环境(项目为 Python 开发)
- PyTorch 与 FSDP,用于多卡分布式训练
- GPU 训练节点(EAGLE / EAGLE3 训练需多卡)
- 使用 external 配方时,需自备 SGLang 与 Mooncake 服务
安装与启动步骤
-
1获取项目代码
从 GitHub 克隆 SpecForge 仓库到本地,作为后续训练配置与脚本的运行目录。
git clone https://github.com/sgl-project/SpecForge.git -
2查阅官方文档
README 未给出安装命令,请先按官方文档完成环境与依赖安装,不要自行猜测包名。
-
3选择训练配方
在 examples/configs 下按 feature mode、拓扑与 online 服务归属挑选 yaml,如 external 配方。
-
4启动训练
用统一训练入口执行所选配置,路径需与 examples/configs 下实际文件一致。
specforge train --config examples/configs/online/disaggregated/external/qwen3-8b-eagle3-disaggregated.yaml -
5准备外部服务
external 配方下 SpecForge 只监管生产者和消费者,Mooncake 与 SGLang 由用户或调度器自行启动。
关键配置
| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
--config | 是 | 指定训练 YAML 配置文件路径,路径本身标识模式、拓扑与服务归属 | examples/configs/online/disaggregated/external/qwen3-8b-eagl |
如何确认成功
执行 specforge train 后命令行无报错并进入训练流程输出,即表示启动成功(README 未给出具体成功标志)。
常见问题
Q:SpecForge 是做什么的?
A:由 SGLang 团队开发的生态项目,用于训练投机解码模型,训练结果可直接迁移到 SGLang 推理框架加速推理。
Q:训练好的模型怎么用到推理里?
A:项目与 SGLang 直接兼容,按官方文档导出后即可部署到 SGLang,无需额外适配工作量。
Q:支持哪些投机解码算法?
A:内置 EAGLE、EAGLE3 等主流方法,通过统一的类型化训练入口调用。
Q:external 和 managed-local 配方有什么区别?
A:external 配方由 SpecForge 在同一训练节点监管生产者与消费者,Mooncake 和 SGLang 由用户或调度器负责;managed-local 则由 SpecForge 托管。
注意事项
- README 未提供 pip 安装命令,务必以官方文档 https://docs.sglang.io/SpecForge/ 的安装说明为准。
- 配置路径区分 feature mode、拓扑和 online 服务归属,换任务时先确认 examples/configs 下存在对应 yaml。
- 训练与推理可分离部署,支持数据、张量与序列并行拓扑。
核心亮点
- 内置 EAGLE、EAGLE3 等主流投机解码算法,开箱即用无需从零实现
- 基于 FSDP 支持多卡分布式训练,可扩展到较大规模草稿模型
- 训练产物可直接导出并接入 SGLang 推理服务,打通训练到部署链路
不足之处
- 项目较新,文档与示例覆盖度仍在完善中
- 与 SGLang 强绑定,迁移到其他推理框架需额外适配
适用场景
- 为大模型推理服务训练草稿模型以提升吞吐
- 研究团队复现和对比 EAGLE 系列投机解码算法
- 在自有模型上构建低延迟高并发的在线生成服务
替代项目
Medusa、EAGLE、LookaheadDecoding
项目介绍
同类项目推荐
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···