JetSpec

让大模型推理更快:并行草稿树突破推测解码速度天花板

JetSpec 是一个针对推测解码(Speculative Decoding)性能瓶颈的开源项目,核心创新在于提出“因果并行树草稿”(Causal Parallel Tree Drafting)机制,打破传统推测解码中草稿模型串行生成带来的扩展上限。它通过并行构建多个草稿序列并利用因果注意力机制进行高效验证,显著提升了大模型推理的吞吐量并降低延迟,尤其适合批量生成场景。项目提供完整的训练和推理代码,支持主流大模型架构,并包含与标准推测解码的对比实验脚本。其核心能力包括草稿树并行生成、动态树深度调整、以及基于因果关系的验证策略优化,旨在让现有LLM服务在不牺牲生成质量的前提下获得数倍加速。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 225
维护状态 活跃
是否开源
定价模式 free

项目数据

分类开源模型
开发团队hao-ai-lab
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型efficient-llm-inference,fast-inference,large-language-models,speculative-decoding
GitHub 星标★ 225
30天Star增速
HF 下载量
上线时间2026-05-27 00:00:00
最近更新2026-09-19 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数9

使用教程

核心亮点

  • 创新性地用并行树草稿替代串行草稿,实测吞吐量提升显著
  • 提供完整训练与推理流程,易于在现有LLM上集成
  • 代码结构清晰,实验配置丰富,便于复现论文结果

不足之处

  • 项目尚处早期,文档和社区支持待观察
  • 对显存和计算资源要求较高,小规模部署收益有限

适用场景

  • 大模型在线服务降低首字延迟
  • 批量离线推理任务提升吞吐
  • 边缘设备上加速中小规模模型生成

替代项目

Medusa、EAGLE、Lookahead Decoding

项目介绍

JetSpec 是模型训练领域的开源项目,由 hao-ai-lab 开发,是 2026 年新上线的项目。

它收录于模型训练分类,该分类目前共有 518 个项目,GitHub 星标数为 225。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-19。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:大模型在线服务降低首字延迟。同类可对比的替代方案包括 Medusa、EAGLE、Lookahead Decoding。

上一篇:MindPipe

下一篇:Awesome-LLM-Post-training

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13