speculative-decoding
本站收录 14 个带「speculative-decoding」标签的 AI 开源项目
luceboxlucebox 是一个面向异构硬件与消费级 GPU 的 LLM 投机推理服务器,用 C++ 编写并深度依赖 CUDA 与自定义内核。它要解决的问题是:在非数据中★ 2,885
EAGLEEAGLE是一个开源的大语言模型推理加速框架,由字节跳动团队开发,包含EAGLE-1、EAGLE-2和EAGLE-3三个版本,分别发表于ICML'24、EMNL★ 2,545
intel-extension-for-transformersIntel Extension for Transformers 是英特尔推出的开源工具包,旨在让开发者快速构建聊天机器人,并在英特尔平台上高效运行大语言模型(★ 2,170
sonarsonar 是一个面向大规模 LLM 推理场景的高性能引擎,用 C++ 编写,旨在解决大模型部署时的高延迟、低吞吐和硬件适配问题。它支持多种硬件后端,包括 NV★ 1,869
AngelSlimAngelSlim 是一个面向大语言模型的开源压缩工具包,旨在让模型压缩更易用、更全面、更高效。它解决了模型部署中体积大、推理慢、成本高的问题,提供从剪枝、量化★ 1,668
awesome-on-policy-distillation这是一个围绕大语言模型在线策略蒸馏(On-Policy Distillation,OPD)的资源合集,系统整理了论文、技术报告、框架和工具。它解决的核心问题是:★ 850
halogen-flash-serverhalogen-flash-server 是一个面向 AMD Strix Halo(gfx1151)平台的本地大模型推理部署脚本,目标是让用户以最快速度在搭载该★ 729
orthrusorthrus 是一个面向大语言模型的高效推理加速项目,核心思路是通过双视角扩散解码(dual-view diffusion decoding)实现快速且无损的★ 482
JetSpecJetSpec 是一个针对推测解码(Speculative Decoding)性能瓶颈的开源项目,核心创新在于提出“因果并行树草稿”(Causal Parall★ 227
model-serving-minefieldmodel-serving-minefield 是一个社区维护的 LLM 推理服务“踩坑登记册”,专门收集那些会让测量结果看似正常、实则自信地给出错误结论的陷阱★ 134
sndr_core_engineSNDR Core Engine (Genesis) 是一个针对消费级 NVIDIA GPU(如 RTX 3090、A5000)的 vLLM 运行时补丁覆盖层,★ 132
OnlineSPECOnlineSPEC 是一个面向大语言模型推理加速的开源项目,核心思想是将投机解码(Speculative Decoding)与在线学习(Online Lear★ 127
DARTDART 是一个旨在加速大语言模型推理的推测解码(Speculative Decoding)方法的官方实现。它受扩散模型启发,通过引入一种新的采样与验证机制,在★ 71
RSDRSD是一个基于奖励引导的投机解码(Speculative Decoding)方法,旨在提升大语言模型推理时的效率与效果。投机解码通过小模型草稿、大模型验证的方★ 57