efficient-inference
本站收录 11 个带「efficient-inference」标签的 AI 开源项目
LLMCompilerLLMCompiler 是一个面向大语言模型(LLM)的函数调用并行化框架,源自 ICML 2024 论文。它借鉴传统编译器思想,将复杂的多步骤任务分解为依赖图★ 1,890
DeepCacheDeepCache 是一个针对扩散模型(Diffusion Models)的免训练加速方案,核心思想是利用扩散模型去噪过程中相邻步骤间特征的高度相似性,通过缓存★ 968
Awesome-Quantization-Papers这是一个精选神经网络量化相关论文的列表项目,持续跟踪AI顶会和期刊的最新研究成果。它系统整理了模型压缩、低比特量化、量化感知训练、后训练量化等方向的关键论文,帮★ 855
orthrusorthrus 是一个面向大语言模型的高效推理加速项目,核心思路是通过双视角扩散解码(dual-view diffusion decoding)实现快速且无损的★ 482
Awesome-Generation-Acceleration这是一个专注于生成模型加速的资源合集,主要收集扩散模型、文本到图像生成等领域的推理加速技术。它解决了生成式AI模型在部署时计算量大、推理速度慢的问题,通过整理高★ 404
picollmpicollm 是一个专注于设备端(on-device)大语言模型推理的开源项目,通过 X-Bit 量化技术实现高效的模型压缩与推理。它支持 Gemma、Lla★ 318
AsyncDiffAsyncDiff 是一个针对扩散模型(Diffusion Models)的推理加速工具,核心思想是通过异步去噪(Asynchronous Denoising)★ 213
Awesome-Efficient-AIGCAwesome-Efficient-AIGC 是一个专注于高效 AIGC(人工智能生成内容)领域的精选资源列表,收录了相关论文、文档和代码。该项目旨在为高效 A★ 209
OnlineSPECOnlineSPEC 是一个面向大语言模型推理加速的开源项目,核心思想是将投机解码(Speculative Decoding)与在线学习(Online Lear★ 127
AdaptiveDiffusionAdaptiveDiffusion 是一个无需训练的扩散模型加速推理方案,发表于 NeurIPS 2024。它针对 Stable Diffusion 等扩散模型★ 74
GuidedQuantGuidedQuant 是 ICML 2025 论文的官方 PyTorch 实现,提出一种利用端到端损失引导的大语言模型量化方法。传统量化方法通常依赖逐层或局部★ 56