inference-optimization

本站收录 10 个带「inference-optimization」标签的 AI 开源项目

efficient-dl-systems这是一个面向深度学习系统的高效实现课程材料仓库,由多伦多大学等机构维护,内容涵盖深度学习系统的高效训练、推理、部署等核心主题。项目通过Jupyter Noteb★ 1,039krasisKrasis 是一个混合 LLM 运行时,专注于在消费级显存受限的硬件上高效运行更大的模型。它通过将模型层智能卸载到 CPU/内存,并利用 GPU 加速关键计算★ 523llm-inference-handbookllm-inference-handbook 是一个用 TypeScript 编写的开源知识手册,系统梳理大语言模型推理(LLM Inference)的全流程知★ 450llm-inference-engineeringllm-inference-engineering 是一份面向工程师的 LLM 推理工程学习路线,用 Markdown 组织成循序渐进的知识体系。它解决的是「会★ 294ram-coffersram-coffers 是一个面向 LLM 推理的基础设施优化项目,通过 NUMA 感知的权重银行(weight banking)技术,在 refurbishe★ 170ContextPilotContextPilot 是一个面向长上下文大模型推理的上下文优化基础设施,目标是在不损失精度的前提下加速推理。它针对 SGLang、vLLM、llama.cp★ 140autoauto 是一个被称为“AGI 编译器”的基础设施项目,用 Rust 编写。它通过记录 LLM agent 的行为轨迹,利用 conformal predict★ 128ReadyLLMReadyLLM 是一个面向本地大模型部署与运维的可视化基础设施工具。它把模型下载、量化、推理服务启动、运行监控和参数调优整合到一个图形界面中,底层基于 lla★ 106awesome-llm-token-optimization这是一个精选资源列表,汇集了降低大语言模型(LLM)Token 成本、提升生产环境效率的策略、工具、论文和资源。它解决的核心问题是 LLM 使用中 Token ★ 87SparseLLMSparseLLM 是 NeurIPS 2024 论文的官方实现,专注于大语言模型的全局剪枝。它解决的核心问题是:现有剪枝方法多依赖层内或局部启发式规则,难以在★ 71