llm-scaler 是基础设施领域的开源项目,由 intel 开发,2025 年首次发布。
它收录于基础设施分类,该分类目前共有 1,112 个项目,GitHub 星标数为 535。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-17。开源免费,无官网及定价信息。
它主要面向的使用场景是:在单张消费级显卡上部署7B/13B模型并提升生成速度。同类可对比的替代方案包括 llama.cpp、vLLM。

让大模型推理更快更省显存,本地部署也能跑得动
llm-scaler 是一个用 C++ 编写的大模型推理性能优化工具,目标是让本地或私有化部署的大语言模型在有限硬件上跑得更快、更省显存。它针对 LLM 推理中显存占用高、吞吐低、长上下文处理慢等痛点,通过量化、张量并行、KV Cache 管理、算子融合等底层优化手段,在推理链路上做加速。项目以 C++ 实现,追求低开销和高可移植性,适合对延迟和成本敏感的部署场景。它不训练模型,而是作为推理侧的基础设施层,配合主流推理框架或自研引擎使用,帮助开发者在消费级显卡或多卡环境下获得更高的 token 吞吐和更长的上下文支持。目前处于早期阶段,星标约 529,接口和功能仍在快速迭代中。
llama.cpp、vLLM
llm-scaler 是基础设施领域的开源项目,由 intel 开发,2025 年首次发布。
它收录于基础设施分类,该分类目前共有 1,112 个项目,GitHub 星标数为 535。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-17。开源免费,无官网及定价信息。
它主要面向的使用场景是:在单张消费级显卡上部署7B/13B模型并提升生成速度。同类可对比的替代方案包括 llama.cpp、vLLM。
上一篇:llmman
下一篇:vLLM-Kunlun
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···