ServerlessLLM 是基础设施领域的开源项目,由 ServerlessLLM 开发,2024 年首次发布。
它收录于基础设施分类,该分类目前共有 1,130 个项目,GitHub 星标数为 716。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-19。Apache-2.0许可证,可免费使用和部署。
它主要面向的使用场景是:个人开发者快速部署个人LLMAPI供应用调用。同类可对比的替代方案包括 KServe、BentoML、Ray Serve。

把大模型部署变成按需调用的无服务器服务,省钱又省心
ServerlessLLM 是一个面向大语言模型(LLM)的无服务器推理服务平台,旨在让任何人都能轻松部署和运行 LLM 服务。它解决了传统 LLM 部署中资源利用率低、冷启动延迟高、运维复杂等问题,通过将模型推理与无服务器架构结合,实现按需自动扩缩容、请求级计费和零闲置成本。核心能力包括:基于请求的自动弹性伸缩,能在流量高峰时快速扩容,低谷时缩容至零;支持多种主流 LLM(如 Llama、GPT 等)的即插即用部署;提供高效的模型加载和缓存机制,显著降低冷启动时间;内置监控和日志系统,便于追踪服务状态。项目采用 Python 编写,当前处于早期阶段(700 星标),但架构设计清晰,适合作为 LLM 服务化的轻量级解决方案。
KServe、BentoML、Ray Serve
ServerlessLLM 是基础设施领域的开源项目,由 ServerlessLLM 开发,2024 年首次发布。
它收录于基础设施分类,该分类目前共有 1,130 个项目,GitHub 星标数为 716。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-19。Apache-2.0许可证,可免费使用和部署。
它主要面向的使用场景是:个人开发者快速部署个人LLMAPI供应用调用。同类可对比的替代方案包括 KServe、BentoML、Ray Serve。
上一篇:spectralquant
下一篇:thepipe
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···