ServerlessLLM

把大模型部署变成按需调用的无服务器服务,省钱又省心

ServerlessLLM 是一个面向大语言模型(LLM)的无服务器推理服务平台,旨在让任何人都能轻松部署和运行 LLM 服务。它解决了传统 LLM 部署中资源利用率低、冷启动延迟高、运维复杂等问题,通过将模型推理与无服务器架构结合,实现按需自动扩缩容、请求级计费和零闲置成本。核心能力包括:基于请求的自动弹性伸缩,能在流量高峰时快速扩容,低谷时缩容至零;支持多种主流 LLM(如 Llama、GPT 等)的即插即用部署;提供高效的模型加载和缓存机制,显著降低冷启动时间;内置监控和日志系统,便于追踪服务状态。项目采用 Python 编写,当前处于早期阶段(700 星标),但架构设计清晰,适合作为 LLM 服务化的轻量级解决方案。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 716
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队ServerlessLLM
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型cuda,huggingface-transformers,large-language-models,model-as-a-service,model-serving,pytorch,serverless-inference
GitHub 星标★ 716
30天Star增速
HF 下载量
上线时间2024-01-23 00:00:00
最近更新2026-09-19 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

核心亮点

  • 自动扩缩容到零,闲置时零成本,适合突发流量场景
  • 冷启动优化,通过模型缓存和预加载减少等待时间
  • 支持主流 LLM 模型,API 兼容 OpenAI 风格,接入简单

不足之处

  • 项目处于早期,文档和社区生态尚不完善
  • 对复杂推理场景(如多模型混合、自定义算子)支持有限

适用场景

  • 个人开发者快速部署个人 LLM API 供应用调用
  • 企业内部分享 LLM 能力,按部门或项目独立计费
  • AI 应用原型开发,需要低成本验证 LLM 集成

替代项目

KServe、BentoML、Ray Serve

项目介绍

ServerlessLLM 是基础设施领域的开源项目,由 ServerlessLLM 开发,2024 年首次发布。

它收录于基础设施分类,该分类目前共有 1,130 个项目,GitHub 星标数为 716。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-19。Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:个人开发者快速部署个人LLMAPI供应用调用。同类可对比的替代方案包括 KServe、BentoML、Ray Serve。

上一篇:spectralquant

下一篇:thepipe

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09