vector-inference 是基础设施领域的开源项目,由 VectorInstitute 开发,2024 年首次发布。
它收录于基础设施分类,该分类目前共有 1,130 个项目,GitHub 星标数为 107。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-10。开源免费,需自行部署于Slurm集群。
它主要面向的使用场景是:高校或实验室在已有Slurm集群上部署内部LLM推理API。同类可对比的替代方案包括 vLLM、SGLang、Ray Serve。

在 Slurm 集群上直接跑 LLM 推理服务
vector-inference 是一个面向 Slurm 集群的 LLM 推理服务框架,目标是让团队在已有 HPC 调度系统上高效部署大模型推理,而不必额外搭建 Kubernetes 或专用推理平台。它把模型加载、请求调度、批处理与多节点并行封装成可在 Slurm 上提交的任务,支持 SGLang 等推理后端,并覆盖文本生成、语音转写、多模态和奖励模型等任务类型。核心能力包括:在 Slurm 作业内启动推理服务并暴露 API,利用批处理和并行策略提升 GPU 利用率,统一管理多种模型任务的部署配置。适合已有 Slurm 集群、需要跑内部 LLM 服务的研究机构或企业,用较低改造成本把闲置 GPU 资源变成可调用的推理能力。
vLLM、SGLang、Ray Serve
vector-inference 是基础设施领域的开源项目,由 VectorInstitute 开发,2024 年首次发布。
它收录于基础设施分类,该分类目前共有 1,130 个项目,GitHub 星标数为 107。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-10。开源免费,需自行部署于Slurm集群。
它主要面向的使用场景是:高校或实验室在已有Slurm集群上部署内部LLM推理API。同类可对比的替代方案包括 vLLM、SGLang、Ray Serve。
上一篇:freellmpool
下一篇:NpgsqlRest
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···