nano-vllm-prefillonly 是基础设施领域的开源项目,由 86MaxCao 开发,是 2026 年新上线的项目。
它收录于基础设施分类,该分类目前共有 1,157 个项目,GitHub 星标数为 120。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-20。免费使用。
它主要面向的使用场景是:多模态检索中的向量/打分前向计算。同类可对比的替代方案包括 vLLM、SGLang、TensorRT-LLM。

砍掉解码只留 prefill,判别式大模型推理更快更省
nano-vllm-prefillonly 是 nano-vllm 的一个专用优化分支,聚焦于仅需 prefill 阶段的推理任务。传统大模型推理框架通常为自回归解码设计,包含 KV Cache 管理、逐 token 生成等完整流程,但对于判别式应用(如多模态检索、打分、分类、rerank),模型只需对输入做一次前向计算即可得到结果,无需逐 token 解码。该项目正是为这类场景裁剪掉解码相关开销,保留并强化 prefill 路径,从而在工业级多模态大模型判别任务上获得更高的吞吐与更低的延迟。核心能力包括:针对 prefill-only 的调度与批处理优化、与多模态大模型输入适配、以及基于 nano-vllm 的轻量代码结构,便于二次开发与部署。适合需要大规模跑判别式推理、又不想背负完整生成式推理框架复杂度的团队。
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
—
vLLM、SGLang、TensorRT-LLM
nano-vllm-prefillonly 是基础设施领域的开源项目,由 86MaxCao 开发,是 2026 年新上线的项目。
它收录于基础设施分类,该分类目前共有 1,157 个项目,GitHub 星标数为 120。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-20。免费使用。
它主要面向的使用场景是:多模态检索中的向量/打分前向计算。同类可对比的替代方案包括 vLLM、SGLang、TensorRT-LLM。
上一篇:delta-Mem
下一篇:没有了!
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
[DEPRECATED / UNMAINTAINED] No longer maintained.
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···