nano-vllm-prefillonly

砍掉解码只留 prefill,判别式大模型推理更快更省

nano-vllm-prefillonly 是 nano-vllm 的一个专用优化分支,聚焦于仅需 prefill 阶段的推理任务。传统大模型推理框架通常为自回归解码设计,包含 KV Cache 管理、逐 token 生成等完整流程,但对于判别式应用(如多模态检索、打分、分类、rerank),模型只需对输入做一次前向计算即可得到结果,无需逐 token 解码。该项目正是为这类场景裁剪掉解码相关开销,保留并强化 prefill 路径,从而在工业级多模态大模型判别任务上获得更高的吞吐与更低的延迟。核心能力包括:针对 prefill-only 的调度与批处理优化、与多模态大模型输入适配、以及基于 nano-vllm 的轻量代码结构,便于二次开发与部署。适合需要大规模跑判别式推理、又不想背负完整生成式推理框架复杂度的团队。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 120
维护状态 较活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类基础设施
开发团队86MaxCao
所属国家
官网地址
定价模式free
价格说明开源项目,免费使用
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型
GitHub 星标★ 120
30天Star增速
HF 下载量
上线时间2026-01-07 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-05
浏览次数0

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

核心亮点

  • 针对 prefill-only 场景裁剪解码逻辑,减少无用开销,判别式任务吞吐更高
  • 基于 nano-vllm 轻量代码,结构简单易读,便于按业务二次修改
  • 面向工业级多模态大模型判别应用,贴合检索/打分/分类等真实需求

不足之处

  • 仅支持 prefill,无法用于文本生成等自回归解码任务,适用范围窄
  • 项目处于早期,星标约 120,生态、文档与社区支持有限

适用场景

  • 多模态检索中的向量/打分前向计算
  • 大规模 rerank 与相关性打分服务
  • 内容分类、审核等判别式批量推理

替代项目

vLLM、SGLang、TensorRT-LLM

项目介绍

nano-vllm-prefillonly 是基础设施领域的开源项目,由 86MaxCao 开发,是 2026 年新上线的项目。

它收录于基础设施分类,该分类目前共有 1,157 个项目,GitHub 星标数为 120。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-20。免费使用。

它主要面向的使用场景是:多模态检索中的向量/打分前向计算。同类可对比的替代方案包括 vLLM、SGLang、TensorRT-LLM。

上一篇:delta-Mem

下一篇:没有了!

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

[DEPRECATED / UNMAINTAINED] No longer maintained.

★ 303 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 9114 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 442 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 182186 2026-08-09