
1Cat-vLLM
让 V100 老卡也能跑现代大模型推理
1Cat-vLLM 是面向 NVIDIA V100(SM70 架构)的 vLLM 工程化分支,专注解决老卡无法顺畅运行现代大模型推理的问题。官方 vLLM 新版逐步放弃对 V100 的支持,导致大量仍在使用 V100 的团队无法享受 PagedAttention、连续批处理等优化。该项目在 vLLM 基础上做了针对性适配:让 V100 支持较新的 CUDA 与 PyTorch 组合,修复 SM70 下的算子兼容问题,并针对该架构的显存与算力特点调整调度策略,从而在 V100 上稳定跑起主流开源大模型。核心能力包括:兼容 vLLM 的 OpenAI 风格 API 与离线推理接口,支持量化与常见并行方式,降低老卡部署大模型的门槛。适合预算有限、手里有 V100 集群、又希望用现代推理框架的团队,是延续老硬件生命周期的实用方案。
项目数据
使用教程
环境要求
- Python 3.12
- CUDA 12.8
- PyTorch 2.10
- NVIDIA Tesla V100(SM70 / Volta 架构)显卡
安装与启动步骤
-
1核对软硬件环境
README 推荐环境为 Python 3.12 + CUDA 12.8 + PyTorch 2.10,且必须是 SM70 / Tesla V100 显卡,不匹配不要继续。
-
2获取安装包
稳定版从 GitHub Releases 下载 1cat_vllm 的 wheel 文件;若要 DFlash2 1.5.0 服务策略,需确认包内含 PR #426、#427 的 SM70 运行时改动。
-
3安装 wheel 包
在下载目录下执行,pip 会按通配符匹配 wheel 文件名安装到当前 Python 环境,注意 pip 需对应 Python 3.12。
pip install ./1cat_vllm-*.whl -
4运行自检脚本
验证 torch、CUDA、vLLM、flash_attn_v100 版本与显卡型号能否正常导入,脚本为 README 提供的原样命令。
python - <<'PY' import sys import torch import vllm import flash_attn_v100 from flash_attn_v100 import flash_attn_v100_cuda, paged_kv_utils from flash_attn_v100 import flash_attn_grouped_verify_max_query_tokens print("Python:", sys.version.split()[0]) print("Torch:", torch.__version__) print("CUDA:", torch.version.cuda) print("GPU:", torch.cuda.get_device_name(0)) print("vLLM:", vllm.__version__) print("flash_attn_v100:", flash_attn_v100.__version__) print("DFlash2 grouped verify max Q:", flash_attn_grouped_verify_max_query_tokens()) print("FlashAttention-V100: OK") PY
如何确认成功
执行自检脚本后能打印出 Python/Torch/CUDA/GPU/vLLM/flash_attn_v100 版本,并最终输出 FlashAttention-V100: OK。
常见问题
Q:需要什么样的显卡才能跑?
A:面向 NVIDIA Volta / SM70 / Tesla V100。README 演示配置为 4× Tesla V100 16GB,其他架构不在此项目的优化目标内。
Q:应该装哪个版本?
A:稳定用户直接装 GitHub Releases 里的 wheel;想用最新 DFlash2 1.5.0 服务策略,需确保 wheel 或源码包含 PR #426、#427 的 SM70 运行时改动。
Q:v1.5.0 是正式发布版吗?
A:README 说明当前仓库状态下 v1.5.0 只完成 RC 构建与隔离的 API/运行时冒烟测试,在 tag 出现前不把它称为正式 Release。
Q:260 tok/s 是人人可复现的速度吗?
A:不是。它是 4× V100 跑 Qwen3.8-27B-NVFP4 + DFlash2 的实机演示头条数据,不同 benchmark 的硬件、上下文、批次、KV dtype 不同,指标不可互换。
注意事项
- README 未给出源码编译或克隆步骤,只有 wheel 安装方式,如需从源码构建请自行参考仓库。
- README 推荐模型:QUASAR-QAT/Qwen3.8-27B-QUASAR-NVFP4、RadixArk/Qwen3.8-Flash-Next-NVFP4、incoai/Qwen3.8-27B-DFlash2。
- 除算子外项目还涉及 FlashAttention-V100、FP8 KV、QSA 稀疏注意力、TurboMind SM70 量化算子、DFlash2、CUDA Graph、前缀缓存等运行时组件。
- README 提到 --kv-cache-dtype fp8 在 SM70 Flash-V100 上会解析为 E4M3,注意与显存规划匹配。
核心亮点
- 专门适配 SM70/V100,解决官方 vLLM 新版对老卡支持缺失的问题
- 保留 vLLM 的 PagedAttention、连续批处理等核心推理优化
- 兼容 OpenAI 风格 API,迁移和接入现有服务成本低
不足之处
- 仅聚焦 V100/SM70,其他架构用户收益有限
- 作为工程 fork,跟进上游 vLLM 新特性的节奏可能滞后
适用场景
- 高校或中小企业用存量 V100 服务器部署开源大模型服务
- 需要 OpenAI 兼容 API 的私有化推理网关
- 在预算受限时延长 V100 集群使用寿命的推理加速
替代项目
vLLM、SGLang
项目介绍
同类项目推荐
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···