1Cat-vLLM

让 V100 老卡也能跑现代大模型推理

1Cat-vLLM 是面向 NVIDIA V100(SM70 架构)的 vLLM 工程化分支,专注解决老卡无法顺畅运行现代大模型推理的问题。官方 vLLM 新版逐步放弃对 V100 的支持,导致大量仍在使用 V100 的团队无法享受 PagedAttention、连续批处理等优化。该项目在 vLLM 基础上做了针对性适配:让 V100 支持较新的 CUDA 与 PyTorch 组合,修复 SM70 下的算子兼容问题,并针对该架构的显存与算力特点调整调度策略,从而在 V100 上稳定跑起主流开源大模型。核心能力包括:兼容 vLLM 的 OpenAI 风格 API 与离线推理接口,支持量化与常见并行方式,降低老卡部署大模型的门槛。适合预算有限、手里有 V100 集群、又希望用现代推理框架的团队,是延续老硬件生命周期的实用方案。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1077
维护状态 活跃
是否开源
定价模式 free

项目数据

分类基础设施
开发团队1CatAI
所属国家
官网地址
定价模式free
价格说明开源免费,需自行部署
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型
GitHub 星标★ 1077
30天Star增速
HF 下载量
上线时间2026-03-10 00:00:00
最近更新2026-09-18 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0

使用教程

难度:进阶 约 20 分钟 部署方式:本地安装 4 步

环境要求

  • Python 3.12
  • CUDA 12.8
  • PyTorch 2.10
  • NVIDIA Tesla V100(SM70 / Volta 架构)显卡

安装与启动步骤

  1. 1核对软硬件环境

    README 推荐环境为 Python 3.12 + CUDA 12.8 + PyTorch 2.10,且必须是 SM70 / Tesla V100 显卡,不匹配不要继续。

  2. 2获取安装包

    稳定版从 GitHub Releases 下载 1cat_vllm 的 wheel 文件;若要 DFlash2 1.5.0 服务策略,需确认包内含 PR #426、#427 的 SM70 运行时改动。

  3. 3安装 wheel 包

    在下载目录下执行,pip 会按通配符匹配 wheel 文件名安装到当前 Python 环境,注意 pip 需对应 Python 3.12。

    pip install ./1cat_vllm-*.whl
  4. 4运行自检脚本

    验证 torch、CUDA、vLLM、flash_attn_v100 版本与显卡型号能否正常导入,脚本为 README 提供的原样命令。

    python - <<'PY'
    import sys
    import torch
    import vllm
    import flash_attn_v100
    from flash_attn_v100 import flash_attn_v100_cuda, paged_kv_utils
    from flash_attn_v100 import flash_attn_grouped_verify_max_query_tokens
    
    print("Python:", sys.version.split()[0])
    print("Torch:", torch.__version__)
    print("CUDA:", torch.version.cuda)
    print("GPU:", torch.cuda.get_device_name(0))
    print("vLLM:", vllm.__version__)
    print("flash_attn_v100:", flash_attn_v100.__version__)
    print("DFlash2 grouped verify max Q:", flash_attn_grouped_verify_max_query_tokens())
    print("FlashAttention-V100: OK")
    PY

如何确认成功

执行自检脚本后能打印出 Python/Torch/CUDA/GPU/vLLM/flash_attn_v100 版本,并最终输出 FlashAttention-V100: OK。

常见问题

Q:需要什么样的显卡才能跑?

A:面向 NVIDIA Volta / SM70 / Tesla V100。README 演示配置为 4× Tesla V100 16GB,其他架构不在此项目的优化目标内。

Q:应该装哪个版本?

A:稳定用户直接装 GitHub Releases 里的 wheel;想用最新 DFlash2 1.5.0 服务策略,需确保 wheel 或源码包含 PR #426、#427 的 SM70 运行时改动。

Q:v1.5.0 是正式发布版吗?

A:README 说明当前仓库状态下 v1.5.0 只完成 RC 构建与隔离的 API/运行时冒烟测试,在 tag 出现前不把它称为正式 Release。

Q:260 tok/s 是人人可复现的速度吗?

A:不是。它是 4× V100 跑 Qwen3.8-27B-NVFP4 + DFlash2 的实机演示头条数据,不同 benchmark 的硬件、上下文、批次、KV dtype 不同,指标不可互换。

注意事项

  • README 未给出源码编译或克隆步骤,只有 wheel 安装方式,如需从源码构建请自行参考仓库。
  • README 推荐模型:QUASAR-QAT/Qwen3.8-27B-QUASAR-NVFP4、RadixArk/Qwen3.8-Flash-Next-NVFP4、incoai/Qwen3.8-27B-DFlash2。
  • 除算子外项目还涉及 FlashAttention-V100、FP8 KV、QSA 稀疏注意力、TurboMind SM70 量化算子、DFlash2、CUDA Graph、前缀缓存等运行时组件。
  • README 提到 --kv-cache-dtype fp8 在 SM70 Flash-V100 上会解析为 E4M3,注意与显存规划匹配。

核心亮点

  • 专门适配 SM70/V100,解决官方 vLLM 新版对老卡支持缺失的问题
  • 保留 vLLM 的 PagedAttention、连续批处理等核心推理优化
  • 兼容 OpenAI 风格 API,迁移和接入现有服务成本低

不足之处

  • 仅聚焦 V100/SM70,其他架构用户收益有限
  • 作为工程 fork,跟进上游 vLLM 新特性的节奏可能滞后

适用场景

  • 高校或中小企业用存量 V100 服务器部署开源大模型服务
  • 需要 OpenAI 兼容 API 的私有化推理网关
  • 在预算受限时延长 V100 集群使用寿命的推理加速

替代项目

vLLM、SGLang

项目介绍

1Cat-vLLM 是一个基础设施领域的开源项目,官方简介:V100 / SM70-focused vLLM engineering fork for modern LLM inference.。项目使用 Python 开发,在 GitHub 上获得 1028 星标。

上一篇:MinivLLM

下一篇:llmman

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···

★ 202 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8576 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 435 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181269 2026-08-09