tokenspeed

让大模型在现有硬件上跑出光速级 token 生成速度

TokenSpeed 是一个主打极致推理速度的 LLM 推理引擎,目标是让大模型在现有硬件上跑出“光速”级别的 token 生成速度。它通过优化内存访问、算子融合、KV Cache 管理等底层技术,显著降低推理延迟,提升吞吐量。项目用 Python 编写,但核心计算路径经过深度优化,适合对延迟敏感或需要高并发服务的场景。它解决了通用推理框架在速度上不够极致的问题,尤其适合边缘设备或高吞吐服务端。核心能力包括动态批处理、连续内存池、自定义 CUDA 内核,以及对主流模型的快速适配。整体设计追求简单直接,让开发者能快速集成并获得立竿见影的性能提升。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2164
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队lightseekorg
所属国家
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型b200,b300,blackwell,deepseek,gb200,gb300,glm,gpt-oss,inkling,kimi,lightseek,llm,mi355x,mi455x,minimax,qwen,rubin,speed-of-light,tokenspeed,vlm
GitHub 星标★ 2164
30天Star增速
HF 下载量
上线时间2026-05-06 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:高级 约 15 分钟 部署方式:本地安装 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(项目开发语言为 Python)
  • NVIDIA Blackwell 系列 GPU(README 提到 Blackwell 上的 MLA 实现)
  • 对应的 CUDA 与 GPU 驱动环境
  • Linux 运行环境(含 C++ 编译工具链,因调度器含 C++ 控制平面)

安装与启动步骤

  1. 1克隆项目仓库

    从 GitHub 拉取 TokenSpeed 源码到本地,后续所有操作都在该目录内进行。

    git clone https://github.com/lightseekorg/tokenspeed.git
  2. 2进入项目目录

    切换到克隆下来的仓库根目录,准备后续环境配置。

    cd tokenspeed
  3. 3创建 Python 虚拟环境

    README 未给出安装命令,这里先建独立环境避免污染系统 Python;具体依赖安装请以官方仓库说明为准。

    python -m venv venv
    source venv/bin/activate
  4. 4确认 GPU 与驱动

    确认机器具备 Blackwell 架构 GPU 及可用驱动,这是 README 强调的性能路径前提。

    nvidia-smi
  5. 5按官方文档安装与启动

    README 节选未包含安装依赖和启动推理服务的命令,请查阅仓库内文档与官网博客补齐。

如何确认成功

README 节选未提供启动命令,暂无官方验证方式;请以仓库内文档和官网博客的说明为准。

常见问题

Q:TokenSpeed 和 vLLM、TensorRT-LLM 有什么区别?

A:README 称其性能对标 TensorRT-LLM,易用性对标 vLLM,并首次把控制平面与执行平面分离,面向 agentic 生产负载。

Q:支持哪些模型?

A:README 节选未列出完整模型清单,但提到面向 agentic 负载的 MLA 实现,并给出 deepseek、qwen、glm、kimi 等标签,具体请查官方文档。

Q:必须用 Blackwell 显卡吗?

A:README 强调在 Blackwell 上有最快的 MLA 实现之一,说明其核心优化路径面向该架构,其他硬件支持情况需查阅官方文档。

Q:为什么 README 里没有安装步骤?

A:当前提供的节选只包含项目定位与架构组件介绍,安装与部署说明需到 GitHub 仓库正文或官网博客中查看。

注意事项

  • 本教程仅依据 README 节选整理,未给出的安装命令一律未编造,请以官方仓库为准。
  • 项目包含 C++ 控制平面与自定义 CUDA 内核,通常需要自行编译,建议预留编译时间。
  • 调度器以有限状态机管理请求生命周期与 KV Cache,调试时需留意资源复用规则。
  • 面向延迟敏感与高并发场景,建议在真实业务负载下做基准测试再上线。

核心亮点

  • 推理速度极快,针对延迟和吞吐做了深度优化
  • 内存管理高效,KV Cache 和算子融合减少开销
  • Python 接口简洁,易于集成到现有项目

不足之处

  • 文档/社区待观察
  • 生态和模型覆盖度可能不如主流框架全面

适用场景

  • 高并发 LLM API 服务,需要低延迟响应
  • 边缘设备或资源受限环境下的模型部署
  • 对 token 生成速度有极致要求的实时应用

替代项目

vLLM、TensorRT-LLM、llama.cpp

项目介绍

tokenspeed 是基础设施领域的开源项目,由 lightseekorg 开发,是 2026 年新上线的项目。

在全站 13,090 个收录项目中,它的 GitHub 星标数(2,164)位列前 30%,在基础设施分类中处于中上游。

近 42 天,它的 GitHub 星标从 1,856 增加到 2,164,净增 308。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:高并发LLMAPI服务,需要低延迟响应。同类可对比的替代方案包括 vLLM、TensorRT-LLM、llama.cpp。

上一篇:nndeploy

下一篇:gollama

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09