InfiniTensor

让大模型在多种 GPU 上快速跑起来并方便做实验

InfiniTensor 是一个面向 GPU 与 AI 加速器的高性能推理引擎,用 C++ 编写,核心目标是让大模型推理在不同硬件上高效部署,同时方便学术研究快速验证新想法。它把模型加载、算子调度、内存管理与硬件抽象层整合在一起,支持多种加速器后端,并提供图优化与算子融合能力,减少显存占用和延迟。相比只针对单一硬件的推理框架,它强调可移植性和可扩展性,研究者可以基于它实现自定义算子或调度策略,并直接在真实硬件上跑通。项目目前处于早期阶段,星标约 500,适合需要做推理性能实验、硬件适配或教学演示的团队,也适合作为学习推理引擎内部实现的代码库。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 498
维护状态 较活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类基础设施
开发团队InfiniTensor
所属国家
官网地址
定价模式free
价格说明开源项目,免费使用
访问状态
是否开源是
开源协议Apache-2.0
主要语言C++
技术栈/模型
GitHub 星标★ 498
30天Star增速
HF 下载量
上线时间2022-07-27 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-08
浏览次数0

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

核心亮点

  • C++ 实现,面向 GPU 和 AI 加速器做底层优化,推理性能有针对性设计
  • 强调学术验证,代码结构便于研究者快速实现和测试新算子、新调度策略
  • 提供硬件抽象层,支持多种加速器后端,降低跨硬件部署的适配成本

不足之处

  • 项目早期,文档和示例相对有限,上手需要一定推理引擎背景
  • 社区规模较小,生态和第三方模型支持不如主流框架丰富

适用场景

  • 学术团队在真实 GPU 上验证新的推理调度或算子融合算法
  • 企业将大模型推理部署到多种 AI 加速器,需要统一引擎做适配
  • 开发者学习推理引擎内部实现,基于源码做二次开发和性能调优

替代项目

TensorRT、ONNX Runtime、TVM

项目介绍

InfiniTensor 是基础设施领域的开源项目,由 InfiniTensor 开发,2022 年首次发布。

它收录于基础设施分类,该分类目前共有 1,176 个项目,GitHub 星标数为 498。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-21。免费使用。

它主要面向的使用场景是:学术团队在真实GPU上验证新的推理调度或算子融合算法。同类可对比的替代方案包括 TensorRT、ONNX Runtime、TVM。

上一篇:edgejs

下一篇:没有了!

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

[DEPRECATED / UNMAINTAINED] No longer maintained.

★ 300 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 9175 2026-09-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 182477 2026-08-09
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 444 2026-08-10