tt-metal

用 Tenstorrent 硬件跑 AI 模型,底层算子与内核编程一手掌控

tt-metal 是 Tenstorrent 公司推出的底层算子库与内核编程模型,包含 TT-NN 算子库和 TT-Metalium 低层内核编程接口。它旨在为 Tenstorrent 的 AI 加速器硬件提供高性能的编程抽象,解决开发者难以直接利用该硬件进行深度学习计算的问题。核心能力包括:提供丰富的神经网络算子(如矩阵乘、卷积、注意力等),支持 Stable Diffusion、LLM(如 Llama、DeepSeek)等主流模型的推理与训练,并具备多芯片扩展(scale-out)能力。通过 TT-Metalium,开发者可以编写自定义内核,精细控制数据流与计算,从而榨取硬件性能。项目采用 C++ 实现,面向高性能计算场景,是构建 AI 应用与底层硬件之间的关键桥梁。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1686
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队tenstorrent
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言C++
技术栈/模型accelerator,ai,cuda,deepseek,gpu,img-gen,kernels,llama,llm,metal,scale-out,stable-diffusion,tenstorrent,video-gen
GitHub 星标★ 1686
30天Star增速
HF 下载量
上线时间2023-02-13 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:高级 约 30 分钟 部署方式:本地安装 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Tenstorrent AI 加速器硬件(README 链接到 Hardware 页面,如 Blackhole)
  • Python 与 C++ 开发环境(TT-NN 是 Python & C++ 神经网络算子库)
  • 能访问 GitHub 与 Tenstorrent 官方文档站的网络环境

安装与启动步骤

  1. 1克隆项目仓库

    从 GitHub 拉取 tt-metal 源码到本地,网络较慢时可加代理或使用镜像。

    git clone https://github.com/tenstorrent/tt-metal.git
  2. 2进入项目目录

    切换到克隆下来的仓库根目录,后续操作都在此目录进行。

    cd tt-metal
  3. 3查看安装文档

    README 顶部 Install 链接指向仓库内 INSTALLING.md,具体依赖安装与编译命令以该文件为准。

    cat INSTALLING.md
  4. 4跑通简单内核示例

    按 README 指引打开官方 simple kernels 示例文档,按示例验证算子与内核可正常调用。

如何确认成功

README 未给出明确验证命令;可运行官方 simple kernels 示例文档中的例子,能正常编译执行即说明环境可用。

常见问题

Q:只按 README 能完成安装吗?

A:不能。README 仅提供 Install 链接,完整安装步骤在仓库的 INSTALLING.md 中,请以该文档为准。

Q:没有 Tenstorrent 加速卡能安装使用吗?

A:tt-metal 面向 Tenstorrent 加速器硬件,README 首行即指向 Hardware 页面,无对应硬件通常无法实际运行内核与模型。

Q:支持哪些模型?

A:README 提到 Stable Diffusion、Llama、DeepSeek 等主流模型的推理与训练,完整列表见 Model Matrix 与开发者中心。

Q:TT-NN 和 TT-Metalium 有什么区别?

A:TT-NN 是 Python & C++ 神经网络算子库,提供现成算子;TT-Metalium 是低层内核编程接口,可自定义内核控制数据流与计算。

注意事项

  • README 节选未包含任何安装命令,本教程步骤仅为通用准备动作,详细安装请查阅 INSTALLING.md。
  • 项目主要语言为 C++,依赖与编译较复杂,建议严格按官方文档逐步执行。
  • README 定义了 TTFT、T/S/U、T/S、TP、DP 等性能指标,评估 LLM 性能时需按此口径理解。
  • 需要 Tenstorrent 硬件才能实际运行,无硬件时仅能做源码阅读与准备。

核心亮点

  • 提供 TT-NN 高层算子库,覆盖 Stable Diffusion、LLM 等主流模型,上手门槛低
  • TT-Metalium 支持自定义内核,可精细控制数据流与计算,性能优化空间大
  • 原生支持多芯片 scale-out,适合大规模分布式推理与训练

不足之处

  • 硬件生态较新,社区规模与文档丰富度相比 CUDA 仍有差距
  • 依赖特定 Tenstorrent 硬件,无法在通用 GPU 上运行,迁移成本高

适用场景

  • 在 Tenstorrent 加速卡上部署 Stable Diffusion 等图像生成模型
  • 为 LLM 推理定制高性能内核,优化延迟与吞吐
  • 构建多卡扩展的 AI 训练或推理集群

替代项目

CUDA、ROCm、oneAPI

项目介绍

tt-metal 是基础设施领域的开源项目,由 tenstorrent 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,686)位列前 30%,在基础设施分类中处于中上游。

近 42 天,它的 GitHub 星标从 1,623 增加到 1,686,净增 63。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:在Tenstorrent加速卡上部署StableDiffusion等图像生成模型。同类可对比的替代方案包括 CUDA、ROCm、oneAPI。

上一篇:openvino

下一篇:ComfyUI-Docker

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09