
tpu-mlir
把 PyTorch/ONNX 模型一键编译到算能 TPU 上跑起来
tpu-mlir 是算能(Sophgo)开源的机器学习编译器,基于 MLIR 框架构建,专门面向 Sophgo TPU 硬件做模型编译与优化。它解决的问题是:主流深度学习框架(PyTorch、ONNX、TFLite 等)训练出的模型无法直接在 Sophgo TPU 上高效运行,需要一套从高层算子到 TPU 指令的完整转换链路。核心能力包括多框架模型导入与图优化、算子融合与量化(支持 INT8 等低精度)、内存与调度规划,以及最终生成可在 TPU 上执行的二进制。项目用 C++ 实现,围绕 MLIR 的 dialect 体系组织编译流程,同时覆盖 LLM 相关算子,适合边缘 AI 推理场景。对使用算能 BM1684X、CV186 等芯片做部署的团队来说,它是打通模型到硬件的关键工具链组件。
项目数据
使用教程
核心亮点
- 基于 MLIR 的完整编译链路,从 ONNX/PyTorch/TFLite 到 TPU 二进制一站式转换
- 支持 INT8 等量化与算子融合,针对 TPU 做内存和调度优化,提升推理效率
- 官方维护,与算能 BM1684X/CV186 等芯片及 SDK 配套,部署路径明确
不足之处
- 强绑定 Sophgo TPU 硬件,无法用于其他厂商芯片,通用性受限
- 社区规模较小,第三方文档和踩坑资料相对有限
适用场景
- 边缘服务器上用 BM1684X 部署视觉检测模型
- 将 LLM 量化后编译到算能 TPU 做本地推理
- 把 PyTorch 训练好的模型转换并部署到算能 AI 加速卡
替代项目
Apache TVM、ONNX Runtime
项目介绍
上一篇:raft
下一篇:SiliconScope
同类项目推荐
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···