LLM-TPU 是基础设施领域的开源项目,由 sophgo 开发,2024 年首次发布。
它收录于基础设施分类,该分类目前共有 1,132 个项目,GitHub 星标数为 311。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。本地部署,完全免费。
它主要面向的使用场景是:边缘AI盒子本地运行LLM助手。同类可对比的替代方案包括 llama.cpp、ONNX Runtime、TensorRT-LLM。

在算能TPU上跑大模型,边缘部署快人一步
LLM-TPU 是一个面向算能(Sophgo)BM1684X 和 BM1688 系列 TPU 芯片的开源推理项目,旨在让生成式 AI 模型(如大语言模型)直接运行在边缘 TPU 设备上。它解决了在资源受限的嵌入式环境中部署大模型的难题,提供了从模型转换、量化到高效推理的完整工具链。核心能力包括针对 TPU 的算子优化、内存管理和多模型支持,能够显著降低延迟并提升吞吐量。项目基于 C++ 实现,强调高性能和低功耗,适合在智能摄像头、边缘网关等场景中落地。目前处于早期阶段,但已具备基本的模型运行能力,并积极适配更多主流开源模型。
llama.cpp、ONNX Runtime、TensorRT-LLM
LLM-TPU 是基础设施领域的开源项目,由 sophgo 开发,2024 年首次发布。
它收录于基础设施分类,该分类目前共有 1,132 个项目,GitHub 星标数为 311。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。本地部署,完全免费。
它主要面向的使用场景是:边缘AI盒子本地运行LLM助手。同类可对比的替代方案包括 llama.cpp、ONNX Runtime、TensorRT-LLM。
上一篇:kvpress
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···