mlc-llm

一次编译,跑遍所有设备,让大模型部署又快又省

mlc-llm 是一个通用的 LLM 部署引擎,核心思路是用机器学习编译技术将大模型高效地部署到各种硬件后端上,包括消费级 GPU、手机、浏览器等。它解决的核心问题是:大模型在不同设备上部署时性能差异大、适配成本高。通过统一的编译和运行时抽象,mlc-llm 能够自动优化模型计算图,生成针对特定硬件的机器码,从而在保持模型精度的前提下大幅提升推理速度。其核心能力包括:支持多种主流模型架构(如 Llama、Mistral 等)、提供 Python/C++/JavaScript 等多语言接口、支持量化(如 INT4/INT8)以降低显存占用、以及跨平台运行能力。项目基于 Apache TVM 构建,强调端到端的编译优化,使得同一套代码可以灵活部署到不同设备,同时保持较好的性能。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 23181
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队mlc-ai
所属国家
官网地址https://llm.mlc.ai
定价模式free
价格说明开源项目,Apache-2.0许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型language-model,llm,machine-learning-compilation,tvm
GitHub 星标★ 23181
30天Star增速
HF 下载量
上线时间2023-04-29 00:00:00
最近更新2026-09-22 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 15 分钟 部署方式:本地安装 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 可访问官方文档站点 llm.mlc.ai(README 的安装说明均指向该文档)
  • 一台受支持的设备:Linux/Windows 的 NVIDIA、AMD、Intel GPU,或 macOS/Apple GPU、iOS/Android 设备、支
  • 基础的 Python 运行环境(项目为 Python 实现)
  • 足够的磁盘与显存空间用于存放量化后的模型权重

安装与启动步骤

  1. 1阅读官方快速开始

    README 未给出具体安装命令,全部指引指向官方文档。请先打开 https://llm.mlc.ai/docs/get_started/quick_start 按页面步骤执行。

  2. 2确认硬件与后端

    对照 README 平台支持表选择后端:NVIDIA 用 Vulkan/CUDA,AMD 用 Vulkan/ROCm,Apple 用 Metal,Android 用 OpenCL,浏览器用 WebGPU/WASM。

  3. 3准备 Python 环境

    项目为 Python 实现,请先准备好可用的 Python 环境,具体版本要求以官方文档为准,README 未指定版本号。

  4. 4获取项目源码

    从 GitHub 拉取仓库,便于查看示例与文档;若只按文档安装预编译运行时,可跳过此步。

    git clone https://github.com/mlc-ai/mlc-llm
  5. 5按文档完成部署

    依照官方文档为所选后端安装运行时并加载模型,README 未提供 pip/docker 等具体安装命令,请以文档页面为准。

如何确认成功

能按官方文档成功加载模型并完成一次推理对话输出,同时日志中显示所使用的硬件后端(如 CUDA、Metal、Vulkan)。

常见问题

Q:为什么没有给出 pip install 或 docker run 命令?

A:README 节选中未包含任何安装命令,全部安装说明都在官方文档 Get Started 页面,请以该页面为准,避免使用过时命令。

Q:我的显卡能用吗?

A:README 支持表显示:NVIDIA/AMD/Intel GPU 支持 Vulkan,NVIDIA 另支持 CUDA,AMD 另支持 ROCm,Apple 全系走 Metal,Android 走 OpenCL。

Q:能在浏览器里跑吗?

A:可以。README 支持表中 Web Browser 一行标注支持 WebGPU 与 WASM,需要浏览器具备 WebGPU 能力。

Q:需要自己训练或转换模型吗?

A:不必。项目定位是部署引擎,README 说明其用 ML 编译技术把模型高效部署到各硬件后端,重点在编译与运行时而非训练。

注意事项

  • README 节选只包含项目介绍与平台支持表,没有安装命令,务必以官网文档 llm.mlc.ai/docs 为唯一安装依据。
  • 不同硬件后端(CUDA/Vulkan/ROCm/Metal/OpenCL/WebGPU)需要分别准备对应驱动与运行时,不要混用。
  • 项目基于 Apache TVM 构建,对编译工具链有依赖,完整环境要求在官方文档中查看。

核心亮点

  • 基于 TVM 的编译优化,推理性能比常规方案显著提升,尤其在边缘设备上
  • 支持从云端 GPU 到手机、浏览器的多后端部署,覆盖面广
  • 提供量化支持(INT4/INT8),有效降低显存和带宽需求

不足之处

  • 编译过程相对复杂,新手入门曲线较陡
  • 对自定义模型或新硬件的适配需要额外编译工作

适用场景

  • 在消费级 GPU 上部署大模型以降低硬件成本
  • 将 LLM 部署到手机或浏览器实现端侧推理
  • 需要跨平台统一部署策略的生产环境

替代项目

llama.cpp、vLLM、TensorRT-LLM

项目介绍

mlc-llm 是基础设施领域的开源项目,由 mlc-ai 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(23,181)位列前 3%,在基础设施分类的 1,132 个项目里位列前 4%。

近 41 天,它的 GitHub 星标从 23,056 增加到 23,181,净增 125。

项目仍在小幅维护中,最近一次代码更新于 2026-09-22。Apache-2.0许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:在消费级GPU上部署大模型以降低硬件成本。同类可对比的替代方案包括 llama.cpp、vLLM、TensorRT-LLM。

上一篇:airllm

下一篇:screenpipe

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09