ggml

轻量级 C++ 张量库,让大模型在本地设备流畅跑起来

ggml 是一个用 C++ 编写的机器学习张量库,专为高效推理和边缘设备优化而设计。它解决了传统深度学习框架(如 PyTorch、TensorFlow)在资源受限环境(如手机、嵌入式设备)中部署模型时体积大、依赖重、推理慢的问题。核心能力包括:支持多种量化格式(如 4-bit、5-bit、8-bit),大幅压缩模型体积并提升推理速度;提供自动微分和计算图优化,便于模型微调;内置多种硬件加速后端(如 CPU、GPU、Metal),并支持跨平台编译(Windows、Linux、macOS、iOS、Android)。ggml 被广泛用于 llama.cpp、whisper.cpp 等知名项目,成为本地运行大型语言模型和语音识别模型的基础设施。其设计强调零依赖、易集成,开发者可直接嵌入 C/C++ 项目,无需复杂环境配置。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 15392
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队ggml-org
所属国家
定价模式free
价格说明开源库,MIT许可证,完全免费,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言C++
技术栈/模型machine-learning
GitHub 星标★ 15392
30天Star增速
HF 下载量
上线时间2022-09-18 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:进阶 约 10 分钟 部署方式:库/依赖 6 步

环境要求

  • 已安装 Git,可用 git clone 拉取仓库
  • 已安装 CMake(README 要求用 cmake 配置和构建)
  • 已安装 C/C++ 编译器(gcc / clang / MSVC)
  • 建议多核 CPU,示例使用 -j 8 并行编译

安装与启动步骤

  1. 1克隆仓库

    从 GitHub 拉取 ggml 源码到本地,命令来自 README 的 Build from source。

    git clone https://github.com/ggml-org/ggml
  2. 2进入项目目录

    切换到刚克隆下来的 ggml 目录,后续构建都在此目录内进行。

    cd ggml
  3. 3创建构建目录

    按 README 做法新建 build 目录并进入,保持源码目录干净,便于后续清理重建。

    mkdir build && cd build
  4. 4生成构建文件

    在 build 目录中运行 cmake ..,读取上层目录的 CMake 配置生成编译文件。

    cmake ..
  5. 5编译项目

    以 Release 配置并行编译,-j 8 表示 8 个并行任务,可按机器核数调整。

    cmake --build . --config Release -j 8
  6. 6查看最小示例

    README 指向 examples/simple,这是一个带完整注释的矩阵乘法示例,可阅读源码了解用法。

如何确认成功

cmake --build 命令无报错并正常结束,build 目录下生成对应构建产物即编译成功。

常见问题

Q:执行 cmake 提示找不到命令怎么办?

A:说明未安装 CMake 或未加入 PATH,请先安装 CMake 并确保终端能调用 cmake,再重新执行 cmake .. 与构建命令。

Q:编译报错提示找不到编译器怎么办?

A:需要先安装 C/C++ 编译器(如 gcc/clang/MSVC),并保证编译器在系统 PATH 中,然后清空 build 目录重新执行 cmake ..。

Q:想启用 GPU 等硬件后端如何操作?

A:README 只给出默认源码编译流程,未列出具体后端开关参数,请查阅 docs/gguf.md 及 README 中给出的 ggml 文档与 tips 链接。

Q:如何在代码中使用 ggml?

A:README 提供了 examples/simple 这一带注释的矩阵乘法示例,可作为最小接入参考,其他文档见 docs/gguf.md 与介绍文章。

注意事项

  • README 只提供从源码构建的方式,没有给出预编译包安装命令。
  • README 未说明编译器与 CMake 的最低版本要求,需自行准备可用的构建环境。
  • 如需修改 ggml 核心库或 CMake 构建系统,README 建议改到 llama.cpp 仓库提 PR,可见度与测试更充分。
  • 更多资料见 docs/gguf.md、Hugging Face 的 Introduction to ggml 以及 llama.cpp wiki 的 GGML Tips & Tricks。

核心亮点

  • 极低依赖,纯 C++ 实现,便于嵌入各类项目
  • 支持多种量化格式,模型体积小、推理速度快
  • 跨平台支持,覆盖移动端和桌面端,硬件加速完善

不足之处

  • API 相对底层,学习曲线陡峭
  • 文档偏少,社区示例有限

适用场景

  • 在本地设备(如手机、PC)部署大语言模型
  • 嵌入式环境下的机器学习推理
  • 需要快速原型验证的 AI 应用开发

替代项目

ONNX Runtime、TensorFlow Lite、ncnn

项目介绍

ggml 是基础设施领域的开源项目,由 ggml-org 开发,2022 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(15,392)位列前 4%,在基础设施分类的 1,130 个项目里位列前 5%。

近 41 天,它的 GitHub 星标从 15,156 增加到 15,392,净增 236。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。开源库,MIT许可证,完全免费,无付费版本。

它主要面向的使用场景是:在本地设备(如手机、PC)部署大语言模型。同类可对比的替代方案包括 ONNX Runtime、TensorFlow Lite、ncnn。

上一篇:redis-vl-python

下一篇:xllm

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09