llama.cpp

用普通电脑本地跑大模型,量化后 CPU 也能流畅推理

llama.cpp 是一个用 C/C++ 编写的大语言模型推理引擎,底层依赖自研张量库 ggml,目标是在消费级硬件上高效运行 LLM。它通过 GGUF 模型格式和量化技术(如 Q4_K_M、Q8_0),把原本需要高端 GPU 才能跑的模型压缩到可在 CPU、Mac(Metal)、CUDA、Vulkan、ROCm 等后端运行,显存占用和内存带宽需求大幅下降。核心能力包括:纯 CPU 推理、多后端 GPU 加速、量化与混合精度、KV 缓存优化、批量推理、OpenAI 兼容的 server 接口,以及丰富的命令行工具(llama-cli、llama-server、llama-bench 等)。它解决的是“没有高端显卡也想本地跑大模型”的问题,同时为上层应用(如 Ollama、LM Studio)提供稳定推理内核。项目以 MIT 协议开源,社区活跃,更新频繁,是本地 LLM 推理领域事实上的基础设施。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 128704
维护状态 活跃
是否开源
定价模式 free

项目数据

分类基础设施
开发团队ggml-org
所属国家
官网地址https://llama.app
定价模式free
价格说明开源免费(MIT 许可证)
访问状态
是否开源
开源协议MIT
主要语言C++
技术栈/模型ggml
GitHub 星标★ 128704
30天Star增速
HF 下载量
上线时间2023-03-10 00:00:00
最近更新2026-09-18 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数1

使用教程

难度:入门 约 10 分钟 部署方式:本地安装 6 步

环境要求

  • 一台可安装软件的本地机器(Windows / macOS / Linux)
  • 选择 Docker 方式时需先安装 Docker
  • 选择源码编译时需具备 C/C++ 编译工具链(详见 docs/build.md)
  • 可访问 Hugging Face 网络,用于通过 -hf 直接拉取模型

安装与启动步骤

  1. 1选择安装方式

    README 给出四种途径:官网 llama.app、Docker、预编译二进制、源码编译,任选其一即可,无需全部执行。

  2. 2按官网指引安装

    访问 https://llama.app 并按页面上的说明完成安装,适合不想自行编译的用户。

  3. 3用 Docker 运行

    README 指向仓库内 docs/docker.md 文档,先装好 Docker,再按该文档中的命令启动。

  4. 4下载预编译二进制

    前往 GitHub releases 页面下载与你的系统匹配的预编译包,解压后即可使用,免编译。

  5. 5源码克隆编译

    克隆仓库后按 docs/build.md 构建指南编译;具体编译参数以该文档为准。

    git clone https://github.com/ggml-org/llama.cpp
  6. 6下载并运行模型

    安装完成后,用 llama cli 配合 -hf 参数直接从 Hugging Face 下载并运行 GGUF 模型。

    llama cli -hf ggml-org/Qwen3.5-0.8B-GGUF

关键配置

配置项必填说明示例
-hf直接从 Hugging Face 仓库下载并加载 GGUF 模型ggml-org/Qwen3.5-0.8B-GGUF

如何确认成功

执行 llama cli 命令后能加载模型并正常输出对话文本,即表示安装成功。

常见问题

Q:我不想自己编译,有更省事的方式吗?

A:有。README 推荐先访问 https://llama.app 按官网说明安装,或直接到 GitHub releases 页面下载预编译二进制。

Q:Docker 方式具体怎么跑?

A:README 未在首页给出具体 docker 命令,需查阅仓库内 docs/docker.md 文档,按其中的说明执行。

Q:从源码构建需要看哪些步骤?

A:README 指向 docs/build.md 构建指南,克隆仓库后按该文档操作,编译参数以其内容为准。

Q:运行模型时模型文件从哪来?

A:README 的示例使用 -hf 参数从 Hugging Face 直接下载,如 -hf ggml-org/Qwen3.5-0.8B-GGUF。

注意事项

  • README 的 Quick start 只提供入口链接,构建与 Docker 的详细命令需分别查看 docs/build.md 与 docs/docker.md
  • README 示例中的命令已写作 llama cli,请以实际安装版本提供的命令名为准
  • 项目使用 GGUF 模型格式,运行时请确保下载的是 GGUF 模型

核心亮点

  • 纯 C/C++ 实现,无重型依赖,跨平台编译部署简单
  • 量化方案成熟,GGUF 格式生态广泛,模型资源丰富
  • 多硬件后端支持完善,CPU、Metal、CUDA、Vulkan 均可加速

不足之处

  • 纯 CPU 推理大参数模型时速度仍受内存带宽限制
  • 命令行工具参数较多,新手上手有一定学习成本
  • 不同后端性能差异大,需要自行调优编译选项

适用场景

  • 在无独立显卡的笔记本上本地运行 7B/13B 量化模型
  • 为 Ollama、LM Studio 等本地 AI 应用提供推理内核
  • 在服务器 CPU 环境批量部署轻量 LLM 服务

替代项目

vLLM、Ollama、text-generation-webui

项目介绍

llama.cpp 是一个基础设施领域的开源项目,官方简介:LLM inference in C/C++。项目使用 C++ 开发,在 GitHub 上获得 128324 星标。

上一篇:bc250

下一篇:LLMLingua

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···

★ 202 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8433 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 435 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181124 2026-08-09