
llama.cpp
用普通电脑本地跑大模型,量化后 CPU 也能流畅推理
llama.cpp 是一个用 C/C++ 编写的大语言模型推理引擎,底层依赖自研张量库 ggml,目标是在消费级硬件上高效运行 LLM。它通过 GGUF 模型格式和量化技术(如 Q4_K_M、Q8_0),把原本需要高端 GPU 才能跑的模型压缩到可在 CPU、Mac(Metal)、CUDA、Vulkan、ROCm 等后端运行,显存占用和内存带宽需求大幅下降。核心能力包括:纯 CPU 推理、多后端 GPU 加速、量化与混合精度、KV 缓存优化、批量推理、OpenAI 兼容的 server 接口,以及丰富的命令行工具(llama-cli、llama-server、llama-bench 等)。它解决的是“没有高端显卡也想本地跑大模型”的问题,同时为上层应用(如 Ollama、LM Studio)提供稳定推理内核。项目以 MIT 协议开源,社区活跃,更新频繁,是本地 LLM 推理领域事实上的基础设施。
项目数据
使用教程
环境要求
- 一台可安装软件的本地机器(Windows / macOS / Linux)
- 选择 Docker 方式时需先安装 Docker
- 选择源码编译时需具备 C/C++ 编译工具链(详见 docs/build.md)
- 可访问 Hugging Face 网络,用于通过 -hf 直接拉取模型
安装与启动步骤
-
1选择安装方式
README 给出四种途径:官网 llama.app、Docker、预编译二进制、源码编译,任选其一即可,无需全部执行。
-
2按官网指引安装
访问 https://llama.app 并按页面上的说明完成安装,适合不想自行编译的用户。
-
3用 Docker 运行
README 指向仓库内 docs/docker.md 文档,先装好 Docker,再按该文档中的命令启动。
-
4下载预编译二进制
前往 GitHub releases 页面下载与你的系统匹配的预编译包,解压后即可使用,免编译。
-
5源码克隆编译
克隆仓库后按 docs/build.md 构建指南编译;具体编译参数以该文档为准。
git clone https://github.com/ggml-org/llama.cpp -
6下载并运行模型
安装完成后,用 llama cli 配合 -hf 参数直接从 Hugging Face 下载并运行 GGUF 模型。
llama cli -hf ggml-org/Qwen3.5-0.8B-GGUF
关键配置
| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
-hf | 否 | 直接从 Hugging Face 仓库下载并加载 GGUF 模型 | ggml-org/Qwen3.5-0.8B-GGUF |
如何确认成功
执行 llama cli 命令后能加载模型并正常输出对话文本,即表示安装成功。
常见问题
Q:我不想自己编译,有更省事的方式吗?
A:有。README 推荐先访问 https://llama.app 按官网说明安装,或直接到 GitHub releases 页面下载预编译二进制。
Q:Docker 方式具体怎么跑?
A:README 未在首页给出具体 docker 命令,需查阅仓库内 docs/docker.md 文档,按其中的说明执行。
Q:从源码构建需要看哪些步骤?
A:README 指向 docs/build.md 构建指南,克隆仓库后按该文档操作,编译参数以其内容为准。
Q:运行模型时模型文件从哪来?
A:README 的示例使用 -hf 参数从 Hugging Face 直接下载,如 -hf ggml-org/Qwen3.5-0.8B-GGUF。
注意事项
- README 的 Quick start 只提供入口链接,构建与 Docker 的详细命令需分别查看 docs/build.md 与 docs/docker.md
- README 示例中的命令已写作 llama cli,请以实际安装版本提供的命令名为准
- 项目使用 GGUF 模型格式,运行时请确保下载的是 GGUF 模型
核心亮点
- 纯 C/C++ 实现,无重型依赖,跨平台编译部署简单
- 量化方案成熟,GGUF 格式生态广泛,模型资源丰富
- 多硬件后端支持完善,CPU、Metal、CUDA、Vulkan 均可加速
不足之处
- 纯 CPU 推理大参数模型时速度仍受内存带宽限制
- 命令行工具参数较多,新手上手有一定学习成本
- 不同后端性能差异大,需要自行调优编译选项
适用场景
- 在无独立显卡的笔记本上本地运行 7B/13B 量化模型
- 为 Ollama、LM Studio 等本地 AI 应用提供推理内核
- 在服务器 CPU 环境批量部署轻量 LLM 服务
替代项目
vLLM、Ollama、text-generation-webui
项目介绍
同类项目推荐
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···