llamafile

一个文件搞定大模型,下载即用,跨平台运行

llamafile 是一个将大语言模型(LLM)及其运行环境打包成单个可执行文件的开源工具,旨在解决 AI 模型分发和部署的复杂性问题。它基于 llama.cpp 构建,支持 GGUF 格式模型,并集成了多种推理引擎。用户只需下载一个文件,即可在 Windows、macOS、Linux 等主流操作系统上直接运行,无需安装 Python、CUDA 等依赖环境。核心能力包括:跨平台兼容、多模态支持(文本、图像、语音)、本地推理、以及通过内置 HTTP 服务器提供 API 服务。它特别适合需要快速分享、离线部署或简化 AI 应用分发的场景,降低了本地运行 LLM 的技术门槛。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 26028
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类基础设施
开发团队mozilla-ai
所属国家
定价模式free
价格说明完全开源免费,本地部署,无付费版本
访问状态
是否开源是
开源协议NOASSERTION
主要语言C++
技术栈/模型cross-platform,gguf,llama-cpp,local-ai,local-inference,local-llm,open-source-ai,single-file-executable,speech-to-text
GitHub 星标★ 26028
30天Star增速
HF 下载量
上线时间2023-09-10 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数7

使用教程

难度:入门 约 5 分钟 部署方式:命令行工具 4 步

环境要求

  • 支持 Windows、macOS、Linux 等主流操作系统及多种 CPU 架构,无需安装 Python、CUDA 等依赖
  • Windows 上只能运行为可执行文件且体积小于 4GB 的 llamafile
  • 想要更高准确率时,需要较强的硬件(如 GPU)以运行更大的预构建模型

安装与启动步骤

  1. 1下载 llamafile

    从官方预构建 llamafile 列表或 GitHub Releases 下载一个模型 llamafile 文件;README 推荐先用最小的 Qwen3.5-0.8B-Q8_0.llamafile,最容易开箱即用。

  2. 2直接运行文件

    llamafile 把模型与运行环境打包成单个可执行文件,下载后直接执行即可,无需任何安装步骤。

    ./Qwen3.5-0.8B-Q8_0.llamafile
  3. 3Windows 用户改名

    Windows 下需先把文件重命名并加上 .exe 后缀,然后才能运行;同时注意文件必须小于 4GB。

  4. 4大模型改用外部权重

    若 llamafile 超过 4GB(Windows 无法直接运行),改为下载 llamafile 主程序(https://github.com/mozilla-ai/llamafile/releases),再配合外部 GGUF 权重模型使

如何确认成功

执行后 llamafile 直接启动并进入可交互状态,能就输入内容给出模型回答,即表示运行成功。

常见问题

Q:运行 llamafile 需要先装 Python 或 CUDA 吗?

A:不需要。llamafile 把 llama.cpp 与 Cosmopolitan Libc 打包成单个可执行文件,在多数操作系统和 CPU 架构上本地运行,无需安装。

Q:Windows 上为什么跑不起来?

A:先确认已重命名为 .exe 后缀;另外 Windows 只能运行小于 4GB 的可执行文件,超过 4GB 的模型需下载 llamafile 主程序并搭配外部 GGUF 权重。

Q:想要更聪明的回答怎么办?

A:可以从官方预构建列表中选择更大、表达能力更强的模型;硬件越强(尤其是带 GPU),越适合运行更大的 llamafile。

Q:能做语音转文字吗?

A:可以。项目包含 whisperfile,这是基于 whisper.cpp 与同一套打包方式的单文件语音转文本工具,支持音频文件的转写与翻译。

注意事项

  • 从 0.10.0 起 llamafile 使用新的构建系统,与 llama.cpp 最新版本对齐,支持更新的模型和功能,但可能缺少部分旧特性。
  • 模型文件体积越大,对内存/显存要求越高,请按自身硬件选择。
  • Windows 用户务必先给文件加上 .exe 后缀再运行。

核心亮点

  • 单文件分发,免安装依赖,极大简化部署流程
  • 基于 llama.cpp,推理性能优秀,支持 CPU/GPU 混合加速
  • 内置 HTTP 服务器,可轻松集成到现有应用中

不足之处

  • 单文件体积较大,对于超大模型分发仍不友好
  • 文档/社区待观察

适用场景

  • 向非技术用户分享可运行的 AI 演示应用
  • 在无网络或受限环境中离线部署 LLM 服务
  • 快速搭建本地 AI 助手或 API 服务原型

替代项目

llama.cpp、Ollama、GPT4All

项目介绍

llamafile 是基础设施领域的开源项目,由 mozilla-ai 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(26,028)位列前 2%,在基础设施分类的 1,132 个项目里位列前 3%。

近 41 天,它的 GitHub 星标从 25,545 增加到 26,028,净增 483。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。完全开源免费,本地部署,无付费版本。

它主要面向的使用场景是:向非技术用户分享可运行的AI演示应用。同类可对比的替代方案包括 llama.cpp、Ollama、GPT4All。

上一篇:foundry-local

下一篇:kvcached

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09