llama2-webui

本地一键运行 Llama 2,网页聊天即刻上手

llama2-webui 是一个让你在本地轻松运行 Llama 2 大语言模型的工具,它基于 Gradio 构建了直观的网页界面,支持在 GPU 或 CPU 上运行,并兼容 Linux、Windows 和 Mac 系统。该项目解决了普通用户和开发者本地部署大模型时面临的环境配置复杂、缺乏交互界面等问题,核心能力包括:一键启动本地模型服务、提供聊天和生成式交互界面、支持多种模型参数调整。它内置了 llama2-wrapper 作为后端,方便开发者将其集成到自己的生成式应用或智能体系统中。无论是想体验 Llama 2 的普通用户,还是需要本地模型后端的开发者,都能通过简单的命令快速启动,无需深入底层细节。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1936
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队liltom-eth
所属国家
官网地址
定价模式free
价格说明开源项目,本地部署,完全免费,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言Jupyter Notebook
技术栈/模型llama-2,llama2,llm,llm-inference
GitHub 星标★ 1936
30天Star增速
HF 下载量
上线时间2023-07-20 00:00:00
最近更新2026-09-16 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数7

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 6 步

环境要求

  • 支持 Linux / Windows / Mac 系统,需 Git、git-lfs 与 Python 环境
  • Nvidia GPU 运行:Llama-2-7b 约需 14GB 显存,13b 约需 28GB 显存
  • CPU 运行:需 GGML 格式模型,如 llama-2-7b-chat.ggmlv3.q4_0.bin 至少 6GB 内存
  • 下载 Meta 官方 Llama 2 模型前需在 ai.meta.com/llama 与 HuggingFace 仓库申请访问权限

安装与启动步骤

  1. 1处理 bitsandbytes 兼容

    若 bitsandbytes >= 0.39 在较老的 NVIDIA GPU 上不可用,需降级安装才能启用 LOAD_IN_8BIT 的 8 位推理。

    pip install bitsandbytes==0.38.1
  2. 2Windows 安装 bitsandby

    Windows 用户需卸载默认包后,改为安装专门的 Windows wheel 才能正常使用。

    pip uninstall bitsandbytes
    pip install https://github.com/jllllll/bitsandbytes-windows-webui/releases/download/wheels/bitsandbytes-0.41.0-py3-none-win_amd64.whl
  3. 3安装后端依赖

    llama2-wrapper 是项目的本地 Llama 2 后端,默认基于 llama.cpp 运行,也可集成到自己的应用中。

    pip install llama2-wrapper
  4. 4下载 Llama 2 模型

    先安装 git-lfs,再从 HuggingFace 克隆模型仓库;需提前获得 Meta 与仓库的访问授权,审核通常数小时内完成。

    git lfs install
    git clone git@hf.co:meta-llama/Llama-2-7b-chat-hf
  5. 5选择并配置 .env

    从 env_examples 中挑选与模型匹配的示例文件复制为 .env,再按需修改后端类型、模型路径等参数。

    cp env_examples/.env.7b_ggmlv3_q4_0_example .env
  6. 6启动 Web 界面

    在项目目录执行启动命令,终端会输出本地访问地址,用浏览器打开即可进入 Gradio 聊天界面。

    python app.py

关键配置

配置项必填说明示例
LOAD_IN_8BIT否设为 True 启用 8 位推理,显存占用约减半但质量略降True
BACKEND_TYPE否指定模型后端类型,例如用 gptq 运行 4 位模型gptq
MODEL_PATH否指向已下载到本地的模型目录或权重文件路径/your/path/Llama-2-7b-Chat-GPTQ

如何确认成功

执行 python app.py 后终端无报错并输出本地访问地址,浏览器打开该地址能看到 Gradio 聊天界面即可。

常见问题

Q:bitsandbytes 在旧 Nvidia GPU 上无法工作怎么办?

A:将版本降级为 0.38.1:pip install bitsandbytes==0.38.1,之后即可使用 LOAD_IN_8BIT 的 8 位模式。

Q:Windows 上 bitsandbytes 安装失败怎么办?

A:先 pip uninstall bitsandbytes,再安装 README 提供的 Windows 专用 wheel(bitsandbytes-0.41.0-py3-none-win_amd64.whl)。

Q:运行 GPTQ 模型时报 NameError: name 'autogptq_cuda_256' is not defi

A:参考官方讨论,安装指定版本的 AutoGPTQ wheel:pip install https://github.com/PanQiWei/AutoGPTQ/releases/download/v0.3.0/auto_gptq-0.3.0+cu117-cp310-cp310-linux_x86_64.whl

Q:显存不够跑 7B 模型怎么办?

A:可在 .env 中把 LOAD_IN_8BIT 设为 True(8GB 显存即可跑 7B),或改用 GPTQ 4 位模型,仅需约 6GB 显存。

Q:官方 Llama 2 模型下载不下来怎么办?

A:需先在 ai.meta.com/llama 申请访问并开通对应 HuggingFace 仓库权限;也可直接下载无需授权的 GPTQ / GGML 社区模型。

注意事项

  • 官方 Llama 2 模型需申请授权后才能下载,TheBloke 的 GPTQ、GGML 模型可直接下载
  • 多张 GPU 时模型会自动加载并拆分显存,例如 2 张 11GB 显卡可跑 7B 模型
  • 8 位压缩会小幅降低模型质量,但兼容 CPU、GPU 与 Metal 后端
  • CPU 运行需使用 llama.cpp 与 GGML 模型,相关依赖已随项目安装

核心亮点

  • Gradio 界面开箱即用,无需前端开发经验
  • 支持 CPU/GPU 双模式,低配电脑也能跑
  • 提供 llama2-wrapper 后端,方便二次开发集成

不足之处

  • 依赖 Python 环境,非技术用户安装仍有门槛
  • 文档/社区待观察

适用场景

  • 个人电脑本地体验 Llama 2 对话能力
  • 快速搭建内部使用的 AI 聊天原型
  • 作为生成式应用或智能体的本地推理后端

替代项目

text-generation-webui、ollama、LM Studio

项目介绍

llama2-webui 是开源模型领域的开源项目,由 liltom-eth 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,936)位列前 30%,在开源模型分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-16。本地部署,完全免费,无付费版本。

它主要面向的使用场景是:个人电脑本地体验Llama2对话能力。同类可对比的替代方案包括 text-generation-webui、ollama、LM Studio。

上一篇:Chinese-LLaMA-Alpaca-3

下一篇:LongWriter

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
awesome-ltx2 开源

找齐 LTX-2 模型、工作流和 LoRA,一键上手视频生成。

All available LTX-2 models, encoders, workflows, LoRAs for ComfyUI

★ 593 2026-08-10