llama-gpt

本地跑起ChatGPT,数据不出门,隐私百分百

llama-gpt 是一个完全自托管的离线聊天机器人,由 Llama 2 模型驱动,提供类似 ChatGPT 的交互体验。它解决了用户在使用云端 AI 服务时对隐私和数据安全的担忧,确保 100% 的对话数据不离开本地设备。项目基于 TypeScript 开发,核心能力包括本地模型推理、多模型支持(如 Code Llama)、简单的 Web 界面以及 API 接口。用户可以通过 Docker 或本地命令快速部署,无需依赖外部网络。项目还支持模型量化以降低资源消耗,适合在个人电脑或边缘设备上运行。作为开源项目,它提供了高度的可定制性,允许开发者集成到自己的应用中。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 10936
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队getumbrel
所属国家
定价模式free
价格说明完全开源免费,MIT许可证,可自行部署,无在线服务。
访问状态
是否开源是
开源协议MIT
主要语言TypeScript
技术栈/模型ai,chatgpt,code-llama,codellama,gpt,gpt-4,gpt4all,llama,llama-2,llama-cpp,llama2,llamacpp,llm,localai,openai,self-hosted
GitHub 星标★ 10936
30天Star增速
HF 下载量
上线时间2023-07-22 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:入门 约 20 分钟 部署方式:Docker 7 步

环境要求

  • 已安装 Docker(Docker Desktop 或 Docker Engine 均可)
  • 支持 x86 或 arm64 架构的系统
  • M1/M2 Mac 上还需安装 Xcode
  • 如需 GPU 加速,需具备 Nvidia GPU
  • 使用 Kubernetes 部署时需有可用集群并配置好 kubectl

安装与启动步骤

  1. 1克隆项目仓库

    把 llama-gpt 源码下载到本地,需要能访问 GitHub 网络。

    git clone https://github.com/getumbrel/llama-gpt.git
  2. 2进入项目目录

    切换到刚克隆下来的目录,后续命令都在此目录下执行。

    cd llama-gpt
  3. 3Docker 启动服务

    在任意 x86/arm64 系统上运行,默认使用 7B 模型;13B、70B 把 7b 换成 13b、70b。

    ./run.sh --model 7b
  4. 4启用 GPU 加速(可选)

    有 Nvidia GPU 时加上 --with-cuda 参数,可显著提升推理速度。

    ./run.sh --model 7b --with-cuda
  5. 5M1/M2 Mac 启动

    Mac 用户改用 run-mac.sh;Code Llama 模型可用 code-7b、code-13b、code-34b。

    ./run-mac.sh --model 7b
  6. 6Kubernetes 部署(可选)

    先创建 llama 命名空间,再应用 deploy/kubernetes 下的清单,之后按自己方式暴露服务。

    kubectl create ns llama
    kubectl apply -k deploy/kubernetes/. -n llama
  7. 7访问聊天界面

    服务就绪后浏览器打开 http://localhost:3000 即可对话,停止服务在终端按 Ctrl+C。

关键配置

配置项必填说明示例
--model是指定使用的模型规格,7b/13b/70b 为对话模型7b
--model (Code Llama)否使用代码模型时填 code-7b / code-13b / code-34bcode-7b
--with-cuda否有 Nvidia GPU 时启用 CUDA 加速推理--with-cuda
-n llama否Kubernetes 部署时指定的命名空间llama

如何确认成功

终端出现 ready - started server on 0.0.0.0:3000,浏览器打开 http://localhost:3000 能正常对话即成功。

常见问题

Q:第一次运行很久没反应,是不是出错了?

A:正常现象。首次运行会自动下载模型到 /models 目录,期间会反复输出 Host not yet available 之类日志,等模型下载加载完成即可。

Q:怎么换成更大的模型?

A:把命令里的 --model 7b 换成 13b 或 70b 即可,Code Llama 则用 code-7b、code-13b、code-34b。

Q:没有 Nvidia GPU 能跑吗?

A:可以。不加 --with-cuda 时在任意 x86 或 arm64 系统上通过 Docker 运行,只是推理速度较慢。

Q:如何停止服务?

A:在运行命令的终端里按 Ctrl + C 即可停止。

Q:Mac 上能用同样的命令吗?

A:不能,M1/M2 Mac 需改用 ./run-mac.sh --model 7b,并提前安装好 Docker 和 Xcode。

注意事项

  • 全程离线运行,聊天数据不会离开本地设备
  • 模型会自动下载到 /models 目录,首次启动耗时较长
  • 更换模型只需修改 --model 参数,无需改代码
  • Kubernetes 部署后需自行决定如何对外暴露服务

核心亮点

  • 完全离线运行,数据零外泄,隐私保护拉满
  • 支持 Llama 2 和 Code Llama,代码生成能力实用
  • Docker 一键部署,上手门槛低

不足之处

  • 模型体积大,低配设备运行卡顿
  • 文档/社区待观察

适用场景

  • 企业内部知识库问答,敏感数据不外传
  • 开发者本地调试代码生成,无需联网
  • 个人隐私聊天助手,替代云端服务

替代项目

Ollama、LocalAI、text-generation-webui

项目介绍

llama-gpt 是对话助手领域的开源项目,由 getumbrel 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(10,936)位列前 5%,在对话助手分类的 907 个项目里位列前 3%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。完全开源免费,MIT许可证,可自行部署,无在线服务。

它主要面向的使用场景是:企业内部知识库问答,敏感数据不外传。同类可对比的替代方案包括 Ollama、LocalAI、text-generation-webui。

上一篇:SillyTavern

下一篇:apfel

同类项目推荐

open-webui 开源

给本地模型配个漂亮聊天室,全家都能用

User-friendly AI Interface (Supports Ollama, OpenAI API, ...)

★ 152821 2026-08-09
prompts.chat 开源

海量好提示词,抄了就能让 AI 更听话

f.k.a. Awesome ChatGPT Prompts. Share, discover, and collect prompts from the commun···

★ 170999 2026-08-09
elia 开源

终端里用键盘快速聊 AI,多模型切换不打断思路

A snappy, keyboard-centric terminal user interface for interacting with large langua···

★ 2479 2026-08-09
NextChat 开源

一个界面聊遍所有主流AI模型,支持全平台部署,轻快又私密。

✨ Zero-config AI chat assistant. No API key needed — sign up and instantly chat wi···

★ 88802 2026-08-09