distributed-llama

把家里闲置设备组集群,跑大模型更快更省

distributed-llama 是一个用 C++ 实现的开源项目,旨在将家庭中的多台设备(如电脑、树莓派等)组成一个分布式集群,共同运行 Llama 大语言模型的推理任务。它解决了单台设备算力不足、无法运行大模型的问题,通过将模型切分到多台设备上并行计算,实现更快的推理速度。核心能力包括:支持 Llama 系列模型、自动设备发现与集群组网、模型分片与并行推理、基于 HTTP 的简单接口。项目处于成长阶段,适合在局域网内搭建低成本推理集群,让普通用户也能利用闲置设备体验大模型。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3062
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队b4rtaz
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言C++
技术栈/模型distributed-computing,distributed-llm,llama2,llama3,llm,llm-inference,llms,neural-network,open-llm
GitHub 星标★ 3062
30天Star增速
HF 下载量
上线时间2023-12-04 00:00:00
最近更新2026-09-23 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:入门 约 15 分钟 部署方式:本地安装 5 步

环境要求

  • Python 3(用于运行 launch.py 启动脚本)
  • C++ 编译器(用于编译项目源码)
  • 支持 Linux、macOS 或 Windows 操作系统
  • x86_64 AVX2 或 ARM 架构 CPU
  • 多台设备需处于同一局域网并支持以太网高速通信

安装与启动步骤

  1. 1克隆项目仓库

    从 GitHub 拉取 distributed-llama 源码到本地,后续所有编译和启动命令都在该目录内执行。

    git clone https://github.com/b4rtaz/distributed-llama.git
    cd distributed-llama
  2. 2确认编译运行环境

    README 明确要求 Python 3 和 C++ 编译器;先确认本机已安装,否则编译阶段会失败。

    python --version
    g++ --version
  3. 3一行命令启动根节点

    launch.py 会自动下载模型和 tokenizer 并编译运行根节点,按设备内存选择合适模型参数。

    python launch.py llama3_2_1b_instruct_q40
  4. 4换用更大模型

    内存充足时可替换命令里的模型名,例如 8B、70B 或 Qwen 3 系列,模型越大下载耗时越久。

    python launch.py llama3_1_8b_instruct_q40
  5. 5加入更多设备加速

    README 说明连接更多设备可提升推理速度,其他设备按对应平台文档接入同一集群。

如何确认成功

命令执行后模型与 tokenizer 下载完成、编译通过并开始输出推理结果,无报错即表示根节点启动成功。

常见问题

Q:支持哪些操作系统和硬件?

A:支持 Linux、macOS、Windows,并针对 ARM 和 x86_64 AVX2 CPU 做了优化。

Q:单机可以用吗?还是必须多台设备?

A:可以先用一台设备跑根节点体验,连接更多设备后借助张量并行可加快推理速度。

Q:命令里的模型名可以换吗?

A:可以。README 列出了 Llama 3.1/3.2/3.3、DeepSeek R1 Distill、Qwen 3 等多个模型对应的参数名。

Q:跑大模型需要多大内存?

A:README 给出了各模型体积,如 Llama 3.1 8B 约 6.32 GB、Llama 3.3 70B 约 40 GB,按此预留磁盘和内存。

Q:想在树莓派或 GPU 上运行怎么办?

A:README 提供了 Raspberry Pi 和 GPU 的专门文档,按对应篇章操作即可。

注意事项

  • 首次运行会下载模型和 tokenizer,请预留足够磁盘空间与下载时间。
  • 不同模型体积差异很大(如 1B 约 1.7 GB、405B 约 238 GB),按设备能力选择。
  • 多设备组网需在同一局域网内,依赖以太网高速同步。
  • 平台细节(树莓派、GPU 等)请查阅 README 中链接的 docs 文档。

核心亮点

  • 利用闲置设备,零成本提升推理性能
  • 纯 C++ 实现,资源占用低,适合嵌入式设备
  • 支持自动组网,部署相对简单

不足之处

  • 仅支持 Llama 系列模型,通用性有限
  • 文档/社区待观察

适用场景

  • 家庭多设备闲置算力整合
  • 低成本本地大模型推理环境搭建
  • 边缘设备集群推理实验

替代项目

llama.cpp、vLLM、ExLlamaV2

项目介绍

distributed-llama 是基础设施领域的开源项目,由 b4rtaz 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(3,062)位列前 30%,在基础设施分类中处于中上游。

近 42 天,它的 GitHub 星标从 3,035 增加到 3,062,净增 27。

项目仍在小幅维护中,最近一次代码更新于 2026-09-23。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:家庭多设备闲置算力整合。同类可对比的替代方案包括 llama.cpp、vLLM、ExLlamaV2。

上一篇:mesh-llm

下一篇:ramalama

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09