BloomBee

多台普通设备拼起来,也能微调和跑大模型

BloomBee 是一个面向大语言模型(LLM)的去中心化微调与推理框架,核心思路是把模型训练和推理任务拆分到多台普通设备上协同完成,并通过 offloading 技术把显存压力转移到内存或磁盘,从而让显存有限的消费级显卡甚至多机环境也能跑起大模型。它结合了流水线并行(pipeline parallelism)和张量并行(tensor parallelism),把模型层切分到不同节点,再配合 PyTorch 生态实现分布式调度。项目主要解决个人或小团队缺乏高端 GPU、又想对 Llama 等模型做微调和推理的痛点,目标是降低大模型训练与部署的硬件门槛。当前项目处于早期阶段,星标约 130,适合关注去中心化训练、分布式推理和显存优化方向的开发者研究试用。

开源 free 模型训练
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 131
维护状态 活跃
是否开源
定价模式 free

项目数据

分类模型训练
开发团队ai-decentralized
所属国家
官网地址
定价模式free
价格说明开源项目,免费使用
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型deep-learning,distributed-systems,llama,machine-learning,pipeline-parallelism,pytorch,tensor-parallelism
GitHub 星标★ 131
30天Star增速
HF 下载量
上线时间2025-01-23 00:00:00
最近更新2026-09-18 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0

使用教程

核心亮点

  • 用 offloading 把参数和中间激活卸载到内存/磁盘,显著降低单卡显存门槛
  • 同时支持 pipeline parallelism 和 tensor parallelism,可跨多机扩展
  • 基于 PyTorch 实现,兼容 Llama 等主流模型,便于二次开发

不足之处

  • 项目处于早期,功能和稳定性可能不完善
  • 去中心化多机通信与调度会带来额外延迟,实际吞吐待验证

适用场景

  • 个人开发者用多台低显存设备微调 Llama 类模型
  • 小团队在无高端 GPU 集群时做分布式推理验证
  • 研究去中心化训练与显存 offloading 方案的教学实验

替代项目

DeepSpeed、Petals、vLLM

项目介绍

BloomBee 是一个模型训练领域的开源项目,官方简介:Decentralized LLMs fine-tuning and inference with offloading。项目使用 Python 开发,在 GitHub 上获得 130 星标。

上一篇:AViD

下一篇:huggingface-gemma-recipes

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 61327 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1279 2026-08-13