
BloomBee
多台普通设备拼起来,也能微调和跑大模型
BloomBee 是一个面向大语言模型(LLM)的去中心化微调与推理框架,核心思路是把模型训练和推理任务拆分到多台普通设备上协同完成,并通过 offloading 技术把显存压力转移到内存或磁盘,从而让显存有限的消费级显卡甚至多机环境也能跑起大模型。它结合了流水线并行(pipeline parallelism)和张量并行(tensor parallelism),把模型层切分到不同节点,再配合 PyTorch 生态实现分布式调度。项目主要解决个人或小团队缺乏高端 GPU、又想对 Llama 等模型做微调和推理的痛点,目标是降低大模型训练与部署的硬件门槛。当前项目处于早期阶段,星标约 130,适合关注去中心化训练、分布式推理和显存优化方向的开发者研究试用。
开源
free
模型训练
GitHub 星标
★ 131
维护状态
活跃
是否开源
是
定价模式
free
项目数据
分类模型训练
开发团队ai-decentralized
所属国家
定价模式free
价格说明开源项目,免费使用
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型deep-learning,distributed-systems,llama,machine-learning,pipeline-parallelism,pytorch,tensor-parallelism
GitHub 星标★ 131
30天Star增速
HF 下载量
上线时间2025-01-23 00:00:00
最近更新2026-09-18 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0
使用教程
核心亮点
- 用 offloading 把参数和中间激活卸载到内存/磁盘,显著降低单卡显存门槛
- 同时支持 pipeline parallelism 和 tensor parallelism,可跨多机扩展
- 基于 PyTorch 实现,兼容 Llama 等主流模型,便于二次开发
不足之处
- 项目处于早期,功能和稳定性可能不完善
- 去中心化多机通信与调度会带来额外延迟,实际吞吐待验证
适用场景
- 个人开发者用多台低显存设备微调 Llama 类模型
- 小团队在无高端 GPU 集群时做分布式推理验证
- 研究去中心化训练与显存 offloading 方案的教学实验
替代项目
DeepSpeed、Petals、vLLM
项目介绍
上一篇:AViD
同类项目推荐
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···