petals

在家用 BitTorrent 方式跑大模型,推理微调快 10 倍

Petals 是一个去中心化的 LLM 推理与微调框架,采用 BitTorrent 风格的点对点网络,将大型语言模型(如 Llama、Falcon、BLOOM)切分成多个小块,由全球志愿者贡献的 GPU 节点协同运行。它解决了个人用户因显存不足而无法运行超大模型的问题,无需昂贵硬件即可在本地参与推理或微调。核心能力包括:通过分布式张量并行实现高效推理,支持 LoRA 等参数高效微调,速度比传统 offloading 方法快 10 倍,且支持动态添加或移除节点,网络弹性强。用户只需安装客户端,即可像使用普通库一样调用模型,同时也能贡献自己的 GPU 资源换取算力。

开源 free 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 10583
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类对话助手
开发团队bigscience-workshop
所属国家
官网地址https://petals.dev
定价模式free
价格说明开源项目,MIT许可证,可免费自部署使用,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型bloom,chatbot,deep-learning,distributed-systems,falcon,gpt,guanaco,language-models,large-language-models,llama,machine-learning,mixtral,neural-networks,nlp,pipeline-parallelism,pretrained-models,pytorch,tensor-parallelism,transformer,volunteer-computing
GitHub 星标★ 10583
30天Star增速
HF 下载量
上线时间2022-06-12 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数12

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 4 步

环境要求

  • Python 环境(示例代码为 Python)
  • 可访问互联网,能连接公共 swarm 网络
  • 如需运行 Llama 等受限模型,需有 Hugging Face 账号并申请权重访问权限
  • 可选:桌面电脑或 Google Colab 环境

安装与启动步骤

  1. 1安装 Petals 库

    通过 PyPI 安装 petals(README 徽章指向 pypi.org/project/petals),建议在虚拟环境中安装。

    pip install petals
  2. 2登录 Hugging Face

    仅在加载 Llama 等需授权模型前执行,按要求在终端登录以获取权重访问权限。

    huggingface-cli login
  3. 3编写推理脚本

    把 README 示例写成脚本:加载分词器与分布式模型,生成文本;模型名可换成 health.petals.dev 上任意可用模型。

    from transformers import AutoTokenizer
    from petals import AutoDistributedModelForCausalLM
    
    # Choose any model available at https://health.petals.dev
    model_name = "meta-llama/Meta-Llama-3.1-405B-Instruct"
    
    # Connect to a distributed network hosting model layers
    tokenizer = AutoTokenizer.from_pretrained(model_name)
    model = AutoDistributedModelForCausalLM.from_pretrained(model_name)
    
    # Run the model as if it were on your computer
    inputs = tokenizer("A cat sat", return_tensors="pt")["input_ids"]
    outputs = model.generate(inputs, max_new_tokens=5)
    print(tokenizer.decode(outputs[0]))  # A cat sat on a mat...
  4. 4或用 Colab 试用

    README 提供在线 Colab 笔记本,不想本地配置环境时可先在这里跑通示例。

关键配置

配置项必填说明示例
model_name是要加载的分布式模型名称,需在可用列表中选择meta-llama/Meta-Llama-3.1-405B-Instruct
max_new_tokens否生成的最大新 token 数量5

如何确认成功

运行脚本后应打印出以 “A cat sat” 开头的句子(README 示例为 A cat sat on a mat...),说明已成功连接分布式网络并完成推理。

常见问题

Q:没有显卡能运行吗?

A:可以。模型层分布在公共 swarm 的其他节点上,本地只需 Python 环境与网络,README 称可在桌面电脑或 Colab 上运行大模型。

Q:为什么加载 Llama 报权限错误?

A:需先在 Hugging Face 申请该模型权重访问权限,然后在终端执行 huggingface-cli login 后再加载,或直接使用官方 chatbot 应用。

Q:我的数据安全吗?

A:数据会借助公共 swarm 中他人节点处理;敏感数据请参考 README 说明,在可信人员之间搭建私有 swarm。

Q:有哪些模型可以用?

A:README 指向 https://health.petals.dev,可从中选择 Llama 3.1(最高 405B)、Mixtral、Falcon、BLOOM 等模型。

注意事项

  • 数据会经过公共 swarm 其他参与者协助处理,敏感数据请使用私有 swarm。
  • 本地推理无需大显存,但生成速度取决于网络中可用节点状况。
  • 遇到问题可前往项目 Discord 提问(README 中给出邀请链接)。

核心亮点

  • 分布式推理,单卡显存不足也能跑超大模型
  • 微调速度比 offloading 快 10 倍,支持 LoRA
  • 点对点网络,社区贡献算力,成本低且弹性好

不足之处

  • 网络依赖性强,节点不稳定时推理延迟可能波动
  • 文档/社区待观察

适用场景

  • 个人开发者无高端 GPU,想本地运行 70B+ 模型
  • 低成本微调大模型,利用空闲 GPU 资源
  • 隐私敏感场景,数据不出本地但需共享算力

替代项目

Hugging Face Transformers、vLLM、ExLlamaV2

项目介绍

petals 是模型训练领域的开源项目,由 bigscience-workshop 开发,2022 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(10,583)位列前 5%,在模型训练分类的 522 个项目里位列前 5%。

近 41 天,它的 GitHub 星标从 10,488 增加到 10,583,净增 95。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。MIT许可证,可免费自部署使用,无付费版本。从国内网络环境看,可直接访问。

它主要面向的使用场景是:个人开发者无高端GPU,想本地运行70B+模型。同类可对比的替代方案包括 Hugging Face Transformers、vLLM、ExLlamaV2。

上一篇:verl-agent

下一篇:h2o-llmstudio

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13