PowerInfer

让普通电脑也能飞快跑大模型,省显存不减速

PowerInfer 是一个面向本地部署的高速大语言模型推理引擎,专注于在消费级硬件上实现接近服务器级的推理速度。它通过利用大语言模型推理中的高稀疏性(即神经元激活的局部性),设计了一套基于CPU-GPU混合推理的架构,将热神经元(高频激活)预加载到GPU,冷神经元(低频激活)则在CPU上按需计算,从而大幅减少显存占用和访存开销。项目采用C++实现,支持多种量化格式和主流模型架构,提供与llama.cpp兼容的接口,可无缝集成到现有应用中。其核心价值在于让普通用户无需昂贵GPU即可流畅运行大模型,推动AI本地化部署的普及。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 9803
维护状态 低维护
是否开源
定价模式 free

项目数据

分类开源模型
开发团队Tiiny-AI
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源
开源协议MIT
主要语言C++
技术栈/模型large-language-models,llama,llm,llm-inference,local-inference
GitHub 星标★ 9803
30天Star增速
HF 下载量
上线时间2023-12-15 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:高级 约 40 分钟 部署方式:本地安装 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 已安装 Python 环境,可执行 python 与 pip 命令
  • 已获取项目源码目录(Python 依赖需在项目根目录安装)
  • 已准备原始模型目录和对应的 predictor 目录(用于模型转换)
  • 消费级 GPU 环境(PowerInfer 定位为 CPU/GPU 混合推理)
  • 足够存放转换后 GGUF 模型的磁盘空间

安装与启动步骤

  1. 1克隆项目仓库

    从 GitHub 获取 PowerInfer 源码。README 未给出具体克隆命令,此处按项目提供的仓库地址获取,克隆后进入项目目录。

    git clone https://github.com/Tiiny-AI/PowerInfer.git
  2. 2安装 Python 依赖

    在项目根目录执行,安装 requirements.txt 中列出的依赖,为模型转换脚本准备运行环境。

    pip install -r requirements.txt
  3. 3准备模型与预测器

    按 README 的 Model Weights 章节准备原始模型目录与 predictor 目录,这两个路径是下一步转换命令的输入。

  4. 4转换模型为 GGUF

    调用 convert.py 把原始模型转换为 PowerInfer 专用的 GGUF 格式;三个路径参数需替换为自己机器上的真实路径。

    python convert.py --outfile /PATH/TO/POWERINFER/GGUF/REPO/MODELNAME.powerinfer.gguf /PATH/TO/ORIGINAL/MODEL /PATH/TO/PREDICTOR
  5. 5运行推理

    转换完成后按 README 的 Inference 章节启动推理。README 节选中未给出具体推理命令,请以仓库该章节内容为准。

关键配置

配置项必填说明示例
--outfile指定转换后生成的 PowerInfer GGUF 模型输出路径/PATH/TO/POWERINFER/GGUF/REPO/MODELNAME.powerinfer.gguf

如何确认成功

README 未给出启动验证方式;可先确认 --outfile 指定路径下已生成 .powerinfer.gguf 模型文件,再按 Inference 章节运行推理并观察输出。

常见问题

Q:为什么没有编译或启动命令?

A:README 节选中 Setup and Installation 与 Inference 章节未给出具体命令,只有依赖安装和模型转换命令。完整步骤请查看仓库对应章节,本项目为 C++ 实现,通常需要自行编译。

Q:pip install -r requirements.txt 在哪里执行?

A:需要在克隆下来的 PowerInfer 项目根目录执行,确保能读取到 requirements.txt 文件,否则会报找不到文件。

Q:模型转换命令的三个路径分别是什么?

A:依次为:转换后 GGUF 的输出文件路径、原始模型所在目录、predictor 所在目录,三个路径都要替换成自己机器上的真实路径。

Q:如何确认模型转换成功?

A:检查 --outfile 指定的路径下是否生成了以 .powerinfer.gguf 结尾的文件,再按 Inference 章节加载该模型进行推理。

注意事项

  • README 节选中未包含完整的编译与推理命令,本教程只覆盖其中明确出现的步骤,其余请以仓库文档为准。
  • 转换命令中的 /PATH/TO/... 为大写占位路径,执行前必须替换为真实路径。
  • 面向手机等端侧场景可参考 PowerInfer-2 及 smallthinker/README.md 中的端侧推理框架。
  • README 中的模型权重来自 Hugging Face(如 PowerInfer/SmallThinker 系列),请按其 Model Weights 章节获取。

核心亮点

  • 利用神经元稀疏性,GPU/CPU混合推理,显存占用降低数倍,可在8GB显卡运行大模型
  • 推理速度显著优于llama.cpp等传统方案,尤其在长上下文和批处理场景下
  • 支持动态稀疏加载,冷热神经元自动调度,无需手动配置,开箱即用

不足之处

  • 对CPU性能要求较高,冷神经元计算依赖CPU,老旧CPU可能成为瓶颈
  • 文档/社区待观察,部分高级功能(如多GPU支持)仍在完善中

适用场景

  • 个人开发者在本地笔记本上运行7B-13B模型进行代码生成或问答
  • 边缘设备或离线环境部署大模型,避免数据外泄
  • 低成本AI服务商利用现有CPU+低端GPU集群提供推理服务

替代项目

llama.cpp、MLC-LLM、vLLM

项目介绍

PowerInfer 是基础设施领域的开源项目,由 Tiiny-AI 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(9,803)位列前 5%,在基础设施分类的 1,130 个项目里位列前 7%。

近 41 天,它的 GitHub 星标从 9,712 增加到 9,803,净增 91。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:个人开发者在本地笔记本上运行7B-13B模型进行代码生成或问答。同类可对比的替代方案包括 llama.cpp、MLC-LLM、vLLM。

上一篇:runanywhere-sdks

下一篇:seatunnel

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09