rwkv.cpp

在 CPU 上跑 RWKV 大模型,量化省内存,推理快人一步

rwkv.cpp 是一个专注于在 CPU 上高效运行 RWKV 语言模型的推理引擎,支持 INT4、INT5、INT8 和 FP16 等多种量化精度。它解决了 RWKV 模型在无 GPU 环境下部署困难的问题,通过量化技术显著降低内存占用和计算开销,使普通 PC 甚至嵌入式设备也能流畅运行大规模语言模型。核心能力包括模型量化、CPU 推理优化、支持多种操作系统和架构,并提供简洁的命令行接口。该项目基于 C++ 实现,借鉴了 llama.cpp 的设计理念,为 RWKV 模型在边缘设备的应用提供了轻量级解决方案。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1583
维护状态 低维护
是否开源 是
定价模式 free

项目预览

项目数据

分类开源模型
开发团队RWKV
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言C++
技术栈/模型deep-learning,ggml,language-model,llm,machine-learning,quantization,rwkv
GitHub 星标★ 1583
30天Star增速
HF 下载量
上线时间2023-03-30 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:进阶 约 30 分钟 部署方式:本地安装 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • C++ 编译环境(项目基于 C++ 与 ggml 实现)
  • 建议 x86 CPU 支持 AVX2(README 性能数据基于 4C/8T x86 + AVX2、4 线程)
  • Python 环境(项目提供 Python wrapper 调用推理)
  • 足够磁盘空间存放 RWKV v4/v5/v6/v7 模型权重

安装与启动步骤

  1. 1克隆项目源码

    从 GitHub 拉取 rwkv.cpp 仓库,后续的 C 库、Python wrapper 与脚本都在该目录内。

    git clone https://github.com/RWKV/rwkv.cpp
  2. 2编译出推理库

    项目以 C++/ggml 实现并对外提供 C 库 rwkv.h。README 节选未给出构建命令,请以仓库完整说明为准。

  3. 3下载模型权重

    从 HuggingFace 获取 RWKV 权重,README 给出 v4、v5、v6、v7 对应页面,按需选择版本与体积。

  4. 4按需合并 LoRA

    如需加载 LoRA,用仓库内 rwkv/merge_lora_into_ggml.py 合并,仅支持 Blealtan 格式的检查点。

  5. 5运行模型推理

    按 README「How to use → 4. Run the model」执行;也可用 Python wrapper 或 C 库 rwkv.h 加载模型取 logits。

如何确认成功

能通过 Python wrapper 或 C 库成功加载模型并正常输出推理结果,过程中无报错。

常见问题

Q:没有 GPU 可以运行吗?

A:可以。项目专注 CPU 推理,同时提供 cuBLAS 支持,有 GPU 时也能启用加速。

Q:支持哪些 RWKV 模型版本?

A:支持 RWKV v4、v5、v6 以及最新的 v7 架构。

Q:有哪些精度可选?

A:除常规 FP32 外,还支持 FP16 以及量化的 INT4、INT5、INT8 推理。

Q:怎么确定该用哪种量化精度?

A:README 建议用 rwkv/measure_pexplexity.py 在代表性数据集上测试各格式的困惑度与延迟后再决定。

注意事项

  • README 中的质量与性能表格仅为参考,作者建议严肃用途自行实测。
  • README 节选只包含 How to use 的「4. Run the model」标题,未给出具体命令,构建与运行步骤请以完整仓库文档为准。
  • 项目路径含 python/rwkv_cpp/rwkv_cpp_model.py 与 rwkv/ 下的脚本,请在克隆后的仓库根目录内查找。
  • LoRA 加载仅支持 Blealtan 格式的检查点。

核心亮点

  • 支持 INT4/INT5/INT8/FP16 多种量化精度,灵活平衡内存与效果
  • 针对 CPU 深度优化,无需 GPU 即可运行,降低部署门槛
  • 兼容多平台(Windows/Linux/macOS),易于集成到现有项目

不足之处

  • 仅支持 RWKV 模型,不适用于其他架构
  • 文档/社区待观察

适用场景

  • 在无 GPU 的服务器或本地 PC 上部署 RWKV 聊天机器人
  • 边缘设备(如树莓派)上运行轻量级语言模型
  • 对隐私敏感场景,本地化推理避免云端依赖

替代项目

llama.cpp、ggml、llama-cpp-python

项目介绍

rwkv.cpp 是基础设施领域的开源项目,由 RWKV 开发,2023 年首次发布。

在全站 13,635 个收录项目中,它的 GitHub 星标数(1,583)位列前 30%,在基础设施分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2025-03-23。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:在无GPU的服务器或本地PC上部署RWKV聊天机器人。同类可对比的替代方案包括 llama.cpp、ggml、llama-cpp-python。

上一篇:gpu-hot

下一篇:nvidia_gpu_exporter

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

[DEPRECATED / UNMAINTAINED] No longer maintained.

★ 303 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 9099 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 442 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 182135 2026-08-09