rwkv.cpp

在 CPU 上跑 RWKV 大模型,量化省内存,推理快人一步

rwkv.cpp 是一个专注于在 CPU 上高效运行 RWKV 语言模型的推理引擎,支持 INT4、INT5、INT8 和 FP16 等多种量化精度。它解决了 RWKV 模型在无 GPU 环境下部署困难的问题,通过量化技术显著降低内存占用和计算开销,使普通 PC 甚至嵌入式设备也能流畅运行大规模语言模型。核心能力包括模型量化、CPU 推理优化、支持多种操作系统和架构,并提供简洁的命令行接口。该项目基于 C++ 实现,借鉴了 llama.cpp 的设计理念,为 RWKV 模型在边缘设备的应用提供了轻量级解决方案。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1580
维护状态 低维护
是否开源
定价模式 free

项目数据

分类开源模型
开发团队RWKV
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源
开源协议MIT
主要语言C++
技术栈/模型deep-learning,ggml,language-model,llm,machine-learning,quantization,rwkv
GitHub 星标★ 1580
30天Star增速
HF 下载量
上线时间2023-03-30 00:00:00
最近更新2026-08-14 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数0

核心亮点

  • 支持 INT4/INT5/INT8/FP16 多种量化精度,灵活平衡内存与效果
  • 针对 CPU 深度优化,无需 GPU 即可运行,降低部署门槛
  • 兼容多平台(Windows/Linux/macOS),易于集成到现有项目

不足之处

  • 仅支持 RWKV 模型,不适用于其他架构
  • 文档/社区待观察

适用场景

  • 在无 GPU 的服务器或本地 PC 上部署 RWKV 聊天机器人
  • 边缘设备(如树莓派)上运行轻量级语言模型
  • 对隐私敏感场景,本地化推理避免云端依赖

替代项目

llama.cpp、ggml、llama-cpp-python

项目介绍

rwkv.cpp 是一个开源模型领域的开源项目,官方简介:INT4/INT5/INT8 and FP16 inference on CPU for RWKV language model。项目使用 C++ 开发,在 GitHub 上获得 1581 星标。

上一篇:gpu-hot

下一篇:nvidia_gpu_exporter

同类项目推荐

ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi-K2.6, GLM-5.2, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma ···

★ 178973 2026-08-09
OpenMemory 开源

AI 工具共用一份记忆,关掉重开照样记得你

Local persistent memory store for LLM applications including claude desktop, github ···

★ 4449 2026-08-09
litellm 开源

一个网关接入所有大模型,告别接口乱、成本散、监控难

The fastest, litest AI Gateway. Rust core with Python SDK. Call 100+ LLM APIs in Ope···

★ 56760 2026-08-09
vllm 开源

同一个模型跑出几倍速度,机器成本省一半

A high-throughput and memory-efficient inference and serving engine for LLMs

★ 89457 2026-08-09