rknn-llm

把大模型塞进瑞芯微开发板,NPU 加速离线跑

rknn-llm 是瑞芯微(Rockchip)官方开源的端侧大语言模型部署工具包,面向 RK3588、RK3576 等 NPU 芯片,解决在嵌入式设备上高效运行 LLM 的问题。它提供模型转换、量化、推理运行时和示例代码,把 HuggingFace 上的主流模型(如 Qwen、Llama、ChatGLM、Phi 等)转换为 RKNN 格式,并调用 NPU 加速推理。核心能力包括:支持 W4A16 等量化方案降低显存占用,提供 C++/Python 推理接口,内置多轮对话、流式输出、多模态(视觉语言模型)示例,以及性能评估脚本。项目还包含模型下载、转换、部署的完整文档,让开发者能在开发板或边缘设备上快速跑通本地大模型,无需依赖云端,适合做离线语音助手、智能座舱、工业质检等场景。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1704
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类基础设施
开发团队airockchip
所属国家
官网地址
定价模式free
价格说明开源免费,基于Rockchip NPU部署LLM
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型
GitHub 星标★ 1704
30天Star增速
HF 下载量
上线时间2024-03-14 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-06
浏览次数0

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:进阶 约 30 分钟 部署方式:命令行工具 5 步

环境要求

  • 支持平台:RK3588 / RK3576 / RK3562 / RV1126B 系列开发板
  • 开发板运行 Linux aarch64,已具备 adb 连接环境
  • 开发板内核需包含 RKNPU 内核驱动(Rockchip 内核代码中已开源)
  • PC 端如需转换自有模型,需准备 RKLLM-Toolkit 工具

安装与启动步骤

  1. 1下载模型与demo

    从 rkllm_model_zoo 下载预转换模型和 quickstart 目录下的 demo 可执行文件,提取码为 rkllm。

  2. 2推送文件到开发板

    用 adb 把 demo 可执行文件和两个模型文件推送到开发板 /data 目录。

    adb push ./demo_Linux_aarch64 /data
    adb push model.rkllm /data/demo_Linux_aarch64
    adb push model.rknn /data/demo_Linux_aarch64
  3. 3登录并配置环境

    adb shell 登录设备,进入 demo 目录并设置动态库路径,否则会找不到依赖库。

    adb shell
    cd /data/demo_Linux_aarch64
    export LD_LIBRARY_PATH=./lib
  4. 4运行多模态demo

    按 Usage 给出的参数顺序传入图片、编码模型、LLM 模型、生成长度、上下文长度、NPU 核数与平台等参数。

    ./demo image_path img_encoder_model_path audio_path aud_encoder_model_path llm_model_path max_new_tokens max_context_len rknn_core_num platform
  5. 5转换自有模型

    若要部署自己的模型,需先在 PC 上用 RKLLM-Toolkit 完成转换与量化,得到 RKLLM 格式模型后再推送。

关键配置

配置项必填说明示例
LD_LIBRARY_PATH是指定 demo 运行时的动态库搜索路径,指向自带 lib 目录./lib
rknn_core_num是demo 运行参数,指定使用的 NPU 核心数量3
max_new_tokens是demo 运行参数,控制单次生成的最大 token 数512
max_context_len是demo 运行参数,设置模型上下文长度上限4096

如何确认成功

在开发板执行 ./demo 后能正常加载 RKNN 与 RKLLM 模型,并对输入的图片提问返回文本回答,即部署成功。

常见问题

Q:没有 Rockchip 开发板能运行吗?

A:不能。该工具包面向 RK3588/RK3576/RK3562/RV1126B 等带 NPU 的平台,推理依赖 RKNPU 内核驱动与开发板环境。

Q:可以用自己的模型吗?

A:可以。需要先在 PC 上用 RKLLM-Toolkit 把训练好的模型转换并量化为 RKLLM 格式,再放到开发板上推理。

Q:模型文件从哪里获取?

A:README 的 Quickstart 提供了 rkllm_model_zoo 下载地址,提取码为 rkllm,其中的模型均为预转换好的。

Q:运行时报找不到动态库怎么办?

A:需要先 cd 到 demo 目录并执行 export LD_LIBRARY_PATH=./lib,让程序能找到随包附带的库文件。

注意事项

  • 预转换模型与 demo 下载地址在 README 的 quickstart 中,提取码为 rkllm。
  • 全部推理在本地设备完成,数据不会上传到云端。
  • 支持 Qwen、Llama、Phi、ChatGLM、Gemma 等主流模型系列。
  • README 仅给出 demo 的参数顺序说明,具体参数取值需按实际文件路径与板卡情况填写。

核心亮点

  • 官方维护,与 RKNN 工具链和 NPU 驱动深度适配,转换和推理流程完整
  • 支持 Qwen、Llama、ChatGLM 等主流模型,提供量化与多模态示例
  • 包含 C++/Python 接口和性能测试脚本,方便集成到嵌入式产品

不足之处

  • 强绑定瑞芯微 NPU 硬件,非 RK 芯片无法使用
  • 模型转换步骤较多,对不熟悉 RKNN 工具链的开发者有上手门槛

适用场景

  • 在 RK3588 开发板上部署离线语音助手
  • 智能座舱/机器人本地大模型对话
  • 边缘设备上的视觉语言多模态推理

替代项目

llama.cpp、MLC-LLM

项目介绍

rknn-llm 是基础设施领域的开源项目,由 airockchip 开发,2024 年首次发布。

在全站 13,752 个收录项目中,它的 GitHub 星标数(1,704)位列前 30%,在基础设施分类中处于中上游。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-29。开源免费,基于Rockchip NPU部署LLM。

它主要面向的使用场景是:在RK3588开发板上部署离线语音助手。同类可对比的替代方案包括 llama.cpp、MLC-LLM。

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

[DEPRECATED / UNMAINTAINED] No longer maintained.

★ 301 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 9132 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 442 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 182248 2026-08-09