GenieX

一行代码让高通设备跑起前沿大模型,离线AI轻松实现

GenieX 是一个专为高通设备设计的开源推理引擎,旨在让开发者通过几行代码即可在本地运行前沿的大语言模型(LLM)和视觉语言模型(VLM)。它充分利用高通芯片的异构计算能力,包括 NPU、GPU 和 CPU,实现高效、低延迟的端侧推理。GenieX 解决了在资源受限的移动设备和嵌入式设备上部署大型模型的难题,提供了跨平台支持,并针对高通硬件进行了深度优化。其核心能力包括:统一的 API 接口、自动设备选择与调度、支持多种主流模型格式,以及为开发者提供的简洁集成体验。通过 GenieX,开发者可以轻松构建隐私保护、离线可用的 AI 应用,而无需依赖云端服务。项目采用 Rust 编写,保证了内存安全和性能,目前正处于快速成长阶段,吸引了大量关注。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 8392
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队qualcomm
所属国家
定价模式free
价格说明开源项目,BSD-3-Clause许可证,可免费本地部署使用,无付费版本。
访问状态
是否开源是
开源协议BSD-3-Clause
主要语言Rust
技术栈/模型gemma4,go,gpt-oss,granite4,hexagon,llama3,llm,local-ai,on-device-ai,qualcomm,qwen3,qwen3vl,sdk,snapdragon,vlm
GitHub 星标★ 8392
30天Star增速
HF 下载量
上线时间2024-08-16 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:入门 约 10 分钟 部署方式:Docker 3 步

环境要求

  • 一台高通骁龙(Snapdragon)设备:Windows ARM64(Snapdragon X / X Elite)、Android(Snapdragon 8
  • 已安装并可正常使用的 Docker 环境
  • 可访问 Docker Hub 与 Hugging Face / Qualcomm AI Hub 的网络
  • 准备好要运行的模型:Hugging Face 上的 GGUF 模型,或 Qualcomm AI Hub 的预编译 bundle

安装与启动步骤

  1. 1确认设备平台

    GenieX 只在高通骁龙设备上运行,先确认自己的机器属于 Windows ARM64、Android 还是 Linux ARM64,再选择对应接口。

  2. 2拉取 GenieX 镜像

    从 Docker Hub 拉取官方 GenieX 镜像,容器内已封装好 CLI,因此后续 geniex 命令可直接在容器环境中使用。

    docker pull docker.io/qualcomm/geniex:latest
  3. 3运行模型推理

    指定要加载的模型即可开始本地推理;README 示例使用 Docker Hub 上的 gemma3,运行时会自动调度 NPU / GPU / CPU。

    geniex infer docker.io/ai/gemma3

如何确认成功

执行 geniex infer docker.io/ai/gemma3 后,命令行能正常加载模型并返回生成的推理结果,即表示运行成功。

常见问题

Q:非高通芯片的电脑可以运行 GenieX 吗?

A:不可以。GenieX 仅支持高通骁龙平台,官方列出 Windows ARM64、Android 和 Linux ARM64 三类设备,其他平台的芯片不在支持范围内。

Q:支持哪些模型来源和格式?

A:两类:一是 Hugging Face 上的 GGUF 模型(走 llama.cpp 运行时),二是 Qualcomm AI Hub 的预编译 bundle(走 qairt 运行时,面向 NPU)。

Q:推理时用 NPU、GPU 还是 CPU?

A:由 GenieX 自动完成设备选择与调度:预编译 bundle 面向 Hexagon NPU,GGUF 模型由 llama.cpp 在 NPU / GPU / CPU 之间运行,无需手动指定。

Q:除了 Docker 和 CLI,还有别的调用方式吗?

A:有。README 提到同一套 C SDK 还提供 Python、Kotlin/Java(Android SDK)以及 OpenAI 兼容的本地服务器接口,具体安装命令需查阅官网对应文档页。

注意事项

  • GenieX 是高通 GENIE 的社区版本,仅限高通骁龙设备使用,不要在 Intel/AMD 或非骁龙 ARM 设备上尝试。
  • README 节选只给出了 Docker 与 CLI 两条命令,Python、Android SDK、本地服务器等接口的安装方式请以官网文档为准。
  • 运行模型前需要确保模型(GGUF 或 AI Hub bundle)已可获取,首次拉取镜像和模型会消耗较多网络流量。

核心亮点

  • 针对高通 NPU 深度优化,推理性能远超纯 CPU 方案
  • API 设计简洁,几行代码即可加载并运行模型,上手门槛低
  • 支持 LLM 和 VLM 多类模型,覆盖文本与视觉场景

不足之处

  • 仅支持高通设备,对非高通平台(如 NVIDIA、Apple Silicon)兼容性差
  • 文档和社区生态尚在建设中,示例和教程不够丰富

适用场景

  • 在 Android 手机上离线运行聊天助手或文档摘要
  • 在智能家居设备上部署本地语音助手,保护隐私
  • 在边缘设备上实现实时图像理解与问答

替代项目

llama.cpp、MNN、ONNX Runtime

项目介绍

GenieX 是基础设施领域的开源项目,由 qualcomm 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(8,392)位列前 6%,在基础设施分类的 1,132 个项目里位列前 8%。

近 41 天,它的 GitHub 星标从 8,303 增加到 8,392,净增 89。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。BSD-3-Clause许可证,可免费本地部署使用,无付费版本。

它主要面向的使用场景是:在Android手机上离线运行聊天助手或文档摘要。同类可对比的替代方案包括 llama.cpp、MNN、ONNX Runtime。

上一篇:ipex-llm

下一篇:lmdeploy

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09