
LiteRT-LM
让大模型跑在手机端,离线低延迟还护隐私
LiteRT-LM 是 Google 推出的开源大语言模型端侧推理框架,前身为 TensorFlow Lite 相关能力演进而来,目标是让 LLM 在手机、平板、嵌入式设备等边缘硬件上高效运行。它解决的核心问题是:传统云端推理存在延迟高、隐私风险、离线不可用和带宽成本高等痛点,而直接在端侧跑大模型又面临内存、算力和功耗限制。LiteRT-LM 提供从模型转换、量化压缩到运行时调度的完整链路,支持多种硬件加速后端(CPU/GPU/NPU),并针对 Transformer 结构做了算子融合、KV Cache 优化和动态内存管理。开发者可以用 C++ 接口集成,也能配合 Android/iOS 生态部署,适合需要低延迟、数据不出端的智能助手、实时翻译、本地问答等场景。
项目数据
使用教程
⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。
环境要求
- README 未给出安装命令,建议先阅读官网 CLI 文档:https://ai.google.dev/edge/litert-lm/cli
- 可运行的目标设备:Linux、macOS、Windows 或 Raspberry Pi
- 使用 --backend=gpu 时,设备需具备可用的 GPU 加速能力
- 从 HuggingFace 拉取模型需要可联网(示例仓库 litert-community/gemma-4-E4B-it-litert-lm)
- 如需在自有应用中集成,需下载对应平台的 C API 预编译库
安装与启动步骤
-
1查看官方 CLI 文档
README 未直接提供 litert-lm 命令行工具的安装方式,先访问官网 CLI 页面确认安装步骤,再执行后续命令。
-
2下载 C API 预编译库
v0.16.0 起提供首个版本化 C API 共享库预编译包,覆盖所有受支持平台,可用于原生集成或自行封装语言绑定。
curl -L -o litert_lm_c_api-0.1.0.zip https://github.com/google-ai-edge/LiteRT-LM/releases/download/v0.16.0/litert_lm_c_api-0.1.0.zip -
3跑通 CLI 推理示例
用 litert-lm run 从 HuggingFace 仓库拉取 Gemma4-E4B 模型并推理,指定 GPU 后端并开启推测解码。
litert-lm run --from-huggingface-repo=litert-community/gemma-4-E4B-it-litert-lm gemma-4-E4B-it.litertlm --backend=gpu --enable-speculative-decoding=true --prompt="What is the capital of France?" -
4体验网页 Demo
若只想快速看效果、不做本地部署,可直接打开 README 中给出的官方 Web Demo 在线试用。
关键配置
| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
--from-huggingface-repo | 是 | 指定从 HuggingFace 拉取的模型仓库,免手动下载权重 | litert-community/gemma-4-E4B-it-litert-lm |
gemma-4-E4B-it.litertlm | 是 | 位置参数,指向具体模型文件(.litertlm 格式) | gemma-4-E4B-it.litertlm |
--backend | 否 | 选择推理硬件后端,README 示例使用 gpu | gpu |
--enable-speculative-decoding | 否 | 开启推测解码以加速生成 | true |
--prompt | 否 | 传给模型的输入提示词 | What is the capital of France? |
如何确认成功
终端开始输出模型对 --prompt 的回答内容,即表示 CLI 已成功加载模型并完成推理。
常见问题
Q:litert-lm 命令怎么安装?
A:README 未提供安装命令,仅给出官网 CLI 文档链接 https://ai.google.dev/edge/litert-lm/cli,请按该页面说明安装后再运行示例命令。
Q:支持哪些平台?
A:README 提到可在 Linux、macOS、Windows 或 Raspberry Pi 上尝试 CLI 示例,并称 C API 预编译包覆盖所有受支持平台。
Q:不想自己下模型怎么办?
A:使用 --from-huggingface-repo 参数即可直接从 HuggingFace 拉取 litert-community 下的模型仓库,无需手动下载权重。
Q:YNNPACK 后端现在能用吗?
A:v0.16.0 中的 YNNPACK delegate 属于实验特性,仅在 linux arm64 构建的 LiteRT-LM CLI 和 Python API 中启用。
Q:怎么集成到自己的 App?
A:下载 v0.16.0 的 C API 预编译共享库(litert_lm_c_api-0.1.0.zip),无需自行构建即可原生集成或创建语言绑定。
注意事项
- README 节选中没有安装步骤,本教程的步骤基于 CLI 示例、C API 预编译发布与官网链接推断,执行前请先阅读官方 CLI 文档。
- 示例命令中的 --prompt 内容 README 被截断,可按需替换成自己的提示词。
- --backend=gpu 与 --enable-speculative-decoding=true 都是可选配置,请按设备实际能力取舍。
- YNNPACK delegate 为实验性功能,生产环境慎用。
核心亮点
- Google 官方出品,工程化程度高,面向生产环境而非实验demo
- 支持 CPU/GPU/NPU 多后端加速,能充分利用端侧异构算力
- 提供量化与内存优化,降低大模型在边缘设备上的资源门槛
不足之处
- C++ 为主,上层应用集成门槛较高,文档和示例仍在完善
- 端侧硬件碎片化严重,不同芯片的实际兼容与性能表现待验证
适用场景
- 手机端离线智能助手,无网络也能对话问答
- 实时语音/文本翻译,数据不出设备保障隐私
- 嵌入式设备上的本地知识库检索与摘要生成
替代项目
llama.cpp、MLC-LLM
项目介绍
上一篇:worker-vllm
下一篇:chats
同类项目推荐
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···