LiteRT-LM

让大模型跑在手机端,离线低延迟还护隐私

LiteRT-LM 是 Google 推出的开源大语言模型端侧推理框架,前身为 TensorFlow Lite 相关能力演进而来,目标是让 LLM 在手机、平板、嵌入式设备等边缘硬件上高效运行。它解决的核心问题是:传统云端推理存在延迟高、隐私风险、离线不可用和带宽成本高等痛点,而直接在端侧跑大模型又面临内存、算力和功耗限制。LiteRT-LM 提供从模型转换、量化压缩到运行时调度的完整链路,支持多种硬件加速后端(CPU/GPU/NPU),并针对 Transformer 结构做了算子融合、KV Cache 优化和动态内存管理。开发者可以用 C++ 接口集成,也能配合 Android/iOS 生态部署,适合需要低延迟、数据不出端的智能助手、实时翻译、本地问答等场景。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 6463
维护状态 活跃
是否开源
定价模式 free

项目数据

分类基础设施
开发团队google-ai-edge
所属国家
定价模式free
价格说明开源免费,Apache 2.0 许可证
访问状态
是否开源
开源协议Apache-2.0
主要语言C++
技术栈/模型edge-ai,on-device-ai,on-device-llm
GitHub 星标★ 6463
30天Star增速
HF 下载量
上线时间2025-04-14 00:00:00
最近更新2026-09-17 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-15
浏览次数0

使用教程

难度:入门 约 15 分钟 部署方式:命令行工具 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • README 未给出安装命令,建议先阅读官网 CLI 文档:https://ai.google.dev/edge/litert-lm/cli
  • 可运行的目标设备:Linux、macOS、Windows 或 Raspberry Pi
  • 使用 --backend=gpu 时,设备需具备可用的 GPU 加速能力
  • 从 HuggingFace 拉取模型需要可联网(示例仓库 litert-community/gemma-4-E4B-it-litert-lm)
  • 如需在自有应用中集成,需下载对应平台的 C API 预编译库

安装与启动步骤

  1. 1查看官方 CLI 文档

    README 未直接提供 litert-lm 命令行工具的安装方式,先访问官网 CLI 页面确认安装步骤,再执行后续命令。

  2. 2下载 C API 预编译库

    v0.16.0 起提供首个版本化 C API 共享库预编译包,覆盖所有受支持平台,可用于原生集成或自行封装语言绑定。

    curl -L -o litert_lm_c_api-0.1.0.zip https://github.com/google-ai-edge/LiteRT-LM/releases/download/v0.16.0/litert_lm_c_api-0.1.0.zip
  3. 3跑通 CLI 推理示例

    用 litert-lm run 从 HuggingFace 仓库拉取 Gemma4-E4B 模型并推理,指定 GPU 后端并开启推测解码。

    litert-lm run 
       --from-huggingface-repo=litert-community/gemma-4-E4B-it-litert-lm 
       gemma-4-E4B-it.litertlm 
       --backend=gpu 
       --enable-speculative-decoding=true 
       --prompt="What is the capital of France?"
  4. 4体验网页 Demo

    若只想快速看效果、不做本地部署,可直接打开 README 中给出的官方 Web Demo 在线试用。

关键配置

配置项必填说明示例
--from-huggingface-repo指定从 HuggingFace 拉取的模型仓库,免手动下载权重litert-community/gemma-4-E4B-it-litert-lm
gemma-4-E4B-it.litertlm位置参数,指向具体模型文件(.litertlm 格式)gemma-4-E4B-it.litertlm
--backend选择推理硬件后端,README 示例使用 gpugpu
--enable-speculative-decoding开启推测解码以加速生成true
--prompt传给模型的输入提示词What is the capital of France?

如何确认成功

终端开始输出模型对 --prompt 的回答内容,即表示 CLI 已成功加载模型并完成推理。

常见问题

Q:litert-lm 命令怎么安装?

A:README 未提供安装命令,仅给出官网 CLI 文档链接 https://ai.google.dev/edge/litert-lm/cli,请按该页面说明安装后再运行示例命令。

Q:支持哪些平台?

A:README 提到可在 Linux、macOS、Windows 或 Raspberry Pi 上尝试 CLI 示例,并称 C API 预编译包覆盖所有受支持平台。

Q:不想自己下模型怎么办?

A:使用 --from-huggingface-repo 参数即可直接从 HuggingFace 拉取 litert-community 下的模型仓库,无需手动下载权重。

Q:YNNPACK 后端现在能用吗?

A:v0.16.0 中的 YNNPACK delegate 属于实验特性,仅在 linux arm64 构建的 LiteRT-LM CLI 和 Python API 中启用。

Q:怎么集成到自己的 App?

A:下载 v0.16.0 的 C API 预编译共享库(litert_lm_c_api-0.1.0.zip),无需自行构建即可原生集成或创建语言绑定。

注意事项

  • README 节选中没有安装步骤,本教程的步骤基于 CLI 示例、C API 预编译发布与官网链接推断,执行前请先阅读官方 CLI 文档。
  • 示例命令中的 --prompt 内容 README 被截断,可按需替换成自己的提示词。
  • --backend=gpu 与 --enable-speculative-decoding=true 都是可选配置,请按设备实际能力取舍。
  • YNNPACK delegate 为实验性功能,生产环境慎用。

核心亮点

  • Google 官方出品,工程化程度高,面向生产环境而非实验demo
  • 支持 CPU/GPU/NPU 多后端加速,能充分利用端侧异构算力
  • 提供量化与内存优化,降低大模型在边缘设备上的资源门槛

不足之处

  • C++ 为主,上层应用集成门槛较高,文档和示例仍在完善
  • 端侧硬件碎片化严重,不同芯片的实际兼容与性能表现待验证

适用场景

  • 手机端离线智能助手,无网络也能对话问答
  • 实时语音/文本翻译,数据不出设备保障隐私
  • 嵌入式设备上的本地知识库检索与摘要生成

替代项目

llama.cpp、MLC-LLM

项目介绍

LiteRT-LM 是一个基础设施领域的开源项目,官方简介:LiteRT-LM is Google's production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.。项目使用 C++ 开发,在 GitHub 上获得 6447 星标。

上一篇:worker-vllm

下一篇:chats

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···

★ 202 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8433 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 435 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181124 2026-08-09