
Orion
在苹果 ANE 上直接跑小 LLM,离线微调不联网
Orion 是一个面向 Apple Silicon 的本地 AI 运行时,目标是直接在 Apple Neural Engine(ANE)上训练和运行小型大语言模型。它绕开了 CoreML 和 Metal 这两条常规路径,通过逆向工程直接调用 ANE 硬件,让 M 系列芯片的神经网络加速器真正跑起 LLM 的推理与微调。项目解决的核心问题是:现有 Apple 端侧 AI 方案大多依赖 CoreML 转换或 Metal GPU 计算,前者对动态模型支持有限,后者功耗和占用较高,而 ANE 长期缺乏开放、可编程的 LLM 运行时。Orion 提供离线、端侧的微调与推理能力,数据不出设备,适合对隐私和延迟敏感的场景。核心能力包括 ANE 上的小模型训练与推理、无需 CoreML/Metal 的底层调度、面向 M 系列芯片的优化。项目用 Objective-C 编写,目前处于早期阶段,星标约 122。
项目数据
使用教程
核心亮点
- 直接逆向调用 ANE,绕开 CoreML 与 Metal,路径独特
- 支持端侧微调而非仅推理,数据可完全离线不出设备
- 针对 M 系列芯片优化,利用神经网络加速器降低功耗
不足之处
- 项目早期,星标仅约 122,生态与文档尚不完善
- 仅支持小型 LLM,模型规模和能力受限,通用性待验证
适用场景
- 隐私敏感场景下在 Mac 上离线微调个人小模型
- 无网络环境下做端侧 LLM 推理与实验
- 研究 ANE 底层能力、探索非 CoreML 端侧 AI 方案
替代项目
llama.cpp、MLX
项目介绍
同类项目推荐
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···