omlx

Mac 菜单栏一键跑大模型,SSD 缓存突破内存限制,连续批处理提速

omlx 是一个专为 Apple Silicon 打造的 LLM 推理服务器,通过 macOS 菜单栏应用进行管理。它解决了在 Mac 上运行大模型时显存不足、推理效率低的问题,核心能力包括连续批处理(continuous batching)以提升吞吐量,以及 SSD 缓存机制来扩展可用模型容量,让大模型能利用 SSD 空间作为内存扩展。用户可通过菜单栏轻松启动、切换和管理本地模型,无需命令行操作。项目基于 Python 实现,深度优化了 Apple Silicon 的 GPU 和统一内存架构,提供类 OpenAI 的 API 接口,方便集成到现有应用中。它让 Mac 用户能流畅运行 7B-70B 级别的模型,兼顾性能与易用性。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 22070
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队jundot
所属国家
官网地址https://omlx.ai
定价模式free
价格说明开源项目,Apache-2.0 许可证,可自行部署,完全免费。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型apple-silicon,inference-server,llm,macos,mlx,openai-api
GitHub 星标★ 22070
30天Star增速
HF 下载量
上线时间2026-02-13 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数7

使用教程

难度:入门 约 10 分钟 部署方式:本地安装 6 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Apple Silicon(M 系列芯片)Mac 设备
  • 较新版本的 macOS 系统
  • 如需从源码构建,需安装 Xcode 开发环境
  • 可通过 macOS 菜单栏应用或 Homebrew 方式安装 oMLX

安装与启动步骤

  1. 1确认硬件环境

    oMLX 专为 Apple Silicon 打造,需在 M 系列芯片的 Mac 上运行,并依赖统一内存与 GPU 优化能力。

  2. 2安装 oMLX

    README 仅说明支持 macOS 应用或 Homebrew 两种安装方式,未给出具体命令,请前往官网获取安装包或安装说明。

  3. 3启动后台服务

    以托管后台服务的方式启动推理服务器,进程崩溃后会自动重启,无需一直停留终端。

    omlx start
  4. 4停止服务

    需要释放内存或更换模型时,可用该命令关闭正在运行的后台推理服务。

    omlx stop
  5. 5重启服务

    修改模型或配置后用于重新加载服务,等效于先 stop 再 start。

    omlx restart
  6. 6从源码构建应用

    该脚本会执行 xcodebuild 构建、venvstacks 打包 Python 层并做 ad-hoc 签名,生成可运行的 oMLX.app。

    apps/omlx-mac/Scripts/build.sh release

如何确认成功

执行 omlx start 后若无报错即代表后台服务已启动;README 未提供端口或健康检查命令。

常见问题

Q:可以在 Intel Mac 或 Windows 上运行吗?

A:不可以。oMLX 专为 Apple Silicon 优化,依赖 MLX 与统一内存架构,只有 M 系列芯片的 Mac 才可运行。

Q:服务崩溃后需要手动重启吗?

A:不需要。README 说明 omlx start 以后台服务方式运行,崩溃后会自动重启,也可用 omlx restart 手动重启。

Q:如何更换或添加模型?

A:README 提到可从菜单栏管理模型,并把常用模型常驻内存、按需自动换入较重模型,具体操作见官网 omlx.ai。

Q:从哪里获取安装包?

A:README 未给出安装命令,说明支持 macOS 应用与 Homebrew 两种安装方式,请以官网 omlx.ai 的安装说明为准。

注意事项

  • README 未提供 pip、Docker 等安装命令,请勿自行安装 Python 包或容器镜像。
  • oMLX 仅支持 Apple Silicon 的 Mac,Intel 机型无法使用。
  • 从源码构建 oMLX.app 需要 Xcode 环境,脚本会执行 xcodebuild 与 venvstacks 打包。
  • 服务默认以后台方式运行,可用 omlx stop 关闭、omlx restart 重启。

核心亮点

  • 连续批处理显著提升多请求并发时的推理吞吐量,比逐条处理更高效
  • SSD 缓存机制让超大模型能跨内存运行,突破 Mac 统一内存容量限制
  • 菜单栏原生管理界面,无需命令行,开箱即用,对非技术用户友好

不足之处

  • 仅支持 Apple Silicon,Intel Mac 和 NVIDIA GPU 用户无法使用
  • SSD 缓存依赖高速外置存储,普通硬盘可能成为性能瓶颈
  • 文档/社区待观察

适用场景

  • 在 MacBook 上本地运行 Llama 3 等大模型做离线问答和文本生成
  • 开发者将 omxl 作为本地 OpenAI 兼容后端,集成到自己的应用中测试
  • 在内存不足的 Mac 上通过 SSD 缓存运行 70B 级别大模型进行实验

替代项目

Ollama、LM Studio、llama.cpp

项目介绍

omlx 是基础设施领域的开源项目,由 jundot 开发,是 2026 年新上线的项目。

在全站 13,109 个收录项目中,它的 GitHub 星标数(22,070)位列前 3%,在基础设施分类的 1,133 个项目里位列前 4%。

近 41 天,它的 GitHub 星标从 18,638 增加到 22,070,净增 3,432。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。Apache-2.0 许可证,可自行部署,完全免费。

它主要面向的使用场景是:在MacBook上本地运行Llama3等大模型做离线问答和文本生成。同类可对比的替代方案包括 Ollama、LM Studio、llama.cpp。

上一篇:screenpipe

下一篇:MNN

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

[DEPRECATED / UNMAINTAINED] Multi-account gateway. No longer maintained; fork it and···

★ 303 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09