
SwiftLM
Mac/iPhone 上跑本地大模型,OpenAI 接口直接调
SwiftLM 是一个面向 Apple Silicon 的原生 MLX Swift 大模型推理服务器,目标是把本地 LLM 推理做成可直接调用的 OpenAI 兼容服务。它解决的核心问题是:在 Mac 和 iPhone 上跑大模型时,显存/内存不够、推理框架与生态割裂、难以接入现有 OpenAI SDK 工具链。项目提供 OpenAI 兼容 API,现有客户端只需改 base URL 即可调用本地模型;通过 SSD 流式加载支持 100B+ 的 MoE 模型,让超大模型在统一内存有限的设备上也能运行;TurboQuant KV 缓存压缩降低长上下文的内存占用;同时附带 macOS 与 iOS 的 iPhone App,方便在移动端直接体验本地推理。整体定位是 Apple 生态里开箱即用的本地推理基础设施,适合想用 Swift/MLX 做端侧 AI 应用、又不想自己写推理服务层的开发者。
项目数据
使用教程
核心亮点
- 原生 MLX Swift 实现,充分利用 Apple Silicon 的 Metal 与统一内存,非 Python 套壳
- 提供 OpenAI 兼容 API,现有 SDK 和工具链改 base URL 即可接入本地模型
- 支持 SSD 流式加载 100B+ MoE 模型,突破统一内存对模型体积的限制
不足之处
- 仅支持 Apple Silicon,无法在 Linux/Windows 或非 M 系列芯片上运行
- 早期项目,766 星,生态、文档与社区案例相对有限
- Swift/MLX 推理性能与模型格式兼容性相比 llama.cpp 等成熟方案仍需验证
适用场景
- 在 Mac 上搭建本地 LLM 服务,供 Cursor、Continue 等 OpenAI 兼容客户端调用
- iPhone 端侧 AI 应用开发,用本地模型做隐私敏感的对话或摘要
- 研究者在 Apple Silicon 上测试 MoE 大模型与 KV 缓存压缩的推理表现
替代项目
llama.cpp、Ollama、MLX
项目介绍
同类项目推荐
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···