mlx-openai-server

在 Mac 上跑起 OpenAI 兼容的本地模型服务,一行代码接入现有工具。

mlx-openai-server 是一个面向 Apple Silicon 芯片的高性能 API 服务器,为 MLX 系列模型提供 OpenAI 兼容的接口。它基于 Python 和 FastAPI 构建,支持视觉模型(如 MLX-VLM)和语言模型(如 MLX-LM),并集成了图像生成能力(如 FLUX)。该项目解决了在本地 Mac 上高效运行多种 MLX 模型并统一接入现有 OpenAI 生态的问题,核心能力包括:连续批处理(continuous batching)提升吞吐、多模型并行加载与切换、请求队列管理、以及兼容 OpenAI 的 RESTful API。用户无需修改代码即可将本地模型接入支持 OpenAI 的客户端或工具,实现低成本、低延迟的私有化部署。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 362
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队cubist38
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,需自行部署。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型apple-silicon,continuous-batching,fastapi,flux,image-generation,mlx,mlx-lm,mlx-vlm,multi-models,openai-compatible,queue,speech-recognition,structured-outputs,tool-calling,vision-api,whisper
GitHub 星标★ 362
30天Star增速
HF 下载量
上线时间2025-03-28 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

核心亮点

  • 原生利用 Apple Silicon 的 MLX 框架,推理性能优化到位
  • 提供 OpenAI 兼容接口,无缝替换云 API,迁移成本极低
  • 支持连续批处理和请求队列,高并发场景吞吐表现稳定

不足之处

  • 仅支持 Apple Silicon,限制了非 Mac 用户的使用场景
  • 项目处于早期阶段,文档和社区支持尚待完善

适用场景

  • 在 Mac 上本地部署私有 LLM 或 VLM,供内部工具调用
  • 开发阶段快速测试 OpenAI 兼容应用,无需连接云端
  • 利用 FLUX 等模型在本地批量生成图像,降低 API 成本

替代项目

vLLM、Ollama、LocalAI

项目介绍

mlx-openai-server 是基础设施领域的开源项目,由 cubist38 开发,2025 年首次发布。

它收录于基础设施分类,该分类目前共有 1,132 个项目,GitHub 星标数为 362。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。MIT许可证,完全免费,需自行部署。

它主要面向的使用场景是:在Mac上本地部署私有LLM或VLM,供内部工具调用。同类可对比的替代方案包括 vLLM、Ollama、LocalAI。

上一篇:llmedge

下一篇:comfyui-api

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09