vllm-mlx

在 Mac 上本地跑大模型,速度超快,兼容 OpenAI 和 Claude。

vllm-mlx 是一个专为 Apple Silicon 芯片设计的开源推理服务器,兼容 OpenAI 和 Anthropic API 协议。它解决了在 Mac 上高效运行大语言模型和视觉语言模型(如 Llama、Qwen-VL、LLaVA)的问题,提供连续批处理、MCP 工具调用和多模态支持。基于原生 MLX 后端,推理速度可达 400+ tokens/秒,并能与 Claude Code 等工具无缝集成。项目旨在将 Mac 变成高性能的本地 AI 推理平台,适合开发者在本地快速部署和测试模型,无需依赖云端 GPU。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1591
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队waybarrios
所属国家
定价模式free
价格说明开源项目,Apache-2.0 许可证,可免费自部署使用,无在线服务或付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型anthropic,anthropic-api,apple-silicon,claude-code,continuous-batching,inference-server,llm,local-llm,macos,mcp,mlx,multimodal-ai,openai,openai-api,openai-compatible,speech-to-text,text-to-speech,tool-calling,vision-language-model,vllm
GitHub 星标★ 1591
30天Star增速
HF 下载量
上线时间2025-12-06 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:入门 约 10 分钟 部署方式:本地安装 5 步

环境要求

  • Apple Silicon(M 系列芯片)Mac,使用 Metal 与统一内存
  • 已安装 Python 环境,并可使用 pip(README 亦推荐 uv)
  • 能访问 mlx-community 模型仓库以下载模型权重
  • 首次使用需下载模型,需预留磁盘空间与稳定网络

安装与启动步骤

  1. 1安装 vllm-mlx

    用 pip 直接安装;README 同时给出 uv 方式,二者择一即可。

    pip install vllm-mlx
  2. 2或改用 uv 安装

    README 推荐方式,把 CLI 工具安装到系统环境,便于全局调用。

    uv tool install vllm-mlx
  3. 3启动推理服务

    指定 mlx-community 上的模型并开启连续批处理,端口用 8000,首次运行会下载模型。

    vllm-mlx serve mlx-community/Llama-3.2-3B-Instruct-4bit --port 8000 --continuous-batching
  4. 4用 OpenAI SDK 调用

    服务兼容 OpenAI 接口,base_url 指向本机 8000 端口,api_key 可随意填。

    from openai import OpenAI
    client = OpenAI(base_url="http://localhost:8000/v1", api_key="not-needed")
    r = client.chat.completions.create(model="default", messages=[{"role": "user", "content": "Hi!"}])
    print(r.choices[0].message.content)
  5. 5接入 Claude Code

    设置 Anthropic 兼容的环境变量后启动 claude,即可复用同一服务。

    export ANTHROPIC_BASE_URL=http://localhost:8000
    export ANTHROPIC_API_KEY=not-needed
    claude

关键配置

配置项必填说明示例
ANTHROPIC_BASE_URL是指向本机 vllm-mlx 服务,供 Anthropic SDK / Claude Code 调用http://localhost:8000
ANTHROPIC_API_KEY是Anthropic 客户端要求的密钥占位,本地服务不校验not-needed
base_url是OpenAI SDK 中指向服务的地址,需带 /v1http://localhost:8000/v1
api_key是OpenAI 客户端要求的密钥占位,本地服务不校验not-needed

如何确认成功

服务启动后,用 OpenAI SDK 向 http://localhost:8000/v1 发送一条 chat.completions 请求,能打印出回复内容即成功。

常见问题

Q:必须用 Mac 吗?

A:是,vllm-mlx 基于原生 MLX 后端,面向 Apple Silicon 芯片,其他平台无法获得该推理能力。

Q:api_key 需要真实的密钥吗?

A:不需要。README 示例中 OpenAI 与 Anthropic 两种接入都使用 not-needed 作为占位值。

Q:能不能不给端口参数?

A:README 的快速开始显式使用 --port 8000,后续的 base_url 与环境变量也都指向 8000,建议沿用一致端口。

Q:模型要在哪里获取?

A:直接写 mlx-community 仓库下的模型名,例如 mlx-community/Llama-3.2-3B-Instruct-4bit,启动时会自动拉取,无需额外转换步骤。

注意事项

  • 安装方式二选一:pip install vllm-mlx 或 uv tool install vllm-mlx,不要重复安装。
  • 启动时 --continuous-batching 开启连续批处理,可提升并发吞吐。
  • 同一进程同时暴露 OpenAI /v1/* 与 Anthropic /v1/messages 接口,无需分别部署。

核心亮点

  • 原生 MLX 后端,针对 Apple Silicon 深度优化,推理速度高达 400+ tok/s
  • 兼容 OpenAI 和 Anthropic API,可直接替换云端服务,无缝接入现有工具
  • 支持多模态模型和 MCP 工具调用,功能全面,适合复杂应用场景

不足之处

  • 仅支持 Apple Silicon,无法在 NVIDIA GPU 或其他硬件上运行
  • 文档/社区待观察

适用场景

  • 在 Mac 上本地开发调试 LLM 应用,无需远程服务器
  • 使用 Claude Code 等工具时,通过本地推理降低成本并保护隐私
  • 快速测试多模态模型(如图像理解)的推理效果

替代项目

llama.cpp、Ollama、MLX-LM

项目介绍

vllm-mlx 是基础设施领域的开源项目,由 waybarrios 开发,2025 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,591)位列前 30%,在基础设施分类中处于中上游。

近 42 天,它的 GitHub 星标从 1,504 增加到 1,591,净增 87。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。Apache-2.0 许可证,可免费自部署使用,无在线服务或付费版本。

它主要面向的使用场景是:在Mac上本地开发调试LLM应用,无需远程服务器。同类可对比的替代方案包括 llama.cpp、Ollama、MLX-LM。

上一篇:fastrtc

下一篇:willow-inference-server

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09