mlx-vlm

在 Mac 上本地跑视觉语言模型,推理微调一把梭

MLX-VLM 是一个专为 Mac 用户设计的视觉语言模型(VLM)推理与微调工具包,基于 Apple 的 MLX 框架构建。它解决了在 Mac 上运行大型多模态模型(如 LLaVA、Qwen2-VL 等)时依赖云端或 Nvidia GPU 的问题,让开发者可以在本地 Apple Silicon 芯片上高效运行和定制 VLM。核心能力包括:支持多种主流 VLM 架构的加载与推理,提供统一的 API 接口,支持 LoRA 等参数高效微调,并针对 Apple 统一内存架构进行了优化,使得大模型推理速度显著提升。项目代码简洁,易于扩展,适合研究、原型开发和个人使用。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 5524
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队Blaizzy
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型apple-silicon,florence2,idefics,llava,llm,local-ai,mlx,molmo,paligemma,pixtral,vision-framework,vision-language-model,vision-transformer
GitHub 星标★ 5524
30天Star增速
HF 下载量
上线时间2024-04-16 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:入门 约 10 分钟 部署方式:本地安装 6 步

环境要求

  • Apple Silicon 芯片的 Mac(项目基于 Apple MLX 框架,README 明确说明用于 Mac)
  • 已安装 Python 与 pip,可执行 pip install 命令
  • 使用 zsh 等会展开方括号的 shell 时,安装带 extras 的包需要加引号
  • 首次调用模型需要联网从 Hugging Face 下载权重,需预留磁盘空间

安装与启动步骤

  1. 1安装 mlx-vlm

    README 给出的最简安装方式,用 pip 安装并升级到最新版本。

    pip install -U mlx-vlm
  2. 2装 Gradio 界面

    可选。Gradio 聊天界面的依赖不在基础安装中,需要单独安装这个 extra。

    pip install -U 'mlx-vlm[ui]'
  3. 3启动本地服务

    README 正文提供了 Server (FastAPI) 章节,但本次节选未给出启动命令,请以仓库该章节为准,服务默认端口 8080。

  4. 4查询模型列表

    服务起来后调用 /models 查看当前可发现的模型。

    curl "http://localhost:8080/models"
  5. 5发送文本对话

    向 /chat/completions 发 POST 请求做纯文本推理,model 换成你本地可用的模型仓库。

    curl -X POST "http://localhost:8080/chat/completions" -H "Content-Type: application/json" -d '{"model": "mlx-community/Qwen2-VL-2B-Instruct-4bit", "messages": [{"role": "user", "content": "Hello, how are you"}], "stream": true, "max_tokens": 100}'
  6. 6发送图片请求

    把 image_url 换成本地图片路径,即可让视觉语言模型分析图片。

    curl -X POST "http://localhost:8080/chat/completions" -H "Content-Type: application/json" -d '{"model": "mlx-community/Qwen2.5-VL-32B-Instruct-8bit", "messages": [{"role": "system", "content": "You are a helpful assistant."}, {"role": "user", "content": [{"type": "text", "text": "This is today's chart for energy demand in California. Can you provide an analysis of the chart and comment on the implications for renewable energy in California?"}, {"type": "input_image", "image_url": "/path/to/repo/examples/images/renewables_california.png"}]}], "stream": true, "max_tokens": 1000}'

关键配置

配置项必填说明示例
MLX_VLM_MODEL_DISCOVERY否开启共享 Hugging Face 缓存范围内的模型发现hf-cache
--model-discovery否命令行方式开启缓存级模型发现,等价于上面的环境变量hf-cache
--embedding-model否预加载默认向量(embedding)模型sentence-transformers/all-MiniLM-L6-v2
--reranker-model否预加载默认重排序(rerank)模型mlx-community/Qwen3-Reranker-0.6B-4bit
model是请求体中指定要调用的模型仓库 id 或本地路径mlx-community/Qwen2-VL-2B-Instruct-4bit

如何确认成功

服务启动后执行 curl "http://localhost:8080/models" 能返回模型列表,且向 /chat/completions 发请求能收到模型回复,即表示部署成功。

常见问题

Q:服务怎么启动?我没在节选里看到命令。

A:本次节选只包含 Installation 与接口调用示例,没有给出服务启动命令。请查看仓库 README 的 Server (FastAPI) 章节获取准确命令,服务默认监听 8080 端口。

Q:安装 'mlx-vlm[ui]' 时报 no matches found。

A:zsh 等 shell 会把方括号当通配符。按 README 提示给包名加引号即可:pip install -U 'mlx-vlm[ui]'。

Q:为什么 /models 看不到我用其他工具下载的模型?

A:默认模型发现与共享的 Hugging Face 缓存隔离。用 --model-discovery hf-cache 或环境变量 MLX_VLM_MODEL_DISCOVERY=hf-cache 开启缓存级发现。

Q:能在 Windows 或 Nvidia 显卡上运行吗?

A:项目定位是 Mac + Apple MLX,主要面向 Apple Silicon。README 另提到 CUDA 下的激活量化,但常规推理路径仍是 Mac 本地。

注意事项

  • 必须在 Apple Silicon Mac 上使用,依赖 Apple MLX 框架。
  • Gradio 聊天界面需要额外安装 [ui] extra,且 zsh 下必须加引号。
  • 服务默认端口为 8080,示例接口地址均基于 localhost:8080。
  • 本次 README 节选未包含 FastAPI 服务的启动命令,请以仓库对应章节为准,不要自行猜测参数。

核心亮点

  • 原生适配 Apple Silicon,利用统一内存跑大模型,速度比 CPU 快数倍
  • 支持 LLaVA、Qwen2-VL、InternVL 等多个主流 VLM,开箱即用
  • 提供简洁的 Python API,几行代码即可完成模型加载和推理

不足之处

  • 仅支持 Mac(Apple Silicon),不适用于 Linux/Windows 用户
  • 文档和社区生态仍在成长,部分高级功能示例较少

适用场景

  • 在 Mac 上本地开发多模态应用,如图像问答、OCR 等
  • 对 VLM 进行 LoRA 微调,快速适配特定领域数据
  • 教学和科研场景,快速验证 VLM 效果而不需 GPU 服务器

替代项目

Hugging Face Transformers、Ollama、llama.cpp

项目介绍

mlx-vlm 是开源模型领域的开源项目,由 Blaizzy 开发,2024 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(5,524)位列前 8%,在开源模型分类的 422 个项目里位列前 12%。

近 41 天,它的 GitHub 星标从 5,320 增加到 5,524,净增 204。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:在Mac上本地开发多模态应用,如图像问答、OCR等。同类可对比的替代方案包括 Hugging Face Transformers、Ollama、llama.cpp。

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1873 2026-08-10