Rapid-MLX

让 Mac 跑大模型快 4 倍,工具调用全兼容

Rapid-MLX 是一个专为 Apple Silicon 芯片打造的高性能本地 AI 推理引擎,旨在解决 Mac 上运行大模型速度慢、工具调用支持差的问题。它基于 MLX 框架深度优化,宣称比 Ollama 快 4.2 倍,缓存场景下首 token 延迟仅 0.08 秒。核心能力包括:100% 的工具调用支持(内置 17 种工具解析器)、智能提示词缓存、推理过程分离(可隐藏思维链)、以及云端路由(本地资源不足时自动切换云端)。它提供 OpenAI 兼容 API,可无缝替换 OpenAI 接口,直接接入 Claude Code、Cursor、Aider 等主流 AI 编程工具。项目处于成长阶段,GitHub 星标 3424,适合追求极致性能和低延迟的 Mac 开发者使用。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3822
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队raullenchai
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0 许可证,可免费本地部署使用。
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型apple-silicon,claude-code,cursor,deepseek,fastapi,hacktoberfest,inference,llm,local-llm,m1,m2,m3,macos,mlx,ollama-alternative,openai-api,python,qwen,tool-calling
GitHub 星标★ 3822
30天Star增速
HF 下载量
上线时间2026-02-25 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:入门 约 10 分钟 部署方式:命令行工具 5 步

环境要求

  • Apple Silicon Mac(M1/M2/M3/M4),不支持 Intel Mac
  • macOS 系统,pip 方式需 Python 3.10+(macOS 自带 3.9 偏低)
  • 首次运行需下载约 3GB 模型权重,预留磁盘空间
  • 基础安装为纯文本版,约 460MB;视觉/音频等需额外 extras

安装与启动步骤

  1. 1安装 Rapid-MLX

    引导式安装脚本会自动检测内存并推荐入门模型;也可用 Homebrew 直接安装。

    curl -fsSL https://rapidmlx.com/install.sh | bash
  2. 2命令行对话测试

    默认使用 qwen3.5-4b-4bit,首次运行下载约 3GB 权重后进入 REPL,用 /help 看命令、/exit 退出。

    rapid-mlx chat
  3. 3启动本地推理服务

    启动 OpenAI 兼容的 HTTP 服务,默认绑定 http://localhost:8000,供其他客户端调用。

    rapid-mlx serve qwen3.5-4b-4bit
  4. 4验证接口可用

    向 /v1/chat/completions 发一条请求,能返回 JSON 即说明服务正常。

    curl http://localhost:8000/v1/chat/completions 
      -H "Content-Type: application/json" 
      -d '{"model":"default","messages":[{"role":"user","content":"Say hello"}]}'
  5. 5接入 Claude Code

    在服务已启动的前提下,该命令自动改写 ~/.claude/settings.json 指向本地端点,无需手填环境变量。

    rapid-mlx launch claude-code

关键配置

配置项必填说明示例
RAPID_MLX_API_KEY否仅当把服务通过公网 HTTPS 隧道暴露时设置,避免无鉴权裸奔your-secret

如何确认成功

执行 curl 能收到聊天补全 JSON,或 rapid-mlx chat 进入 REPL 正常对话,即安装并启动成功。

常见问题

Q:pip 安装提示 no matching distribution 怎么办?

A:说明 Python 版本过低(macOS 自带 3.9)。先执行 brew install python@3.12,再用 python3.12 -m pip install rapid-mlx 安装。

Q:可以在 Cursor 里用吗?

A:Cursor 的 BYOK 请求经由其自有服务器,无法访问 localhost。README 说明需通过公网 HTTPS 隧道暴露,并同时设置 RAPID_MLX_API_KEY,此时已不是纯本地连接。

Q:如何支持视觉、音频等模型?

A:基础安装仅文本。视觉装 pip install 'rapid-mlx[vision]',音频装 'rapid-mlx[audio]',全功能装 'rapid-mlx[all]'。

Q:后续怎么升级版本?

A:Homebrew 用 brew upgrade rapid-mlx;uv 用 uv tool upgrade rapid-mlx;pip 用 pip install -U rapid-mlx。

注意事项

  • 仅支持 Apple Silicon(M1/M2/M3/M4)的 Mac,Intel 机器不可用。
  • 引导安装按内存推荐模型:低于 16GB 用 lfm2.5-1b-4bit,16GB 及以上用 qwen3.5-4b-4bit。
  • 基础安装是纯文本版(约 460MB),首次对话还会额外下载约 3GB 权重。
  • 接入 Claude Code 必须先启动 rapid-mlx serve,launch 命令会修改 ~/.claude/settings.json。

核心亮点

  • 性能激进:宣称比 Ollama 快 4.2 倍,缓存 TTFT 仅 0.08 秒,实测感知明显
  • 工具调用完整:支持 17 种工具解析器,100% 兼容 OpenAI 工具协议,适配 Claude Code 等
  • 智能缓存与路由:提示词缓存降低重复请求延迟,本地资源不足自动路由云端,兼顾速度与容量

不足之处

  • 仅支持 Apple Silicon,Intel Mac 和 Linux/Windows 用户无法使用
  • 文档/社区待观察:项目较新,生态和稳定性验证尚未充分

适用场景

  • Mac 上本地运行大模型作为 OpenAI API 的替代,用于开发调试
  • 配合 Claude Code、Cursor 等工具,实现低延迟的代码生成与工具调用
  • 对隐私敏感或网络不稳定的场景,利用本地推理+云端路由兜底

替代项目

Ollama、LM Studio、llama.cpp

项目介绍

Rapid-MLX 是基础设施领域的开源项目,由 raullenchai 开发,是 2026 年新上线的项目。

在全站 13,090 个收录项目中,它的 GitHub 星标数(3,822)位列前 30%,在基础设施分类中处于中上游。

近 42 天,它的 GitHub 星标从 3,451 增加到 3,822,净增 371。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。Apache-2.0 许可证,可免费本地部署使用。

它主要面向的使用场景是:Mac上本地运行大模型作为OpenAIAPI的替代,用于开发调试。同类可对比的替代方案包括 Ollama、LM Studio、llama.cpp。

上一篇:basic-memory

下一篇:eidos

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09