LLaMA_MPS 是基础设施领域的开源项目,由 jankais3r 开发,2023 年首次发布。
它收录于基础设施分类,该分类目前共有 1,132 个项目,GitHub 星标数为 576。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-21。本地部署,完全免费。
它主要面向的使用场景是:在MacBook上本地运行LLaMA聊天机器人,无需联网。同类可对比的替代方案包括 llama.cpp、mlc-llm、gpt4all。

在 Mac 上让 LLaMA 跑得更快,用上 GPU 加速推理。
LLaMA_MPS 是一个面向 Apple Silicon 芯片的 LLaMA 模型推理加速项目,主要解决在 Mac 上运行 LLaMA 和 Stanford-Alpaca 模型时 GPU 利用率低、推理速度慢的问题。它利用苹果的 Metal Performance Shaders(MPS)后端,将 PyTorch 模型的计算图映射到 GPU 上执行,从而显著提升 token 生成速度。项目提供了简单的命令行接口,支持加载 Hugging Face 格式的模型权重,并针对 MPS 进行了算子优化和内存管理。核心能力包括:自动检测 MPS 设备、模型半精度加载、KV 缓存优化以及流式输出。该项目适合希望在本地 Mac 上体验 LLaMA 对话能力的开发者,无需 Nvidia GPU 或云服务。
llama.cpp、mlc-llm、gpt4all
LLaMA_MPS 是基础设施领域的开源项目,由 jankais3r 开发,2023 年首次发布。
它收录于基础设施分类,该分类目前共有 1,132 个项目,GitHub 星标数为 576。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-21。本地部署,完全免费。
它主要面向的使用场景是:在MacBook上本地运行LLaMA聊天机器人,无需联网。同类可对比的替代方案包括 llama.cpp、mlc-llm、gpt4all。
上一篇:AI-in-a-Box
下一篇:caiss
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
[DEPRECATED / UNMAINTAINED] Multi-account gateway. No longer maintained; fork it and···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···