ramalama

像拉容器镜像一样拉取并运行AI模型,本地推理一键搞定。

RamaLama 是一个开源开发者工具,旨在简化 AI 模型的本地部署与推理流程。它通过容器化技术,让开发者能够从任何来源(如 HuggingFace、Ollama 等)拉取模型,并自动处理模型格式转换、依赖安装和运行环境配置,最终以标准容器方式启动模型服务。该工具的核心价值在于屏蔽底层差异,让开发者无需关心模型文件细节,即可在本地或生产环境中快速调用模型进行推理。它支持多种模型源和推理运行时,并提供与 Podman、Docker 等容器工具链的无缝集成,使得模型管理如同管理容器镜像一样简单。RamaLama 特别适合需要快速原型验证、离线部署或对数据隐私有要求的场景,帮助团队降低 AI 应用开发的门槛。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3058
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队containers
所属国家
定价模式free
价格说明开源工具,本地部署,完全免费,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型ai,containers,cuda,hacktoberfest,hip,inference-server,intel,llamacpp,llm,podman,vllm
GitHub 星标★ 3058
30天Star增速
HF 下载量
上线时间2024-07-24 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:入门 约 10 分钟 部署方式:命令行工具 7 步

环境要求

  • Python 3.9 或更高版本(PyPI / Windows 安装方式需要)
  • Windows 需配合 Docker Desktop 或 Podman Desktop(WSL2 后端)
  • macOS 自包含安装包已内置 Python 及全部依赖,无需额外环境
  • 使用 MLX 运行时需 macOS 系统 + Apple Silicon(M1/M2/M3 或更新)硬件
  • 需要本机可用的 Podman 或 Docker 容器引擎来运行模型容器

安装与启动步骤

  1. 1Fedora 使用 dnf 安装

    在 Fedora 系统上直接通过官方仓库安装,无需 pip,安装后即可使用 ramalama 命令。

    sudo dnf install ramalama
  2. 2PyPI 方式安装

    适用于大多数 Linux 与 macOS 环境,前提是已安装 Python 3.9 或更高版本。

    pip install ramalama
  3. 3一键脚本安装

    Linux 和 macOS 通用,脚本自动完成下载与安装,可省去手动配置 Python 环境。

    curl -fsSL https://ramalama.ai/install.sh | bash
  4. 4macOS 安装包安装

    先从 Releases 页面下载最新的 .pkg 安装包,再执行命令安装;也可直接双击安装包。

    sudo installer -pkg RamaLama-*-macOS-Installer.pkg -target /
  5. 5Windows 安装

    在已装好 Docker Desktop 或 Podman Desktop(WSL2 后端)的 Windows 上,用 PowerShell 通过 pip 安装。

    pip install ramalama
  6. 6安装 MLX 运行时

    仅 macOS + Apple Silicon 需要,MLX 以 uv 工具形式装在宿主机上,且只能配合 --nocontainer 使用。

    uv tool install mlx-lm
  7. 7验证安装

    执行 info 子命令查看 RamaLama 的配置信息,确认加速器、容器引擎与推理引擎被正确识别。

    ramalama info

关键配置

配置项必填说明示例
XDG_CONFIG_HOME否RamaLama 配置目录的基址,卸载后需删除其下的 ramalama 目录/home/user/.config

如何确认成功

运行 ramalama info,能打印出包含 Accelerator、Engine、Image、Inference 等字段的 JSON 配置信息,即表示安装成功。

常见问题

Q:用 pip 安装后怎么卸载?

A:执行 pip uninstall ramalama 即可。卸载后如需清理数据,再删除配置目录下的 ramalama 文件夹。

Q:Fedora 上如何卸载?

A:使用 DNF 卸载:sudo dnf remove ramalama。

Q:卸载后已下载的模型和配置怎么清理?

A:配置需删除 ${XDG_CONFIG_HOME:-~/.config}/ramalama;macOS 安装包版本还需删除 /usr/local/share/ramalama。

Q:macOS 上如何使用 MLX 运行时?

A:需 macOS + Apple Silicon 硬件,先用 uv tool install mlx-lm 安装,再以 --nocontainer 选项运行(MLX 不支持容器)。

Q:Windows 支持 GPU 加速吗?

A:支持,需参考官方文档 docs/readme/wsl2-docker-cuda.md 完成 WSL2 下的 NVIDIA GPU 配置。

注意事项

  • 模型默认在 Podman 或 Docker 的 rootless 容器中运行,模型以只读卷方式挂载,与宿主机隔离。
  • ramalama run 会使用 --network=none,容器无法访问网络,避免数据外泄。
  • 容器以 --rm 运行,进程退出后容器内写入的内容会被删除。
  • Windows 上模型存储优先使用硬链接(无需管理员权限),不支持时回退为文件复制。

核心亮点

  • 统一接口:从HuggingFace/Ollama等源拉模型,自动转换格式,无需手动处理
  • 容器原生:基于Podman/Docker,环境隔离,依赖管理零负担
  • 生产可用:支持本地和服务器部署,推理服务可直接集成到现有工作流

不足之处

  • 文档/社区待观察
  • 对非容器技术栈的开发者有一定学习曲线

适用场景

  • 本地开发环境快速搭建模型推理服务
  • 企业内网离线部署AI模型,避免数据外泄
  • 多模型统一管理,需要频繁切换不同来源的模型

替代项目

Ollama、LocalAI、vLLM

项目介绍

ramalama 是基础设施领域的开源项目,由 containers 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(3,058)位列前 30%,在基础设施分类中处于中上游。

近 42 天,它的 GitHub 星标从 2,996 增加到 3,058,净增 62。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。开源工具,本地部署,完全免费,无付费版本。

它主要面向的使用场景是:本地开发环境快速搭建模型推理服务。同类可对比的替代方案包括 Ollama、LocalAI、vLLM。

上一篇:distributed-llama

下一篇:database-build

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09