mistral.rs

用 Rust 快速跑大模型,本地部署低延迟

mistral.rs 是一个用 Rust 编写的高性能、灵活的 LLM 推理引擎,旨在提供快速且可定制的模型推理服务。它解决了在本地或云端高效运行大型语言模型的问题,支持多种主流模型架构(如 Mistral、Llama、Gemma 等),并提供量化、流式输出、OpenAI 兼容 API 等核心能力。其设计强调易用性和可扩展性,允许开发者通过简单的配置快速部署模型,并利用 Rust 的内存安全和并发优势实现低延迟推理。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 7732
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类开源模型
开发团队EricLBuehler
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,需自行部署。
访问状态
是否开源是
开源协议MIT
主要语言Rust
技术栈/模型llm,rust,uqff
GitHub 星标★ 7732
30天Star增速
HF 下载量
上线时间2024-02-26 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:入门 约 10 分钟 部署方式:命令行工具 5 步

环境要求

  • Linux / macOS / Windows 均可使用(各平台有对应的安装脚本)
  • 标准加速无需预先安装 Rust 或 CUDA 工具链,安装脚本会下载自包含的预编译二进制
  • 可选 cuTile 加速需要额外单独安装 NVIDIA 的 tileiras 工具
  • Windows 平台的预编译二进制为 CPU 版本

安装与启动步骤

  1. 1安装(Linux/macOS)

    执行官方安装脚本,自动下载对应平台的自包含预编译二进制(Apple Silicon 用 Metal,Linux 按 GPU 用 CUDA 或 CPU)。

    curl -fsSL https://mistralrs.dev/install.sh | sh
  2. 2安装(Windows)

    在 PowerShell 中执行官方安装脚本,Windows 平台下载的是 CPU 版预编译二进制。

    irm https://mistralrs.dev/install.ps1 | iex
  3. 3运行本地 GGUF

    用 -f 指定本地 GGUF 模型文件路径,README 示例路径为 /path/to/model.gguf,请替换成你自己的文件。

    mistralrs run -f /path/to/model.gguf
  4. 4运行已发布模型

    用 -m 指定已发布模型仓库,并用 --quant 选择量化版本,示例为 4-bit GGUF。

    mistralrs run -m unsloth/Qwen3.5-4B-GGUF --quant 4
  5. 5用配置文件运行

    通过 from-config 读取生成的配置文件启动,示例文件名为 config.toml,需自行准备该文件。

    mistralrs from-config -f config.toml

如何确认成功

命令执行后终端开始输出模型推理结果且无报错即启动成功;可先确认 mistralrs 命令可用。

常见问题

Q:需要先装 Rust 或 CUDA 工具链吗?

A:不需要。标准加速使用安装脚本下载的预编译二进制;只有可选的 cuTile 加速需要额外安装 NVIDIA 的 tileiras 工具。

Q:Windows 上怎么安装?

A:在 PowerShell 中执行:irm https://mistralrs.dev/install.ps1 | iex。Windows 预编译包为 CPU 版本。

Q:没有本地模型文件怎么办?

A:可以改用 -m 指定已发布模型并配合 --quant 选择量化,例如 mistralrs run -m unsloth/Qwen3.5-4B-GGUF --quant 4。

Q:如何用 Docker 部署?

A:项目已将预构建的 CPU 与 CUDA 镜像发布到 GHCR,具体拉取命令、标签和 Kubernetes 说明见官方 Docker 指南。

Q:config.toml 里该写什么?

A:README 未给出配置项说明,只演示了 mistralrs from-config -f config.toml 的用法,请查阅官方 Quickstart 文档了解配置格式。

注意事项

  • 安装脚本找不到匹配的预编译二进制时会回退到源码构建。
  • Docker 预构建镜像已发布到 GHCR,但 README 未给出具体 docker pull 命令,请以官方 Docker 指南为准。
  • 使用 from-config 前需自行准备好 config.toml,README 未列出其配置项。
  • 完整安装说明、加速器细节和其他平台支持见官方 Quickstart 文档。

核心亮点

  • 推理速度快,基于 Rust 实现,内存安全且并发性能强
  • 支持多种模型架构和量化格式,灵活适配不同硬件
  • 提供 OpenAI 兼容 API,易于集成到现有应用

不足之处

  • 项目较新,生态和文档相对不成熟
  • Rust 学习曲线陡峭,对新手开发者不友好

适用场景

  • 本地私有化部署 LLM,保障数据隐私
  • 边缘设备或资源受限环境下的推理
  • 需要低延迟响应的实时对话或生成场景

替代项目

llama.cpp、vLLM、Candle

项目介绍

mistral.rs 是基础设施领域的开源项目,由 EricLBuehler 开发,2024 年首次发布。

在全站 13,635 个收录项目中,它的 GitHub 星标数(7,731)位列前 6%,在基础设施分类的 1,155 个项目里位列前 9%。

近 44 天,它的 GitHub 星标从 7,616 增加到 7,731,净增 115。

项目目前处于活跃维护状态,最近一次代码更新于 2026-10-01。MIT许可证,完全免费,需自行部署。

它主要面向的使用场景是:本地私有化部署LLM,保障数据隐私。同类可对比的替代方案包括 llama.cpp、vLLM、Candle。

上一篇:lmdeploy

下一篇:MegaParse

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

[DEPRECATED / UNMAINTAINED] No longer maintained.

★ 303 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 9099 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 442 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 182135 2026-08-09