FastFlowLM

在 AMD NPU 上像用 Ollama 一样快速跑大模型

FastFlowLM 是一个专为 AMD Ryzen AI NPU 深度优化的开源推理引擎,目标是在 AMD 平台上实现大语言模型的高效本地运行。它借鉴了 Ollama 的易用性,但针对 AMD NPU 的硬件特性进行了底层重构和优化,解决了通用推理框架在 NPU 上性能不佳或无法利用的问题。核心能力包括:提供简洁的命令行接口,支持主流开源模型(如 Llama、Phi 等)的量化与部署,自动调度 NPU 资源,实现低延迟、低功耗的本地推理。项目处于快速成长阶段,为 AMD 用户提供了一种新的、接近 Ollama 体验的本地 AI 运行方式。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1894
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队ROCm
所属国家
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言C++
技术栈/模型amd,deepseek,llama,llm,npu
GitHub 星标★ 1894
30天Star增速
HF 下载量
上线时间2025-06-16 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:入门 约 10 分钟 部署方式:本地安装 7 步

环境要求

  • 搭载 XDNA2 NPU 的 AMD Ryzen AI 芯片(Strix、Strix Halo、Kraken、Gorgon Point)
  • AMD NPU 驱动版本 32.0.203.311 或更高(旧版本已不支持)
  • Windows 系统(官方提供 flm-setup.msi 安装包);Linux 参考官方 Linux Getting Started 指南
  • 安装与首次运行需要能访问 HuggingFace 下载模型

安装与启动步骤

  1. 1检查 NPU 与驱动

    打开任务管理器(Ctrl+Shift+Esc)→性能→NPU,或设备管理器查看 NPU 驱动版本,必须为 32.0.203.311 或更高,否则先更新驱动。

  2. 2下载安装包

    从 GitHub Releases 下载官方 Windows 安装包 flm-setup.msi,安装包仅约 17MB,安装约 20 秒。

  3. 3安装 FLM

    双击运行 flm-setup.msi 完成安装,安装过程中可自定义基础目录;若选 C:Users lm,模型会存到该目录下的 models 子目录。

  4. 4打开 PowerShell

    按 Win + X 再按 I 打开 PowerShell,安装后 flm 命令即可使用,无需其他配置。

  5. 5运行第一个模型

    用 flm run 拉取并运行指定模型标签,首次会自动从 HuggingFace 下载优化后的模型内核,随后进入命令行对话。

    flm run llama3.2:1b
  6. 6查看已有模型

    在 PowerShell 中列出本机已下载的全部可用模型及其标签,便于后续直接运行。

    flm list
  7. 7启动本地服务

    以服务模式启动,模型标签为初始模型且可选;本地服务默认监听 52625 端口,请求其他模型时会自动切换。

    flm serve llama3.2:1b

关键配置

配置项必填说明示例
FLM_MODEL_PATH否Linux 下覆盖模型默认存放路径/home/user/.flm/models
FLM_DISABLE_UPDATE_CHECK否设为 1 可关闭启动时的版本检查1
模型默认目录(Windows)否Windows 下模型默认存放位置C:Users.flmmodels
模型默认目录(Linux)否Linux 下模型默认存放位置~/.config/flm/

如何确认成功

能进入对话即成功;任务管理器性能→NPU 可看到占用,flm list 能列出已下载模型。

常见问题

Q:模型下载损坏或运行异常怎么办?

A:从 HuggingFace 下载的模型内核偶尔会损坏,执行 flm pull --force(如 flm pull llama3.2:1b --force)强制重新下载即可修复。

Q:所在地区无法访问 HuggingFace 怎么办?

A:可手动下载模型文件,再放入你选定的模型目录(Windows 默认 C:Users.flmmodels,Linux 默认 ~/.config/flm/),具体见项目 issue #2。

Q:如何查看推理性能或退出对话?

A:对话中输入 /verbose 打开性能报告,再次输入 /verbose 关闭;输入 /bye 退出当前会话。

Q:本地服务用什么端口?

A:服务模式默认运行在 52625 端口,请求其他模型时 FastFlowLM 会自动切换过去。

Q:没有 AMD NPU 能用吗?

A:不支持。FLM 是专为 Ryzen AI XDNA2 NPU 打造的运行时,需要 Strix、Strix Halo、Kraken 或 Gorgon Point 等芯片。

注意事项

  • 必须使用最新 AMD NPU 驱动(32.0.203.311 及以上),旧版本已不再支持。
  • 首次运行模型需要联网访问 HuggingFace 下载优化模型内核。
  • Linux 用户的安装步骤请参考仓库 docs/linux-getting-started.md。
  • 第三方论坛的驱动下载未经 AMD 验证,使用需自行承担风险。

核心亮点

  • 针对 AMD NPU 深度优化,性能远超通用框架
  • 命令行体验类似 Ollama,上手门槛低
  • 支持主流模型量化,降低硬件要求

不足之处

  • 仅支持 AMD NPU,硬件兼容性受限
  • 项目较新,生态和文档待完善

适用场景

  • AMD 笔记本/迷你主机本地离线运行聊天模型
  • 隐私敏感场景下在本地处理文本任务
  • 在低功耗设备上部署轻量级 AI 助手

替代项目

Ollama、llama.cpp、ONNX Runtime

项目介绍

FastFlowLM 是基础设施领域的开源项目,由 ROCm 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,894)位列前 30%,在基础设施分类中处于中上游。

近 42 天,它的 GitHub 星标从 1,724 增加到 1,894,净增 170。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:AMD笔记本/迷你主机本地离线运行聊天模型。同类可对比的替代方案包括 Ollama、llama.cpp、ONNX Runtime。

上一篇:ai

下一篇:paddler

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09