miles

企业级 RL 后训练框架,让大模型和多模态模型快速做强化微调

Miles 是一个面向企业场景的大模型强化学习后训练框架,支持 LLM 与 VLM 的 RL 微调,从 slime 项目 fork 而来并与其协同演进。它要解决的问题是:通用 RL 框架往往偏研究、工程化不足,企业难以在自有集群上稳定跑通大规模后训练。Miles 提供可扩展的训练编排、rollout 与训练解耦、分布式并行支持,并针对视觉语言模型做了适配,让团队能在已有基础设施上完成 SFT 之后的偏好对齐、推理增强等强化学习流程。核心能力包括灵活的采样与训练流水线、对多模态输入的支持、面向生产环境的容错与资源调度,以及与 slime 生态共享的算法实现。适合需要把 RL 后训练落地到业务模型、又不愿从零搭建训练栈的工程团队。

开源 unknown 模型训练
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3054
维护状态 活跃
是否开源 是
定价模式 unknown

项目预览

项目数据

分类模型训练
开发团队radixark
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型
GitHub 星标★ 3054
30天Star增速
HF 下载量
上线时间2025-10-09 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-07
浏览次数1

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:高级 约 60 分钟 部署方式:本地安装 7 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • NVIDIA GPU:GB300/GB200/B300/B200/H200/H100/A100 之一
  • 或 AMD GPU:MI355X/MI350X/MI325X/MI300X 之一
  • Python 环境(项目开发语言为 Python)
  • 已具备自有多卡集群与分布式训练环境

安装与启动步骤

  1. 1获取项目代码

    克隆 Miles 官方仓库到本地,后续所有安装与启动都基于该代码目录进行。

    git clone https://github.com/radixark/miles.git
  2. 2阅读安装文档

    README 未给具体安装命令,必须打开官方 Installation 文档按步骤安装依赖。

  3. 3核对硬件支持

    安装文档的 hardware requirements 一节按 GPU 型号列出支持状态,先确认你的卡在列。

  4. 4跑通 Quick Start

    按官方 Quick Start 页面提供的流程完成第一次训练运行,这是验证环境的最快方式。

  5. 5理解核心概念

    阅读 Core Concepts,弄清 rollout 与训练解耦、采样与训练流水线的组织方式。

  6. 6选择训练配方

    按任务目标在 GRPO、GSPO、PPO、REINFORCE++ 中选算法,SFT 与在线蒸馏另有文档。

  7. 7参考启动脚本

    对照 Launch Script Walkthrough 理解官方启动脚本的结构,再改成自己的配置。

如何确认成功

Miles 未在 README 中给出启动成功标志,请按官方 Quick Start 文档的预期输出核对训练日志与 rollout 进程状态。

常见问题

Q:Miles 支持哪些硬件?

A:NVIDIA GB300/GB200/B300/B200/H200/H100/A100,以及 AMD MI355X/MI350X/MI325X/MI300X;逐卡支持状态见安装文档的 hardware requirements。

Q:支持哪些 RL 算法?

A:RL 方面支持 GRPO、GSPO、PPO、REINFORCE++,另外还支持 SFT 和 on-policy distillation(在线策略蒸馏)。

Q:支持多模态模型吗?

A:支持。Inkling 等前沿多模态模型在发布当天即完成支持,Miles 本身也面向 LLM 与 VLM 的 RL 微调。

Q:Miles 和 slime 是什么关系?

A:Miles 从 slime 项目 fork 而来,并与其协同演进,两者共享算法实现与生态。

Q:扩散模型能用 Miles 吗?

A:可以,走 Miles-diffusion 仓库,提供 Flow-GRPO、DiffusionNFT 和 SFT,后端为 sglang-diffusion rollout 引擎加 FSDP2 训练器。

注意事项

  • 本 README 节选未包含任何安装命令,所有安装步骤必须以官网 Installation 文档为准,不要凭猜测执行包安装。
  • 不同 GPU 型号支持状态不同,部署前务必先核对 hardware requirements 页面。
  • AMD ROCm 用户需要改用文档中提供的 ROCm 镜像,与 NVIDIA 路径不同。
  • 大规模后训练需要自备多卡集群,Miles 面向企业生产环境的容错与资源调度场景。

核心亮点

  • 支持 LLM 与 VLM 两类模型的强化学习后训练,覆盖多模态对齐需求
  • 从 slime fork 并协同演进,可复用其算法与工程积累,降低从零搭建成本
  • 面向企业场景设计,强调生产可用性与分布式训练编排,而非纯研究原型

不足之处

  • 项目相对年轻,文档与最佳实践积累可能不够完善
  • 与上游 slime 协同演进,版本兼容和迁移成本需要额外关注

适用场景

  • 企业用自有数据对客服大模型做 RLHF 偏好对齐
  • 多模态模型在图文任务上的强化学习微调
  • 在已有 GPU 集群上搭建可复用的后训练流水线

替代项目

slime、OpenRLHF

项目介绍

miles 是模型训练领域的开源项目,由 radixark 开发,2025 年首次发布。

在全站 13,916 个收录项目中,它的 GitHub 星标数(3,054)位列前 30%,在模型训练分类的 544 个项目里位列前 14%。

项目目前处于活跃维护状态,最近一次代码更新于 2026-10-07。从国内网络环境看,可用性暂无实测数据。

它主要面向的使用场景是:企业用自有数据对客服大模型做RLHF偏好对齐。同类可对比的替代方案包括 slime、OpenRLHF。

上一篇:vime

下一篇:EasySteer

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 63272 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1308 2026-08-13