miles 是模型训练领域的开源项目,由 radixark 开发,2025 年首次发布。
在全站 13,916 个收录项目中,它的 GitHub 星标数(3,054)位列前 30%,在模型训练分类的 544 个项目里位列前 14%。
项目目前处于活跃维护状态,最近一次代码更新于 2026-10-07。从国内网络环境看,可用性暂无实测数据。
它主要面向的使用场景是:企业用自有数据对客服大模型做RLHF偏好对齐。同类可对比的替代方案包括 slime、OpenRLHF。

企业级 RL 后训练框架,让大模型和多模态模型快速做强化微调
Miles 是一个面向企业场景的大模型强化学习后训练框架,支持 LLM 与 VLM 的 RL 微调,从 slime 项目 fork 而来并与其协同演进。它要解决的问题是:通用 RL 框架往往偏研究、工程化不足,企业难以在自有集群上稳定跑通大规模后训练。Miles 提供可扩展的训练编排、rollout 与训练解耦、分布式并行支持,并针对视觉语言模型做了适配,让团队能在已有基础设施上完成 SFT 之后的偏好对齐、推理增强等强化学习流程。核心能力包括灵活的采样与训练流水线、对多模态输入的支持、面向生产环境的容错与资源调度,以及与 slime 生态共享的算法实现。适合需要把 RL 后训练落地到业务模型、又不愿从零搭建训练栈的工程团队。
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
—
⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。
1获取项目代码
克隆 Miles 官方仓库到本地,后续所有安装与启动都基于该代码目录进行。
git clone https://github.com/radixark/miles.git2阅读安装文档
README 未给具体安装命令,必须打开官方 Installation 文档按步骤安装依赖。
3核对硬件支持
安装文档的 hardware requirements 一节按 GPU 型号列出支持状态,先确认你的卡在列。
4跑通 Quick Start
按官方 Quick Start 页面提供的流程完成第一次训练运行,这是验证环境的最快方式。
5理解核心概念
阅读 Core Concepts,弄清 rollout 与训练解耦、采样与训练流水线的组织方式。
6选择训练配方
按任务目标在 GRPO、GSPO、PPO、REINFORCE++ 中选算法,SFT 与在线蒸馏另有文档。
7参考启动脚本
对照 Launch Script Walkthrough 理解官方启动脚本的结构,再改成自己的配置。
Miles 未在 README 中给出启动成功标志,请按官方 Quick Start 文档的预期输出核对训练日志与 rollout 进程状态。
Q:Miles 支持哪些硬件?
A:NVIDIA GB300/GB200/B300/B200/H200/H100/A100,以及 AMD MI355X/MI350X/MI325X/MI300X;逐卡支持状态见安装文档的 hardware requirements。
Q:支持哪些 RL 算法?
A:RL 方面支持 GRPO、GSPO、PPO、REINFORCE++,另外还支持 SFT 和 on-policy distillation(在线策略蒸馏)。
Q:支持多模态模型吗?
A:支持。Inkling 等前沿多模态模型在发布当天即完成支持,Miles 本身也面向 LLM 与 VLM 的 RL 微调。
Q:Miles 和 slime 是什么关系?
A:Miles 从 slime 项目 fork 而来,并与其协同演进,两者共享算法实现与生态。
Q:扩散模型能用 Miles 吗?
A:可以,走 Miles-diffusion 仓库,提供 Flow-GRPO、DiffusionNFT 和 SFT,后端为 sglang-diffusion rollout 引擎加 FSDP2 训练器。
slime、OpenRLHF
miles 是模型训练领域的开源项目,由 radixark 开发,2025 年首次发布。
在全站 13,916 个收录项目中,它的 GitHub 星标数(3,054)位列前 30%,在模型训练分类的 544 个项目里位列前 14%。
项目目前处于活跃维护状态,最近一次代码更新于 2026-10-07。从国内网络环境看,可用性暂无实测数据。
它主要面向的使用场景是:企业用自有数据对客服大模型做RLHF偏好对齐。同类可对比的替代方案包括 slime、OpenRLHF。
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···