vime 是模型训练领域的开源项目,由 vllm-project 开发,是 2026 年新上线的项目。
它收录于模型训练分类,该分类目前共有 543 个项目,GitHub 星标数为 482。
项目目前处于活跃维护状态,最近一次代码更新于 2026-10-06。开源免费,无官方定价信息。
它主要面向的使用场景是:团队用GRPO/PPO对LLM做数学推理强化学习后训练。同类可对比的替代方案包括 OpenRLHF、verl、TRL。

用 vLLM 加速 LLM 强化学习后训练,采样更快、规模更大
vime 是一个面向大语言模型后训练的开源框架,核心思路是把 vLLM 的高吞吐推理能力引入强化学习训练流程,解决 RL 后训练阶段采样速度慢、GPU 利用率低的问题。它主要服务于需要做 RLHF、GRPO 等强化学习微调的团队,让策略模型在生成 rollout 时不再受限于传统 HuggingFace 推理的低效。框架围绕 vLLM 构建了采样、奖励计算、策略更新等环节的调度,支持在训练与推理之间共享或切换权重,从而在扩展 RL 训练规模时保持较高吞吐。项目用 Python 实现,定位为训练侧基础设施,适合已有 vLLM 使用经验、想把 RL 后训练从实验推向更大规模的研究者或工程团队。当前星标约 482,属于早期项目,API 和文档仍在演进中。
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
—
OpenRLHF、verl、TRL
vime 是模型训练领域的开源项目,由 vllm-project 开发,是 2026 年新上线的项目。
它收录于模型训练分类,该分类目前共有 543 个项目,GitHub 星标数为 482。
项目目前处于活跃维护状态,最近一次代码更新于 2026-10-06。开源免费,无官方定价信息。
它主要面向的使用场景是:团队用GRPO/PPO对LLM做数学推理强化学习后训练。同类可对比的替代方案包括 OpenRLHF、verl、TRL。
上一篇:Composition-RL
下一篇:miles
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···