vime

用 vLLM 加速 LLM 强化学习后训练,采样更快、规模更大

vime 是一个面向大语言模型后训练的开源框架,核心思路是把 vLLM 的高吞吐推理能力引入强化学习训练流程,解决 RL 后训练阶段采样速度慢、GPU 利用率低的问题。它主要服务于需要做 RLHF、GRPO 等强化学习微调的团队,让策略模型在生成 rollout 时不再受限于传统 HuggingFace 推理的低效。框架围绕 vLLM 构建了采样、奖励计算、策略更新等环节的调度,支持在训练与推理之间共享或切换权重,从而在扩展 RL 训练规模时保持较高吞吐。项目用 Python 实现,定位为训练侧基础设施,适合已有 vLLM 使用经验、想把 RL 后训练从实验推向更大规模的研究者或工程团队。当前星标约 482,属于早期项目,API 和文档仍在演进中。

开源 free 模型训练
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 482
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类模型训练
开发团队vllm-project
所属国家
官网地址
定价模式free
价格说明开源免费,无官方定价信息
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型
GitHub 星标★ 482
30天Star增速
HF 下载量
上线时间2026-05-11 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-07
浏览次数0

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

核心亮点

  • 把 vLLM 高吞吐推理接入 RL rollout,显著提升采样阶段效率
  • 面向 RL Scaling 设计,支持更大批量与更长训练规模
  • 基于 Python 与 vLLM 生态,已有 vLLM 经验的团队迁移成本低

不足之处

  • 项目处于早期,文档与示例相对有限
  • 社区规模小,遇到问题可参考的案例和讨论较少

适用场景

  • 团队用 GRPO/PPO 对 LLM 做数学推理强化学习后训练
  • 需要大规模 rollout 采样但受限于推理速度的 RLHF 流程
  • 已有 vLLM 部署经验,想复用到训练侧做策略迭代

替代项目

OpenRLHF、verl、TRL

项目介绍

vime 是模型训练领域的开源项目,由 vllm-project 开发,是 2026 年新上线的项目。

它收录于模型训练分类,该分类目前共有 543 个项目,GitHub 星标数为 482。

项目目前处于活跃维护状态,最近一次代码更新于 2026-10-06。开源免费,无官方定价信息。

它主要面向的使用场景是:团队用GRPO/PPO对LLM做数学推理强化学习后训练。同类可对比的替代方案包括 OpenRLHF、verl、TRL。

上一篇:Composition-RL

下一篇:miles

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 63243 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1308 2026-08-13