grpo
本站收录 30 个带「grpo」标签的 AI 开源项目
ms-swiftms-swift 是魔搭社区推出的国产大模型全流程训练与部署工具,旨在解决开发者微调大模型时面临的框架割裂、上手门槛高、多模态支持不足等痛点。它支持从增量预训练★ 15,754
ARTART(Agent Reinforcement Trainer)是一个面向真实世界多步骤任务的开源强化学习训练框架,专注于使用GRPO算法对智能体进行在线训练。★ 10,781
AgentGuideAgentGuide 是一个面向 AI Agent 开发者的中文实战指南,主要解决大模型应用开发中从入门到进阶的学习路径问题。项目以 LangGraph 实战为★ 10,269
VLM-R1VLM-R1 是一个将强化学习(RL)应用于视觉语言模型(VLM)的开源项目,旨在提升模型在视觉理解任务中的推理能力。它基于 DeepSeek-R1 的 RL ★ 6,029
reasoning-from-scratchreasoning-from-scratch 是一个从零开始实现推理大语言模型(LLM)的开源教程项目,基于 PyTorch 逐步构建。它旨在帮助开发者和研究者★ 5,321
hands-on-modern-rl这是一个开源强化学习课程,旨在帮助学习者从基础RL概念平滑过渡到LLM对齐、RLVR(基于强化学习的验证)以及高级智能体系统。项目以实践为核心,提供系统化的学习★ 4,473
Skywork-R1VSkywork-R1V 是由昆仑万维 Skywork AI 开发的多模态推理模型系列,专注于视觉-语言联合推理任务。它解决了传统多模态模型在复杂视觉问答中推理能★ 3,172
verl-agentverl-agent 是 veRL 的扩展,专注于通过强化学习训练 LLM/VLM 智能体,也是论文《Group-in-Group Policy Optimiz★ 2,352
diy-llmdiy-llm 是 Datawhale 社区推出的开源大模型全栈学习项目,面向想从零理解并动手实现 LLM 的开发者与学习者。它把大模型知识拆成预训练数据、To★ 1,426
judgevaljudgeval 是一个面向 AI Agent 的持续改进与评测平台,旨在解决 Agent 在生产环境中缺乏系统性评估与监控的问题。它提供了丰富的评测数据集和评★ 1,063
haloHalo 是由 White Circle 开源的大语言与多模态模型训练框架,用 Python 编写。它面向从微调到强化学习后训练的完整流程,核心能力包括分布式训★ 798
Awesome-RL-for-Video-GenerationAwesome-RL-for-Video-Generation 是一个精选论文列表,聚焦于强化学习(RL)在视频生成领域的应用。它系统整理了利用 PPO、DPO★ 591
agent_learning这是一个系统性的 AI Agent 开发教程项目,旨在帮助开发者从零开始学习智能体开发。它覆盖了 LLM 智能体、RAG、工具调用、记忆系统、多智能体系统等核心★ 559
Agentic-RAG-R1Agentic-RAG-R1 是一个基于强化学习的智能体检索增强生成(Agentic RAG)框架,旨在解决传统 RAG 系统在复杂多跳推理任务中检索策略僵化、★ 442
BioReasonBioReason 是一个面向生物领域的多模态大语言模型,核心创新在于将 DNA 序列与文本、图像等多模态信息融合,并引入推理激励机制,让模型在理解 DNA 序★ 406
LightRFTLightRFT 是一个轻量、高效、支持全模态的强化微调(RFT)框架,核心思路是用奖励模型驱动训练,把强化学习引入大语言模型和多模态模型的微调流程。它解决了传★ 404
hud-pythonhud-python 是一个为 AI 智能体提供强化学习环境和评估工具的开源项目。它旨在解决智能体训练中环境定义和评估标准不统一的问题,允许开发者定义一次环境,★ 304
mini-verlmini-verl 是字节跳动 verl 强化学习训练框架的轻量单卡版本,目标是在一张消费级 NVIDIA GPU(如 RTX 3090/4090)上跑通大模型★ 304
RLVR-WorldRLVR-World 是 NeurIPS 2025 论文《Training World Models with Reinforcement Learning》的★ 278
FineEnvsFineEnvs 是一个面向大语言模型强化学习(RL)的开源环境构建与规模化工具集,定位为「RL Environments 101」。它解决的核心问题是:在 L★ 265
HuggingEnvsHuggingEnvs 是一个面向 LLM 时代的教育型开源项目,专注于强化学习(RL)环境的构建与规模化实践。它旨在解决当前 RL 环境设计缺乏标准化、难以适★ 262
RLPRLP 是一个将强化学习作为预训练目标的开源模型项目,由 ICLR 2026 论文官方实现,基于 PyTorch。它旨在解决传统预训练模型仅关注监督学习或自监督★ 254
AutoGEOAutoGEO 是一个面向生成式搜索引擎(GEO)的优化框架,旨在帮助网站内容自动适应生成引擎(如 AI 搜索)的偏好,从而提升内容在 AI 搜索结果中的曝光和★ 222
minimind-deep-dive这是一个以 MiniMind 开源大模型源码为切入点,面向中文读者的深度学习笔记项目。它逐行精读预训练、SFT、DPO、PPO、GRPO 等核心训练机制,帮助读★ 222
hands-on-llmhands-on-llm 是一个面向中文开发者的 LLM 全栈动手学习项目,核心目标是把大模型从理论到落地的完整链路拆解成可运行的代码与实验。它包含三大部分:一★ 125
DataClaw0DataClaw 是一个面向多模态数据智能处理的开源项目,核心目标是解决原始数据流到高质量训练数据的自动化加工问题。它通过 Agentic 方式,结合视觉语言模★ 115
agentic-rlagentic-rl 是一个面向中文零基础学习者的 Agentic RL 教程项目,共 25 章,从强化学习与智能体基础概念讲起,逐步过渡到 GRPO 实战,并★ 114
aarambh-studioaarambh-studio 是一个完全用 Rust 和 Candle 框架从零构建的 decoder-only 大语言模型项目,不依赖 Python 或 Py★ 110
MeanFlowNFTMeanFlowNFT 是一个基于 PyTorch 的图像生成开源项目,对应 arXiv 2026 论文,核心思想是将前向过程强化学习引入平均速度生成器。它针对★ 95
VisionFoundryVisionFoundry 是一个专注于提升视觉语言模型(VLM)视觉感知能力的开源训练框架。它通过合成图像数据来训练模型,解决真实图像数据稀缺、标注成本高的问★ 57