rl

本站收录 28 个带「rl」标签的 AI 开源项目

Llama-ChineseLlama-Chinese 是 Llama 中文社区维护的开源项目,旨在构建最好的中文 Llama 大模型开源生态。它实时汇总最新的 Llama 学习资料,提供★ 14,762ARTART(Agent Reinforcement Trainer)是一个面向真实世界多步骤任务的开源强化学习训练框架,专注于使用GRPO算法对智能体进行在线训练。★ 10,781AReaLAReaL 是一个面向 LLM Agent 应用的开源强化学习框架,旨在简化并灵活地桥接强化学习与基于大语言模型的智能体应用。它解决了将 RL 技术应用于复杂 ★ 5,802EasyR1EasyR1 是一个基于 veRL 的高效、可扩展的多模态强化学习训练框架,专注于解决视觉-语言模型(VLM)在强化学习训练中的效率与扩展性问题。它支持大规模并★ 5,176hands-on-modern-rl这是一个开源强化学习课程,旨在帮助学习者从基础RL概念平滑过渡到LLM对齐、RLVR(基于强化学习的验证)以及高级智能体系统。项目以实践为核心,提供系统化的学习★ 4,473Awesome-RL-for-LRMs这是一个关于强化学习(RL)在大推理模型(LRMs)中应用的综述性开源项目,以TeX文档形式整理了该领域的研究进展。它系统梳理了RL在提升模型推理能力(如数学、★ 2,489all-rl-algorithms这是一个用Jupyter Notebook实现的强化学习算法集合,旨在以更简洁的方式实现所有主流RL算法。项目覆盖了从基础算法到前沿方法的广泛内容,包括DQN、★ 1,965PRIMEPRIME 是一个面向语言模型高级推理的可扩展强化学习(RL)解决方案。它解决了当前大模型在复杂推理任务上能力不足的问题,通过创新的 RL 训练框架,让模型在数★ 1,871diy-llmdiy-llm 是 Datawhale 社区推出的开源大模型全栈学习项目,面向想从零理解并动手实现 LLM 的开发者与学习者。它把大模型知识拆成预训练数据、To★ 1,426judgevaljudgeval 是一个面向 AI Agent 的持续改进与评测平台,旨在解决 Agent 在生产环境中缺乏系统性评估与监控的问题。它提供了丰富的评测数据集和评★ 1,063tensorlakeTensorlake 是一个面向智能体应用的无服务器运行时,专注于沙箱环境和后台任务部署。它解决了 AI 智能体在代码执行、工具调用和强化学习训练中需要隔离、安★ 1,015OpenDeriskOpenDerisk 是一个 AI 原生的风险智能系统,旨在为应用程序提供 7*24 小时的全面深度防护。它解决的是传统安全工具依赖规则、响应滞后、难以应对复杂★ 971AI-CompassAI-Compass 是一个面向 AI 学习者的开源知识导航与路线图项目,用 Python 组织内容,目标是解决 AI 领域知识点庞杂、学习路径混乱的问题。它把★ 965awesome-on-policy-distillation这是一个围绕大语言模型在线策略蒸馏(On-Policy Distillation,OPD)的资源合集,系统整理了论文、技术报告、框架和工具。它解决的核心问题是:★ 850mobilegymMobileGym 是一个面向移动端 GUI 智能体研究的可验证、高并行仿真平台,论文已被 EMNLP 2026 收录。它把安卓模拟器搬进浏览器,无需真机或本地★ 801neptune-clientneptune-client 是 Neptune.ai 的官方 Python 客户端库,用于跟踪和记录基础模型训练过程中的实验数据。它解决了机器学习团队在训练大★ 623meta-agents-research-environmentsMeta Agents Research Environments 是一个用于评估 AI 智能体的动态仿真平台。与静态基准测试不同,它构建了信息持续变化的环境,★ 559DiffusionOPSDDiffusionOPSD 是一个针对扩散模型的在线策略自蒸馏(On-Policy Self-Distillation)训练框架,旨在解决扩散模型在生成质量和训★ 555Agentic-RAG-R1Agentic-RAG-R1 是一个基于强化学习的智能体检索增强生成(Agentic RAG)框架,旨在解决传统 RAG 系统在复杂多跳推理任务中检索策略僵化、★ 442VADERVADER 是一个用于视频扩散模型对齐的开源项目,通过奖励梯度(Reward Gradients)对预训练的视频生成模型进行微调,以提升生成视频的质量和与人类偏★ 318hud-pythonhud-python 是一个为 AI 智能体提供强化学习环境和评估工具的开源项目。它旨在解决智能体训练中环境定义和评估标准不统一的问题,允许开发者定义一次环境,★ 304rlixrlix 是一个面向强化学习(RL)实验的基础设施工具,旨在解决 RL 研究者频繁运行实验时 GPU 等待时间长、资源利用率低的问题。它通过智能调度和资源管理,★ 296MLX-LoRA-StudioMLX-LoRA-Studio 是一款原生 macOS 应用,让用户在 Apple Silicon 芯片的 Mac 上直接完成大语言模型的 LoRA 微调,全程★ 271Awesome-Multimodal-Reasoning这是一个精选多模态推理与生成前沿资源的列表,聚焦于基于强化学习(RL)的多模态大语言模型(MLLM)技术。项目系统梳理了图像理解、图像推理、图像生成等方向的最新★ 104verl-vlaverl-vla 是一个面向视觉-语言-动作(VLA)模型的统一后训练框架,基于 verl 生态构建,目标是把机器人策略的迭代流程标准化。它解决的核心问题是:V★ 103MeanFlowNFTMeanFlowNFT 是一个基于 PyTorch 的图像生成开源项目,对应 arXiv 2026 论文,核心思想是将前向过程强化学习引入平均速度生成器。它针对★ 95GEMGEM 是论文《Preserving Diversity in Supervised Fine-tuning of Large Language Models》★ 60VisionFoundryVisionFoundry 是一个专注于提升视觉语言模型(VLM)视觉感知能力的开源训练框架。它通过合成图像数据来训练模型,解决真实图像数据稀缺、标注成本高的问★ 57