reinforcement-learning

本站收录 141 个带「reinforcement-learning」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

cs-video-courses这是一个精心整理的计算机科学视频课程清单,收录了全球顶尖大学和机构的免费视频讲座,涵盖算法、人工智能、系统、理论、生物信息学、计算物理等广泛领域。项目解决了计算★ 83,580unsloth本地运行与训练文本、扩散模型的 UI 工具,支持 Kimi、Gemma、Qwen3.6、DeepSeek-V4、FLUX 等最新模型,让个人开发者也能轻松微调与★ 77,026ai-engineering-from-scratch这是一个面向AI工程师的免费开源课程,旨在帮助学习者从零开始掌握AI工程的核心技能。项目内容涵盖机器学习、深度学习、生成式AI、计算机视觉、大语言模型和智能体等★ 61,160ai-agent-book《深入理解 AI Agent:设计原理与工程实践》是一本由李博杰撰写的开源技术书籍,旨在系统讲解 AI Agent 的设计原理与工程实践。该书解决了开发者从零构★ 51,740rayRay 是一个面向 AI 计算的分布式引擎,由核心分布式运行时和一组 AI 库组成,用于加速机器学习工作负载。它解决了大规模分布式训练、调参、推理和服务部署中的★ 43,949sglangSGLang 是一个高性能的大语言模型和多模态模型服务框架,旨在解决 LLM 推理服务中吞吐量低、延迟高、显存利用率不足等问题。它通过 RadixAttenti★ 36,594FinGPTFinGPT 是一个开源的金融大语言模型项目,旨在为金融领域提供可定制、可访问的 LLM 解决方案。它解决了金融文本处理中数据隐私、高成本和领域适配难题,通过数★ 21,303machine-learning-for-trading这是一个与《Machine Learning for Trading》第三版配套的开源代码仓库,旨在帮助读者和开发者系统学习如何将机器学习技术应用于金融交易。项★ 21,121agent-lightning微软推出的 AI Agent 训练框架,专注于帮助开发者高效训练和优化智能体。它提供了完整的训练管线与工具链,支持多种主流模型,旨在让 Agent 的开发像闪电★ 18,532leedl-tutorial《李宏毅深度学习教程》是Datawhale社区维护的开源教材,源自台湾大学李宏毅老师的深度学习课程。该项目将课程内容整理为Jupyter Notebook格式,★ 16,787deep-learning-drizzle这是一个深度学习相关学习资源的精选合集,汇集了全球顶尖大学和机构的免费视频讲座,覆盖深度学习、强化学习、机器学习、计算机视觉和自然语言处理等核心领域。项目以分类★ 12,956wandb面向 AI 开发者的实验追踪与模型管理平台,支持训练过程的实时监控、指标可视化与团队协作,并能对模型从实验到生产的全生命周期进行管理。无论是调参对比、结果复现还★ 11,266amazon-sagemaker-examplesamazon-sagemaker-examples 是亚马逊官方维护的 Jupyter Notebook 示例集,旨在帮助开发者快速上手 Amazon Sage★ 10,987ARTART(Agent Reinforcement Trainer)是一个面向真实世界多步骤任务的开源强化学习训练框架,专注于使用GRPO算法对智能体进行在线训练。★ 10,781OpenRLHFOpenRLHF 是一个基于 Ray 的强化学习框架,专为大规模语言模型(LLM)的智能体训练而设计。它解决了传统 RLHF(人类反馈强化学习)流程中训练效率低★ 10,053SanaNVIDIA 开源的高效高分辨率图像合成模型,采用线性 Diffusion Transformer 架构,在保持高质量生成的同时显著降低计算开销,支持超高清图像★ 9,163TensorLayerTensorLayer 是一个面向科学家和工程师的深度学习与强化学习库,基于 Python 构建。它旨在解决深度学习研究和工程应用中模型搭建复杂、调试困难、部署★ 7,382Awesome-LLM-StrawberryAwesome-LLM-Strawberry 是一个聚焦于 OpenAI o1 模型及推理技术的精选资源列表,收录了相关论文、博客和项目。它旨在帮助研究者和开发★ 6,907MooncakeMooncake 是 Moonshot AI 为其 Kimi 大语言模型服务打造的高性能推理平台,核心解决 LLM 服务中的高吞吐、低延迟和成本控制问题。它基于★ 6,689awesome-ai-in-finance这是一个面向金融市场的 AI 资源精选列表,系统整理了将大语言模型与深度学习应用于金融交易、量化投资和加密资产分析的策略、论文、工具与数据集。它解决的核心问题是★ 6,629VLM-R1VLM-R1 是一个将强化学习(RL)应用于视觉语言模型(VLM)的开源项目,旨在提升模型在视觉理解任务中的推理能力。它基于 DeepSeek-R1 的 RL ★ 6,029rllmrllm是一个致力于将强化学习(RL)技术普及到大型语言模型(LLM)训练与推理中的开源框架。它主要解决当前LLM在复杂推理、决策和智能体任务中依赖监督微调、泛★ 5,851AReaLAReaL 是一个面向 LLM Agent 应用的开源强化学习框架,旨在简化并灵活地桥接强化学习与基于大语言模型的智能体应用。它解决了将 RL 技术应用于复杂 ★ 5,802reasoning-from-scratchreasoning-from-scratch 是一个从零开始实现推理大语言模型(LLM)的开源教程项目,基于 PyTorch 逐步构建。它旨在帮助开发者和研究者★ 5,321xtunerXTuner 是一个专为超大规模 MoE(混合专家)模型设计的下一代训练引擎。它解决了传统训练框架在 MoE 模型上显存占用高、训练效率低、扩展性差的问题,提供★ 5,205EasyR1EasyR1 是一个基于 veRL 的高效、可扩展的多模态强化学习训练框架,专注于解决视觉-语言模型(VLM)在强化学习训练中的效率与扩展性问题。它支持大规模并★ 5,176LLM-RL-VisualizedLLM-RL-Visualized 是一个专注于大语言模型(LLM)和强化学习(RL)算法可视化的开源项目,由《大模型算法》作者倾力打造。项目提供了100多张原★ 4,922hands-on-modern-rl这是一个开源强化学习课程,旨在帮助学习者从基础RL概念平滑过渡到LLM对齐、RLVR(基于强化学习的验证)以及高级智能体系统。项目以实践为核心,提供系统化的学习★ 4,473awesome-RLHFawesome-RLHF 是一个持续更新的强化学习与人类反馈(RLHF)资源精选列表。它系统整理了 RLHF 领域的论文、教程、代码库、数据集和工具,帮助研究者★ 4,431polyaxonPolyaxon 是一个开源的 AI 基础设施平台,定位为 AI 编排与控制平面。它解决的是机器学习生命周期中实验管理、模型训练、超参数调优、模型部署等环节缺乏★ 3,737MetaClawMetaClaw 是一个让 AI 智能体通过对话持续进化的开源框架。它解决的是传统智能体在部署后能力固化、无法从交互中学习的问题。其核心能力是结合元学习、在线学★ 3,492catalystCatalyst 是一个面向深度学习研究与开发的 Python 框架,旨在加速从实验设计到模型部署的全流程。它解决了深度学习项目中代码重复、实验管理混乱、复现困★ 3,387Skywork-R1VSkywork-R1V 是由昆仑万维 Skywork AI 开发的多模态推理模型系列,专注于视觉-语言联合推理任务。它解决了传统多模态模型在复杂视觉问答中推理能★ 3,172OSWorldOSWorld 是一个用于评估多模态 AI 智能体在真实计算机环境中执行开放式任务能力的基准测试平台,发表于 NeurIPS 2024。它解决了现有基准测试环境★ 3,165Awesome-LLM-Post-trainingAwesome-LLM-Post-training 是一个聚焦大语言模型后训练(Post-training)阶段的开源教程、综述与指南合集。它系统梳理了从预训练★ 2,565ProtoMotionsProtoMotions 是一个基于 GPU 加速的物理仿真与强化学习框架,专为训练物理模拟的数字人和人形机器人而设计。它解决了传统物理仿真速度慢、难以扩展到复★ 2,409verl-agentverl-agent 是 veRL 的扩展,专注于通过强化学习训练 LLM/VLM 智能体,也是论文《Group-in-Group Policy Optimiz★ 2,352NemotronNemotron 是 NVIDIA 官方的开发者资源中心,旨在为使用 Nemotron 模型进行训练和微调的开发者提供一站式支持。它解决了模型训练过程中配方分散★ 2,115all-rl-algorithms这是一个用Jupyter Notebook实现的强化学习算法集合,旨在以更简洁的方式实现所有主流RL算法。项目覆盖了从基础算法到前沿方法的广泛内容,包括DQN、★ 1,965RoboVerseRoboVerse 是一个面向机器人学习的统一平台、数据集与基准测试项目,旨在解决机器人领域长期存在的仿真环境碎片化、数据格式不统一、算法难以跨任务迁移的问题。★ 1,865MinariMinari 是面向离线强化学习(Offline RL)的数据集标准与工具库。它定义了统一的离线 RL 数据集格式,把不同来源、不同环境产生的轨迹数据(状态、动★ 1,776safe-rlhfSafe RLHF 是一个基于安全强化学习的人类反馈对齐框架,旨在解决大模型价值对齐中的安全问题。传统 RLHF 通过人类反馈优化模型行为,但可能忽略安全约束,★ 1,618agent-apprenticeship这是一个让AI智能体通过工作流循环完成任务、迭代改进并积累经验的开源生态系统。它解决了当前AI智能体孤立运行、无法从过往任务中学习成长的问题。核心能力包括:智能★ 1,617AgentEvolverAgentEvolver 是一个面向智能体系统的高效自进化框架,旨在解决大语言模型驱动的智能体在复杂任务中依赖人工调优、难以自主适应环境变化的问题。其核心思想是★ 1,576reasoning-gymreasoning-gym 是一个为强化学习(RL)提供可验证奖励(verifiable rewards)的推理环境集合,旨在解决大语言模型(LLM)在推理任务★ 1,522tensor-housetensor-house 是一个面向企业场景的 AI/ML 参考实现集合,以 Jupyter Notebook 形式提供端到端的演示应用,覆盖营销、定价、供应链★ 1,460ReCallReCall 是一个通过强化学习让大语言模型学会自主调用工具(如搜索引擎)的开源项目。它解决的核心问题是:当前 LLM 在需要外部信息或实时数据时,往往依赖预训★ 1,441GymGym 是一个用于评估和改进模型与智能体的环境框架,核心思路是把评测从静态数据集搬到可交互的环境中。传统 benchmark 通常只给固定题目和标准答案,难以衡★ 1,210ai-engineering-from-scratch-zh这是一个面向中文开发者的 AI 工程系统学习项目,把从零到精通 AI Agent 工程师所需的完整知识路径拆成 20 个阶段、503 节课,覆盖 Python ★ 1,130judgevaljudgeval 是一个面向 AI Agent 的持续改进与评测平台,旨在解决 Agent 在生产环境中缺乏系统性评估与监控的问题。它提供了丰富的评测数据集和评★ 1,063