all-rl-algorithms
开源
一个仓库搞定所有强化学习算法,快速上手复现
这是一个用Jupyter Notebook实现的强化学习算法集合,旨在以更简洁的方式实现所有主流RL算法。项目···
汇聚全球AI模型训练与微调项目,LoRA、全参微调、蒸馏、训练框架工具大全。
共收录 524 个开源项目
all-rl-algorithms
开源
一个仓库搞定所有强化学习算法,快速上手复现
这是一个用Jupyter Notebook实现的强化学习算法集合,旨在以更简洁的方式实现所有主流RL算法。项目···
VeOmni
开源
声明式配方,把任意模态大模型训练一键扩展到多机多卡
VeOmni 是字节跳动开源的多模态大模型训练框架,核心思路是「以模型为中心」的分布式配方库(Recip···
Cosyvoice_DPO_NOTES
开源
用 DPO 微调 CosyVoice,让合成语音更自然更讨喜
CosyVoice_DPO_NOTES 是一个针对阿里 CosyVoice 语音合成模型的 DPO(直接偏好优化)微调工具集。它···
SoftCoT
开源
用软思维链替代文本推理,大幅降低 LLM 推理成本
SoftCoT 是一个针对大语言模型推理效率优化的开源项目,提出了“软思维链”方法。传统 Chain-of-Th···
EvoTune
开源
让 LLM 自动进化出算法,省去手工设计
EvoTune 是一个利用大语言模型(LLM)结合进化搜索与强化学习来自动发现算法的开源项目。它解决的核···
verl-agent
开源
用强化学习训练更聪明的 AI 智能体,支持 GIGPO 算法
verl-agent 是 veRL 的扩展,专注于通过强化学习训练 LLM/VLM 智能体,也是论文《Group-in-Group P···
AViD
开源
用自定义数据微调视觉定位模型,省去搭训练管线
AViD 是一个面向视觉语言定位(visual grounding)模型的微调框架,目标用户是需要在自定义数据集上···
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna 是一个面向开发者的模型优化框架,旨在以最小的工作量让 AI 模型运行得更快、更高效。它主要···
ART
开源
让AI智能体在实际任务中边干边学,用GRPO强化训练,快速提升多步决策能力。
ART(Agent Reinforcement Trainer)是一个面向真实世界多步骤任务的开源强化学习训练框架,专注于···
CogKit
开源
给视频生成模型做微调和推理,快速定制专属视频生成能力。
CogKit 是智谱 AI 开源的 CogView4 和 CogVideoX 模型系列的微调与推理工具集。它主要解决视频生成···
reasoning-from-scratch
开源
从零手写推理模型,彻底搞懂 o1 原理
reasoning-from-scratch 是一个从零开始实现推理大语言模型(LLM)的开源教程项目,基于 PyTorch 逐···
Agent-R1
开源
端到端强化学习,训练出能自主决策的 LLM Agent
Agent-R1 是一个专注于通过端到端强化学习训练强大 LLM Agent 的开源项目。它解决的核心问题是:传···
ReCall
开源
让大模型学会自己上网查资料,回答更准更及时
ReCall 是一个通过强化学习让大语言模型学会自主调用工具(如搜索引擎)的开源项目。它解决的核心问···
hud-python
开源
一次定义环境,训练任意智能体,快速评估效果。
hud-python 是一个为 AI 智能体提供强化学习环境和评估工具的开源项目。它旨在解决智能体训练中环境···
native-sparse-attention-triton
开源
用Triton实现原生稀疏注意力,长序列推理提速降本。
这是一个基于Triton的高效原生稀疏注意力(NSA)实现。NSA是一种新型注意力机制,通过动态选择重要···
Primus
开源
在 AMD GPU 上高效训练大模型,开箱即用
Primus 是面向 AMD GPU 的大规模基础模型训练框架,目标是在 AMD 硬件上提供灵活且高性能的分布式训···
EasyR1
开源
多模态强化学习训练,高效扩展不卡壳
EasyR1 是一个基于 veRL 的高效、可扩展的多模态强化学习训练框架,专注于解决视觉-语言模型(VLM)···
Re-Align
开源
用图像检索给VLM装上“防幻觉滤镜”,生成更可信。
Re-Align 是一个针对视觉语言模型(VLM)幻觉问题的对齐框架,发表于 EMNLP 2025。它通过引入图像检···
MPO
开源
让LLM智能体先学会定计划,再动手执行,提升复杂任务成功率
MPO是一个针对大型语言模型智能体的元计划优化框架,旨在通过优化智能体的高层计划生成能力来提升其···
train-deepseek-r1
开源
手把手从零实现 DeepSeek R1,看懂并跑通核心代码
这是一个从零开始构建 DeepSeek R1 的开源项目,使用 Jupyter Notebook 形式逐步讲解和实现。它旨在···
Awesome-LLM-Post-training
开源
一站式掌握大模型后训练,从微调到推理增强
Awesome-LLM-Post-training 是一个聚焦大语言模型后训练(Post-training)阶段的开源教程、综述与指···
DS2
开源
用 LLM 评分自动筛数据,少数据也能训出好模型
DS2 是 ICLR 2025 论文《Improving Data Efficiency via Curating LLM-Driven Rating Systems》的官···
DPO-Shift
开源
修正 DPO 分布偏移,让模型对齐更稳更准
DPO-Shift 是一个针对直接偏好优化(DPO)算法的改进开源项目,旨在解决 DPO 训练中分布偏移的问题···
VLM-R1
开源
用强化学习让视觉模型学会推理,少数据也能提升定位精度。
VLM-R1 是一个将强化学习(RL)应用于视觉语言模型(VLM)的开源项目,旨在提升模型在视觉理解任务···