模型训练

汇聚全球AI模型训练与微调项目,LoRA、全参微调、蒸馏、训练框架工具大全。

共收录 524 个开源项目

all-rl-algorithms 开源

一个仓库搞定所有强化学习算法,快速上手复现

这是一个用Jupyter Notebook实现的强化学习算法集合,旨在以更简洁的方式实现所有主流RL算法。项目···

★ 1956 评分 2025-03-30
VeOmni 开源

声明式配方,把任意模态大模型训练一键扩展到多机多卡

VeOmni 是字节跳动开源的多模态大模型训练框架,核心思路是「以模型为中心」的分布式配方库(Recip···

★ 2225 评分 2025-03-28
Cosyvoice_DPO_NOTES 开源

用 DPO 微调 CosyVoice,让合成语音更自然更讨喜

CosyVoice_DPO_NOTES 是一个针对阿里 CosyVoice 语音合成模型的 DPO(直接偏好优化)微调工具集。它···

★ 129 评分 2025-03-27
SoftCoT 开源

用软思维链替代文本推理,大幅降低 LLM 推理成本

SoftCoT 是一个针对大语言模型推理效率优化的开源项目,提出了“软思维链”方法。传统 Chain-of-Th···

★ 96 评分 2025-03-26
EvoTune 开源

让 LLM 自动进化出算法,省去手工设计

EvoTune 是一个利用大语言模型(LLM)结合进化搜索与强化学习来自动发现算法的开源项目。它解决的核···

★ 144 评分 2025-03-24
verl-agent 开源

用强化学习训练更聪明的 AI 智能体,支持 GIGPO 算法

verl-agent 是 veRL 的扩展,专注于通过强化学习训练 LLM/VLM 智能体,也是论文《Group-in-Group P···

★ 2341 评分 2025-03-23
AViD 开源

用自定义数据微调视觉定位模型,省去搭训练管线

AViD 是一个面向视觉语言定位(visual grounding)模型的微调框架,目标用户是需要在自定义数据集上···

★ 606 评分 2025-03-19
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna 是一个面向开发者的模型优化框架,旨在以最小的工作量让 AI 模型运行得更快、更高效。它主要···

★ 1298 评分 2025-03-11
ART 开源

让AI智能体在实际任务中边干边学,用GRPO强化训练,快速提升多步决策能力。

ART(Agent Reinforcement Trainer)是一个面向真实世界多步骤任务的开源强化学习训练框架,专注于···

★ 10777 评分 2025-03-10
CogKit 开源

给视频生成模型做微调和推理,快速定制专属视频生成能力。

CogKit 是智谱 AI 开源的 CogView4 和 CogVideoX 模型系列的微调与推理工具集。它主要解决视频生成···

★ 131 评分 2025-03-07
reasoning-from-scratch 开源

从零手写推理模型,彻底搞懂 o1 原理

reasoning-from-scratch 是一个从零开始实现推理大语言模型(LLM)的开源教程项目,基于 PyTorch 逐···

★ 5293 评分 2025-03-04
Agent-R1 开源

端到端强化学习,训练出能自主决策的 LLM Agent

Agent-R1 是一个专注于通过端到端强化学习训练强大 LLM Agent 的开源项目。它解决的核心问题是:传···

★ 1678 评分 2025-03-04
ReCall 开源

让大模型学会自己上网查资料,回答更准更及时

ReCall 是一个通过强化学习让大语言模型学会自主调用工具(如搜索引擎)的开源项目。它解决的核心问···

★ 1438 评分 2025-03-03
hud-python 开源

一次定义环境,训练任意智能体,快速评估效果。

hud-python 是一个为 AI 智能体提供强化学习环境和评估工具的开源项目。它旨在解决智能体训练中环境···

★ 303 评分 2025-03-02
native-sparse-attention-triton 开源

用Triton实现原生稀疏注意力,长序列推理提速降本。

这是一个基于Triton的高效原生稀疏注意力(NSA)实现。NSA是一种新型注意力机制,通过动态选择重要···

★ 283 评分 2025-02-24
Primus 开源

在 AMD GPU 上高效训练大模型,开箱即用

Primus 是面向 AMD GPU 的大规模基础模型训练框架,目标是在 AMD 硬件上提供灵活且高性能的分布式训···

★ 128 评分 2025-02-24
EasyR1 开源

多模态强化学习训练,高效扩展不卡壳

EasyR1 是一个基于 veRL 的高效、可扩展的多模态强化学习训练框架,专注于解决视觉-语言模型(VLM)···

★ 5171 评分 2025-02-22
Re-Align 开源

用图像检索给VLM装上“防幻觉滤镜”,生成更可信。

Re-Align 是一个针对视觉语言模型(VLM)幻觉问题的对齐框架,发表于 EMNLP 2025。它通过引入图像检···

★ 52 评分 2025-02-18
MPO 开源

让LLM智能体先学会定计划,再动手执行,提升复杂任务成功率

MPO是一个针对大型语言模型智能体的元计划优化框架,旨在通过优化智能体的高层计划生成能力来提升其···

★ 82 评分 2025-02-17
train-deepseek-r1 开源

手把手从零实现 DeepSeek R1,看懂并跑通核心代码

这是一个从零开始构建 DeepSeek R1 的开源项目,使用 Jupyter Notebook 形式逐步讲解和实现。它旨在···

★ 799 评分 2025-02-14
Awesome-LLM-Post-training 开源

一站式掌握大模型后训练,从微调到推理增强

Awesome-LLM-Post-training 是一个聚焦大语言模型后训练(Post-training)阶段的开源教程、综述与指···

★ 2563 评分 2025-02-13
DS2 开源

用 LLM 评分自动筛数据,少数据也能训出好模型

DS2 是 ICLR 2025 论文《Improving Data Efficiency via Curating LLM-Driven Rating Systems》的官···

★ 102 评分 2025-02-11
DPO-Shift 开源

修正 DPO 分布偏移,让模型对齐更稳更准

DPO-Shift 是一个针对直接偏好优化(DPO)算法的改进开源项目,旨在解决 DPO 训练中分布偏移的问题···

★ 59 评分 2025-02-10
VLM-R1 开源

用强化学习让视觉模型学会推理,少数据也能提升定位精度。

VLM-R1 是一个将强化学习(RL)应用于视觉语言模型(VLM)的开源项目,旨在提升模型在视觉理解任务···

★ 6027 评分 2025-02-06