post-training
本站收录 24 个带「post-training」标签的 AI 开源项目
FastVideo统一的视频生成加速框架,将推理与后训练(post-training)流程整合一体,通过高效优化实现更快的视频生成速度,降低训练与推理成本,适合研究团队与工程部署★ 4,521
Awesome-LLM-Post-trainingAwesome-LLM-Post-training 是一个聚焦大语言模型后训练(Post-training)阶段的开源教程、综述与指南合集。它系统梳理了从预训练★ 2,565
EmoLLMEmoLLM 是一个专注于心理健康领域的大语言模型项目,旨在通过微调开源基座模型(如 InternLM、Qwen、Baichuan、DeepSeek 等)来提供★ 1,788
agent-apprenticeship这是一个让AI智能体通过工作流循环完成任务、迭代改进并积累经验的开源生态系统。它解决了当前AI智能体孤立运行、无法从过往任务中学习成长的问题。核心能力包括:智能★ 1,617
NeoHorseNeoHorse 是一个面向大语言模型后训练(post-training)的开源研究项目,核心思路是通过「智能体式后训练」与「路由挂架(Routing Harn★ 1,130
awesome-on-policy-distillation这是一个围绕大语言模型在线策略蒸馏(On-Policy Distillation,OPD)的资源合集,系统整理了论文、技术报告、框架和工具。它解决的核心问题是:★ 850
haloHalo 是由 White Circle 开源的大语言与多模态模型训练框架,用 Python 编写。它面向从微调到强化学习后训练的完整流程,核心能力包括分布式训★ 798
RandOptRandOpt 是 ICML 2026 Spotlight 论文《Neural Thickets: Diverse Task Experts Are Dense★ 648
LightReasonerLightReasoner 是一个源自 ACL 2026 Oral 论文的开源项目,核心研究问题是“小语言模型能否教会大语言模型推理”。它通过让小型语言模型生成★ 610
PostTrainBenchPostTrainBench 是一个用于评测命令行 AI 编程代理(如 Claude Code、Codex CLI、Gemini CLI)在单张 H100 GP★ 573
DiffusionOPSDDiffusionOPSD 是一个针对扩散模型的在线策略自蒸馏(On-Policy Self-Distillation)训练框架,旨在解决扩散模型在生成质量和训★ 555
LLMInternSkillLLMInternSkill 是一个面向大模型方向求职者的开源工具箱,以 Codex Skill 形式提供简历优化、职位匹配、证据审查、面试模拟和项目挖掘五大核★ 323
mini-verlmini-verl 是字节跳动 verl 强化学习训练框架的轻量单卡版本,目标是在一张消费级 NVIDIA GPU(如 RTX 3090/4090)上跑通大模型★ 304
alpamayo-recipesalpamayo-recipes 是 NVIDIA Alpamayo 的开发者中心,面向自动驾驶与物理 AI 场景,提供一整套可直接运行的模型配方。它解决的核心★ 193
rapidfireaiRapidFire AI 是一个面向开发者的 AI 定制化平台,旨在简化从 RAG(检索增强生成)到模型微调的整个流程。它解决了 AI 应用落地过程中定制化门槛★ 170
d3LLMd3LLM 是一个基于扩散模型的超快大语言模型,旨在解决传统自回归 LLM 生成速度慢的问题。它通过将扩散生成范式引入语言建模,实现并行解码,显著提升推理吞吐量★ 156
rlhf-summary-notes这是一个关于RLHF(基于人类反馈的强化学习)算法的简明总结笔记项目。它旨在为研究者和工程师提供一份精炼的RLHF算法概览,涵盖从基础概念到具体算法的核心要点。★ 154
agentic-rlagentic-rl 是一个面向中文零基础学习者的 Agentic RL 教程项目,共 25 章,从强化学习与智能体基础概念讲起,逐步过渡到 GRPO 实战,并★ 114
verl-vlaverl-vla 是一个面向视觉-语言-动作(VLA)模型的统一后训练框架,基于 verl 生态构建,目标是把机器人策略的迭代流程标准化。它解决的核心问题是:V★ 103
RPGRPG 是一个基于 KL 正则化策略梯度的强化学习训练框架,源自 ICLR 2026 论文。它旨在解决大语言模型在强化学习微调中策略更新过快、导致奖励黑客和分布★ 78
graftinggrafting 是 NeurIPS 2025 Oral 论文的官方代码,研究扩散 Transformer(DiT)的设计空间。它提出一种称为“嫁接”的架构编辑★ 75
learning-from-rewards-llm-papers这是一个聚焦于大语言模型(LLM)后训练与测试时扩展中“从奖励中学习”主题的论文合集。项目系统梳理了奖励模型(RM)与学习策略在训练、推理及推理后阶段的相关研究★ 74
Re-AlignRe-Align 是一个针对视觉语言模型(VLM)幻觉问题的对齐框架,发表于 EMNLP 2025。它通过引入图像检索机制,在模型生成文本时检索相关图像作为额外★ 52
OntoTuneOntoTune 是一个面向大语言模型(LLM)的本体驱动自训练框架,旨在解决模型与领域知识对齐不足的问题。它利用本体(Ontology)结构来引导模型的自我训★ 50