dpo

本站收录 16 个带「dpo」标签的 AI 开源项目

oumioumi 是一个专注于开源大语言模型(LLM)微调、评估和部署的全流程工具包。它旨在简化从模型选择到生产部署的复杂流程,支持 Qwen、Gemma、Llama ★ 9,392SoupSoup 是一个用于微调大语言模型(LLM)的开源工具,它通过一个 YAML 配置文件即可完成整个微调流程,极大简化了操作。其核心亮点是采用“层流式训练”(La★ 7,822MedicalGPTMedicalGPT 是一个开源项目,旨在帮助开发者训练自己的医疗领域大语言模型。它提供了一套完整的训练流水线,覆盖了从增量预训练(PT)、有监督微调(SFT)★ 5,846align-anythingAlign Anything 是一个面向全模态模型的对齐训练框架,旨在解决多模态模型(文本、图像、音频、视频等)在人类反馈对齐方面的碎片化问题。它提供统一的训练★ 4,670hands-on-modern-rl这是一个开源强化学习课程,旨在帮助学习者从基础RL概念平滑过渡到LLM对齐、RLVR(基于强化学习的验证)以及高级智能体系统。项目以实践为核心,提供系统化的学习★ 4,473Awesome-RL-for-Video-GenerationAwesome-RL-for-Video-Generation 是一个精选论文列表,聚焦于强化学习(RL)在视频生成领域的应用。它系统整理了利用 PPO、DPO★ 591mlx-lm-loramlx-lm-lora 是面向 Apple Silicon 的 LLM 训练工具,基于苹果 MLX 框架,让 Mac 用户无需 NVIDIA GPU 也能对大语★ 418SiLLMSiLLM 是一个基于 Apple MLX 框架的开源工具,旨在简化在 Apple Silicon 芯片上训练和运行大语言模型(LLM)的流程。它解决了 Mac★ 283SPOSPO(Step-by-step Preference Optimization)是一个CVPR 2025的扩散模型后训练方法,旨在从通用人类偏好中提升文生图模★ 269minimind-deep-dive这是一个以 MiniMind 开源大模型源码为切入点,面向中文读者的深度学习笔记项目。它逐行精读预训练、SFT、DPO、PPO、GRPO 等核心训练机制,帮助读★ 222IterCompIterComp 是一个面向文本到图像生成的开源框架,核心解决复杂组合生成问题(如多物体、属性绑定、空间关系等)。它提出迭代组合感知反馈学习方法,从模型库中收集★ 202Cosyvoice_DPO_NOTESCosyVoice_DPO_NOTES 是一个针对阿里 CosyVoice 语音合成模型的 DPO(直接偏好优化)微调工具集。它解决了 CosyVoice 模型★ 129hands-on-llmhands-on-llm 是一个面向中文开发者的 LLM 全栈动手学习项目,核心目标是把大模型从理论到落地的完整链路拆解成可运行的代码与实验。它包含三大部分:一★ 125CHATSCHATS 是一个面向文本到图像生成的开源项目,核心思路是结合人类对齐优化与测试时采样,提升生成图像与文本描述的一致性。它基于 SDXL 和 DPO(直接偏好优★ 109awesome-direct-preference-optimization这是一个关于直接偏好优化(Direct Preference Optimization, DPO)的精选资源列表,旨在系统梳理该领域的研究进展。DPO是一种用于★ 94Re-AlignRe-Align 是一个针对视觉语言模型(VLM)幻觉问题的对齐框架,发表于 EMNLP 2025。它通过引入图像检索机制,在模型生成文本时检索相关图像作为额外★ 52