Directional-Preference-Alignment 是模型训练领域的开源项目,由 RLHFlow 开发,2024 年首次发布。
它收录于模型训练分类,该分类目前共有 518 个项目,GitHub 星标数为 62。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-05-13。Apache-2.0许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:研究大模型对齐算法的新方法验证。同类可对比的替代方案包括 DPO (Direct Preference Optimization)、TRL (Transformer Reinforcement Learning)、RL…。




