safe-rlhf 是评测安全领域的开源项目,由 PKU-Alignment 开发,2023 年首次发布。
在全站 13,090 个收录项目中,它的 GitHub 星标数(1,618)位列前 30%,在评测安全分类的 466 个项目里位列前 15%。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-20。Apache-2.0许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:构建企业级对话助手,需严格避免有害输出。同类可对比的替代方案包括 TRL (Transformer Reinforcement Learning)、RLHF (Hugging Face 的 RLHF 库)、Constituti…。




