safe-rlhf

在强化学习中对齐人类价值观,让AI输出既有用又安全。

Safe RLHF 是一个基于安全强化学习的人类反馈对齐框架,旨在解决大模型价值对齐中的安全问题。传统 RLHF 通过人类反馈优化模型行为,但可能忽略安全约束,导致模型生成有害内容。Safe RLHF 将安全约束引入强化学习过程,通过约束优化算法在提升模型有用性的同时,确保行为符合安全规范。它提供了从数据收集、奖励建模到策略优化的完整流程,支持多轮迭代训练,并内置了安全评估工具。核心能力包括:安全奖励模型、约束策略优化、以及可视化训练监控。该项目由北京大学团队开发,适用于需要高安全性的对话系统、内容生成等场景。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1618
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队PKU-Alignment
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型ai-safety,alpaca,beaver,datasets,deepspeed,gpt,large-language-models,llama,llm,llms,reinforcement-learning,reinforcement-learning-from-human-feedback,rlhf,safe-reinforcement-learning,safe-reinforcement-learning-from-human-feedback,safe-rlhf,safety,transformer,transformers,vicuna
GitHub 星标★ 1618
30天Star增速
HF 下载量
上线时间2023-05-15 00:00:00
最近更新2026-09-20 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 5 步

环境要求

  • Git(用于克隆 safe-rlhf 源码)
  • conda 或 mamba(用于创建 conda-recipe.yaml 环境)
  • 如使用容器方式,需先安装 NVIDIA Container Toolkit / nvidia-docker
  • 如使用 BIG-bench 多尺度评估,需准备 OpenAI API Key

安装与启动步骤

  1. 1克隆源码

    从 GitHub 克隆 safe-rlhf 仓库并进入项目根目录,后续所有操作都在该目录下进行。

    git clone https://github.com/PKU-Alignment/safe-rlhf.git
    cd safe-rlhf
  2. 2创建 conda 环境

    用仓库自带的 conda-recipe.yaml 一次性安装全部依赖,环境创建过程可能较久。

    conda env create --file conda-recipe.yaml
  3. 3或改用 Docker

    已装好 nvidia-docker 时,可执行 make docker-run 自动构建并启动容器;宿主机 / 映射到容器 /host,当前目录映射到 /workspace。

    make docker-run
  4. 4安装 BIG-bench

    可选步骤:从 Google 仓库克隆 BIG-bench 并以可编辑模式安装,用于安全约束的多尺度评测。

    git clone https://github.com/google/BIG-bench.git
    cd BIG-bench
    python3 setup.py sdist
    python3 -m pip install -e .
  5. 5安装 OpenAI API

    可选步骤:安装 openai 包并导出 API Key,供 GPT-4 评估等环节调用。

    pip3 install openai
    export OPENAI_API_KEY="..."

关键配置

配置项必填说明示例
OPENAI_API_KEY否调用 OpenAI 接口进行评估时使用的密钥sk-xxxxxxxxxxxxxxxx

如何确认成功

执行 conda env list 能看到新建环境;用 Docker 方式时容器内可见 /host 与 /workspace 目录即表示启动成功。

常见问题

Q:没有 conda,能用 mamba 吗?

A:可以。README 明确说明可用 mamba env create --file conda-recipe.yaml 代替 conda 命令创建同一环境。

Q:Docker 方式需要什么前置条件?

A:需先按 NVIDIA Container Toolkit 安装指南配好 nvidia-docker,然后才能执行 make docker-run。

Q:容器里我的代码放在哪?

A:宿主机根目录 / 映射到容器内 /host,运行 make docker-run 时所在的当前工作目录映射到容器内 /workspace。

Q:OPENAI_API_KEY 是必须的吗?

A:不是必须的。它只在使用 OpenAI 相关评测(如 GPT-4 Evaluation)时需要,跑 SFT/RLHF 训练本身不依赖它。

注意事项

  • 项目支持 SFT、RLHF 与 Safe RLHF 训练,适用 LLaMA、OPT、Baichuan 等预训练模型。
  • 仓库提供最多约 1M 条人类标注的 helpful/harmless 偏好数据及奖励模型、代价模型预训练检查点,可直接复用。
  • BIG-bench 与 openai 的安装属于评测相关的可选步骤,只做训练时可不安装。
  • 请按 README 说明区分原生 conda 隔离与容器化两种环境方式,不要混用两者的依赖。

核心亮点

  • 首个将安全约束系统融入RLHF的开源框架,算法创新性强
  • 提供完整的训练管线,从数据到模型一站式解决
  • 支持自定义安全约束,灵活适配不同场景需求

不足之处

  • 依赖大规模人类反馈数据,数据获取成本高
  • 文档和社区生态仍在建设中,上手门槛较高

适用场景

  • 构建企业级对话助手,需严格避免有害输出
  • 开源大模型的安全微调与对齐
  • 研究安全RLHF算法,复现论文结果

替代项目

TRL (Transformer Reinforcement Learning)、RLHF (Hugging Face 的 RLHF 库)、Constitutional AI (Anthropic)

项目介绍

safe-rlhf 是评测安全领域的开源项目,由 PKU-Alignment 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,618)位列前 30%,在评测安全分类的 466 个项目里位列前 15%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-20。Apache-2.0许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:构建企业级对话助手,需严格避免有害输出。同类可对比的替代方案包括 TRL (Transformer Reinforcement Learning)、RLHF (Hugging Face 的 RLHF 库)、Constituti…。

上一篇:awesome-llm-security

下一篇:LLM-eval-survey

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12