RWKU

给大模型做“记忆清除手术”,并验证效果是否达标

RWKU是一个针对大语言模型(LLM)的“知识遗忘”基准测试框架,源自NeurIPS 2024论文。它解决的是大模型在预训练中可能记住敏感、过时或侵权知识,导致合规风险的问题。该框架提供了一套标准化的评估流程,通过设计真实世界中的知识遗忘任务(如特定人物、事件或事实),衡量模型在遗忘指定知识后,是否仍能保持其余知识能力与生成质量。其核心能力包括:构建多样化的遗忘目标集、设计推理链与对抗性提示来检测残留记忆、以及评估遗忘后模型的通用能力(如常识、推理)是否受损。RWKU为研究者提供了一个可复现的基准,推动“机器遗忘”领域从理论走向实用,帮助开发更安全、合规的LLM应用。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 102
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队jinzhuoran
所属国家
定价模式free
价格说明开源项目,无在线服务,需自行部署,完全免费。
访问状态
是否开源是
开源协议
主要语言Python
技术栈/模型adversarial-attacks,benchmark,evaluation-framework,forgetting,large-language-models,membership-inference-attack,natural-language-processing,privacy-protection,right-to-be-forgotten,unlearning
GitHub 星标★ 102
30天Star增速
HF 下载量
上线时间2024-05-28 00:00:00
最近更新2026-09-03 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

核心亮点

  • 首个聚焦真实世界知识遗忘的基准,覆盖人物、事件等复杂知识类型
  • 提供多维度评估指标,兼顾遗忘彻底性与模型能力保留度
  • 基于NeurIPS 2024论文,方法严谨,社区认可度高

不足之处

  • 项目处于早期,文档和示例代码不够完善
  • 仅支持Python,且依赖特定框架,上手门槛略高

适用场景

  • 合规审查:检测模型是否残留敏感个人信息或版权内容
  • 模型更新:定向移除过时或错误知识,避免误导用户
  • 安全研究:评估遗忘算法在对抗性攻击下的鲁棒性

替代项目

TOFU、MUSE、WhoIsHarryPotter

项目介绍

RWKU 是评测安全领域的开源项目,由 jinzhuoran 开发,2024 年首次发布。

它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 102。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-03。无在线服务,需自行部署,完全免费。

它主要面向的使用场景是:合规审查:检测模型是否残留敏感个人信息或版权内容。同类可对比的替代方案包括 TOFU、MUSE、WhoIsHarryPotter。

上一篇:VisualWebBench

下一篇:MMStar

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12