Rules.txt

用指令集撬开AI黑盒,审计推理与偏见

Rules.txt 是一个针对大型语言模型(LLM)的对齐与越狱(jailbreak)研究项目,提供一套指令集,用于审计模型内部推理过程并揭示潜在偏见。它通过精心设计的提示词,引导模型暴露其隐藏的推理链和决策依据,帮助研究人员和安全从业者理解模型行为背后的逻辑,发现对齐漏洞和系统性偏见。项目核心能力包括:构造越狱提示词以触发模型非预期行为、分析模型内部推理模式、识别训练数据中的偏见来源。适用于AI安全研究、模型审计和红队测试场景。

开源 free 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 98
维护状态 维护中
是否开源
定价模式 free

项目数据

分类对话助手
开发团队Xayan
所属国家
定价模式free
价格说明开源项目,无在线服务,需自行部署,完全免费。
访问状态
是否开源
开源协议NOASSERTION
主要语言
技术栈/模型ai,ai-alignment,ai-research,ai-safety,chatgpt,epistemology,gemini,grok,inference,jailbreak,jailbreak-prompts,jailbreaking,llm,openai,philosophy,prompt,prompt-engineering,prompts,rationalism,rlhf
GitHub 星标★ 98
30天Star增速
HF 下载量
上线时间2025-10-03 00:00:00
最近更新2026-07-29 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数0

核心亮点

  • 提供可直接使用的越狱提示词库,降低审计门槛
  • 聚焦内部推理审计,超越表面输出分析
  • 覆盖多模型(ChatGPT/Gemini/Grok),适用性广

不足之处

  • 项目处于早期,文档和社区支持尚不完善
  • 越狱指令可能被滥用,需谨慎使用

适用场景

  • AI安全研究:测试模型对齐鲁棒性
  • 模型审计:发现隐藏偏见和推理漏洞
  • 红队演练:模拟攻击以改进防御

替代项目

JailbreakBench、LLM-Attacks、Garak

项目介绍

Rules.txt 是一个对话助手领域的开源项目,官方简介:LLM alignment jailbreak; a set of instructions for auditing their internal reasoning and uncovering biases。项目使用 未知 开发,在 GitHub 上获得 98 星标。

同类项目推荐

trulens 开源

给LLM应用装上仪表盘,量化评估效果,快速定位问题。

Evaluation and Tracking for LLM Experiments and AI Agents

★ 3515 2026-08-09
giskard-oss 开源

给 LLM 应用做全面质检,上线前自动揪出漏洞和偏见

Open-Source Evaluation & Testing library for LLM Agents

★ 5759 2026-08-09
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 160 2026-08-10