heretic

一键去除模型审查,解锁无限制回答

heretic 是一个针对语言模型的全自动审查移除工具,旨在消除模型输出中的内容限制。它通过分析模型内部机制,自动识别并绕过安全过滤层,使模型能够生成未经过滤的回复。该项目主要解决开源模型在部署时因审查机制导致的回答受限问题,核心能力包括自动检测审查规则、动态生成绕过策略,并支持多种主流语言模型架构。其技术实现基于 Python,利用提示注入和模型微调等技术,实现对审查系统的透明化处理。项目在 GitHub 上拥有超过 2.7 万星标,表明其受到广泛关注,但也引发了关于伦理和合规的讨论。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 32181
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队p-e-w
所属国家
定价模式free
价格说明开源项目,AGPL-3.0许可,可自行部署使用,完全免费。
访问状态
是否开源是
开源协议AGPL-3.0
主要语言Python
技术栈/模型abliteration,llm,transformer
GitHub 星标★ 32181
30天Star增速
HF 下载量
上线时间2025-09-21 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 30 分钟 部署方式:命令行工具 5 步

环境要求

  • Python 3.10 或更高版本
  • PyTorch 2.2 及以上(部分模型/配置需更高版本,如 MXFP4 量化模型需 PyTorch 2.6+)
  • 建议配备 NVIDIA GPU 并安装匹配硬件的 PyTorch(默认配置下 RTX 3090 处理 4B 模型约需 20-30 分钟)
  • 可选:uv(用于按仓库锁文件复现开发者依赖版本)

安装与启动步骤

  1. 1准备 Python 环境

    先装好 Python 3.10+,并按自己的硬件安装对应版本的 PyTorch 2.2 或更高版本;显存不足时可后续启用 4bit 量化。

  2. 2安装 heretic

    用 pip 安装官方发布的 heretic-llm 包,-U 参数确保升级到最新版本。

    pip install -U heretic-llm
  3. 3运行自动去审查

    把示例模型换成你想处理的任意 Hugging Face 模型名即可;过程全自动,无需手动配置参数。

    heretic Qwen/Qwen3-4B-Instruct-2507
  4. 4查看可调参数

    想更精细地控制流程时,查看命令行可选项,或改用配置文件方式配置。

    heretic --help
  5. 5uv 方式运行(可选)

    若已使用 uv,可克隆仓库后通过 uv run 运行,依赖版本与开发者锁文件完全一致。

    git clone https://github.com/p-e-w/heretic
    cd heretic
    uv run heretic

关键配置

配置项必填说明示例
quantization否启用 bitsandbytes 模型量化,大幅降低处理模型所需的显存bnb_4bit

如何确认成功

运行结束会给出保存模型、上传 Hugging Face、对话测试、跑基准测试等选项,出现该交互提示即表示去审查流程完成。

常见问题

Q:跑不动,显存不够怎么办?

A:Heretic 支持 bitsandbytes 量化,把 quantization 选项设为 bnb_4bit,可大幅降低处理模型所需的显存占用。

Q:整个过程要多久?

A:默认配置下,在 RTX 3090 上对 Qwen3-4B-Instruct-2507 进行去审查大约需要 20-30 分钟,程序启动时会先测速以确定最优 batch size。

Q:需要手动调参或写配置吗?

A:不需要。该流程完全自动,会自动寻找高质量 abliteration 参数;如需更多控制可运行 heretic --help 或参考 config.default.toml。

Q:PyTorch 装 2.2 够用吗?

A:2.2 是能运行的最低版本,但部分模型和配置需要更高版本,例如加载 MXFP4 量化的 gpt-oss 需要 PyTorch 2.6(torch.accelerator)。

Q:依赖版本冲突怎么排查?

A:可以用 uv:克隆仓库后用 uv run heretic 运行,仓库自带 uv.lock 锁定了每个包的版本,与开发者环境一致,可靠性更好。

注意事项

  • Heretic 通过定向消融(abliteration)移除模型的安全对齐,仅应在你合法合规的场景下使用,注意相关伦理与合规要求。
  • PyTorch 2.2 只是最低要求,实际模型可能需要更高版本,建议先确认模型对 PyTorch 的要求。
  • 显存吃紧时优先启用 quantization=bnb_4bit,而不是盲目调大 batch。
  • 使用 uv 运行时需先进入克隆下来的仓库目录,否则 uv run heretic 无法找到项目配置。

核心亮点

  • 全自动流程,无需手动设计绕过提示,节省时间
  • 支持多种模型架构,适配性强,易于集成
  • 社区活跃,星标高,持续更新,问题响应快

不足之处

  • 使用可能违反服务条款,存在法律风险
  • 对最新审查机制可能失效,需频繁更新
  • 文档/社区待观察

适用场景

  • 研究模型安全机制,测试审查边界
  • 开发需要无限制输出的本地部署应用
  • 教育用途,演示审查漏洞与防御

替代项目

llm-guard、rebuff、guardrails-ai

项目介绍

heretic 是评测安全领域的开源项目,由 p-e-w 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(32,181)位列前 2%,在评测安全分类的 458 个项目里位列前 1%。

近 41 天,它的 GitHub 星标从 27,347 增加到 32,181,净增 4,834。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。AGPL-3.0许可,可自行部署使用,完全免费。

它主要面向的使用场景是:研究模型安全机制,测试审查边界。同类可对比的替代方案包括 llm-guard、rebuff、guardrails-ai。

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1362 2026-08-24