any-guardrail

一个接口切换多种大模型安全护栏,评测对比不再改代码

any-guardrail 是一个面向大模型安全评测的 Python 工具库,目标是让研究者和工程实践者用统一接口在不同护栏(guardrail)方案之间快速切换。它解决的核心问题是:当前各类内容安全护栏(如 Llama Guard、OpenAI Moderation、本地规则模型等)接口、调用方式和输出格式各不相同,导致评测和对比成本高、代码重复。项目提供抽象层,把不同护栏封装成一致的调用方式,支持批量测试、结果对比,方便在安全评测、红队测试和上线前验证中快速替换或组合护栏。它不训练新模型,而是做适配与编排,让安全策略的选型从“改代码”变成“换配置”。适合需要频繁比较护栏效果、构建安全评测流水线的团队。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 122
维护状态 活跃
是否开源
定价模式 free

项目数据

分类评测安全
开发团队mozilla-ai
所属国家
定价模式free
价格说明开源免费,文档托管于Mozilla AI
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型
GitHub 星标★ 122
30天Star增速
HF 下载量
上线时间2025-07-18 00:00:00
最近更新2026-09-15 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0

使用教程

核心亮点

  • 统一抽象层屏蔽不同护栏的接口差异,切换成本低
  • 面向评测场景设计,便于批量跑测试和横向对比结果
  • Python 实现,轻量易集成到现有安全评测或红队流程

不足之处

  • 项目早期,星标和生态较小,覆盖的护栏种类可能有限
  • 文档和社区支持尚不完善,长期维护情况待观察

适用场景

  • 安全团队上线前对比多个内容护栏的拦截效果
  • 研究机构做护栏鲁棒性和红队评测实验
  • 开发者快速替换或组合不同护栏构建安全流水线

替代项目

garak、NeMo-Guardrails

项目介绍

any-guardrail 是一个评测安全领域的开源项目,官方简介:Giving researchers and practitioners an easy way to switch between guardrails.。项目使用 Python 开发,在 GitHub 上获得 122 星标。

上一篇:guardrails-llm-filter

下一篇:guardrail

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1516 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24