openai-guardrails-python

给 LLM 应用加一层安全护栏,自动拦截违规输入输出

openai-guardrails-python 是 OpenAI 官方开源的 Python 安全护栏库,用于在 LLM 应用中检测和拦截不安全内容。它解决的是生成式 AI 落地时的内容合规与风险控制问题:模型可能输出暴力、仇恨、自残、色情等违规内容,或用户输入恶意提示词。该库提供可组合的护栏(Guardrails),对输入和输出进行多维度审查,支持自定义规则与策略,并可与 OpenAI API 或自建模型服务集成。核心能力包括:预置多种安全分类器、支持同步/异步调用、可配置拦截阈值与动作(阻断、改写、记录),以及便于扩展的插件式架构。项目处于早期阶段,星标约 248,适合需要快速为聊天机器人、内容生成、客服系统等场景增加安全层的开发者。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 249
维护状态 活跃
是否开源
定价模式 free

项目数据

分类评测安全
开发团队openai
所属国家
定价模式free
价格说明开源免费使用
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型
GitHub 星标★ 249
30天Star增速
HF 下载量
上线时间2025-04-09 00:00:00
最近更新2026-09-18 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0

使用教程

核心亮点

  • OpenAI 官方维护,与 OpenAI API 生态天然兼容
  • 提供可组合的护栏抽象,支持输入/输出双向审查
  • 插件式架构,方便接入自定义分类器或规则

不足之处

  • 项目早期,星标较少,API 可能不稳定
  • 文档和示例相对有限,社区生态待观察

适用场景

  • 聊天机器人内容合规过滤
  • 用户生成内容平台自动审核
  • 企业客服系统防止敏感信息泄露

替代项目

NeMo Guardrails、Guardrails AI

项目介绍

openai-guardrails-python 是评测安全领域的开源项目,由 openai 开发,2025 年首次发布。

它收录于评测安全分类,该分类目前共有 448 个项目,GitHub 星标数为 249。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-18。开源免费使用。

它主要面向的使用场景是:聊天机器人内容合规过滤。同类可对比的替代方案包括 NeMo Guardrails、Guardrails AI。

上一篇:dodoguard

下一篇:trustmebro

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1518 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24