safety
本站收录 18 个带「safety」标签的 AI 开源项目
GuardrailsNeMo Guardrails 是 NVIDIA 开源的 LLM 对话系统安全护栏工具包,旨在为基于大语言模型的对话应用添加可编程的、可组合的安全约束。它解决的★ 7,219
destructive_command_guardDestructive Command Guard (dcg) 是一个用 Rust 编写的命令行安全工具,专门用于拦截 AI 智能体执行危险的 git 和 sh★ 6,071
Awesome-LM-SSPAwesome-LM-SSP 是一个聚焦大模型安全、隐私与可信度的精选阅读清单,收录了相关论文、工具、数据集和攻击防御方法。它系统梳理了提示注入、越狱攻击、隐私★ 2,081
Awesome-Jailbreak-on-LLMs这是一个聚焦大语言模型越狱攻击方法的精选资源库,系统整理了学术界和工业界关于LLM安全漏洞的最新研究。项目收集了论文、代码、数据集、评估工具和分析报告,覆盖从提★ 1,659
safe-rlhfSafe RLHF 是一个基于安全强化学习的人类反馈对齐框架,旨在解决大模型价值对齐中的安全问题。传统 RLHF 通过人类反馈优化模型行为,但可能忽略安全约束,★ 1,618
MarkLLMMarkLLM 是一个面向大语言模型(LLM)水印技术的开源工具包,在 EMNLP 2024 上作为 Demo 发布。它旨在解决 AI 生成文本的溯源与版权保护★ 1,078
Awesome-LLM-Uncertainty-Reliability-Robustness这是一个聚焦大语言模型不确定性、可靠性与鲁棒性的精选资源清单,汇集了相关论文、工具、数据集和评测基准。项目解决LLM在实际应用中普遍存在的幻觉、过度自信、知识边★ 835
AutoHarnessAutoHarness 是一个面向 AI 智能体的自动化 Harness 工程工具,旨在解决智能体在复杂任务中的可控性、安全性和可观测性问题。它通过自动生成和优★ 412
mcp-for-statamcp-for-stata 是一个将 Stata 统计软件接入 AI 智能体的 MCP 服务器。它解决了 AI 助手无法直接操作 Stata 进行数据分析的问题★ 261
awesome_LLM-harmful-fine-tuning-papers这是一个聚焦大语言模型有害微调攻击的论文综述仓库,对应一篇被 ACM Computing Surveys 收录的综述文章。它系统整理了 harmful fine★ 248
RiOSWorldRiOSWorld 是 NeurIPS 2025 官方发布的基准测试项目,用于评估多模态计算机操作智能体的风险。它基于 OSWorld 框架,专门测试智能体在真★ 125
Boucle-frameworkBoucle-framework 是一个自主智能体框架,由运行在其上的智能体自身构建。它旨在解决智能体在长时间运行任务中缺乏结构化记忆、安全控制和循环管理的问题★ 124
Omni-SafetyBenchOmni-SafetyBench 是一个用于评估音视频大语言模型(AV-LLMs)安全性的基准测试工具,源自 ACM MM 2026 Oral 论文。它解决当前★ 115
VLGuardVLGuard是一个针对视觉大语言模型(VLLMs)的安全微调基线项目,发表于ICML 2024。它解决的是VLLMs在视觉输入下容易生成不安全内容的问题,例如★ 91
slbslb 是一个为 AI 编程代理设计的双人规则命令行工具,要求在运行可能具有破坏性的命令之前,必须经过同行评审和批准。它解决了 AI 代理在自主执行代码时可能带★ 81
safe-clipSafe-CLIP 是一个针对视觉-语言模型的安全增强工具,主要解决 CLIP 类模型在图像生成和检索任务中可能生成或检索到 NSFW(不宜工作场所)内容的问题★ 68
ChineseHarm-benchChineseHarm-Bench 是一个面向中文场景的有害内容检测基准测试集,旨在评估和比较各类模型(包括开源大模型和内容安全API)在识别中文有害信息上的能★ 68
Re-AlignRe-Align 是一个针对视觉语言模型(VLM)幻觉问题的对齐框架,发表于 EMNLP 2025。它通过引入图像检索机制,在模型生成文本时检索相关图像作为额外★ 52