llm-safety

本站收录 10 个带「llm-safety」标签的 AI 开源项目

GuardrailsNeMo Guardrails 是 NVIDIA 开源的 LLM 对话系统安全护栏工具包,旨在为基于大语言模型的对话应用添加可编程的、可组合的安全约束。它解决的★ 7,219deepteamDeepTeam 是一个面向大语言模型和 AI Agent 的红队测试框架,用 Python 编写。它要解决的问题是:当企业把 LLM 或 Agent 接入真实★ 2,975uqlmUQLM 是一个专注于大语言模型(LLM)不确定性量化的 Python 包,源自 JMLR 2026 论文。它解决的核心问题是:LLM 在生成文本时经常产生幻觉★ 1,205awesome-llm-unlearning这是一个关于大语言模型机器遗忘(Machine Unlearning)的资源列表仓库,旨在系统整理该领域的前沿论文、基准数据集、评估指标和开源工具。它解决的核心★ 627agent-auditagent-audit 是一个针对 LLM 智能体的静态安全扫描工具,主要解决 AI Agent 应用中的安全漏洞问题,如提示注入、MCP 配置错误和污点分析。★ 233Awesome-Embodied-AI-Safety这是一个关于具身AI安全领域的综述性开源项目,汇集了500多篇相关论文,系统梳理了具身AI在感知、认知、规划、交互和智能体系统等层面面临的风险、攻击与防御方法。★ 144autoguardrailsAutoGuardrails 是一个面向 LLM 护栏的 alignment-research 脚手架,采用 autoresearch 风格,在单一的 poli★ 130SIMURGSIMURG 是一个面向大语言模型流式输出的在线异常检测与防护工具。它解决的核心问题是:LLM 在解码过程中常出现重复循环、语言漂移、乱码等退化现象,而传统方案★ 108awesome-llm-agent-papers这是一个精选的LLM智能体论文阅读清单,持续更新,收录了200多篇关于规划、记忆、工具使用、多智能体、评估与安全等主题的论文。项目旨在为研究者和开发者提供系统性★ 85SECASECA 是一个针对大语言模型(LLM)幻觉问题的对抗性攻击框架,发表于 NeurIPS 2025。它通过生成语义等价且连贯的对抗性提示,诱导模型产生与事实不符★ 73