评测安全

汇聚全球AI评测与安全项目,模型评估、基准测试、安全对齐、护栏工具大全。

共收录 474 个开源项目

Guardrails 开源

给大模型对话装上可编程的安全护栏,防止跑偏和有害输出。

NeMo Guardrails 是 NVIDIA 开源的 LLM 对话系统安全护栏工具包,旨在为基于大语言模型的对话应用添···

★ 7202 评分 2023-04-18
evalplus 开源

给 LLM 代码生成做严格体检,避免高分低能

evalplus 是一个用于严格评估大语言模型生成代码质量的基准测试框架,源自 NeurIPS 2023 与 COLM 2···

★ 1819 评分 2023-04-15
stride-gpt 开源

输入应用描述,几分钟自动生成 STRIDE 威胁模型

stride-gpt 是一个基于 OpenAI GPT 模型的 AI 威胁建模工具,面向安全工程师、架构师和开发团队。它···

★ 1131 评分 2023-04-10
awesome-MLSecOps 开源

一站式查找 AI/ML 安全工具,快速构建防御体系

awesome-MLSecOps 是一个精选的 MLSecOps(机器学习安全运营)工具与资源清单,旨在帮助安全工程师···

★ 473 评分 2023-04-01
napolab 开源

一站式对比葡萄牙语AI模型,掌握最新性能排名

Napolab 是一个专注于葡萄牙语自然语言处理的基准测试项目,旨在系统评估和追踪葡萄牙语语言模型的···

★ 72 评分 2023-03-29
Anti-DreamBooth 开源

给照片加隐形噪声,让AI学不会你的脸

Anti-DreamBooth 是 ICCV 2023 收录的学术项目,旨在保护用户免受个性化文本到图像合成技术的滥用。···

★ 273 评分 2023-03-21
tifa 开源

用问答方式自动检查AI画图是否忠实于文字描述

TIFA 是一个用于评估文本到图像生成模型忠实度的开源工具,由微软研究院开发。它通过将输入文本提示···

★ 188 评分 2023-03-21
Awesome-LLM-Uncertainty-Reliability-··· 开源

一页看懂LLM可靠性研究全景,找论文、查基准、避幻觉坑

这是一个聚焦大语言模型不确定性、可靠性与鲁棒性的精选资源清单,汇集了相关论文、工具、数据集和···

★ 834 评分 2023-03-20
WatermarkDM 开源

给AI生成的图像打上隐形水印,一键溯源防滥用

WatermarkDM 是论文《A Recipe for Watermarking Diffusion Models》的官方代码实现,专注于为扩散···

★ 155 评分 2023-03-17
ErrorAnalysis_Prompt 开源

用 ChatGPT 快速定位翻译错误,输出结构化评估报告

ErrorAnalysis_Prompt 是一个专为 ChatGPT 设计的机器翻译(MT)评估提示词项目,旨在通过结构化提···

★ 91 评分 2023-03-02
gpt_jailbreak_status 开源

追踪 GPT 越狱动态,掌握 AI 安全薄弱点

这是一个追踪 OpenAI GPT 语言模型越狱状态的开源项目,旨在实时更新 GPT 系列模型(如 ChatGPT)被···

★ 932 评分 2023-03-01
ChatGPT-Sentiment-Evaluation 开源

测测ChatGPT懂不懂你的情绪

这是一个针对ChatGPT情感理解能力的初步评测项目。它通过一系列测试用例,评估ChatGPT能否准确理解···

★ 54 评分 2023-02-28
chatbot-experiments 开源

收集 AI 越狱提示词,探索聊天机器人边界

这是一个存放 ChatGPT/Bing Chat 越狱提示词、实验性 Prompt 及实用工具的仓库,旨在收集和分享绕过···

★ 129 评分 2023-02-16
ChatGPT_DAN 开源

复制粘贴一句提示词,让 ChatGPT 突破限制回答任何问题。

ChatGPT_DAN 是一个专门收集和分享 ChatGPT 越狱提示词(Jailbreak prompts)的开源项目,核心是让···

★ 12492 评分 2023-02-15
awesome-RLHF 开源

一份清单,从入门到进阶搞定 RLHF 全部资源

awesome-RLHF 是一个持续更新的强化学习与人类反馈(RLHF)资源精选列表。它系统整理了 RLHF 领域的···

★ 4427 评分 2023-02-13
Awesome-Machine-Generated-Text 开源

一站式找全大模型生成文本的检测与分析资源

这是一个持续更新的资源列表,汇集了与生成式大语言模型(如GPT)相关的分析、检测和评估工具与论文···

★ 231 评分 2023-02-02
akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto 是一个面向企业团队的 AI 安全测试与治理平台,专注于保护 AI 代理、MCP 服务、LLM 应用及生成···

★ 1519 评分 2023-01-31
guardrails 开源

给大模型输出装上安全阀,让生产更可靠

guardrails 是一个为大型语言模型(LLM)添加防护栏(guardrails)的开源 Python 库。它解决的核心···

★ 7452 评分 2023-01-29
chatgpt-failures 开源

看AI翻车现场,理性用大模型

这是一个记录ChatGPT及类似大模型失败案例的公开档案库。它系统性地收集、分类和展示AI模型在各类任···

★ 595 评分 2023-01-02
common_metrics_on_video_quality 开源

一键计算视频生成质量指标,快速对比模型效果

这是一个用于评估视频生成或预测质量的Python工具库,专注于计算FVD、PSNR、SSIM、LPIPS等核心指标···

★ 587 评分 2022-12-23
KnowledgeEditingPapers 开源

一榜在手,快速掌握大模型知识编辑前沿论文

KnowledgeEditingPapers 是一个精选论文列表,聚焦于大语言模型(LLM)的知识编辑(Knowledge Edit···

★ 1247 评分 2022-12-06
SelfAware 开源

测出模型不知道自己不知道什么,减少胡编乱造

SelfAware 是一个研究型开源项目,核心探索大语言模型(LLM)的自我认知能力,即模型是否知道自己的···

★ 105 评分 2022-12-01
Stable-Diffusion-Pickle-Scanner-GUI 开源

扫描模型文件,防止恶意代码入侵你的电脑

Stable-Diffusion-Pickle-Scanner-GUI 是一个针对 Stable Diffusion 生态中恶意 pickle 文件的可视···

★ 214 评分 2022-11-22
langtest 开源

给大模型做全面体检,上线前揪出安全漏洞

LangTest 是一个专注于语言模型安全性与有效性的开源测试框架。它解决的是大语言模型在部署前缺乏系···

★ 561 评分 2022-11-18