Guardrails
开源
给大模型对话装上可编程的安全护栏,防止跑偏和有害输出。
NeMo Guardrails 是 NVIDIA 开源的 LLM 对话系统安全护栏工具包,旨在为基于大语言模型的对话应用添···
汇聚全球AI评测与安全项目,模型评估、基准测试、安全对齐、护栏工具大全。
共收录 474 个开源项目
Guardrails
开源
给大模型对话装上可编程的安全护栏,防止跑偏和有害输出。
NeMo Guardrails 是 NVIDIA 开源的 LLM 对话系统安全护栏工具包,旨在为基于大语言模型的对话应用添···
evalplus
开源
给 LLM 代码生成做严格体检,避免高分低能
evalplus 是一个用于严格评估大语言模型生成代码质量的基准测试框架,源自 NeurIPS 2023 与 COLM 2···
stride-gpt
开源
输入应用描述,几分钟自动生成 STRIDE 威胁模型
stride-gpt 是一个基于 OpenAI GPT 模型的 AI 威胁建模工具,面向安全工程师、架构师和开发团队。它···
awesome-MLSecOps
开源
一站式查找 AI/ML 安全工具,快速构建防御体系
awesome-MLSecOps 是一个精选的 MLSecOps(机器学习安全运营)工具与资源清单,旨在帮助安全工程师···
napolab
开源
一站式对比葡萄牙语AI模型,掌握最新性能排名
Napolab 是一个专注于葡萄牙语自然语言处理的基准测试项目,旨在系统评估和追踪葡萄牙语语言模型的···
Anti-DreamBooth
开源
给照片加隐形噪声,让AI学不会你的脸
Anti-DreamBooth 是 ICCV 2023 收录的学术项目,旨在保护用户免受个性化文本到图像合成技术的滥用。···
tifa
开源
用问答方式自动检查AI画图是否忠实于文字描述
TIFA 是一个用于评估文本到图像生成模型忠实度的开源工具,由微软研究院开发。它通过将输入文本提示···
Awesome-LLM-Uncertainty-Reliability-···
开源
一页看懂LLM可靠性研究全景,找论文、查基准、避幻觉坑
这是一个聚焦大语言模型不确定性、可靠性与鲁棒性的精选资源清单,汇集了相关论文、工具、数据集和···
WatermarkDM
开源
给AI生成的图像打上隐形水印,一键溯源防滥用
WatermarkDM 是论文《A Recipe for Watermarking Diffusion Models》的官方代码实现,专注于为扩散···
ErrorAnalysis_Prompt
开源
用 ChatGPT 快速定位翻译错误,输出结构化评估报告
ErrorAnalysis_Prompt 是一个专为 ChatGPT 设计的机器翻译(MT)评估提示词项目,旨在通过结构化提···
gpt_jailbreak_status
开源
追踪 GPT 越狱动态,掌握 AI 安全薄弱点
这是一个追踪 OpenAI GPT 语言模型越狱状态的开源项目,旨在实时更新 GPT 系列模型(如 ChatGPT)被···
ChatGPT-Sentiment-Evaluation
开源
测测ChatGPT懂不懂你的情绪
这是一个针对ChatGPT情感理解能力的初步评测项目。它通过一系列测试用例,评估ChatGPT能否准确理解···
chatbot-experiments
开源
收集 AI 越狱提示词,探索聊天机器人边界
这是一个存放 ChatGPT/Bing Chat 越狱提示词、实验性 Prompt 及实用工具的仓库,旨在收集和分享绕过···
ChatGPT_DAN
开源
复制粘贴一句提示词,让 ChatGPT 突破限制回答任何问题。
ChatGPT_DAN 是一个专门收集和分享 ChatGPT 越狱提示词(Jailbreak prompts)的开源项目,核心是让···
awesome-RLHF
开源
一份清单,从入门到进阶搞定 RLHF 全部资源
awesome-RLHF 是一个持续更新的强化学习与人类反馈(RLHF)资源精选列表。它系统整理了 RLHF 领域的···
Awesome-Machine-Generated-Text
开源
一站式找全大模型生成文本的检测与分析资源
这是一个持续更新的资源列表,汇集了与生成式大语言模型(如GPT)相关的分析、检测和评估工具与论文···
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto 是一个面向企业团队的 AI 安全测试与治理平台,专注于保护 AI 代理、MCP 服务、LLM 应用及生成···
guardrails
开源
给大模型输出装上安全阀,让生产更可靠
guardrails 是一个为大型语言模型(LLM)添加防护栏(guardrails)的开源 Python 库。它解决的核心···
chatgpt-failures
开源
看AI翻车现场,理性用大模型
这是一个记录ChatGPT及类似大模型失败案例的公开档案库。它系统性地收集、分类和展示AI模型在各类任···
common_metrics_on_video_quality
开源
一键计算视频生成质量指标,快速对比模型效果
这是一个用于评估视频生成或预测质量的Python工具库,专注于计算FVD、PSNR、SSIM、LPIPS等核心指标···
KnowledgeEditingPapers
开源
一榜在手,快速掌握大模型知识编辑前沿论文
KnowledgeEditingPapers 是一个精选论文列表,聚焦于大语言模型(LLM)的知识编辑(Knowledge Edit···
SelfAware
开源
测出模型不知道自己不知道什么,减少胡编乱造
SelfAware 是一个研究型开源项目,核心探索大语言模型(LLM)的自我认知能力,即模型是否知道自己的···
Stable-Diffusion-Pickle-Scanner-GUI
开源
扫描模型文件,防止恶意代码入侵你的电脑
Stable-Diffusion-Pickle-Scanner-GUI 是一个针对 Stable Diffusion 生态中恶意 pickle 文件的可视···
langtest
开源
给大模型做全面体检,上线前揪出安全漏洞
LangTest 是一个专注于语言模型安全性与有效性的开源测试框架。它解决的是大语言模型在部署前缺乏系···